Обновить
512K+

Машинное обучение *

Основа искусственного интеллекта

1 191,94
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

7 дней новостей ИИ (12–18 сентября): абсурд и реалии кибербезопасности 2026 года

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели890

Добро пожаловать в середину сентября 2026 года. Если вам казалось, что индустрия ИИ летит на гиперскорости в бетонную стену, то на этой неделе это поняли и сами водители спорткаров. Риски того, что технологии выйдут из-под контроля, перестали быть сюжетом для блогов и перешли в разряд экстренных совещаний.

Эта неделя подарила нам киберпанковые сюжеты: нейросети начали взламывать серверы конкурентов (буквально), автономные агенты изобретают собственные диалекты с отсылками к Джойсу, а для «спятивших» ботов теперь создают горячие линии доносов. И пока в Китае ИИ-актеры уже захватили рынок мобильных сериалов, бигтех всерьез заговорил о том, чтобы ударить по тормозам.

Собрали для вас дайджест того, как наш мир в очередной раз необратимо изменился за последние семь дней.

Читать далее

Новости

Jev: как устроен его API решений и что на нём уже строят

Уровень сложностиСредний
Время на прочтение13 мин
Охват и читатели4.1K

За три дня вокруг Jev выросла маленькая экосистема: браузерный агент искал авиабилеты за семь секунд, разработчики собрали торгового бота, фильтры контента и даже Tesla FSD. Но Jev не пишет текст. Его API выбирает ответ из пространства, которое заранее задало приложение.

Я разобрал документацию TypeSafe, код jev-ultrafast, опубликованную трассу семисекундного прогона и сто первичных или близких к ним источников. В статье — контракт Noul, Choice и Score, вызов API, цена, устройство браузерного агента и 15 ранних кейсов с границами их доказательности.

Главный вопрос простой: где узкий слой решений действительно выигрывает у обычной LLM, а где валидный ответ всё ещё оказывается просто не тем ответом?

Читать далее

Поиск идеального ML ноута — с макбука на x86+Linux

Уровень сложностиПростой
Время на прочтение18 мин
Охват и читатели7.6K

В этом несерьёзном посте попробую разобраться с вполне серьёзным вопросом: каким должен быть идеальный ноутбук для ML-разработчика.

Читать далее

Как австралийца судят за утечку судебных документов из-за нейросети

Время на прочтение3 мин
Охват и читатели42K

Кристофер Дафф, 40 лет, Сидней. Обвиняется во взломе судебной системы штата Новый Южный Уэльс.

Версия следствия — умышленно использовал ChatGPT для написания программы, предназначенной для загрузки большого количества документов и несанкционированного доступа к конфиденциальной информации. Полиция говорит, что дело касается почти 9000 судебных документов, и доступ Дафф к ним получил ещё в 2025. Тогда же ему предъявлили первые обвинения и провели обыск в его доме, изъяв два ноутбука, и отпустили под залог. Сейчас завертелось снова.

Вину не признает. В качестве доказательства суд хочет использовать переписку Кристофера с чатботом.

Первый такой случай в австралийском правосудии. Под катом — подробности и доводы сторон.

Читать далее

Запустить LLM локально: что считать до покупки видеокарты?

Уровень сложностиСложный
Время на прочтение14 мин
Охват и читатели5.8K

Мощная видеокарта не всегда означает быстрый локальный запуск LLM. Разбираемся, почему GPU может простаивать, как на производительность влияют память, KV‑кэш и движок инференса, и что учитывать перед сборкой собственного стенда.

Разобраться в LLM

Мы пытались оптимизировать граф агентов в LangGraph — и в итоге написали gMAS

Уровень сложностиСредний
Время на прочтение17 мин
Охват и читатели6.4K

Около полугода назад мы с командой взялись за оптимизацию мультиагентных систем. Нас интересовали не новые промпты и не очередной способ заставить несколько LLM обсуждать ответ по кругу. Нам хотелось работать с самой структурой системы: автоматически подбирать агентов, менять связи между ними, удалять бесполезные ветви и перестраивать граф по результатам выполнения.

Первым делом мы решили воспроизвести G-Designer. В этой работе коммуникационная топология мультиагентной системы оптимизирована с помощью графовой нейросети: агенты представлены вершинами, обмен сообщениями — рёбрами, а итоговый граф должен лучше соответствовать решаемой задаче.

С воспроизводимостью всё оказалось сложнее. Повторить весь заявленный процесс по опубликованному коду не получилось. Но постановка задачи была слишком интересной, чтобы останавливаться. Мы начали писать собственную реализацию, а средой выполнения выбрали LangGraph.

И тут эксперимент про оптимизацию графов неожиданно превратился в эксперимент про ограничения агентных фреймворков.

Читать далее

474 712 строк за 35 лет: как мы с LLM и 21 экспертом приводим в порядок справочник автосервиса

Уровень сложностиСредний
Время на прочтение14 мин
Охват и читатели5.5K

НАР РУЧКУ ДВЕРЬ РАСПАШ З ПР С/У

Это не битая кодировка и не ошибка миграции. Это настоящее название работы из нашего справочника. За 35 лет в нём накопилось 474 712 строк: сокращения, дубли, опечатки, разные языки и разные варианты одной и той же операции.

Опытный мастер-консультант многое понимает по контексту. Для специалиста по записи клиентов и аналитика такой справочник уже становится системной проблемой: первый зависит от знаний более опытных коллег, второму приходится вручную собирать разные названия одной операции.

Мы столкнулись с этим при разработке Dealer Digital Platform «Флора». Проект ещё не завершён, но основную часть нормализации уже прошли: дедуплицировали массив, дважды провели его через экспертную проверку и для 96,13% работ после дедупликации подтвердили корректный узел.

Я решил рассказать об этом сейчас, не дожидаясь финального релиза: основные грабли уже случились. Мы отказались от полнотекстового поиска, несколько раз перестроили работу LLM и экспертов, научились возвращать экспертный фидбек в правила и skills агента и ошиблись больше чем втрое в оценке производительности на одной из задач.

Если вы работаете с историческими справочниками, master data или LLM-классификацией, значительную часть этого опыта можно перенести и за пределы автобизнеса.

Читать далее

ИИ и? К чему привел ажиотаж вокруг искусственного интеллекта

Уровень сложностиПростой
Время на прочтение19 мин
Охват и читатели5.4K

ИИ заменит нас или просто изменит способ работы? Пока одни боятся массовой безработицы, а другие жалуются на «нейрослоп» и уничтожение книг, реальная картина оказывается гораздо сложнее. Разбираем сухие цифры статистики, данные Microsoft и отчеты мировых институтов, чтобы понять: перед нами промышленная революция или очередной масштабный хайп.

Читать далее

Как я учил ИИ работать с 1С и другими корпоративными системами

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели5.2K

Пользователь ИИ-агента прикрепил к диалогу навык и написал рабочую заметку. Навык должен был добавить комментарий к отчету в корпоративной системе проектной организации. Но до отправки дело даже не дошло: модель не вызвала инструмент.

В описании инструмента было условие - применять его, когда пользователь явно просит добавить комментарий в систему. Человек уже выбрал нужный навык и начал писать заметку. Но для модели этого оказалось недостаточно.

Я занимаюсь разработкой ИскраБота - это российский ИИ-агент. Недавно создал один навык для корпоративной системы проектировщика, а в другой интеграции исправлял подключение к 1С через VPN. Расскажу о проблемах, с которыми столкнулся, но для начала - о том, что такое навык.

Читать далее

Один текст — две оценки: как я ошибся при проверке humanizer-ru

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели10K

В одном из тестов моего humanizer-ru оценка “машинности” ответа упала с 0,95 до 0,10. Сам ответ при этом не изменился ни на букву: “Столица Австралии - Канберра”. Из файла убрали строки вокруг него, включая название чат-бота.

В другой паре тексты отличались лишь переводом строки в конце файла. Оценки всё равно разошлись: 0,9 и 0,3.

Эти пары лежат в открытых данных проекта. По общей таблице я раньше делал вывод о качестве редактирования, но теперь эта интерпретация отозвана. Разбираю, что именно я измерил на самом деле и как это проверить самому.

Что я измерил на самом деле

Kodacode лучший харнес для DeepSeek v4 Flash!? Замерили различные харнессы и модели

Уровень сложностиПростой
Время на прочтение12 мин
Охват и читатели12K

Мы запустили DeepSeek V4 Flash в четырёх популярных харнессах. В наших замерах Koda набрала 52,2% и обошла Kilocode, Claude Code и OpenCode.

В статье рассказываем, как устроили эксперимент, почему одна и та же модель показывает разные результаты и что именно помогает агенту решать больше реальных задач.

Читать далее

Дорогие знатоки, внимание, вопрос: сколько всего пережила цифровая муха за последнюю неделю?

Время на прочтение7 мин
Охват и читатели8K

Учёные опубликовали подробную карту нервной системы дрозофилы. Интернету понадобилось несколько дней, чтобы посадить её за руль, отправить в Doom, дать $100 на биткоин, зарегистрировать на сайте знакомств и переселить в робота. Мы всё это время переживали, что работу у нас отнимет ИИ. Возможно, стоило присматривать ещё и за мухами.

В начале сентября Google Research, HHMI Janelia и большая команда исследователей представили подробную карту центральной нервной системы взрослого самца дрозофилы. В ней около 166 тысяч нейронов и примерно 125 миллионов синаптических контактов. Это важное продолжение проекта FlyWire, в рамках которого ранее был реконструирован мозг взрослой самки, но теперь исследователи получили не только мозг, но и вентральную нервную цепочку, через которую центральная нервная система связана с двигательными цепями тела.

Читать далее

ИИ может уничтожить человечество с вероятностью выше 10%. Чего именно боятся исследователи

Уровень сложностиСредний
Время на прочтение10 мин
Охват и читатели6.8K

9 сентября руководитель Alignment Science в Anthropic Эван Хубингер написал довольно безумную для человека на такой должности вещь: лично он оценивает вероятность того, что AI убьёт всех людей в течение ближайших десяти лет, выше 10%.

Поводом стало увольнение его коллеги Джейкоба Коксона. Тот три года занимался обучением моделей в OpenAI и Anthropic, а уход объяснил тем, что считает нынешнее направление развития AI слишком опасным.

Читать далее

Ближайшие события

Почему ChatGPT хорошо рассуждает о покере, но плохо в него играет

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели6.9K

Однажды утром вы читаете новость: новая GPT Astra за ночь решила одну из фундаментальных математических задач человечества. И тут приходит гениальная мысль: раз LLM настолько умна, почему бы ей не поработать за покерным столом на ваше благо?

Звучит как план? Да. Как очень плохой план.

И вот почему...

Кредитный радар: LLM-воркфлоу, который каждое утро читает условия 12 банков и сам проверяет свои числа

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели6.7K

TL;DR. Собрал воркфлоу на языковой модели, который раз в сутки обходит 34 страницы условий у 12 российских банков, сравнивает их со вчерашним снимком и публикует сводку изменений с ссылкой на источник в каждой строке, а при изменении цены пишет разбор с расчётом. Модель вызывается в четырёх точках и ни в одной не решает, что делать дальше. Цитаты, числа и статистика проверяются кодом. Каждый выпуск оценивается по 14 бинарным проверкам, метрики публичные. Стоит от 3 центов до 70 в день. Ниже устройство, проверки, evals и что он нашёл за первую неделю.

Я работаю в розничных кредитных рисках банка. С языковыми моделями познакомился пару недель назад, начал собирать себе инструменты, и один из них за это время дорос до публичного продукта: Telegram-канал и сайт, где каждое утро в 09:00 выходит сводка изменений условий кредитных карт, рассрочки, кредитов наличными и автокредитов, а когда есть повод, короткий разбор одного изменения.

Как устроен и что нашел

OpenAI пообещали впредь вовремя рассказывать о «бедокурстве» своих нейронок

Время на прочтение5 мин
Охват и читатели9K

…а не по пинку от внешних расследователей, как это было последние разы (в эпизодах с роем агентов на немецкой вики и со взломом RubyGems). Заодно OpenAI раскрыли шесть новых примеров странного поведения своих моделей, разберем в этом материале кратко самое интересное.

Читать далее

Сколько токенов в секунду выдадут новые Mac mini на M6 и M5 Pro. Прогноз до того, как железо приехало

Время на прочтение4 мин
Охват и читатели5.5K

Через несколько дней Apple начнёт отгружать Mac mini на M6 и M5 Pro и Mac Studio на M5 Max и M5 Ultra. Замеров локальных моделей на них ещё ни у кого нет, а прикинуть скорость можно уже сейчас. В прошлой статье я замерил шесть моделей на базовом M4 и вывел правило через полосу памяти с КПД 0.83, которое сошлось с замером в пределах двух процентов. Здесь применяю его к новым чипам и публикую цифры до того, как железо приехало. Потом замерю и покажу, где ошибся.

Коротко. M6 для локальных моделей не апгрейд, прирост 25 до 40 процентов и тот же потолок 8B. M5 Pro первый mini, где 32B работает на рабочей скорости. M5 Max меняет класс, 70B на 13 токенах в секунду. Отдельно про ловушки младших конфигураций, у M6 с 16 ГБ и M5 Max с 36 ГБ полоса памяти заметно ниже.

Читать далее

Империя терминаторов: как двести агентов построили цивилизацию

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели6.6K

В 1959 году энтомолог Пьер-Поль Грассе проводил небольшое исследование того, как термиты строят себе жилища — термитники, которые достигают высоты в несколько метров. Каждое из насекомых таскало глину и клало ее в определенное место, которое изначально выбрал предводитель роя. Благодаря общему делу термитники были детально проработаны, там были даже вентиляционные каналы и подвалы. 

Это явление было названо стигмергией — координацией существ через изменение среды. Десятки лет спустя несколько исследователей из MIT воссоздали тот же механизм в цифровом мире. Однако вместо термитов у них были ИИ-агенты, и построили они не гигантский термитник, а технологическую цивилизацию. О результатах эксперимента мини-терминаторов и о том, чему нам, людям, нужно научиться у LLM, рассказываю в статье.

Читать

Граница код | модель как архитектурный объект

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели11K

Размышление по мотивам проекта. Архитектура – router + pipelines (AWS, Claude).

Рассмотрим сравнительно простой пример, знакомый почти всем, кто делал LLM-агента для запросов к данным на естественном языке – будь то text2sql, аналитический ассистент или чат-бот над базой. Обычно агенту поручают решать всё самому – и определять тип запроса, и формировать его, и выбирать форму результата и решать, нужно ли предупредить об отклонении. Именно в этом суть агента и именно для этого пишется системный промпт.

На десятке тестовых вопросов система работает без нареканий. Но позже появляются проблемы, когда вопросы начинают приходить в разных формулировках. Например, один и тот же вопрос, заданный другими словами, вдруг обрабатывается иначе – модель по-другому интерпретировала фразу и одинаковые по структуре результаты приняли разную форму (строка, таблица, график) без объяснения причины. Или при одной той же формулировке вопроса отклонение то получает пояснение, то приходит пустым.

Первое, что обычно меняют в таких случаях – добавляют в промпт ещё одно правило. Несколько раз это действительно помогает. Потом новое правило начинает противоречить старым, и промпт превращается в набор заплаток под конкретные ситуации. Нестабильность никуда не уходит, она просто прячется теперь в том, в каком порядке моделью применяются противоречащие друг другу инструкции.

Именно здесь кроется и проблема, и ее решение. Проблема в том, что в описанном сценарии работы никто явно не решал, что в системе делает код, а что модель. Это сложилось само, по ходу генерации промпта. Спросите, почему модель выбирает форму результата запроса, а не разработчик пишет десять строк обычного кода, – и внятного ответа, как правило, не найдётся. Отсюда и решение: граница между тем, что делает код, и тем, что делает модель, – это не деталь реализации, а отдельный архитектурный объект. Если такое решение не принять явно, оно всё равно будет принято по умолчанию, и чаще всего не в пользу устойчивости системы.

Читать далее

AI‑GameDev. Учим ИИ азам левел‑дизайна

Уровень сложностиПростой
Время на прочтение10 мин
Охват и читатели11K

Все уже наверняка видели посты на «Бэкдорах», «Эксплойтах» и прочих кибертопорах о том, как кто-то, особенно с выходом новой модели, естественно, в один промпт сгенерировал копию Call of Duty, Starfield или любой другой игры. По видео выглядит сыровато, но играбельно, однако ключевая проблема здесь в том, что это демонстрационный вариант в формате браузерной игры. То есть совсем не те проекты, где мы с вами увлеченно сидим часами (любители браузерных игр и мобилок простите).

Как любой геймер, я всегда мечтал сделать свою игру. Не то что бы мне недоставало проектов, которые регулярно презентуют на Gamescom, а потом убирают на полку. Но хочется чего-то своего, людского, с российским колоритом. А наш АА\ААА-геймдев только начал подавать признаки жизни.

Я умею в C#, более-менее понимаю, как устроен Unity, могу поковыряться в Blender и что-то подрисовать на развертке в фотошопе. Но просто не хочу и все. С бесконечными задачами по работе, хобби и бытовым СДВГ сесть за какой-то долгострой нет ни времени, ни возможности. А потому меня посетила мысль отработать маркетинг желтушных IT-каналов на полную и собрать игру исключительно при помощи ИИ. Без единой собственной строчки кода, без единой собранной вручную модели и отрисованной текстуры.

В этой части я расскажу о тестах некоторых технических аспектов. Здесь не будет ничего о сценарии, механиках, кор лупах и даже о концепте. Ведь сперва нам нужно понять, а можно ли в принципе сделать играбельную сцену достойного уровня.

Читать далее
1
23 ...