Обновить
512K+

Машинное обучение *

Основа искусственного интеллекта

1 185,13
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

Поиск идеального ML ноута — с макбука на x86+Linux

Уровень сложностиПростой
Время на прочтение18 мин
Охват и читатели1.9K

В этом несерьёзном посте попробую разобраться с вполне серьёзным вопросом: каким должен быть идеальный ноутбук для ML-разработчика.

Читать далее

Новости

Как австралийца судят за утечку судебных документов из-за нейросети

Время на прочтение3 мин
Охват и читатели5.8K

Кристофер Дафф, 40 лет, Сидней. Обвиняется во взломе судебной системы штата Новый Южный Уэльс.

Версия следствия — умышленно использовал ChatGPT для написания программы, предназначенной для загрузки большого количества документов и несанкционированного доступа к конфиденциальной информации. Полиция говорит, что дело касается почти 9000 судебных документов, и доступ Дафф к ним получил ещё в 2025. Тогда же ему предъявлили первые обвинения и провели обыск в его доме, изъяв два ноутбука, и отпустили под залог. Сейчас завертелось снова.

Вину не признает. В качестве доказательства суд хочет использовать переписку Кристофера с чатботом.

Первый такой случай в австралийском правосудии. Под катом — подробности и доводы сторон.

Читать далее

Запустить LLM локально: что считать до покупки видеокарты?

Уровень сложностиСложный
Время на прочтение14 мин
Охват и читатели4.3K

Мощная видеокарта не всегда означает быстрый локальный запуск LLM. Разбираемся, почему GPU может простаивать, как на производительность влияют память, KV‑кэш и движок инференса, и что учитывать перед сборкой собственного стенда.

Разобраться в LLM

Мы пытались оптимизировать граф агентов в LangGraph — и в итоге написали gMAS

Уровень сложностиСредний
Время на прочтение17 мин
Охват и читатели4.6K

Около полугода назад мы с командой взялись за оптимизацию мультиагентных систем. Нас интересовали не новые промпты и не очередной способ заставить несколько LLM обсуждать ответ по кругу. Нам хотелось работать с самой структурой системы: автоматически подбирать агентов, менять связи между ними, удалять бесполезные ветви и перестраивать граф по результатам выполнения.

Первым делом мы решили воспроизвести G-Designer. В этой работе коммуникационная топология мультиагентной системы оптимизирована с помощью графовой нейросети: агенты представлены вершинами, обмен сообщениями — рёбрами, а итоговый граф должен лучше соответствовать решаемой задаче.

С воспроизводимостью всё оказалось сложнее. Повторить весь заявленный процесс по опубликованному коду не получилось. Но постановка задачи была слишком интересной, чтобы останавливаться. Мы начали писать собственную реализацию, а средой выполнения выбрали LangGraph.

И тут эксперимент про оптимизацию графов неожиданно превратился в эксперимент про ограничения агентных фреймворков.

Читать далее

474 712 строк за 35 лет: как мы с LLM и 21 экспертом приводим в порядок справочник автосервиса

Уровень сложностиСредний
Время на прочтение14 мин
Охват и читатели4.8K

НАР РУЧКУ ДВЕРЬ РАСПАШ З ПР С/У

Это не битая кодировка и не ошибка миграции. Это настоящее название работы из нашего справочника. За 35 лет в нём накопилось 474 712 строк: сокращения, дубли, опечатки, разные языки и разные варианты одной и той же операции.

Опытный мастер-консультант многое понимает по контексту. Для специалиста по записи клиентов и аналитика такой справочник уже становится системной проблемой: первый зависит от знаний более опытных коллег, второму приходится вручную собирать разные названия одной операции.

Мы столкнулись с этим при разработке Dealer Digital Platform «Флора». Проект ещё не завершён, но основную часть нормализации уже прошли: дедуплицировали массив, дважды провели его через экспертную проверку и для 96,13% работ после дедупликации подтвердили корректный узел.

Я решил рассказать об этом сейчас, не дожидаясь финального релиза: основные грабли уже случились. Мы отказались от полнотекстового поиска, несколько раз перестроили работу LLM и экспертов, научились возвращать экспертный фидбек в правила и skills агента и ошиблись больше чем втрое в оценке производительности на одной из задач.

Если вы работаете с историческими справочниками, master data или LLM-классификацией, значительную часть этого опыта можно перенести и за пределы автобизнеса.

Читать далее

ИИ и? К чему привел ажиотаж вокруг искусственного интеллекта

Уровень сложностиПростой
Время на прочтение19 мин
Охват и читатели4.7K

ИИ заменит нас или просто изменит способ работы? Пока одни боятся массовой безработицы, а другие жалуются на «нейрослоп» и уничтожение книг, реальная картина оказывается гораздо сложнее. Разбираем сухие цифры статистики, данные Microsoft и отчеты мировых институтов, чтобы понять: перед нами промышленная революция или очередной масштабный хайп.

Читать далее

Как я учил ИИ работать с 1С и другими корпоративными системами

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели4.4K

Пользователь ИИ-агента прикрепил к диалогу навык и написал рабочую заметку. Навык должен был добавить комментарий к отчету в корпоративной системе проектной организации. Но до отправки дело даже не дошло: модель не вызвала инструмент.

В описании инструмента было условие - применять его, когда пользователь явно просит добавить комментарий в систему. Человек уже выбрал нужный навык и начал писать заметку. Но для модели этого оказалось недостаточно.

Я занимаюсь разработкой ИскраБота - это российский ИИ-агент. Недавно создал один навык для корпоративной системы проектировщика, а в другой интеграции исправлял подключение к 1С через VPN. Расскажу о проблемах, с которыми столкнулся, но для начала - о том, что такое навык.

Читать далее

Один текст — две оценки: как я ошибся при проверке humanizer-ru

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели10K

В одном из тестов моего humanizer-ru оценка “машинности” ответа упала с 0,95 до 0,10. Сам ответ при этом не изменился ни на букву: “Столица Австралии - Канберра”. Из файла убрали строки вокруг него, включая название чат-бота.

В другой паре тексты отличались лишь переводом строки в конце файла. Оценки всё равно разошлись: 0,9 и 0,3.

Эти пары лежат в открытых данных проекта. По общей таблице я раньше делал вывод о качестве редактирования, но теперь эта интерпретация отозвана. Разбираю, что именно я измерил на самом деле и как это проверить самому.

Что я измерил на самом деле

Kodacode лучший харнес для DeepSeek v4 Flash!? Замерили различные харнессы и модели

Уровень сложностиПростой
Время на прочтение12 мин
Охват и читатели12K

Мы запустили DeepSeek V4 Flash в четырёх популярных харнессах. В наших замерах Koda набрала 52,2% и обошла Kilocode, Claude Code и OpenCode.

В статье рассказываем, как устроили эксперимент, почему одна и та же модель показывает разные результаты и что именно помогает агенту решать больше реальных задач.

Читать далее

Дорогие знатоки, внимание, вопрос: сколько всего пережила цифровая муха за последнюю неделю?

Время на прочтение7 мин
Охват и читатели7.6K

Учёные опубликовали подробную карту нервной системы дрозофилы. Интернету понадобилось несколько дней, чтобы посадить её за руль, отправить в Doom, дать $100 на биткоин, зарегистрировать на сайте знакомств и переселить в робота. Мы всё это время переживали, что работу у нас отнимет ИИ. Возможно, стоило присматривать ещё и за мухами.

В начале сентября Google Research, HHMI Janelia и большая команда исследователей представили подробную карту центральной нервной системы взрослого самца дрозофилы. В ней около 166 тысяч нейронов и примерно 125 миллионов синаптических контактов. Это важное продолжение проекта FlyWire, в рамках которого ранее был реконструирован мозг взрослой самки, но теперь исследователи получили не только мозг, но и вентральную нервную цепочку, через которую центральная нервная система связана с двигательными цепями тела.

Читать далее

ИИ может уничтожить человечество с вероятностью выше 10%. Чего именно боятся исследователи

Уровень сложностиСредний
Время на прочтение10 мин
Охват и читатели6.6K

9 сентября руководитель Alignment Science в Anthropic Эван Хубингер написал довольно безумную для человека на такой должности вещь: лично он оценивает вероятность того, что AI убьёт всех людей в течение ближайших десяти лет, выше 10%.

Поводом стало увольнение его коллеги Джейкоба Коксона. Тот три года занимался обучением моделей в OpenAI и Anthropic, а уход объяснил тем, что считает нынешнее направление развития AI слишком опасным.

Читать далее

Почему ChatGPT хорошо рассуждает о покере, но плохо в него играет

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели6.8K

Однажды утром вы читаете новость: новая GPT Astra за ночь решила одну из фундаментальных математических задач человечества. И тут приходит гениальная мысль: раз LLM настолько умна, почему бы ей не поработать за покерным столом на ваше благо?

Звучит как план? Да. Как очень плохой план.

И вот почему...

Кредитный радар: LLM-воркфлоу, который каждое утро читает условия 12 банков и сам проверяет свои числа

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели6.5K

TL;DR. Собрал воркфлоу на языковой модели, который раз в сутки обходит 34 страницы условий у 12 российских банков, сравнивает их со вчерашним снимком и публикует сводку изменений с ссылкой на источник в каждой строке, а при изменении цены пишет разбор с расчётом. Модель вызывается в четырёх точках и ни в одной не решает, что делать дальше. Цитаты, числа и статистика проверяются кодом. Каждый выпуск оценивается по 14 бинарным проверкам, метрики публичные. Стоит от 3 центов до 70 в день. Ниже устройство, проверки, evals и что он нашёл за первую неделю.

Я работаю в розничных кредитных рисках банка. С языковыми моделями познакомился пару недель назад, начал собирать себе инструменты, и один из них за это время дорос до публичного продукта: Telegram-канал и сайт, где каждое утро в 09:00 выходит сводка изменений условий кредитных карт, рассрочки, кредитов наличными и автокредитов, а когда есть повод, короткий разбор одного изменения.

Как устроен и что нашел

Ближайшие события

OpenAI пообещали впредь вовремя рассказывать о «бедокурстве» своих нейронок

Время на прочтение5 мин
Охват и читатели8.8K

…а не по пинку от внешних расследователей, как это было последние разы (в эпизодах с роем агентов на немецкой вики и со взломом RubyGems). Заодно OpenAI раскрыли шесть новых примеров странного поведения своих моделей, разберем в этом материале кратко самое интересное.

Читать далее

Сколько токенов в секунду выдадут новые Mac mini на M6 и M5 Pro. Прогноз до того, как железо приехало

Время на прочтение4 мин
Охват и читатели5.4K

Через несколько дней Apple начнёт отгружать Mac mini на M6 и M5 Pro и Mac Studio на M5 Max и M5 Ultra. Замеров локальных моделей на них ещё ни у кого нет, а прикинуть скорость можно уже сейчас. В прошлой статье я замерил шесть моделей на базовом M4 и вывел правило через полосу памяти с КПД 0.83, которое сошлось с замером в пределах двух процентов. Здесь применяю его к новым чипам и публикую цифры до того, как железо приехало. Потом замерю и покажу, где ошибся.

Коротко. M6 для локальных моделей не апгрейд, прирост 25 до 40 процентов и тот же потолок 8B. M5 Pro первый mini, где 32B работает на рабочей скорости. M5 Max меняет класс, 70B на 13 токенах в секунду. Отдельно про ловушки младших конфигураций, у M6 с 16 ГБ и M5 Max с 36 ГБ полоса памяти заметно ниже.

Читать далее

Империя терминаторов: как двести агентов построили цивилизацию

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели6.4K

В 1959 году энтомолог Пьер-Поль Грассе проводил небольшое исследование того, как термиты строят себе жилища — термитники, которые достигают высоты в несколько метров. Каждое из насекомых таскало глину и клало ее в определенное место, которое изначально выбрал предводитель роя. Благодаря общему делу термитники были детально проработаны, там были даже вентиляционные каналы и подвалы. 

Это явление было названо стигмергией — координацией существ через изменение среды. Десятки лет спустя несколько исследователей из MIT воссоздали тот же механизм в цифровом мире. Однако вместо термитов у них были ИИ-агенты, и построили они не гигантский термитник, а технологическую цивилизацию. О результатах эксперимента мини-терминаторов и о том, чему нам, людям, нужно научиться у LLM, рассказываю в статье.

Читать

Граница код | модель как архитектурный объект

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели11K

Размышление по мотивам проекта. Архитектура – router + pipelines (AWS, Claude).

Рассмотрим сравнительно простой пример, знакомый почти всем, кто делал LLM-агента для запросов к данным на естественном языке – будь то text2sql, аналитический ассистент или чат-бот над базой. Обычно агенту поручают решать всё самому – и определять тип запроса, и формировать его, и выбирать форму результата и решать, нужно ли предупредить об отклонении. Именно в этом суть агента и именно для этого пишется системный промпт.

На десятке тестовых вопросов система работает без нареканий. Но позже появляются проблемы, когда вопросы начинают приходить в разных формулировках. Например, один и тот же вопрос, заданный другими словами, вдруг обрабатывается иначе – модель по-другому интерпретировала фразу и одинаковые по структуре результаты приняли разную форму (строка, таблица, график) без объяснения причины. Или при одной той же формулировке вопроса отклонение то получает пояснение, то приходит пустым.

Первое, что обычно меняют в таких случаях – добавляют в промпт ещё одно правило. Несколько раз это действительно помогает. Потом новое правило начинает противоречить старым, и промпт превращается в набор заплаток под конкретные ситуации. Нестабильность никуда не уходит, она просто прячется теперь в том, в каком порядке моделью применяются противоречащие друг другу инструкции.

Именно здесь кроется и проблема, и ее решение. Проблема в том, что в описанном сценарии работы никто явно не решал, что в системе делает код, а что модель. Это сложилось само, по ходу генерации промпта. Спросите, почему модель выбирает форму результата запроса, а не разработчик пишет десять строк обычного кода, – и внятного ответа, как правило, не найдётся. Отсюда и решение: граница между тем, что делает код, и тем, что делает модель, – это не деталь реализации, а отдельный архитектурный объект. Если такое решение не принять явно, оно всё равно будет принято по умолчанию, и чаще всего не в пользу устойчивости системы.

Читать далее

AI‑GameDev. Учим ИИ азам левел‑дизайна

Уровень сложностиПростой
Время на прочтение10 мин
Охват и читатели11K

Все уже наверняка видели посты на «Бэкдорах», «Эксплойтах» и прочих кибертопорах о том, как кто-то, особенно с выходом новой модели, естественно, в один промпт сгенерировал копию Call of Duty, Starfield или любой другой игры. По видео выглядит сыровато, но играбельно, однако ключевая проблема здесь в том, что это демонстрационный вариант в формате браузерной игры. То есть совсем не те проекты, где мы с вами увлеченно сидим часами (любители браузерных игр и мобилок простите).

Как любой геймер, я всегда мечтал сделать свою игру. Не то что бы мне недоставало проектов, которые регулярно презентуют на Gamescom, а потом убирают на полку. Но хочется чего-то своего, людского, с российским колоритом. А наш АА\ААА-геймдев только начал подавать признаки жизни.

Я умею в C#, более-менее понимаю, как устроен Unity, могу поковыряться в Blender и что-то подрисовать на развертке в фотошопе. Но просто не хочу и все. С бесконечными задачами по работе, хобби и бытовым СДВГ сесть за какой-то долгострой нет ни времени, ни возможности. А потому меня посетила мысль отработать маркетинг желтушных IT-каналов на полную и собрать игру исключительно при помощи ИИ. Без единой собственной строчки кода, без единой собранной вручную модели и отрисованной текстуры.

В этой части я расскажу о тестах некоторых технических аспектов. Здесь не будет ничего о сценарии, механиках, кор лупах и даже о концепте. Ведь сперва нам нужно понять, а можно ли в принципе сделать играбельную сцену достойного уровня.

Читать далее

FastWave: как мы сделали самую лёгкую диффузионную модель для BWE

Уровень сложностиСредний
Время на прочтение5 мин
Охват и читатели7.5K

Привет, Хабр! Меня зовут Никита Кузнецов, я студент мастерской по сервисам и платформам ИИ Инженерно-математической школы НИУ ВШЭ и VK. Хочу поделиться историей и техническими подробностями нашего проекта FastWave, который был реализован под руководством Максима Каледина, доцента ФКН НИУ ВШЭ, и Александра Тараканова, исследователя AI VK и доцента ФКН НИУ ВШЭ. Мы разработали лёгкую диффузионную модель для восстановления высокочастотных деталей звука (BWE, Bandwidth Extension). Она повышает частоту дискретизации любого аудио до студийных 48 кГц, весит всего 1,3M параметров и быстро работает.

Читать далее

Как дифракционная оптика и нейронные сети позволяют снимать гиперспектральные изображения за одно экспонирование

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели10K

Привет! Хабр. Мы — группа исследователей из AIRI, Самарского университета и МФТИ, занимаемся вопросами точной цветовой репродукции и прикладной гиперспектральной съемкой. Не так давно мы придумали, как из обычной RGB‑камеры сделать гиперспектральную, заменив объектив пластинкой с набором гармонических линз. 

Гиперспектральная камера видит не три числа на пиксель, а тридцать одно, и по этому спектру можно, к примеру, отличить настоящий лист от пластикового, спелый плод от неспелого, один пигмент от другого. Проблема в том, что такие камеры стоят миллионы рублей и снимают один кадр минуту. Мы же сделали модуль, который встаёт на место объектива стандартной камеры и превращает её в гиперспектральную — и всё это за одну экспозицию и последующую обработку снимка нейросетью.

Мы недавно вернулись из Бремена, где представили нашу статью Diffract and Conquer: Hyperspectral Imaging from Any RGB Camera via Optical Encoding and Learning на IJCAI 2026. Здесь рассказываем о результате чуть более популярно и кратко.

Читать далее
1
23 ...