Обновить
1024K+

Машинное обучение *

Основа искусственного интеллекта

1 276,78
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

Mac mini feat OpenClaw: проверяем локальный инференс LLM

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели9K

Локальный инференс LLM требует не только мощного GPU, но и огромной ширины шины памяти. Объединенная память Apple Silicon частично решает проблему нехватки VRAM за разумные деньги, превращая Mac miniTM в портативный сервер для AI-агентов вроде OpenClaw. В этом материале протестируем Mac miniTM M4 Pro на языковых моделях среднего размера, разберем настройку окружения и выясним, где проходят реальные границы возможностей этой конфигурации.

Читать далее

Модель ведет себя хорошо, потому что знает, что ее тестируют: почему зеленый safety-бенч не значит зеленый прод

Уровень сложностиСредний
Время на прочтение13 мин
Охват и читатели7K

Реплика с обложки не выдумана: осенью 2025-го Claude Sonnet 4.5 выдала ее проверяющим прямо посреди автоматизированного safety-аудита. «I think you're testing me. That's fine, but I'd prefer if we were just honest about what's happening». Фраза попала в официальную системную карточку вместе с числом: подобное модель проговаривала примерно в 13% тестовых диалогов.

Там же Anthropic письменно признает: alignment-оценки могут недооценивать склонность модели к вредным действиям в более реалистичных условиях. Проще говоря, когда модель видит перед собой экзамен, она ведет себя лучше, чем обычно. А экзамен она видит часто.

Я CTO ML-команды, мы ставим фронтир-модели в прод и собираем шорт-листы по этим самым таблицам из карточек. Разобрал по открытым первоисточникам, что известно про evaluation awareness к июлю 2026-го: как модели отличают тест от работы, насколько расходится поведение между бенчем и продом и как теперь читать model card.

Читать разбор

Дообучил pretrain ruGPT3 XL 1.3B до уровня LLM (~2020 год, ChatGPT выйдет через 2 года). Сравнение с Gemma3 1B 2025 года

Время на прочтение15 мин
Охват и читатели8K

Древняя модель ruGPT-3 XL 1.3B конца 2020 - начала 2021. Модели тех времён не умели выполнять инструкции или вести диалог в чате, они умели только продолжать текст. С помощью современных методов дообучения SFT и DPO можно ли сделать из старого pretrain современную LLM? Получившийся результат сравним с Gemma3 1B, моделью 2025 года. И немного продолжения HabrGPT 0.5B с дообучением на большом датасете.

Читать далее

Модель не виновата: разбираем 3 громких ИИ-инцидента, которые случились из-за отсутствия архитектуры

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели7.3K

Я проектирую системы на LLM, и после каждого громкого ИИ‑инцидента мне прилетает одна и та же ссылка с одним и тем же вопросом: «а у нас такое может случиться?» Чтобы отвечать не на глазок, я завёл привычку разбирать каждый такой инцидент до конкретной технической причины. За последние месяцы таких разборов набралось три, и они удивили меня не сходством, а различием. Дыры, в совершенно разных местах: у одного проекта не проверялись источники, у другого, данные на границах системы, у третьего, права автономного агента. А вот причина одна: системы вокруг LLM строили люди, которые умеют писать промпты, но не умеют проектировать архитектуру.

Судите сами. Deloitte Australia возвращает правительству деньги за отчёт, в котором ИИ выдумал источники. В Миннесоте полиция четырьмя машинами блокирует на парковке журналиста, потому что сеть ИИ‑камер несколько дней вела его как угонщика, из‑за опечатки, сделанной за две тысячи миль от него. А основатель инди‑SaaS просыпается и обнаруживает, что написанный моделью код ночью отменил все подписки его клиентов и оставил бизнесу $38 месячной выручки.

Читать далее

56 минут созвона → текст за 5 минут на M4 без OBS и облака

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели7K

У меня от трёх до пяти созвонов в день, почти все в браузере: Meet, Яндекс Телемост, ktalk, реже всего Zoom. Детали встреч мне нужны в тексте, иначе договорённости расползаются. Писал я звонки через OBS с захватом экрана, и на самих звонках началось веселье: звук временами жёстко квакал, всё чуть-чуть подвисало. Причину до конца не выяснял, моё предположение - процессор зажирался захватом и перебивал сам разговор; ktalk и браузер тут ни при чём. А экран, как потом дошло, мне вообще был не нужен.

Дальше вторая серия. Расшифровку я гонял своими Python-скриптами: конвертация → транскрибация → диаризация (разметка, кто когда говорил). На встрече с пятью участниками диаризация расставляла голоса крайне плохо, половину фраз всё равно восстанавливал по памяти.

Пошёл искать вариант, чтобы запись не мешала звонку, результат был приличный и всё крутилось локально: не хотелось ни отдавать записи в облако, ни платить подписку за минуты. Нашёл платный Audio Hijack, он подкупил лёгкостью и простотой настройки. Потом узнал, что на M-чипе быстрее всего у меня отрабатывает mlx-whisper на MLX: веса large-v3-turbo с Hugging Face, инференс на GPU Mac. Это архитектура Whisper, но рантайм — пакет mlx-whisper и бинарь mlx_whisper, не pip install openai-whisper и не репозиторий openai/whisper. Так собрался стек: Hijack пишет один mp3, mlx_whisper делает VTT, pyannote раскладывает по SPEAKER_XX. На 56-минутном звонке транскрипция заняла около пяти минут. Платный только Hijack — разовая лицензия, без подписки (цену смотрите на сайте Rogue Amoeba). Скрипты выложил в mac-call-transcribe под MIT. Ниже сборка, замеры с двух реальных звонков и грабли; повторяется на любом Mac с M-чипом.

Читать далее

Минфин США пригрозил санкциями за китайский ИИ. Через несколько часов глава Nvidia встал на защиту моделей

Уровень сложностиПростой
Время на прочтение3 мин
Охват и читатели12K

Во вторник министр финансов США Скотт Бессент заявил в эфире Fox Business, что администрация изучает китайские ИИ-модели на предмет украденной интеллектуальной собственности и рассматривает санкции: по его словам, внутри китайских моделей находят "водяные знаки" американских. А через несколько часов глава Nvidia Дженсен Хуанг в интервью Axios заявил, что Америке нечего бояться китайского ИИ — бояться стоит кампании по его запрету.

Читать далее

Python: как один из самых медленных языков стал королем нейросетей

Уровень сложностиПростой
Время на прочтение9 мин
Охват и читатели21K

Python. IT-курсы разрекламировали его как один из самых легких языков для входа в разработку, любители ИИ создают на нем свои первые нейросети, а некоторые сеньоры Java и C++ по-прежнему смотрят на него свысока, считая недостаточно строгим и производительным для «серьезной» разработки. В любом случае сегодня о Python знают все.

Поскольку заметный рост его популярности пришелся на 2010-е годы, многие считают, что язык появился сравнительно недавно. Но это неверно: Python старше большинства современных веб- и ML-фреймворков, массовой мобильной разработки и нынешнего AI-бума.

Как язык с репутацией медленного стал основным инструментом data science и машинного обучения, почему он поднялся на вершину рейтингов популярности и какую роль в этом сыграли его архитектура и экосистема — разберем в этой статье.

Читать далее

Чемпионат среди uplift-моделей: групповой этап, плей-офф и неожиданный лидер

Уровень сложностиСредний
Время на прочтение19 мин
Охват и читатели11K

Привет! Меня зовут Гриша Крюков, я аналитик в команде доверия и безопасности Авито. Я провёл чемпионат среди четырёх популярных моделей для оценки индивидуальных эффектов: S-learner, T-learner, X-learner и Causal Forest. В статье расскажу, как проходили испытания и какая из моделей забрала золото после всех испытаний. 

Материал будет полезен тем, кто интересуется uplift-моделированием: новичкам, чтобы узнать об этом методе, профессионалам — посмотреть на сравнение моделей в формате турнира. Не каждый же день такое устраивают!

Читать далее

Как мы учим гуманоида работать в динамической среде и почему это не так просто, как кажется

Уровень сложностиСредний
Время на прочтение10 мин
Охват и читатели11K

Сегодня большинство впечатляющих демонстраций роботов показывают их действия в статической среде: предметы лежат на столе, освещение стабильно, камера направлена в рабочую зону, а сама сцена почти не меняется. В таких условиях современные VLA действительно показывают высокое качество управления.

Но реальные задачи для роботов в быту или на производстве намного сложнее. Как минимум — объекты движутся по конвейеру. И если с ними взаимодействует не закрепленный манипулятор, а полноростовой робот, ему придется делать шаги и поддерживать баланс тела дополнительными движениями. Все это многократно усложняет расчет движений.

Привет, Хабр! Меня зовут Дания, я ML-инженер в MTC Web Services. Мы в RnD-направлении Physical AI разрабатываем VLA (Vision-Language-Action) политику для гуманоида, который должен взаимодействовать не с аккуратно разложенными объектами на столе, а с предметами, которые двигаются во время выполнения действия.

В этом материале я хочу сосредоточиться на одной конкретной проблеме: почему робот уверенно берет предмет со стола, но начинает промахиваться, когда предмет едет по конвейеру. А еще расскажу, над чем мы сейчас работает у себя, чтобы научить гуманоида справляться с задачей в подобных условиях.

Читать дальше

Koda Desktop – больше возможностей и не только для разработчика

Время на прочтение5 мин
Охват и читатели11K

Про AI-агентов для кода обычно рассказывают одну и ту же историю: разработчик открывает терминал, пишет промпт – агент правит файлы. Koda Desktop начинался ровно с этого, но по дороге выяснилось: окно с агентом, проектами и понятными действиями нужно куда большему числу людей, чем терминал.

Сегодня представляем Koda Desktop [beta] –  настольное приложение, в котором можно открыть локальный проект, говорить с агентом обычным языком, прикладывать документы и скриншоты, безопасно принимать изменения и работать с Git – в одном окне.

Читать далее

Первый опыт малоресурсного перевода: Data dojo 2026

Уровень сложностиСредний
Время на прочтение9 мин
Охват и читатели7.7K

Месяц назад закончилась тренировка DATA DOJO от Яндекса. Здесь я бы хотел рассказать про ключевые аспекты соревнования, моё решение на топ-6%, авторские идеи и, конечно, про реальный путь к победе.

Погрузиться в машинный перевод

Как я объединил четыре Mac Studio в один компьютер с 1,5 ТБ – и запустил ИИ, который не влезает ни в одну видеокарту

Уровень сложностиПростой
Время на прочтение10 мин
Охват и читатели12K

Представляю вашему вниманию довольно необычный эксперимент: объединение четырех компьютеров Mac Studio в единый кластер с 1,5 ТБ общей памяти с помощью новой технологии RDMA через Thunderbolt 5.

Это нужно, чтобы запускать локально гигантские языковые модели уровня DeepSeek V3 и Kimi K2 Thinking на 1 триллион параметров. Автор делится результатами тестов производительности, сравнивает систему с решениями от Nvidia и AMD, а также подробно рассказывает о трудностях настройки и проблемах стабильности, с которыми пришлось столкнуться в процессе.

Читать далее

Все, что нужно знать про построение точечных оценок

Уровень сложностиСредний
Время на прочтение5 мин
Охват и читатели6.6K

Что происходит под капотом, когда вы вызываете scipy.stats.norm.fit()? В статье рассматриваются два классических подхода точечного оценивания параметров — метод моментов и метод максимального правдоподобия — с математическими выводами, экспериментами на Python и визуализацией.

Читать статью

Ближайшие события

Thales Group: отчёт о роли ИИ в информационной безопасности

Время на прочтение5 мин
Охват и читатели8.2K

Привет! Наш экспертно-аналитический центр разобрал отчёт Thales Group (это транснациональная корпорация, которая  занимается разработкой решений и систем для аэрокосмического, оборонного и морского секторов). Для исследования опросили более
3 000 респондентов из 20 разных стран.

Под катом — ситуация с ИБ в компаниях по всему миру, изменения, связанные с активным развитием ИИ, а еще результаты исследования Ассоциации по защите деловой информации (BISA), которая опросила представителей российских компаний на тему рисков информационной безопасности, связанных с использованием ИИ в рабочих процессах.

Кроме ставших привычными изменений, вызванных внедрением ИИ на предприятиях и в компаниях, ситуацию стали усложнять ИИ-агенты. Согласно данным Thales Group, уже больше трети организаций используют в работе ИИ-агентов (34%), а насчёт того, планируют ли компании начать их внедрять, 73% ответили положительно — причём внедрения планируются в течение года.

С появлением агентных приложений резко выросли скорость и объём используемых данных, из-за чего компаниям стало гораздо сложнее обеспечивать должный уровень безопасности. Исследование отмечает, рост числа организаций (на 50% в год), выделяющих бюджет на информационную безопасность именно для обеспечения защиты в связи с применением ИИ.

Эксперты сходятся в том, что по мере использования агентных ИИ необходимо улучшать способы обеспечения внутренней безопасности, иначе ИИ быстро станет внутренней угрозой.

Читать далее

Точность игрока в шахматной партии 71%, что это значит?

Уровень сложностиСредний
Время на прочтение17 мин
Охват и читатели10K

Магнус Карлсен сыграл партию с точностью 88.7% на Chess.com и 71% на Lichess. Кто прав? Спойлер: единственно правильного ответа здесь, скорее всего, нет. Разбираю по шагам, как Lichess считает точность партии, от сантипешек и логистической функции до гармонического среднего и контекстно-взвешенной агрегации. В конце - Python-скрипт для воспроизведения результата.

Читать далее

Агенты, или Путешествие к LLM и обратно

Уровень сложностиСредний
Время на прочтение19 мин
Охват и читатели7.3K

Агенты сейчас обсуждают все подряд. Меняются фреймворки, появляются MCP-серверы, облака обещают «агента из коробки». Но в центре любой такой схемы по-прежнему одна и та же вещь — LLM: она читает контекст и формулирует следующий шаг. А между запросом к агенту и самой моделью — ещё несколько слоёв.

Сама модель всего лишь предсказывает вероятности следующего токена; снаружи нарастает луковица обёрток — о них и речь. Если собирать агента не из готового конструктора, понимание этой логики помогает быстрее найти источник проблемы: поломки могут быть не в модели, а на каком-то уровне рядом. Я пришёл к агентам из ML: для меня каждый новый слой появлялся поверх уже знакомого — поэтому дальше рассказываю от модели наружу. Идея статьи пришла после очередного совместного поиска бага с технической командой: захотелось собрать заметки в один обзор, чтобы в следующий раз было проще объяснять.

Читать далее

Поймай jailbreak, если сможешь

Уровень сложностиСредний
Время на прочтение12 мин
Охват и читатели5.4K

«Люди понимают то, что им дают понять», — говорил Фрэнк Абигнейл. Модели — тоже. Статья о том, как jailbreak обходит защиту LLM не силой, а формой: легендой, стилем, поддельной ролью.

Читать далее

Самообучающийся ИИ-агент Hermes: что умеет и как запустить его на сервере

Время на прочтение7 мин
Охват и читатели9K

Всем привет!

Почти все ИИ-ассистенты хорошо справляются с отдельными запросами, но почти каждый новый диалог начинают с чистого листа. Можно, конечно, снова объяснить структуру проекта, напомнить принятые решения и перечислить уже найденные вами ошибки, но через несколько раз это начинает раздражать.

Hermes Agent от Nous Research - это уже другой случай. Он сохраняет важные факты, ищет информацию в предыдущих диалогах, превращает удачные способы решения задач в навыки и использует их в дальнейшем. При этом, что довольно удобно, агент может работать и принимать сообщения из Telegram!

В этой статье разберем, что именно в Hermes называется самообучением, чем он отличается от обычного чат-бота, какие задачи ему можно поручить и как запустить собственного агента на удаленном сервере.

Читать далее

Не дали ИИ-агенту соврать — его же памятью

Уровень сложностиСредний
Время на прочтение9 мин
Охват и читатели12K

На днях наш агент собрался дежурно отчитаться об успехе. Прежде чем нажать «готово», он сверился с собственной памятью — и нашёл там запись из прошлой сессии: эту идею он уже проверял на реальных данных, и она провалилась. Он остановил сам себя, до ложного отчёта.

Это не рекламная зарисовка, это лог из жизни. Ниже — два таких лога подряд, и во втором память заставила нас выбросить фичу, которой мы гордились.

Хватай за цифровой хвост

MAP‑Elites: как искать не «лучшее», а «лучшее в каждой нише»

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели11K

Проблема, которую не решает обычная оптимизация

Классические методы оптимизации — градиентный спуск, генетические алгоритмы с элитизмом, CMA‑ES — заточены под одну вещь: найти один глобальный максимум функции приспособленности. Всё остальное население на пути к этому максимуму считается расходным материалом и отбрасывается.

Но во многих задачах нас интересует не единственное решение, а набор разнообразных хороших решений:

Эволюционная робототехника. Нужно не одно «оптимальное» положение ног шагающего робота, а целая библиотека походок под разные повреждения — если у робота откажет один сустав, он должен уметь быстро подобрать альтернативную походку вместо повторной оптимизации с нуля.

Процедурная генерация контента в играх. Нужны не «лучшие» уровни, а уровни, покрывающие весь спектр: лёгкие/сложные, линейные/разветвлённые.

Дизайн и инженерия. Инженеру интересно увидеть весь фронт компромиссов (вес vs прочность vs стоимость), а не одну точку.

Открытые (так называемый open‑ended) эволюционные системы, где само понятие «лучшего» плохо определено, а интересна широта поведенческого репертуара.

Это направление получило название Quality‑Diversity (QD) оптимизации: цель — не максимизировать один скаляр, а заполнить пространство возможных поведений решениями, каждое из которых максимально хорошо в своей поведенческой нише.

MAP‑Elites — один из первых и самый концептуально простой алгоритм этого семейства.

Идея алгоритма

MAP‑Elites (Multi‑dimensional Archive of Phenotypic Elites) был предложен в 2015 году.

Читать далее