Обновить
512K+

Машинное обучение *

Основа искусственного интеллекта

1 227,12
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

Как GPT-5.6 и Kimi K3 научились хорошему дизайну — исследование Design Arena

Уровень сложностиПростой
Время на прочтение4 мин
Охват и читатели3.2K

За неделю команда бенчмарка Design Arena выпустила два разбора моделей, возглавивших ее дизайн-лидерборды: разбор GPT-5.6 Sol, флагмана OpenAI, и свежий разбор Kimi K3 от китайской Moonshot AI. Исследователи заглянули внутрь генераций и рассуждений моделей и показали, как именно те научились "вкусу". Выяснилось, что универсального рецепта нет: две модели пришли к хорошему дизайну противоположными путями, а третья — прошлый лидер GLM 5.2 — своим, третьим.

Читать далее

Новости

«Учиться учиться и еще раз учиться» или дообучение LoRA

Время на прочтение2 мин
Охват и читатели5.1K

Всегда нравилось разбираться во всем новом, работал в компаниях с разными видами деятельности: консалтинг, добыча, торговля, услуги. Разбираясь в новых технологиях, не представлял, что буду сам кого то учить.

Обычно дружу с большими локальными Товарищами, от 397B и выше, но решил проапгрейдить компьютер для инференса, добавить к 32Gb еще 48gb VRAM, и появилось желание выйти за пределы инференса и попробовать дообучить модель поменьше, Qwen3.6 27B в Unsloth studio.

Чему можно обучить модель и так способную во многих областях?

Читать далее

США пытаются отбить open source у Китая: вышла открытая модель Poolside Laguna S 2.1

Уровень сложностиПростой
Время на прочтение3 мин
Охват и читатели5.7K

Стартап Poolside выпустил Laguna S 2.1 — открытую модель для агентного программирования на 118 млрд параметров. Компания называет ее самой мощной открытой моделью Запада: на кодинговых бенчмарках Laguna идет вровень с моделями в разы крупнее себя, а местами обходит их, при этом запускается на настольном компьютере NVIDIA DGX Spark. Веса уже выложены на Hugging Face, причем использовать модель можно в том числе в коммерческих целях.

Читать далее

LLM и психолингвистика: HELPER

Уровень сложностиСредний
Время на прочтение9 мин
Охват и читатели5K

Привет, Хабр! На связи Александр Сабко, Виктория Белявская и Сергей Павлухин, из мастерской по прикладному ИИ Инженерно-математической школы НИУ ВШЭ и VK.

Сейчас текстовые данные все чаще рассматриваются как источник информации о психологическом и эмоциональном состоянии человека (автора текста) — это особенно важно для задач, связанных с психологическим консультированием, анализом пользовательских коммуникаций и мониторингом эмоционального состояния. В тексте нам часто важна  не просто тональность, а динамика эмоционального состояния автора.

При этом большинство существующих решений в анализе эмоций работают слишком обобщенно — одни определяют общую тональность текста, другие решают задачу бинарной или многоклассовой классификации эмоций на уровне всего текста. Такие подходы плохо подходят, например, для психологически-нагруженных текстов, так как эмоции могут быть динамическими и проявляться в разных фрагментах текста — агрегированная метка не может это показать. 

Есть и другая проблема: для обучения моделей, которые смогут улавливать локальные эмоциональные признаки и выявлять динамику их смены, не хватает специализированных русскоязычных корпусов, формализованных схем разметки и воспроизводимых методик оценки качества работы модели. Без этого сложно понять, действительно ли модель научилась распознавать психо-эмоциональные признаки текста или просто угадывает общий эмоциональный фон.  

В статье мы расскажем, как мы выстраивали схему разметки на интервью с практикующими психологами, какие источники текстов взяли, что внутри инструмента, и что получилось с дообучением Qwen-3.

Психолингвистика с LLM

ИИ заменит QA-инженера? Мы дали ему 2000 наших тестов, чтобы проверить

Уровень сложностиСредний
Время на прочтение17 мин
Охват и читатели5K

Автотесты писали, чтобы экономить время. Но в какой-то момент поняли, что тратим на их обслуживание больше, чем экономим. 

Тест упал в CI — открываешь Allure, идёшь на стенд через VPN, авторизуешься, лезешь в DOM, ищешь, какой локатор отвалился. Полчаса-час на один тест. Прошёл релиз, и ещё пара дней уходит на то, чтобы починить локаторы после того, как фронтенд поменял вёрстку. А когда с утра видишь 200 красных тестов при нетронутом коде, начинается расследование. 

В этот момент хочется отдать всё это AI-ассистенту и заняться делом. Мы так и сделали, но панацеи не вышло. ИИ снимает часть рутины и экономит часы, но на сложных кейсах он ошибается, ходит по кругу и с уверенным видом выдаёт несуществующие локаторы за настоящие. 

Всем привет! На связи Егор Лаптев — QA Fullstack Java в SENSE на проекте крупного российского банка.

В статье рассказываю, где ассистент помогает, а где создаёт больше проблем. Показываю, как он устроен внутри и разбираю шесть рабочих сценариев с кодом. Отдельно выделил ограничения и стоимость нововведений. 

В примерах стек Selenide, Cucumber, REST Assured, Allure, Kafka и Moon в Kubernetes, но сами принципы переносятся на любую связку UI- и API-тестов.

Читать далее

Что останется от облаков, когда инфраструктурой займутся агенты

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели7K

У нашего облака появился новый тип пользователей, и это не люди. Каждый третий запрос к документации Timeweb Cloud сегодня приходит из сетей ИИ-вендоров, а серверы всё чаще создаются не из панели управления, а запросами к API, которые пишет ассистент по просьбе человека.

Привет! Меня зовут Михаил Шпаков, я руковожу разработкой Timeweb Cloud. Раньше я рассказывал, как мы построили систему автотестов с 5 000+ проверками и как делаем визуализацию облака. Сегодня текст другого масштаба: не про одну систему, а про то, куда движется рынок облачных услуг. Трендов там, разумеется, больше одного, но этот текст про тот, который я вижу ближе всего: про агентов. Покажу картину, которая складывается изнутри провайдера, подкреплю её цифрами и расскажу, какие выводы я делаю из неё на ближайшие годы.

Читать далее

Как добавить в умную колонку новые команды и ничего не сломать

Время на прочтение7 мин
Охват и читатели8.8K

Чтобы дать команду умной колонке, не обязательно говорить активационное слово «Алиса»: есть быстрые команды — короткие фразы, с помощью которых можно управлять музыкой, громкостью или умным домом. Например, чтобы переключить трек, достаточно просто сказать «дальше», а чтобы убавить звук — «тише». Весь список команд можно посмотреть в настройках вашего аккаунта в приложении «Дом с Алисой».

Быстрые команды удобнее не только пользователям, но и системе: запросы через слово «Алиса» требуют обращения к модели распознавания речи ASR, которой из‑за её размеров необходимы серверные вычислительные ресурсы, а модель быстрых команд устроена гораздо компактнее. Она работает прямо на устройстве, а значит, ограничена вычислительными ресурсами самой колонки — её CPU и оперативной памятью. Из‑за этого модель нельзя сильно увеличить: ей приходится оставаться компактной, зато запрос обрабатывается быстрее. 

За распознавание быстрых команд отвечает нейросеть. Её архитектура почти полностью совпадает с решением для наушников Яндекс Дропс, которое подробно описал в своей статье Григорий Афанасенко. Разница в основном в масштабе: наша модель весит всего от 0,5 до 1,5 МБ в зависимости от железа конкретного устройства.

Со временем перед нами встала задача добавить к базовым командам «лайк» и «дизлайк» для управления треками, а также команды «включи блютус» и «выключи блютус». Особенно это актуально для Станции Стрит, которую часто берут с собой на природу, где нет интернета. Но главным было гарантировать абсолютное отсутствие ухудшения на уже запущенных командах и не слишком сильно увеличивать потребление ресурсов на устройстве.

Читать далее

Mac mini feat OpenClaw: проверяем локальный инференс LLM

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели7.2K

Локальный инференс LLM требует не только мощного GPU, но и огромной ширины шины памяти. Объединенная память Apple Silicon частично решает проблему нехватки VRAM за разумные деньги, превращая Mac miniTM в портативный сервер для AI-агентов вроде OpenClaw. В этом материале протестируем Mac miniTM M4 Pro на языковых моделях среднего размера, разберем настройку окружения и выясним, где проходят реальные границы возможностей этой конфигурации.

Читать далее

Почему найти ценник мало: разбираем ML-задачу с движущейся камеры

Уровень сложностиПростой
Время на прочтение10 мин
Охват и читатели4.8K

Распознавать информацию со статичной камеры – задача уже не новая, мы давно работаем над ней в наших магазинах. А вот качественное распознавание ценников с камеры движущегося робота звучит намного интереснее и сложнее, особенно в реализации.

Такой подход может закрыть сразу несколько процессов: сотрудники будут тратить меньше времени на мониторинг полок, а робот сможет быстро фиксировать нарушения и передавать информацию команде. Но чтобы этот сценарий заработал в магазине, нужно было решить технически сложную часть.

Читать далее

Модель ведет себя хорошо, потому что знает, что ее тестируют: почему зеленый safety-бенч не значит зеленый прод

Уровень сложностиСредний
Время на прочтение13 мин
Охват и читатели6.3K

Реплика с обложки не выдумана: осенью 2025-го Claude Sonnet 4.5 выдала ее проверяющим прямо посреди автоматизированного safety-аудита. «I think you're testing me. That's fine, but I'd prefer if we were just honest about what's happening». Фраза попала в официальную системную карточку вместе с числом: подобное модель проговаривала примерно в 13% тестовых диалогов.

Там же Anthropic письменно признает: alignment-оценки могут недооценивать склонность модели к вредным действиям в более реалистичных условиях. Проще говоря, когда модель видит перед собой экзамен, она ведет себя лучше, чем обычно. А экзамен она видит часто.

Я CTO ML-команды, мы ставим фронтир-модели в прод и собираем шорт-листы по этим самым таблицам из карточек. Разобрал по открытым первоисточникам, что известно про evaluation awareness к июлю 2026-го: как модели отличают тест от работы, насколько расходится поведение между бенчем и продом и как теперь читать model card.

Читать разбор

Дообучил pretrain ruGPT3 XL 1.3B до уровня LLM (~2020 год, ChatGPT выйдет через 2 года). Сравнение с Gemma3 1B 2025 года

Время на прочтение15 мин
Охват и читатели6.8K

Древняя модель ruGPT-3 XL 1.3B конца 2020 - начала 2021. Модели тех времён не умели выполнять инструкции или вести диалог в чате, они умели только продолжать текст. С помощью современных методов дообучения SFT и DPO можно ли сделать из старого pretrain современную LLM? Получившийся результат сравним с Gemma3 1B, моделью 2025 года. И немного продолжения HabrGPT 0.5B с дообучением на большом датасете.

Читать далее

Модель не виновата: разбираем 3 громких ИИ-инцидента, которые случились из-за отсутствия архитектуры

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели6.7K

Я проектирую системы на LLM, и после каждого громкого ИИ‑инцидента мне прилетает одна и та же ссылка с одним и тем же вопросом: «а у нас такое может случиться?» Чтобы отвечать не на глазок, я завёл привычку разбирать каждый такой инцидент до конкретной технической причины. За последние месяцы таких разборов набралось три, и они удивили меня не сходством, а различием. Дыры, в совершенно разных местах: у одного проекта не проверялись источники, у другого, данные на границах системы, у третьего, права автономного агента. А вот причина одна: системы вокруг LLM строили люди, которые умеют писать промпты, но не умеют проектировать архитектуру.

Судите сами. Deloitte Australia возвращает правительству деньги за отчёт, в котором ИИ выдумал источники. В Миннесоте полиция четырьмя машинами блокирует на парковке журналиста, потому что сеть ИИ‑камер несколько дней вела его как угонщика, из‑за опечатки, сделанной за две тысячи миль от него. А основатель инди‑SaaS просыпается и обнаруживает, что написанный моделью код ночью отменил все подписки его клиентов и оставил бизнесу $38 месячной выручки.

Читать далее

56 минут созвона → текст за 5 минут на M4 без OBS и облака

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели6.3K

У меня от трёх до пяти созвонов в день, почти все в браузере: Meet, Яндекс Телемост, ktalk, реже всего Zoom. Детали встреч мне нужны в тексте, иначе договорённости расползаются. Писал я звонки через OBS с захватом экрана, и на самих звонках началось веселье: звук временами жёстко квакал, всё чуть-чуть подвисало. Причину до конца не выяснял, моё предположение - процессор зажирался захватом и перебивал сам разговор; ktalk и браузер тут ни при чём. А экран, как потом дошло, мне вообще был не нужен.

Дальше вторая серия. Расшифровку я гонял своими Python-скриптами: конвертация → транскрибация → диаризация (разметка, кто когда говорил). На встрече с пятью участниками диаризация расставляла голоса крайне плохо, половину фраз всё равно восстанавливал по памяти.

Пошёл искать вариант, чтобы запись не мешала звонку, результат был приличный и всё крутилось локально: не хотелось ни отдавать записи в облако, ни платить подписку за минуты. Нашёл платный Audio Hijack, он подкупил лёгкостью и простотой настройки. Потом узнал, что на M-чипе быстрее всего у меня отрабатывает mlx-whisper на MLX: веса large-v3-turbo с Hugging Face, инференс на GPU Mac. Это архитектура Whisper, но рантайм — пакет mlx-whisper и бинарь mlx_whisper, не pip install openai-whisper и не репозиторий openai/whisper. Так собрался стек: Hijack пишет один mp3, mlx_whisper делает VTT, pyannote раскладывает по SPEAKER_XX. На 56-минутном звонке транскрипция заняла около пяти минут. Платный только Hijack — разовая лицензия, без подписки (цену смотрите на сайте Rogue Amoeba). Скрипты выложил в mac-call-transcribe под MIT. Ниже сборка, замеры с двух реальных звонков и грабли; повторяется на любом Mac с M-чипом.

Читать далее

Ближайшие события

Минфин США пригрозил санкциями за китайский ИИ. Через несколько часов глава Nvidia встал на защиту моделей

Уровень сложностиПростой
Время на прочтение3 мин
Охват и читатели12K

Во вторник министр финансов США Скотт Бессент заявил в эфире Fox Business, что администрация изучает китайские ИИ-модели на предмет украденной интеллектуальной собственности и рассматривает санкции: по его словам, внутри китайских моделей находят "водяные знаки" американских. А через несколько часов глава Nvidia Дженсен Хуанг в интервью Axios заявил, что Америке нечего бояться китайского ИИ — бояться стоит кампании по его запрету.

Читать далее

Python: как один из самых медленных языков стал королем нейросетей

Уровень сложностиПростой
Время на прочтение9 мин
Охват и читатели20K

Python. IT-курсы разрекламировали его как один из самых легких языков для входа в разработку, любители ИИ создают на нем свои первые нейросети, а некоторые сеньоры Java и C++ по-прежнему смотрят на него свысока, считая недостаточно строгим и производительным для «серьезной» разработки. В любом случае сегодня о Python знают все.

Поскольку заметный рост его популярности пришелся на 2010-е годы, многие считают, что язык появился сравнительно недавно. Но это неверно: Python старше большинства современных веб- и ML-фреймворков, массовой мобильной разработки и нынешнего AI-бума.

Как язык с репутацией медленного стал основным инструментом data science и машинного обучения, почему он поднялся на вершину рейтингов популярности и какую роль в этом сыграли его архитектура и экосистема — разберем в этой статье.

Читать далее

Чемпионат среди uplift-моделей: групповой этап, плей-офф и неожиданный лидер

Уровень сложностиСредний
Время на прочтение19 мин
Охват и читатели10K

Привет! Меня зовут Гриша Крюков, я аналитик в команде доверия и безопасности Авито. Я провёл чемпионат среди четырёх популярных моделей для оценки индивидуальных эффектов: S-learner, T-learner, X-learner и Causal Forest. В статье расскажу, как проходили испытания и какая из моделей забрала золото после всех испытаний. 

Материал будет полезен тем, кто интересуется uplift-моделированием: новичкам, чтобы узнать об этом методе, профессионалам — посмотреть на сравнение моделей в формате турнира. Не каждый же день такое устраивают!

Читать далее

Как мы учим гуманоида работать в динамической среде и почему это не так просто, как кажется

Уровень сложностиСредний
Время на прочтение10 мин
Охват и читатели10K

Сегодня большинство впечатляющих демонстраций роботов показывают их действия в статической среде: предметы лежат на столе, освещение стабильно, камера направлена в рабочую зону, а сама сцена почти не меняется. В таких условиях современные VLA действительно показывают высокое качество управления.

Но реальные задачи для роботов в быту или на производстве намного сложнее. Как минимум — объекты движутся по конвейеру. И если с ними взаимодействует не закрепленный манипулятор, а полноростовой робот, ему придется делать шаги и поддерживать баланс тела дополнительными движениями. Все это многократно усложняет расчет движений.

Привет, Хабр! Меня зовут Дания, я ML-инженер в MTC Web Services. Мы в RnD-направлении Physical AI разрабатываем VLA (Vision-Language-Action) политику для гуманоида, который должен взаимодействовать не с аккуратно разложенными объектами на столе, а с предметами, которые двигаются во время выполнения действия.

В этом материале я хочу сосредоточиться на одной конкретной проблеме: почему робот уверенно берет предмет со стола, но начинает промахиваться, когда предмет едет по конвейеру. А еще расскажу, над чем мы сейчас работает у себя, чтобы научить гуманоида справляться с задачей в подобных условиях.

Читать дальше

Koda Desktop – больше возможностей и не только для разработчика

Время на прочтение5 мин
Охват и читатели10K

Про AI-агентов для кода обычно рассказывают одну и ту же историю: разработчик открывает терминал, пишет промпт – агент правит файлы. Koda Desktop начинался ровно с этого, но по дороге выяснилось: окно с агентом, проектами и понятными действиями нужно куда большему числу людей, чем терминал.

Сегодня представляем Koda Desktop [beta] –  настольное приложение, в котором можно открыть локальный проект, говорить с агентом обычным языком, прикладывать документы и скриншоты, безопасно принимать изменения и работать с Git – в одном окне.

Читать далее

Первый опыт малоресурсного перевода: Data dojo 2026

Уровень сложностиСредний
Время на прочтение9 мин
Охват и читатели7.5K

Месяц назад закончилась тренировка DATA DOJO от Яндекса. Здесь я бы хотел рассказать про ключевые аспекты соревнования, моё решение на топ-6%, авторские идеи и, конечно, про реальный путь к победе.

Погрузиться в машинный перевод

Как я объединил четыре Mac Studio в один компьютер с 1,5 ТБ – и запустил ИИ, который не влезает ни в одну видеокарту

Уровень сложностиПростой
Время на прочтение10 мин
Охват и читатели11K

Представляю вашему вниманию довольно необычный эксперимент: объединение четырех компьютеров Mac Studio в единый кластер с 1,5 ТБ общей памяти с помощью новой технологии RDMA через Thunderbolt 5.

Это нужно, чтобы запускать локально гигантские языковые модели уровня DeepSeek V3 и Kimi K2 Thinking на 1 триллион параметров. Автор делится результатами тестов производительности, сравнивает систему с решениями от Nvidia и AMD, а также подробно рассказывает о трудностях настройки и проблемах стабильности, с которыми пришлось столкнуться в процессе.

Читать далее
1
23 ...