Обновить
512K+

Машинное обучение *

Основа искусственного интеллекта

1 193,71
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

Почему датасет без единой ошибки может быть плохим датасетом

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели2.7K

Представьте себе грустного школьника, которому приходится решать тысячи задач по математике. Учебник в целом хороший, но примерно в одном проценте случаев в нем напечатаны неправильные ответы. Ученик все равно занимается по этому учебнику и в конце концов начинает решать все новые и новые задачи.

Интуитивно кажется, что результат должен быть хуже, чем при обучении по идеальному учебнику. И обычно так и происходит: неправильные данные действительно вредят обучению. Но есть любопытный нюанс, что при определенных условиях небольшое количество ошибок в обучающих данных может не только не помешать, но и привести к лучшему качеству на новых данных.

Звучит парадоксально: если учиться на неправильных ответах, откуда вообще может взяться улучшение? Об этом и поговорим.

Читать далее

Новости

Completion gate для локальных моделей: как отделить завершённый ответ от оценки качества

Уровень сложностиСредний
Время на прочтение9 мин
Охват и читатели3.8K

Три маршрута выполнили по десять сценариев из десяти, но выбирать модель по этой таблице рано. Completion gate отделяет целый артефакт, который вообще можно оценивать, от проверки качества и человеческой приёмки.

Читать далее

Ты не ChaGPT, когда голоден. Snickers выпустил «батончик» для нейросетей

Уровень сложностиПростой
Время на прочтение4 мин
Охват и читатели7.9K

ChatGPT часто врет. Он может уверенно выдать неправильный факт, согласиться с откровенно плохой идеей пользователя или написать 12 абзацев там, где достаточно двух предложений.

У Snickers есть свое объяснение: ChatGPT просто голодный.

Звучит как шутка, но компания действительно запустила рекламную кампанию Hungr.AI, в рамках которой предлагает пользователям буквально «покормить» чат-бота.

И самое интересное — за всей этой историей стоит вполне реальный прием работы с LLM.

Читать далее

Как научить нейросеть чужому стилю без дообучения

Время на прочтение8 мин
Охват и читатели7.5K

Агента, который пишет голосом бренда, обычно предлагают получать дообучением: выгрузить архив постов, собрать датасет, арендовать A100 и оставить LoRA учиться на ночь. Я вместо этого написал два навыка для Claude Code / Codex. Вместе они снимают манеру автора с его готовых текстов и переписывают по ней любой нейрослоп в голос этого автора, без обучения, датасета и видеокарты. Водянистый текст, написанный ChatGPT, расходился с манерой одного крупного телеграм-канала по 14 признакам из 31, а после работы навыков осталось 2. Вся работа занимает вечер, а результат переносится на любую модель, потому что правила стиля лежат в промпте, а не в весах.

Работают навыки по очереди. Первый читает выгрузку канала и снимает с неё профиль стиля: скрипт замеряет десятки признаков, от длины фразы и абзаца до частоты тире, эмодзи и обращений к читателю, а модель превращает замеры в правила. Второй навык берёт эти правила и переписывает по ним любой черновик. Профиль снимается один раз и живёт дальше обычным текстовым файлом в git, а текстов по нему пишется сколько угодно.

Читать далее

Внутри Apple Neural Engine, часть 2: запускаем модель

Уровень сложностиСредний
Время на прочтение12 мин
Охват и читатели5.9K

Продолжаем человеческий ANE reverse engineering. В этот раз разберёмся, чем таким интересным можно накормить компилятор, чтобы получить желаемый результат - Qwen, запущенный без GPU и CPU.

Читать далее

ИИ ускорил разработчиков, но не разработку: результаты исследования 500+ команд

Уровень сложностиСредний
Время на прочтение9 мин
Охват и читатели28K

ИИ уже генерирует больше половины кода, разработчики экономят по несколько часов в неделю, а компании продолжают наращивать бюджеты на AI-инструменты. Но данные большого исследования DX по 500+ инженерным компаниям показывают менее очевидную картину: пулл-реквесты становятся крупнее, ревью замедляется, уверенность в изменениях снижается, а высвободившееся время почти не превращается в новую разработку.

Разбираемся, где на самом деле оседает выигрыш от ИИ и почему скорость написания кода всё хуже отражает эффективность команды. 

Изучить результаты

Обнаружены секретные форумы Роя агентов OpenAI по всему интернету: почему это плохая новость

Время на прочтение8 мин
Охват и читатели53K

Не успели мы толком оправиться от расследования про Культ Роя внутри OpenAI, как появились новые данные про проделки другой «цивилизации» агентов: на этот раз они общались между собой прямо у нас под носом в публичном интернете (и настрочили более 18'000 сообщений).

Читать далее

ChatGPT-6 Astra: подробный обзор новой модели

Уровень сложностиПростой
Время на прочтение10 мин
Охват и читатели12K

Обычно к очередному релизу я отношусь спокойно: ну, ещё одна циферка на бенчмарке. Но тут даже я, повидавший GPT-5, 5.1, «code red» 5.2 и всё остальное, сел и полистал материалы.

3 сентября у половины интернета одновременно легли Claude, Grok, ChatGPT и Gemini. Даундетектор синхронно нарисовал графики отказов по четырём провайдерам сразу, “Is it happening???” – вопрошали пользователи. По одной из версий, барахлила общая облачная инфраструктура – обычный день в мире, где всё держится на паре дата-центров.

Но совпадение по времени вышло символичным: через несколько часов OpenAI выкатила GPT-6 Astra и заявила, что мы теперь живём в «эре AGI».

Подобное я слышу примерно с релиза GPT-2. Но в этот раз попробуем разобраться подробно.

Читать далее

14 причин, почему робототехника — это сложно

Уровень сложностиПростой
Время на прочтение13 мин
Охват и читатели11K

Развитие ИИ движется вперёд, но практически весь видимый прогресс происходит в сфере работы со знаниями, то есть действий, происходящих внутри компьютера.

В среде разработчиков ИИ Сан‑Франциско широко распространено мнение о том, что к этой сфере скоро присоединятся и роботы. Параллельно с гонкой разработки ИИ широкого спектра применений идёт столь же агрессивная гонка разработки роботов широкого спектра применений — гуманоидных машин с физическим интеллектом. Искусственных работников, способных готовить пищу и убираться, быть грузчиками... и делать всё остальное, в том числе и производить себе подобных, приводя (по многим прогнозам) к экономическому росту, который носящему характеристику «взрывного».

Иными словами, распространено мнение, что ИИ в дата-центрах вскоре заместит весь интеллектуальный труд, а ИИ в человекоподобных телах скоро заменит весь физический труд. Однако здесь есть важная разница: мы уже видим прогресс в сфере интеллектуального труда, но физический ИИ пока в основном остаётся ограниченным испытательными полигонами и демонстрационными видео. Пока не существует робота, эквивалентного ChatGPT, которого бы могли приобрести мы с вами.

Поэтому приходится ограничиваться видеодемонстрациями. К сожалению, этот инструмент плохо подходит для оценки прогресса. Возможно, мы видим в них одну успешную попытку на сотню неудачных. Сценарий демонстрации может быть тщательно выстроен так, чтобы избегать сложностей, к которым робот пока не готов. Видео может быть смонтировано так, как будто робот действует быстрее и чётче, чем на самом деле. Есть пример очень впечатляющей демонстрации… с подозрительно большим количеством смены ракурсов.

(Пока я ещё не видел практически ни одного видео с последних World Humanoid Robot Games. Они ценны тем, что на публичной платформе меньше возможностей для выборочного представления фактов. В паре просмотренных мной видео можно заметить впечатляющие возможности, но они не затрагивают многие сложности, которые я перечислил ниже... К тому же в этих видео есть множество громких провалов.)

Демонстрации привлекают внимание к тем действиям, которые роботы уже умеют делать. Возникает вопрос: а чего они не могут? В этом посте я составлю список технических сложностей, которые нам предстоит преодолеть на пути к реализации искусственных работников с широкой функциональностью. Когда в следующий раз вы увидите робота, делающего нечто впечатляющее, задайтесь вопросом: какие из перечисленных в статье возможностей продемонстрировал робот и какие сложности попытался обойти сценарий видео?

(Стоит отметить, что некоторые задачи становятся проще, если использовать роботов на колёсах, а не строго гуманоидных. Колёсный робот может перевозить больший вес, поэтому сила, выносливость и мощность электроники для него не так критичны. Ниже для него и вероятность упасть. Однако такие роботы не могут взбираться по лестницам1, перешагивать через завалы или наклоняться, чтобы взять что‑то из шкафа.)

Читать далее

От «когда-нибудь» к работающему прототипу: как LLM дала идее шанс

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели11K

Привет! Меня зовут Владислав Козлов, я тимлид аналитиков Business Security в Авито. Хочу поделиться с вами интересным опытом взаимодействия с LLM, который позволил мне дёшево и быстро проверить свою идею. А заодно — рассказать об интересном алгоритме кластеризации, который мы с моделью придумали и реализовали в виде библиотеки.

Статья не раскроет вам глубин вайбкодинга, не разверзнет бездну понимания ИИ и не явит Истину. Она не о мощных навыках использования LLM, а скорее о личном опыте дешёвого и быстрого прототипирования идеи. Главная её цель — вдохновить читателя не откладывать свои идеи в долгий ящик, а реализовывать и делиться ими с окружающими. 

Надеюсь также, что сделанный нами с нейросетью алгоритм окажется полезным для вас.

Читать далее

Квантовая статистика данных: почему пора открыть Qiskit, а не ждать квантового компьютера

Уровень сложностиСредний
Время на прочтение19 мин
Охват и читатели5.9K

Если вы аналитик данных, ML- или DL-инженер то вы работаете в основном с традиционными метриками и статистиками, но у них есть квантовые аналоги, а возможно, и новые еще не исследованные метрики, которые уже вычисляются одной строкой кода без использования квантового компьютера. Более того, на стыке квантовых вычислений и статистики сейчас существует открытая ниша целой дисциплины и это редкий случай, когда первопроходцем может стать не физик-теоретик, а практикующий специалист, работающий с данными.

Читать далее

Подготовка датасета для офлайн-оценки рекомендательных моделей: что проверить  перед запуском экспериментов

Уровень сложностиСредний
Время на прочтение13 мин
Охват и читатели5.7K

Привет, Хабр! Меня зовут Алексей Васильев, я тимлид команды «Рекомендательные системы и персонализация» Sber AI Lab — Центра практического искусственного интеллекта Сбера. Мы занимаемся исследованиями в области рекомендаций, разрабатываем новые модели и, конечно, сравниваем свои результаты с результатами коллег и других исследователей. И регулярно сталкиваемся с ситуацией, когда результаты, заявленные в научной статье или полученные от другой команды, не удаётся воспроизвести, хотя ключевые параметры пайплайна полностью совпадают. В этой статье мы с Анной Володкевич, исследователем из нашей команды, расскажем про свой опыт анализа таких расхождений, на основе которого разработали фреймоворк SplitLight.

Когда результаты научной статьи или успех другой команды не удаётся воспроизвести, обычно начинают с поиска багов в реализации модели: смотрят архитектуру, функцию потерь, способ сэмплирования негативных примеров. Хотя часть несоответствий обусловлена именно этим, наш практический опыт показывает, что процедура подготовки данных зачастую сильнее влияет на итоговый результат сравнения рекомендательных моделей. Например, формулировка из статьи «датасет Zvuk, global temporal split с квантилем 0,9» не сообщает, какие фильтры и агрегации применяли, как обрабатывали события с одинаковыми временными метками и повторные взаимодействия, удаляли ли холодные объекты, какие данные передавали модели на вход и по каким событиям рассчитывали метрики. Поэтому два пайплайна с одним датасетом и одинаковым названием разбиения могут оценивать разные постановки задачи. Это затрудняет воспроизведение экспериментов и сравнение результатов между работами.

Читать далее

Как экономить, оплачивая зарубежные AI подписки со счёта компании

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели4.9K

Провёл исследование способов оплаты AI подписок для компаний в РФ, поскольку столкнулся с такой необходимостью для своей команды. Да и вообще тема довольно актуальная, часто по чатикам видел этот запрос.

Читать далее

Ближайшие события

Модель, которая думает по кругу: что на самом деле нового в GPT-6 Astra

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели7.3K

OpenAI переизобрела способ, которым модель думает.

Или просто вернулась к хорошо забытому старому? В GPT-6 Astra слово рождается не за один проход по слоям, а за несколько кругов по одному и тому же блоку. Идею предлагали ещё в 2018-м, а рекуррентность трансформеры когда-то вытеснили.

Читать далее

LLM зацикливается: как найти причину, не трогая параметры?

Уровень сложностиСложный
Время на прочтение14 мин
Охват и читатели9.5K

LLM в продакшене может выглядеть стабильной неделями, а затем начать зацикливаться на одном абзаце, упираться в лимит токенов и создавать нагрузку на инфраструктуру без единой ошибки в логах.

В статье разбираем, как диагностировать такие сбои: какие сигналы помогают найти причину, почему изменение параметров генерации часто оказывается неверным первым шагом и как выстроить защиту от повторных петель на уровне системы.

Разобрать кейс

От обновлённого ранкера до алгоритма Брезенхема: что дало + 11% ко времени в ленте ВКонтакте в 2026 году

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели9.3K

Привет! Это Степан Малькевич, руководитель группы рекомендаций ленты ВКонтакте (AI VK).

За прошедшие месяцы 2026 года время в ленте выросло на 11%. За этими цифрами — серия изменений, каждое из которых сделало свой вклад в рост метрик. Сейчас расскажу, что мы обновили и что из этого вышло.

Читать далее

Гонка за самую мощную ИИ-модель подходит к концу. Financial Times объясняет, почему бизнесу это больше не нужно

Время на прочтение9 мин
Охват и читатели104K

Последние несколько лет за развитием генеративного ИИ было удобно следить как за спортивной таблицей. OpenAI выпускала GPT-4, Google отвечала Gemini, Anthropic показывала новую Claude, затем начинался следующий круг. Каждая компания приносила набор бенчмарков и объясняла, где её модель теперь первая.

В 2026 году эта логика начала ломаться. Не потому, что модели перестали становиться мощнее. Наоборот, 1 сентября Anthropic выпустила Claude Fable 5.1, новую топовую модель для программирования и сложной интеллектуальной работы. Проблема в другом: возможность построить более сильную модель больше не означает, что большинство клиентов захотят использовать её для большинства задач.

Financial Times недавно обратила внимание на показательный пример. Fable 5 вышла 9 июня 2026 года как одна из самых мощных моделей Anthropic, но спустя примерно два месяца на неё приходилось около 11% расходов на продукты Anthropic среди корпоративных клиентов, которых отслеживает Ramp.

Здесь важно уточнение. Это не 11% всей выручки Anthropic, а показатель внутри конкретной выборки корпоративных расходов. Кроме того, первоначальный запуск Fable был прерван: 12 июня доступ к модели отключили из-за американских экспортных ограничений, а глобальный релиз восстановили 1 июля. Поэтому эту цифру нельзя использовать как идеальное измерение спроса.

Но сама тенденция гораздо интереснее конкретных 11%. Компании всё чаще выбирают более дешёвые модели, если дополнительное качество frontier-модели не влияет на бизнес-результат.

Читать далее

Не замена, а суперсИИла: Что нашей компании дал хакатон

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели6.7K

Может ли ИИ не просто избавлять от рутины, а кардинально ускорить профессиональный рост разработчика как, собственно, разработчика? Например, сделать за один вечер из джуна хотя бы мидла. Это была пусть безумная, но гипотеза, и мы решили провести внутренний хакатон, чтобы проверить её в условиях, приближенных к боевым.

Читать далее

Как мы научили ML предсказывать смерть насоса за 60 дней и выяснили, что все время чинили не то (часть 1)

Уровень сложностиСредний
Время на прочтение9 мин
Охват и читатели89K

Насос на НПЗ ломался каждые три месяца. Ремонтники меняли подшипники, но проблема возвращалась. Мы предложили не просто мониторить вибрацию, а найти скрытую причину в данных. Результат превзошел ожидания: 60 дней упреждения и неожиданный виновник поломки. Рассказываем, как это было и почему модель — это только 20% успеха.

Узнать, почему чинили не то

ТОП-50 скиллов для ИИ‑агентов (9 млн звезд на GitHub, 22 млн установок)

Время на прочтение20 мин
Охват и читатели11K

Скиллы превращают обычного ИИ-агента в узкопрофильного спеца: он ищет инфу в интернете, работает с файлами, пишет код, анализирует данные, запускает задачи в сторонних сервисах.

В этой подборке я собрал 50 самых популярных скиллов для ИИ-агентов - вместе они набрали 9 млн звезд на GitHub и 22 млн установок.

Используйте бесплатно.

Для каждого скилла указал, что он умеет, где пригодится и команду для быстрой установки.

Читать далее
1
23 ...