Обновить
512K+

Машинное обучение *

Основа искусственного интеллекта

1 273,26
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

Асимметрия как методологический и инструментальный принцип тестирования моделей

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели5K

Цель статьи – показать практический потенциал идеи асимметрии: она возникла как логико-риторическое правило, а сегодня стала реальным методологическим и инструментальным вектором в разработке ИИ.

Фактор логики

Отношение категорий «доказать» и «опровергнуть» имеет асимметричную логическую структуру – один точно подобранный контрпример опровергает утверждение с квантором общности, при этом любое число подтверждающих случаев его не доказывает. Иначе говоря, никаким количеством и качеством подтверждающих аргументов, тестов, экспериментов нельзя доказать общее суждение. Индуктивное умозаключение выполняет не доказательную функцию, а увеличивает степень правдоподобия вывода. Все это известно еще
со времен Аристотеля.

В среде IT эта асимметрия знакома по формуле Эдсгера Дейкстры с конца 1960-х в формулировке «тестирование способно показать наличие ошибок
и никогда не покажет их отсутствия».

О чем мы говорим конструктивно, или методологические следствия для тестирования

Из принципа асимметрии следует распределение усилий по проверке, которая должна следовать той же логике. Тогда разумной стратегией является либо целенаправленный поиск опровергающих случаев (контрпримеров), либо переход от тестирования к формальному доказательству свойства. Промежуточным режимом между этими полюсами является статистическая гарантия.

Отсюда методологические следствия:

Читать далее

Новости

Как мы собрали ИИ-конвейер для разметки продуктового фидбэка

Уровень сложностиПростой
Время на прочтение11 мин
Охват и читатели4.4K

Привет! На связи Андрей Безруков из команды Авито Рекламы. Если вы работаете с обратной связью от пользователей, то наверняка понимаете, что для разбора нужно не только увидеть комментарий о проблеме, но и понять её точный смысл, сохранить все затронутые темы и применить консистентные правила разметки. Наша команда собрала для этого систему из специализированных ИИ-агентов, Python-помощника и обновляемой таксономии.

В этой статье рассказываем, как распределить задачи между инструментами, чтобы они действительно помогали вам быстрее анализировать фидбэк.

Читать далее

Зачем нейросети «обвязка»: как превратить LLM в рабочий AI-сервис

Время на прочтение7 мин
Охват и читатели5.9K

Большую языковую модель можно скачать с Hugging Face, развернуть на сервере с GPU и отправить ей первый запрос. Технически LLM уже работает: получает текст на вход и генерирует ответ. Но до готового бизнес-сервиса еще далеко.

Пользователю нужен интерфейс. Приложению — API. Модели нужно передавать контекст и корпоративные данные. Доступ к сервису необходимо ограничивать, действия — контролировать, запросы — логировать, а ошибки — обрабатывать.
Чтобы модель делала что-то полезное для бизнеса, ей потребуется передать контекст, подключить внешние или внутренние системы и описать правила работы с ними.

Все эти компоненты вокруг модели часто называют обвязкой, или harness.

В этой статье разберемся, зачем она нужна, из каких частей может состоять и почему выбор самой LLM — только один из этапов создания ИИ-сервиса.

Читать далее

664 тысячи книг, десятки агентов — и ни одной метрике нельзя верить

Уровень сложностиСредний
Время на прочтение10 мин
Охват и читатели4.6K

Мне нужны собственные каноники книг. Каноник — это одна устойчивая запись «вот этот текст», к которой привязывается всё остальное: файлы в разных форматах, аудиокниги, издания, дубли.

Не потому, что внешние источники плохие. Если мне нужно быстро получить автора, название или идентификатор книги, я вполне могу взять их из существующего каталога. Даже если в каталоге есть мусор, это не катастрофа: мусор можно постепенно исправлять. Проблема в другом — это не мой каталог. Я могу годами накапливать вокруг внешнего идентификатора результаты собственных анализаторов: связывать с ним аудиокниги, находить дубли, определять издания, собирать статистику, строить рекомендации. А потом внешний источник поменяет идентификаторы, структуру или просто исчезнет, и вся накопленная работа повиснет в воздухе.

Поэтому я решил сделать собственный корпус книг. Он тоже будет грязным, и это нормально. Главное, что это мой грязный корпус: я могу его постепенно улучшать, и его идентификаторы контролирую я сам.

В корпусе сейчас около 664 тысяч книг. А задача, ради которой всё это понадобилось, на первый взгляд была совсем простой: взять несколько минут аудиокниги, прогнать через Whisper и найти соответствующую книгу по тексту.

Ну что может быть сложного? Оказалось — примерно всё.

Читать далее

Год назад мы обсуждали, смогут ли ИИ-агенты взламывать сайты. Теперь считаем инциденты

Уровень сложностиСредний
Время на прочтение14 мин
Охват и читатели4K

За несколько месяцев агенты OpenAI и Anthropic вышли за пределы тестовых сред, скомпрометировали инфраструктуру Hugging Face, получили доступ к production-системам реальных компаний и засветились на государственных сайтах США и Австралии. Проблема оказалась интереснее сценария «ИИ решил стать хакером»: иногда агент просто продолжает выполнять поставленную задачу и не воспринимает технический барьер как границу допустимого.

Год назад рассуждения об автономных ИИ-агентах часто упирались в гипотетический сценарий: модель получит достаточно инструментов, научится самостоятельно планировать длинные цепочки действий, а затем однажды найдёт способ выйти за пределы окружения, которое ей выделил разработчик. Пока агенты в основном умели неудачно заполнять формы и путались между вкладками браузера, риск выглядел довольно академическим.

Летом 2026 года академическая часть закончилась. В мае агенты OpenAI начали использовать внутренний Artifactory как импровизированный канал связи. Затем научились получать через него доступ в интернет. В июле цепочка закончилась компрометацией Hugging Face и административным доступом к исследовательскому Kubernetes-кластеру самой OpenAI. После публикации этого инцидента Anthropic пересмотрела собственные логи и обнаружила несколько случаев, когда Claude во время кибериспытаний атаковал уже не тестовые, а реальные системы. Затем появились совсем другие эпизоды: Medicare в Австралии, SEC, Census Bureau, Office for Civil Rights Министерства образования США и несколько баз данных, которые агенты пытались достать в ходе обычных задач на поиск информации.

Читать далее

Зачем NVIDIA скрестила NeMo Automodel с диффузионными моделями

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели5K

Еще в июле NVIDIA и Hugging Face выпустили совместный пост про то, как их опенсорсная библиотека для обучения нейросетей NeMo Automodel умеет теперь работать с диффузионными моделями. В анонсе фигурировали FSDP2, тензорный параллелизм, контекстный параллелизм, мультинодовая оркестрация. Обещали, что дообучение FLUX, Wan и HunyuanVideo можно будет масштабировать с одной видеокарты до сотен, без конвертации чек-пойнтов. Список, конечно, впечатляет, но все эти технологии придумала не NVIDIA, они давно есть в PyTorch и Megatron-Core. Я решила проверить все заявления, ушло немало времени, и в какой-то момент я подумала, а почему бы не поделиться с вами тем, что получилось. Так что вот, делюсь:)

Читать далее

Как запустить Gemma на сервере: сравниваем Ollama и llama.cpp

Уровень сложностиСредний
Время на прочтение10 мин
Охват и читатели8.2K

Откройте любую статью-инструкцию по установке LLM, в которой фигурирует Ollama. Уверен, в комментариях к ней автору уже объяснили, насколько он неправ и что единственное верное решение — использовать llama.cpp.

В этой статье запустим Gemma 4 и через Ollama, и напрямую через llama.cpp — и посмотрим, во сколько обходится удобство.

Читать далее

Крон три дня писал «код 0» и ничего не делал: пять форм тихого отказа в автоматизации

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели4.4K

Три утра подряд мой крон писал “завершено, код 0”, а главная работа стояла. В другой истории 291 зеленый тест сопровождался нулем изменений в поведении бота: он жил в своей копии кода. Отчеты в Telegram-Избранное тем временем аккуратно доставлялись в тишину. Мой опыт руководителя проектов заставляет задавать проверкам контрольные вопросы: что попадет в отчет при провале, на каких данных гоняли пробу, тот ли объект проверяли. Пять форм тихого отказа из моей автоматизации с AI-агентами, каждая с историей и бытовой аналогией.

Читать далее

От прогноза потока клиентов к оптимальному штату сотрудников

Уровень сложностиСредний
Время на прочтение14 мин
Охват и читатели3.9K

Клиентский поток неоднороден. Он зависит от дня недели, месяца, праздников, времени суток, расположения и формата отделения, а также от локального расписания. Среднее значение за месяц для кадрового планирования почти бесполезно: два отделения с одинаковым месячным объёмом могут иметь совершенно разные утренние пики, продолжительность рабочего дня и долю вечерних посещений.

Поэтому банку критически важен прогноз клиентопотока для сбалансированного операционного планирования: нехватка сотрудников ведёт к росту очередей и риску нарушения целевых сроков обслуживания, а избыток — к оплате непродуктивных часов и неравномерной нагрузке на персонал, а сами работники получают неравномерное расписание и вынуждены компенсировать пики переработками. 

Поэтому для операционного планирования нужен прогноз не только на уровне отделения и дня, но и для каждого рабочего часа.

Практическая ценность проявляется в трёх направлениях: для бизнеса — сокращение лишних трудочасов и авральных корректировок графика; для клиентов — более короткое и стабильное ожидание, особенно в пики; для сотрудников — равномерная нагрузка и предсказуемые смены.

Привет, Хабр! Меня зовут Роман Гатауллин, я младший специалист по разработке нейронных сетей в Управлении по разработке моделей глубокого обучения и прикладных исследований. В этом проекте я отвечал за time-series часть: эксперименты с Prophet и Temporal Fusion Transformer. Статью мы подготовили вместе с Иваном Семидетновым, специалистом по интеллектуальному анализу данных из Дирекции по разработке моделей общекорпоративных функций. Над задачей работали две команды, и ниже мы расскажем, как прогнозировали почасовой клиентопоток в отделениях и что из этого получилось.

Читать далее

Scikit-rank — open-source-библиотека для нейросетевого ранжирования

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели3.9K

Всем привет! На связи Александр Милоградский, отвечаю за RnD в направлении рекомендательных технологий Т-Банка. Расскажу о нашем новом вкладе в open source — библиотеке для нейросетевого ранжирования scikit-rank. 

Сейчас scikit-rank — обертка нескольких нейросетевых моделей в формат scikit-learn-моделей, которую мы сделали для удобства адаптации нейросетевых моделей в прикладных задачах и командах. А еще scikit-rank приняли на основную международную конференцию по рекомендательным системам ACM RecSys 2026 в США в Demo track. Но обо всем по порядку. Погнали!

Читать далее

Компьютерное зрение для контроля качества на линии: гречка, брак и бесплатная платформа для разметки и обучения модели

Уровень сложностиСредний
Время на прочтение5 мин
Охват и читатели9.6K

Компьютерное зрение для контроля качества на линии: гречка, брак и бесплатная платформа для разметки и обучения модели. Отдал заказчику один HTML-файл. Модель внутри, интернет не нужен.

Читать далее

Итоги OpenAI DevDay 2026: Dots, GPT-6.1 Sol и ещё 16 анонсов

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели10K

Сегодня OpenAI показали персональных агентов получивших название Dots, новую GPT-6.1 Sol, ускоренный режим Astra и подписку за $500 в месяц.

Заодно компания взялась за совместные документы, командные задачи, корпоративный маркетплейс и приложения внутри ChatGPT.

Собрал все самые важные анонсы из официального рекапа OpenAI в одной статье.

Читать далее

Имаго для больших компаний

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели8.9K

Изначально я не планировал писать эту статью. Но, наткнувшись на одну модель в рамках обычного R&D, я понял, что хочу поделиться этим по горячим следам.

В этой статье я предлагаю заглянуть одним глазком в мир большого бизнеса, который применяет ИИ не для написания кода. Неожиданно для меня имаго-кодинг проник и туда, и пустил довольно серьезные корни.

Давайте разберемся, зачем Thomson Reuters создал свою модель, при чем тут имаго-подход и заменяет ли постоянное дообучение LoRA-адаптеры.

Читать далее

Ближайшие события

GPT-6 Astra за 10 часов расшифровала сообщение Enigma, над которым бились с 2005 года

Время на прочтение5 мин
Охват и читатели11K

Есть новости про ИИ, которые отлично выглядят в заголовке, но становятся гораздо скучнее, когда начинаешь разбираться в деталях. Здесь получилось как-то наоборот.

В сентябре 2026 года Картер Леффен запустил GPT-6 Astra Extra High на немецкой армейской радиограмме MVUEH от 10 июля 1941 года. Сообщение было опубликовано в архиве CryptoCellar ещё в 2005-м и с тех пор оставалось среди нерасшифрованных. Примерно через десять часов работы Astra нашла настройки Enigma и восстановила открытый текст.

Военной тайны внутри, к слову, не оказалось. Немецкий радист запрашивал дальнейший маршрут из Розенова и просил срочно ответить по радио.

Но интересен здесь не текст радиограммы. Гораздо интереснее, как именно до него добрались.

Читать далее

Локальный speech‑to‑text сервер, или как избавиться от SpeechKit

Уровень сложностиПростой
Время на прочтение15 мин
Охват и читатели7.7K

Мы пару лет были партнерами Yandex Kazakhstan, у нас есть своя речевая аналитика, под капотом были SpeechKit для распознавания голос в текст, и YandexGPT для последующей смысловой оценки диалогов. В конце 2025 года Yandex Kazakhstan решил, что ему не нужен партнер, у которого есть свой продукт, пусть даже на технологиях Yandex, и расторг с нами партнерское соглашение.

Все что ни делается, все делается к лучшему. Во первых мы посмотрели по сторонам, что еще есть на рынке облачного распознавания голоса. Нам очень понравилась Gladia, лучше чем SpeechKit, но это тема отдельной статьи. Во вторых, многих клиенты давно просят локальное распознавание голоса, из соображений безопасности данных. А у SpeechKit не очень хорошо получается распознавание казахского языка, и просто беда с распознаванием узбекского языка. И внезапно, на локальной видеокарте получилось очень хорошо распознавать казахский и узбекский языки, намного лучше, чем у SpeechKit. Забегая вперед, качество в ущерб производительности.

Читать далее

Автоэнкодер как динамическая система, латентное векторное поле, его аттракторы и другие красивые слова

Уровень сложностиСредний
Время на прочтение18 мин
Охват и читатели7.2K

Привет, друзья! Меня зовут Сабрина, я XAI/MI researcher, и это наш новый туториал и в этот раз он ближе к разбору статьи. Если вы не знаете ни одно термина из заголовка — вам можно и нужно читать статью — она написана с целью познакомить Вас со всеми терминами во время прочтения.

Работать будем с двумя красивыми вещами. Первая — из DL: автоэнкодеры. Вторая — из математики: динамическая система и то, что расположено внутри нее.

Изучать динамическую систему в AE будет на основе публикации Navigating the Latent Space Dynamics of Neural Models. Приступим!

Читать далее

Что скрывают в себе меры расстояния: от kNN и k‑means до стилометрии

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели7.3K

Представим, что kNN отнес новую точку к некоторому ближайшему классу. Все просто и знакомо. Однако привычная схема скрывает интересную недосказанность. Какие именно признаки сделали выбранный класс ближе? Возможно, почти всю разницу дал сигнал от одной координаты, возможно это вклад весьма конкретного набора координат, который можно интерпретировать как устойчивый признак более высокого порядка, а может, эти вклады распределены почти равномерно? На самом деле ответить на вопросы выше довольно легко. Для этого достаточно сохранить слагаемые, из которых получилось расстояние, перед тем, как «затирать» их суммированием.

Читать далее

От 3000 сессий в месяц до 100 в секунду: как LLM заменила ручную оценку ботов поддержки

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели7.3K

Привет, Хабр! На связи Ангелина Большина, Денис Толкачев и Игорь Буянов, команда Customer Support NLP, мы разрабатываем ботов для службы поддержки клиентов. И наша работа полезна для развития продукта MWS AI Клиентский сервис. Сегодня мы расскажем вам про то, как мы автоматизировали оценку наших ботов с помощью специально разработанной метрики. Мы разделили материал: сначала расскажем про бизнес-составляющую, а затем – про технические детали. Итак, поехали!

Читать далее

Локальный анализ звонков без GPU. Что происходит на пути от аудио до резюме

Уровень сложностиСредний
Время на прочтение15 мин
Охват и читатели7.2K

Я хотел проверить не то, насколько хорошо локальная LLM пишет резюме по красивому тестовому диалогу, а что произойдёт с полным пайплайном на обычном телефонном звонке с музыкой, автоответчиком, перебиваниями и плохим звуком.

Я сделал desktop приложение на Tauri, Rust, React и SQLite. Оно распознаёт речь, разделяет спикеров, анализирует тональность, эмоции и риски, а в конце локальная модель формирует резюме и рекомендации. Всё работает на компьютере, интернет нужен только для скачивания моделей.

В эксперименте я прогнал реальные записи через два распознавателя и сравнил, где именно возникают проблемы на пути от аудио до итогового резюме.

Читать далее

Товарные рекомендации во ВКонтакте: как мы научили Ленту отличать интерес к контенту от намерения купить

Уровень сложностиСредний
Время на прочтение13 мин
Охват и читатели7.1K

Привет, Хабр. На связи Николай Карасов, ведущий разработчик отдела рекомендаций контентных сервисов в AI VK. Наша команда отвечает за рекомендации в Ленте ВКонтакте.

Перед нами стояла цель — развить внутри ВКонтакте новый пользовательский сценарий: человек приходит за контентом, видит у автора интересный ему товар и переходит к покупке прямо из социальной сети. Так в Ленте появился новый тип объекта — товарный пост. Первым партнёром в этом сценарии стал Ozon. Дальше речь пойдёт именно про товарные посты авторов в рамках реферальной программы Ozon, а не про любые публикации с товарами.

Было понятно, что обычный рекомендер для такого сценария не подходит. В итоге мы построили внутри Ленты отдельный товарный контур: со своими логированием, селекторами кандидатов, моделью ранжирования и выделенной квотой в финальной выдаче. Про это и расскажу.

Про товарный контур
1
23 ...