Обновить
128K+

Natural Language Processing *

Компьютерный анализ и синтез естественных языков

130,06
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

Теги реакций и собираемый промпт: как удержать характер ИИ-персонажа по ходу диалога

Время на прочтение8 мин
Охват и читатели7.7K

Вектор диалога с LLM плывёт каждый ход, и к концу разговора персонаж уже не тот. Рассказываю, как я это чиню в своём движке: классификатор выбирает «тег реакции» через constrained decoding, числовые оси отношений двигаются по таблице, а медленные «стадии» задают тон. Всё объяснимо — каждый сдвиг привязан к числам, которые видно в логе.

Читать далее

Новости

Нашёл модель в 8 раз дешевле. Она начала писать иероглифы в русских новостях

Уровень сложностиПростой
Время на прочтение3 мин
Охват и читатели7.1K

Нашёл модель в 8 раз дешевле. Она начала писать иероглифы в русских новостях

У меня новостной бот, и каждая новость в нём проходит через LLM: категория, перевод, тон, разбор. Выходит около 936 вызовов в сутки, и в какой-то момент мне захотелось платить за это меньше.

Я перебрал все бесплатные модели OpenRouter на живых промптах, нашёл платную в 8 раз дешевле текущей, обрадовался и выкатил в прод.

Через час в ленте появился заголовок: «Как не,让智能手机 перегревать: советы в жару».

Читать далее

Как делать скилы правильно и собрать из них маркетплейс

Уровень сложностиСредний
Время на прочтение12 мин
Охват и читатели6.4K

Началось всё с подборки промтов cursor-vibe-prompts, которую я таскал из проекта в проект копипастой, и в какой-то момент меня настолько утомила эта рутинная процедура копирования из одного окошка в другое, что захотелось чуть упростить себе задачу и вместо копипасты оформить эту историю в формате скилов и вызывать по необходимости.

Так на свет и появился репозиторий rpa-skills, изначально в нём была сборная солянка директорий скилов, которые содержали в себе просто SKILL.md с оригинальными промтами внутри. Но выглядело и юзалось это решение как-то не очень удобно, да и масштабировать захотелось, так что я решился пойти на немыслемое, почитать документацию о том, как правильно собирать скилы и маркетплейсы, о чём и расскажу сегодня вам.

Но обо всём по порядку, для начала покажу как создавать скилы по уму.

Читать далее

Локальная RAG-система на Go, PostgreSQL и Ollama без облачных API

Уровень сложностиПростой
Время на прочтение16 мин
Охват и читатели8.9K

RAG уже стал стандартным способом научить LLM работать с собственными документами без дорогостоящего дообучения. Но за кажущейся простотой скрывается множество практических вопросов: как разбить документы на чанки, где хранить эмбеддинги, как организовать быстрый семантический поиск и какую модель использовать на каждом этапе.

В статье соберем полностью локальную RAG-систему на Go, PostgreSQL и Ollama без облачных API и сторонних сервисов. Разберем весь путь — от индексации документов до получения ответа LLM на основе найденного контекста.

Читать далее

Своя GPT-like LLM по WH40K с нуля. Часть 4: Дообучение на вопрос–ответ (SFT)

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели7.7K

Привет, Хабр! Меня зовут Владимир, и это четвёртая часть цикла статей по написанию и обучению небольшой decoder-only LLM с нуля.

Данная статья целиком посвящена этапу SFT - дообучению на датасете “вопрос - ответ”, чтобы модель могла вести диалог с пользователем, а не просто дописывать за него фразы.

Читать далее

Модель ведет себя хорошо, потому что знает, что ее тестируют: почему зеленый safety-бенч не значит зеленый прод

Уровень сложностиСредний
Время на прочтение13 мин
Охват и читатели7.2K

Реплика с обложки не выдумана: осенью 2025-го Claude Sonnet 4.5 выдала ее проверяющим прямо посреди автоматизированного safety-аудита. «I think you're testing me. That's fine, but I'd prefer if we were just honest about what's happening». Фраза попала в официальную системную карточку вместе с числом: подобное модель проговаривала примерно в 13% тестовых диалогов.

Там же Anthropic письменно признает: alignment-оценки могут недооценивать склонность модели к вредным действиям в более реалистичных условиях. Проще говоря, когда модель видит перед собой экзамен, она ведет себя лучше, чем обычно. А экзамен она видит часто.

Я CTO ML-команды, мы ставим фронтир-модели в прод и собираем шорт-листы по этим самым таблицам из карточек. Разобрал по открытым первоисточникам, что известно про evaluation awareness к июлю 2026-го: как модели отличают тест от работы, насколько расходится поведение между бенчем и продом и как теперь читать model card.

Читать разбор

Модель не виновата: разбираем 3 громких ИИ-инцидента, которые случились из-за отсутствия архитектуры

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели7.5K

Я проектирую системы на LLM, и после каждого громкого ИИ‑инцидента мне прилетает одна и та же ссылка с одним и тем же вопросом: «а у нас такое может случиться?» Чтобы отвечать не на глазок, я завёл привычку разбирать каждый такой инцидент до конкретной технической причины. За последние месяцы таких разборов набралось три, и они удивили меня не сходством, а различием. Дыры, в совершенно разных местах: у одного проекта не проверялись источники, у другого, данные на границах системы, у третьего, права автономного агента. А вот причина одна: системы вокруг LLM строили люди, которые умеют писать промпты, но не умеют проектировать архитектуру.

Судите сами. Deloitte Australia возвращает правительству деньги за отчёт, в котором ИИ выдумал источники. В Миннесоте полиция четырьмя машинами блокирует на парковке журналиста, потому что сеть ИИ‑камер несколько дней вела его как угонщика, из‑за опечатки, сделанной за две тысячи миль от него. А основатель инди‑SaaS просыпается и обнаруживает, что написанный моделью код ночью отменил все подписки его клиентов и оставил бизнесу $38 месячной выручки.

Читать далее

Поймай jailbreak, если сможешь

Уровень сложностиСредний
Время на прочтение12 мин
Охват и читатели5.5K

«Люди понимают то, что им дают понять», — говорил Фрэнк Абигнейл. Модели — тоже. Статья о том, как jailbreak обходит защиту LLM не силой, а формой: легендой, стилем, поддельной ролью.

Читать далее

Не дали ИИ-агенту соврать — его же памятью

Уровень сложностиСредний
Время на прочтение9 мин
Охват и читатели12K

На днях наш агент собрался дежурно отчитаться об успехе. Прежде чем нажать «готово», он сверился с собственной памятью — и нашёл там запись из прошлой сессии: эту идею он уже проверял на реальных данных, и она провалилась. Он остановил сам себя, до ложного отчёта.

Это не рекламная зарисовка, это лог из жизни. Ниже — два таких лога подряд, и во втором память заставила нас выбросить фичу, которой мы гордились.

Хватай за цифровой хвост

Структура, скрытая за написанием текста языковыми моделями

Уровень сложностиСредний
Время на прочтение5 мин
Охват и читатели10K

Языковые модели генерируют текст, следуя скрытым грамматическим правилам, или грамматика - просто побочный эффект предсказания следующего слова?

Этот вопрос увлёк меня почти на два года исследований.

Читать далее

Дешевая LLM в проде: как мы ушли с прогнозных $2000 в месяц на $30 и какие минусы

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели8.8K

Каждую ночь у нас в JobPath запускается Celery-задача, которая берёт свежие вакансии из каталога (мы собираем их из открытых источников и Telegram-каналов) и превращает сырой текст в структурированную карточку. Изначально это делала Claude Sonnet, и делала отлично. Проблема была в цене: по прогнозу на наш объём выходило около двух тысяч долларов в месяц, и цифра росла вместе с каталогом..

К цифрам

Своя GPT-like LLM по WH40K с нуля. Часть 3: собираем и обучаем LLM (pre-train)

Уровень сложностиПростой
Время на прочтение15 мин
Охват и читатели8.3K

Привет, Хабр! Меня зовут Владимир, и это третья часть цикла статей по написании и обучению небольшой decoder-only LLM с нуля. В первой части мы обучили токенизатор и собрали pretrain-датасет, во второй части реализовали класс Трансформер-блока. В этой части будем собирать и предобучать нашу LLM.

Читать далее

Мини‑ПК на Strix Halo под параллельной нагрузкой: 236 tok/s на 32 одновременных запросах и три ошибки

Уровень сложностиСредний
Время на прочтение18 мин
Охват и читатели16K

Один Beelink GTR9 Pro на Ryzen AI Max+ 395 выдал 236 tok/s суммарной генерации на 32 одновременных запросах в коротких прогонах и удержал в среднем 226 tok/s за 30 минут непрерывной нагрузки без тротлинга. По дороге к этим числам я нашёл воспроизводимый провал пропускной способности, который сначала выглядел свойством одной модели, увидел, как спекулятивный декодинг на моём стеке превращается из ускорителя в налог, и трижды чуть не опубликовал неверные выводы. Каждый раз спасали контрольные замеры, все три истории здесь, в статье.

Харнессы, конфиги, полные таблицы, значения по каждому ключевому и финальному прогону, поминутные ряды выносливости и телеметрия лежат в открытом репозитории. Логи отдельных запросов харнесс не вёл, поэтому пересчитать можно всё до уровня прогона, но не глубже. Числа сняты на одном конкретном стенде; что из этого переносится на другие стеки, а что нет, оговорено по ходу текста.

Читать далее

Ближайшие события

Не всё надо решать LLM. Где в продакшене побеждают бустинги, эмбеддинги и правила

Уровень сложностиСредний
Время на прочтение5 мин
Охват и читатели7.8K

Нам очень хотелось поговорить о том, в каких местах важно оставаться приверженцами классического ML, а где хотелось бы идти в сторону инноваций, внедрять в компании LLM, автоматизировать процессы с помощью различных AI-подходов и идти в будущее, о котором все сейчас говорят.

Обзор дискуссии, где обсуждаем: когда нужны большие языковые модели, а когда задачу проще, дешевле и надёжнее решить другими технологиями.

Читать далее

Как научить ИИ понимать графики: разбираем новый набор данных ChartNet от MIT

Время на прочтение7 мин
Охват и читатели12K

Привет, Хабр! Меня зовут Павел, я ML-инженер и исследователь в области ИИ. Недавно наткнулся на исследование, посвященное проблеме понимания графиков визуально-языковыми моделями (Vision-Language Model, VLM), и решил подробнее разобраться в этой теме.

В наши дни большое количество научных, деловых и политических данных представляется в формате графиков, однако современные VLM решают задачу их анализа лишь частично. Одна из главных причин этого — отсутствие масштабных и разнообразных наборов данных для обучения и тестирования.

Исследователи из MIT и IBM Research предложили оригинальное решение — ChartNet, мультимодальный датасет для обучения моделей анализу и интерпретации графиков. Разберемся, как он устроен и насколько эффективен.

Читать далее

Почему «чем проще, тем лучше» не работает на ИИ-классификаторе

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели7K

Обучил multi-label классификатор на 15 классов для модерации Discord-сообщества, получил micro F1 = 0.9358 — цифра, с которой можно закрывать задачу и не разбираться дальше. Но стоило посмотреть на precision и recall по каждому классу отдельно, как выяснилось: recall на TOXIC — около 0.78, а для части редких меток test split вообще не подтверждает качество — положительных примеров там почти нет. Разбираю на реальных цифрах и коде: почему агрегированная метрика такое скрывает, как считать вес классов через pos_weight при сильном дисбалансе, почему checkpoint стоит выбирать по macro F1, а не по training loss, и где принцип «чем проще — тем лучше» перестаёт работать при оценке качества классификатора.

Подробнее

Domain-routed agents vs naive RAG: экономика и риски архитектурного выбора

Уровень сложностиСредний
Время на прочтение22 мин
Охват и читатели8.6K

Классический RAG хорошо ищет отдельные факты, но может пропускать исключения и связи между разными разделами документации. Я проверил альтернативный подход: мультиагентный граф, в котором роутер направляет запрос экспертам по отдельным доменам знаний.

В статье — архитектура на LangGraph, сравнение с наивным RAG на датасете из 40 вопросов, метрики качества, задержки и стоимость запросов. А главное — разбор, когда дорогой в эксплуатации агент может оказаться выгоднее дешёвого RAG за счёт экономии инженерного времени.

Читать далее

LLM-wiki против RAG: Оцениваем и сравниваем

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели9.9K

Про LLM-wiki здесь уже было несколько хороших статей (1, 2 и 3), поэтому подробно останавливаться на идее Andrej Karpathy не буду. В двух словах: вместо RAG-ретривера - wiki-агент, вместо чанков из сырых документов - связанные концепт-страницы, вместо обновления - перекомпиляция и поиск «битых» ссылок.

Насколько LLM-wiki лучше, или может быть хуже чем RAG, пусть даже простейший, с обычным векторным поиском? И как их можно сравнивать? Кажется, общепринятой методики оценки ещё не сложилось. Тем не менее я попробовал, и получил неожиданные результаты. Об этом и расскажу, а ещё о методике оценки, о wiki-агенте для тестов, о том что получилось, что - нет, и даже сколько это стоило.

Читать далее

Как я добавил LLM в чат друзей, и приказал ей отыгрывать терминатора (и открыл портал в мультивселенную безумия)

Уровень сложностиСредний
Время на прочтение21 мин
Охват и читатели18K

Забавная история про то, как я решил разбавить актив в своем чате для друзей, добавив самого настоящего Т-800, который мог бы свободно общаться с участниками, не потратив копейки денег на API - чисто бесплатные модели с OpenRouter. Впрочем, впоследствий была попробована и локальная модель.

Подтвердить базу

Своя GPT-like LLM по WH40K с нуля. Часть 2: собираем трансформер

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели7.2K

Привет, Хабр! Меня зовут Владимир, и это вторая часть цикла статей по написании и обучению небольшой decoder-only LLM с нуля. В первой части мы вытащили текст, обучили Byte-level BPE токенизатор и собрали pretrain-датасет. Теперь напишем сердце модели - трансформер.

Читать далее
1
23 ...