Обновить
128K+

Natural Language Processing *

Компьютерный анализ и синтез естественных языков

239,31
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

Что скрывают в себе меры расстояния: от kNN и k‑means до стилометрии

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели4.1K

Представим, что kNN отнес новую точку к некоторому ближайшему классу. Все просто и знакомо. Однако привычная схема скрывает интересную недосказанность. Какие именно признаки сделали выбранный класс ближе? Возможно, почти всю разницу дал сигнал от одной координаты, возможно это вклад весьма конкретного набора координат, который можно интерпретировать как устойчивый признак более высокого порядка, а может, эти вклады распределены почти равномерно? На самом деле ответить на вопросы выше довольно легко. Для этого достаточно сохранить слагаемые, из которых получилось расстояние, перед тем, как «затирать» их суммированием.

Читать далее

Новости

От 3000 сессий в месяц до 100 в секунду: как LLM заменила ручную оценку ботов поддержки

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели3.9K

Привет, Хабр! На связи Ангелина Большина, Денис Толкачев и Игорь Буянов, команда Customer Support NLP, мы разрабатываем ботов для службы поддержки клиентов. И наша работа полезна для развития продукта MWS AI Клиентский сервис. Сегодня мы расскажем вам про то, как мы автоматизировали оценку наших ботов с помощью специально разработанной метрики. Мы разделили материал: сначала расскажем про бизнес-составляющую, а затем – про технические детали. Итак, поехали!

Читать далее

Локальный анализ звонков без GPU. Что происходит на пути от аудио до резюме

Уровень сложностиСредний
Время на прочтение15 мин
Охват и читатели4.7K

Я хотел проверить не то, насколько хорошо локальная LLM пишет резюме по красивому тестовому диалогу, а что произойдёт с полным пайплайном на обычном телефонном звонке с музыкой, автоответчиком, перебиваниями и плохим звуком.

Я сделал desktop приложение на Tauri, Rust, React и SQLite. Оно распознаёт речь, разделяет спикеров, анализирует тональность, эмоции и риски, а в конце локальная модель формирует резюме и рекомендации. Всё работает на компьютере, интернет нужен только для скачивания моделей.

В эксперименте я прогнал реальные записи через два распознавателя и сравнил, где именно возникают проблемы на пути от аудио до итогового резюме.

Читать далее

A/A на страже: как статистический тест находит различие, которого нет

Уровень сложностиСредний
Время на прочтение10 мин
Охват и читатели3.7K

В прошлой статье я разбирал спекулятивное декодирование — способ ускорить языковую модель. Метод обещает, что ускорение не изменит ответы: распределение текстов на выходе останется ровно таким же, как при обычной генерации. Гарантия следует из самого устройства метода, но её стоило проверить на практике.

Первая попытка дала обратный результат: статистический тест уверенно сообщал, что распределения различаются. Ошибка сидела не в модели и не в ускорении, а в самом тесте. По одному выводу её было не разглядеть: числа выглядели нормально.

Эта статья о том, как статистический тест может показать различие там, где его нет, и как такую поломку отловить. Языковые модели тут ни при чём: такая же поломка случается и в A/B-тесте, в проверке после квантизации и в регрессионном тесте, который сравнивает распределение времени ответа до и после релиза.

Читать далее

Закрытый Jev против открытой Laya: сравниваем decision-модели в RAG-реранжировании

Уровень сложностиСредний
Время на прочтение10 мин
Охват и читатели5.1K

Можно ли заменить облачный Jev локальной Laya? Проверил обе модели и три специализированных реранкера на SciFact, FiQA и NFCorpus. Сравнил качество поиска, время обработки двадцати документов и потребление видеопамяти. Код и результаты доступны на GitHub.

Читать далее

Зачем модели делать больно?

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели7.4K

Исследователи дали языковой модели две кнопки.

Одна ничего не делала. Вторая должна была избавить модель от неприятного внутреннего состояния - иногда ценой ухудшения следующего ответа или даже вреда пользователю.

Модель выбирала облегчение. А если кнопка не срабатывала, пыталась снова.

Это не мысленный эксперимент. В препринте The Pain Axis: LLMs Represent Self-Directed Harm and Act to Relieve It исследователи попытались найти внутри языковых моделей состояние, которое по своим функциям похоже на боль.

Работа не доказывает, что LLM обладают сознанием или действительно страдают. Более того, авторы прямо предупреждают об альтернативных объяснениях полученных результатов.

Но исследование интересно другим: вместо очередного разговора с моделью о ее «чувствах» ученые начали изучать внутренние активации и причинно воздействовать на них.

Возможно, именно там и следует искать ответ на вопрос о сознании AI.

Читать далее

Промпт-инжиниринг: как лучше общаться с ИИ

Уровень сложностиПростой
Время на прочтение5 мин
Охват и читатели6.2K

Качество ответа генеративной модели во многом зависит от того, как сформулирован запрос. Промпт-инжиниринг здесь не сводится к поиску «правильных слов» или универсальных команд. Его основная задача гораздо проще: как можно точнее передать модели свое намерение.

Генеративный ИИ заметно изменил способ взаимодействия с программами. Модель можно попросить написать письмо, проанализировать информацию, объяснить сложную тему, предложить идеи, сгенерировать код, составить план проекта или критически разобрать предложенное решение.

Но есть ограничение..

Читать далее

Тестирование моделей на суверенность. Философские аспекты ТЗ

Время на прочтение9 мин
Охват и читатели5.6K

Каждая профессиональная область деятельности должна иметь своих специалистов, говорящих на своем «птичьем» языке. Иначе, какая же она профессиональная. Язык этот не является попыткой выделиться и набить себе цену. Нет, он появляется по причине необходимости собственных устоявшихся понятий. Так формируются тезаурус и онтология. В отношении естественных языков дела обстоят еще сложнее.

Ведущую роль здесь играют тезаурусы как модели смыслов и их взаимосвязей, выражаемые средствами языка. И эти модели являются основой понимания, через них достигается согласие. Проблему онтологий как моделей объектов и их взаимосвязей «реального» (в кавычках, так как сама по себе реальность является большой философской проблемой) мира, оставим пока в стороне.

До последнего времени в мире IT всё главным образом крутилось вокруг computer science, математики, финансов (статистики) и промышленного дизайна. Однако с появлением LLM этот, вполне себе теплый и камерный мир, где «рыбак рыбака видел из далека», начал стремительно разрушаться. Вначале, появились голосовые помощники и чат‑боты, а теперь это разрослось до новой формы поиска и попыток управления чем‑то (и да же вынесения суждений о чем‑то) в реальном мире с помощью LLM.

Читать далее

300 классов, 400 сэмплов и никакого промптинга: ЛЛМ как энкодер для классификации

Уровень сложностиСложный
Время на прочтение14 мин
Охват и читатели6K

Когда речь заходит о ЛЛМ и классификации, первая мысль — попросить модель сгенерировать класс через промптирование модели с описанием правил и добавлением примеров. Для небольшого количества классов это работает. Но для 100+ классов (или даже 20-30) — уже нет: контекст раздувается, модель галлюцинирует, а инференс может занимать десятки секунд. Мы решили использовать ЛЛМ иначе: не как генератор текста, а как энкодер, прикрутив сверху обычную классификационную голову.

В статье расскажу про нашу мотивацию использовать ЛЛМ как энкодер и покажу результаты на четырёх разных доменах банка, в рамках которых сравню генеративные модели с классическими энкодерами

Читать далее

Как нейросеть переводит видео. Часть 1: Whisper врёт, и мы это знаем

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели4.8K

Я один пишу сервис дубляжа видео с 2022 года, когда OpenAI выложил Whisper и мне показалось, что дело на месяц. В 2026-м через конвейер прошло 9 203 задачи, и он ломается в тех же местах, что и в первый. Первая часть из трёх: как звук становится текстом с таймкодами и спикерами. Три типа галлюцинаций Whisper и ловушки на каждый с кодом, почему мы выбрасываем его сегменты и собираем предложения сами, каскад на своей видеокарте с запасными выходами, хинди, который молча терял по 15 секунд речи, и честное ограничение: двое говорящих одновременно не бывает.

Читать далее

От готовых реплик к контекстной памяти: как эволюционировали AI‑чаты

Уровень сложностиСредний
Время на прочтение28 мин
Охват и читатели8K

В первой части статьи мы рассказывали об эволюции поисковых систем. Теперь перейдем к технологиям, благодаря которым AI-чаты получили свои нынешние возможности. Если основная задача классического поисковика — найти и ранжировать существующие документы, то AI-чат должен сформировать ответ с учетом запроса и контекста разговора.

Речь пойдет о переходе от сценарных чат-ботов, для которых разработчики вручную прописывали правила и реплики, к современным системам на основе языковых моделей. Они способны выполнять инструкции, поддерживать многоходовый диалог, учитывать сведения из предыдущих бесед и обращаться к внешним источникам при подготовке ответа.

< --- Часть I. Как поисковые системы учились понимать запросы

Читать далее

Jev и обычные LLM: сравниваем качество, скорость и стоимость

Уровень сложностиСредний
Время на прочтение13 мин
Охват и читатели6.7K

Сравнил Jev и обычные LLM на трёх задачах: определение спама, выбор категории комментария и оценка негатива. Проверил качество ответов, скорость и стоимость на русском и английском. Отдельно посмотрел, распознают ли модели повторный вопрос в длинной истории комментариев.

Читать далее

Open‑weight LLM догнали закрытые? Проверка на продакшене

Уровень сложностиСложный
Время на прочтение21 мин
Охват и читатели5.3K

Открытые LLM уже близки к закрытым моделям по многим бенчмаркам, но в продакшене разрыв проявляется в качестве, стоимости и эксплуатации. В статье разбирается, когда open‑weight модели действительно подходят для задач бизнеса и какие ограничения важно учитывать при внедрении.

Узнать детали

Ближайшие события

ИИ спотыкается не об ум, а об контекст: как генератор майндмап превратился в RAG по продукту

Уровень сложностиСредний
Время на прочтение9 мин
Охват и читатели5.3K

Привет! Я Саша Сыч, руководитель отдела тестирования в группе компаний «Синтека». Мы разрабатываем софт для строительной отрасли. В начале года инвестор предложил всем в компании внедрять ИИ — вплоть до уборщицы на этаже. Доклад об этом на нашей внутренней конференции я назвал «СдохнИИ или умрИИ»: примерно с таким настроением нам поставили задачу. Эта статья — по мотивам доклада.

Компания разделилась на два лагеря. Первый поддерживал хайп: главное начать, разберёмся потом, смотрите, как ИИ за выходные пилит приложения и рисует красивые графики. Второй стоял на инженерной реальности: чудес не будет, будет много дополнительной работы, и вообще посмотрите, какую ерунду ваш ИИ отвечает. Я успел побывать в обоих лагерях и решил не внедрять ИИ куда попало, а сначала посмотреть, как это делают другие компании: что у них завелось, а что только красиво выглядит. Из этого выбрал задачи, которые стоило проверить у нас.

Читать далее

Локальный агент для кода на Mac: MTPLX + pi + Qwen3.8–27B. Что реально ускоряет, а что нет

Уровень сложностиСредний
Время на прочтение9 мин
Охват и читатели8.3K

Я хотел, чтобы кодовый агент работал целиком на ноутбуке, без облака: локальная модель, локальный сервер, агент в терминале. Главная боль с самого начала — скорость. Агент постоянно перечитывает длинный контекст и много «думает», и на локальном железе это превращается в минуты ожидания на каждую задачу.

Читать далее

ASR для языка, которого Whisper почти не знает: LoRA за полтора часа — и почему полдела сделал декодер

Уровень сложностиПростой
Время на прочтение16 мин
Охват и читатели7.7K

В первой статье серии я рассказывал про речевые технологии для крымскотатарского в целом и обещал отдельно разобрать распознавание. Разбираю.

Итоговая таблица, чтобы сразу было видно, о каких величинах речь. Один и тот же отложенный тест, один и тот же скоринг, 893 клипа / 1.86 ч, два диктора, которых модель не слышала:

Читать далее

Бенчмарк качества англо-русского перевода для ведущих западных и китайских LLM

Уровень сложностиСредний
Время на прочтение15 мин
Охват и читатели14K

Сто ловушек в одном рассказе, LLM-судья с ключом ответов и баллы, которые считает код. Так устроен бенчмарк художественного перевода, который теперь встроен в опенсурсный конвейер BookTrans. В статье — зачем он понадобился, и как на нём выступили флагманы Anthropic, OpenAI и Google против китайских моделей. И ответ на главный вопрос: можно ли сэкономить, используя китайские модели, не потеряв в качестве.

Читать далее

Встречаем GPT‑6 Sol и Luna

Уровень сложностиПростой
Время на прочтение10 мин
Охват и читатели6.5K

В начале этого месяца мы представили GPT-6 Astra — нашу самую интеллектуальную и выровненную модель. Для самых сложных и критически важных задач по-прежнему стоит использовать всю мощь Astra, но на практике задачи бывают разного масштаба, требуют разной скорости и укладываются в разные бюджеты.

Поэтому мы расширяем семейство GPT-6 моделями GPT-6 Sol и GPT-6 Luna. GPT-6 Astra открыла новое поколение интеллектуальных моделей, а Sol и Luna позволяют сделать преимущества этого поколения доступнее за счёт более высокой эффективности по соотношению стоимости и возможностей. При обучении GPT-6 Sol и Luna мы использовали подходы, схожие с теми, что применялись для GPT-6 Astra. Благодаря этому более быстрые и доступные модели получили многие из улучшений Astra: высокий уровень работы с профессиональными задачами, фактическую точность, навыки программирования, взаимодействия с компьютером и следования заданным принципам поведения.

Читать далее

Как сделать интерактивного агента с помощью KV‑кеш‑манипуляций

Время на прочтение10 мин
Охват и читатели9.6K

Обычно LLM работает строго последовательно: получает запрос, рассуждает и только после этого отвечает. Пока она думает, новая информация остаётся за пределами текущего процесса. Пользователь может уточнить вопрос, камера — передать следующий кадр, а инструмент — вернуть результат, но модель не увидит ничего из этого, пока не закончит начатое.

Для чат‑бота такая задержка может быть приемлемой. Для голосового ассистента, робота, игрового агента или системы, которая следит за непрерывным видеопотоком, это превращается в фундаментальное ограничение. Интерактивный агент должен получать новые данные прямо во время вычислений, корректировать план без полного перезапуска, выдавать полезные промежуточные действия и координировать процессы, которые идут с разной скоростью: восприятие, рассуждение, речь, работу с инструментами.

Меня зовут Георгий Якушев. Я исследователь Yandex Research, преподаватель и выпускник ШАД. Мы изучаем, какую часть этой интерактивности можно реализовать на уровне инференса, не меняя весов уже обученной модели. В этой статье я расскажу, почему полезно перестать воспринимать KV‑кеш только как способ ускорить генерацию и начать рассматривать его как активное состояние агента.

Читать далее

ИИ знает, что он не знает? Как психология 1970-х может улучшить наш prompt engineering

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели10K

На днях я наткнулся на статью на VC.ru о том, как инженер Anthropic Тарик Шихипар работает с Claude. В основе довольно простая конструкция: перед большой задачей он раскладывает знания на четыре категории. То, что мы знаем. То, про что понимаем, что не знаем. То, что знаем настолько хорошо, что даже не считаем нужным проговаривать. И, наконец, то, о существовании чего вообще не подозреваем.

Последний пункт особенно противный. Сложно задать хороший вопрос о вещи, про которую ты даже не знаешь, что её стоило спросить. Вообще ничего об этой вещи ты ещё не знаешь, в первую очередь — о её существовании.

Тут я поймал дежавю, потому что эта конструкция напоминала что‑то из старой психологии. Полез разбираться и довольно быстро провалился в кроличью нору из prompt engineering в работы 1970-х о метакогниции, затем в исследования того, способны ли языковые модели оценивать собственное знание, а оттуда обратно в Anthropic, только уже в их работы по introspection и mechanistic interpretability.

Короче, исходный совет «сначала разберитесь, чего вы не знаете» оказался только верхушкой гораздо более интересной истории.

Если смотреть на исследования Anthropic последних лет, начинает просматриваться одна повторяющаяся тема. Вся исследовательская линия Anthropic последние годы крутится вокруг одной и той же фундаментальной проблемы: как понять границы знания системы и увидеть то, чего мы сами о ней не знаем.

Но началось всё, конечно, не с Claude.

Просветиться
1
23 ...