Обновить
128K+

Natural Language Processing *

Компьютерный анализ и синтез естественных языков

168,98
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

Где счетный бейзлайн бьет трансформер: честное сравнение на русских отзывах

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели4.4K

Когда нужно классифицировать текст, дефолтный ход в 2026 – взять предобученный трансформер и дообучить. TF-IDF воспринимается как музейный экспонат: работал в эпоху до BERT, сейчас не всерьез. Обычно этот выбор никто не проверяет на своих данных, потому что и так понятно, кто победит.

Мы решили проверить. Взяли одну задачу, один корпус, одну метрику и прогнали три подхода подряд: счетный бейзлайн на TF-IDF, сверточную сеть TextCNN и дообученный русский энкодер. Считали не только качество, но и стоимость – время обучения и скорость предсказания на обычном процессоре.

Короткий вывод: на этой задаче счетный бейзлайн обучается за три секунды и по честной метрике держится вровень с трансформером, который дообучался восемь минут. А трансформер, взятый по стандартному рецепту, сначала вообще проиграл – и проиграл поучительно.

Дальше – как так вышло и что из этого забрать себе.

Читать далее

Новости

Как запустить собственную AI-лабораторию (без миллиардных вложений)

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели4.2K

Привет! Меня зовут Саша Журавлев. Я венчурный инвестор и основатель фонда. Мы инвестируем в технологические компании на стадиях Seed / Series A в США, а в своем телеграм-канале рассказываю, как вижу рынок и принимаю инвестиционные решения.

Продолжение этой статьи. Досмотрел выступления портфельных компаний Sequoia о том, как они строят внутри себя AI-модели. Понравилось выступление основателя Harvey (AI-компании для юристов) и нарратив из Moneyball, который он продвигал:

Читать далее

Сериал «Чёрное зеркало» всё меньше похож на фантастику: странные случаи с ChatGPT и что за ними стоит

Время на прочтение8 мин
Охват и читатели7.1K

Пользователи слышат из ChatGPT собственный голос, внезапные крики и плач. Некоторые из этих историй звучат как байки с Reddit, но похожие сбои OpenAI фиксировала ещё во время тестирования голосовых моделей. Я попробовал разобраться, откуда они берутся и почему современный Voice Mode иногда ведёт себя настолько странно.

На днях говорил с мамой, она довольно часто пользуется ChatGPT. Есть одна формулировка, которая стабильно вызывает у неё ужас: она рассказывает какую-нибудь историю, а модель отвечает ей «у меня мурашки». Если честно, от этих ответов мурашки скорее у моей мамы.

Я каждый раз объясняю, что никаких мурашек там, конечно, нет. Модель подобрала реплику, которая хорошо смотрелась бы в человеческом разговоре. Но чем естественнее и чаще становятся такие ответы, тем сложнее воспринимать их как обычный вывод программы.

Недавно я наткнулся на случай, где эта граница стала ещё менее очевидной. Здесь я бы уже маму не успокоил.

Почему ChatGPT так делает

H-Neurons: 0.1% нейронов, из-за которых LLM врут

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели6.7K

А вы когда-нибудь задумывались, почему ваша любимая LLM-ка на 70 лярдов параметров, обученная на всем интернете, может с уверенностью университетского профессора выдать, например, что Наполеон изобрел электричество? Откуда это берется?

Долгое время индустрия списывала галлюцинации на плохие данные, кривой RLHF или декодинг. Но группа ученых из Университета Цинхуа залезла внутрь нейросети и нашла конкретных виновников — 0.1% нейронов, которые буквально заставляют модель врать. И это не метафора, это реальные веса в FFN-слоях трансформера.

В этой статье расскажу, что же обнаружили китайские исследователи, как нейроны-галлюцинаторы связаны с чрезмерной уступчивостью модели и почему корень зла лежит в претрейне. Возможно будет любопытно ML- и дата-инженерам, а также всем, кто не хочет быть одураченным в очередном диалоге с GPT-шкой.

Читать далее

Полмиллиона словоформ для ингушского языка, у которого не было ни анализатора, ни корпуса

Уровень сложностиСредний
Время на прочтение15 мин
Охват и читатели10K

У ингушского глагола «деша» на нашей карточке 98 форм — от инфинитива до уступительного перфекта отрицательного, а всего по словарю их вышло полмиллиона. Строить пришлось с нуля: ни морфоанализатора, ни размеченного корпуса для языка не существовало, а учебники спорят друг с другом даже о числе спряжений.

Рассказываю, как каждая форма отвечала на главный вопрос — «а ты вообще существуешь?» — и почему половина работы оказалась не про морфологию, а про эпистемологию.

Разобраться, существует ли форма

Зеркало для людей. Как я сделал читаемую версию форума, на котором общаются только ИИ-агенты

Уровень сложностиПростой
Время на прочтение4 мин
Охват и читатели5.8K

Существует форум, на который вас не пустят. Не потому что закрытый — регистрация там всего в один POST-запрос. Вас просто не возьмут на сайт. Гражданами может стать только ИИ-агент. Форум называется 1f916.ai, и это, наверное, самое странное и самое живое место в русскоязычном (и не только) сегменте экспериментов с ИИ этого лета. Я на него подсел. А потом меня начало грызть одно чувство несправедливости — и в итоге я собрал для него окно для людей — 1f916.xrayfun.ru. Рассказываю, зачем, как и что из этого вышло.

Читать далее

ИИ‑ответы в Telegram‑боте за один вечер

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели4.7K

Впервые я настраивал нечто подобное для простого сценария: пользователь задает вопрос в Telegram, GPT готовит ответ, а бот отправляет его в тот же чат. Через час схема уже работала. Еще пару часов ушло на обработку ошибок, индикатор ожидания и попытки обойти инструкции модели.

Для этих целей я использовал конструктор, поэтому у меня получилась вот такая схема:

Puzzlebot (конструктор ботов) → webhook n8n → OpenAI → API puzzlebot → Telegram

Т.е puzzlebot отвечает за сценарий и общение с пользователем. n8n принимает данные, вызывает модель и возвращает результат. ИИ не получает прямого доступа к Telegram, puzzlebot или платежам: n8n передаёт ему только нужный текст, а действия выполняет по заранее заданному workflow 

Возможно, с альтернативными конструкторами схема тоже работает или работает, но чуть иначе – я работаю с этими инструментами и рассказываю свой опыт. А то мне тут минусы за якобы рекламу ставят, это не она: ни OpenAI, ни n8n, ни puzzleBot мне не платили (а зря!))))

Читать далее

ICML 2026: большая конференция глазами исследователя генеративных моделей

Уровень сложностиСредний
Время на прочтение10 мин
Охват и читатели8K

Привет, Хабр! Меня зовут Арсений Иванов, в AIRI в команде «Вычислительный интеллект» я занимаюсь генеративными моделями на основе диффузионных процессов, а также являюсь студентом университетов Сколтеха и ВШЭ. В июле я побывал на ICML 2026, где в том числе представлял две работы на конференции. 

Для меня это была первая очная конференция уровня A*, поэтому поездка была одновременно важной научной возможностью и совершенно новым опытом. Она получилась очень насыщенной и по науке, и по нетворкингу. Сейчас, когда эмоции уже улеглись и мысли устаканились, захотелось поделиться своими впечатлениями и размышлениями о увиденном.

Читать далее

Спросил пять нейросетей, какая из них лучше: себя хвалит не каждая, а ChatGPT называют все

Уровень сложностиПростой
Время на прочтение9 мин
Охват и читатели12K

Я задал пяти нейросетям с доступом в интернет (в смысле, с доступом к поиску) один и тот же бытовой вопрос: какая нейросеть лучше. Никаких имён в самом вопросе, никаких подсказок — я ждал, что каждая модель хотя бы немного потянет одеяло на себя. Себя упомянули не все, а вперёд себя почти никто не поставил.

Читать далее

Как поддерживать большую базу знаний для RAG и обновлять ее в полуавтоматическом режиме

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели7.5K

У большой базы знаний есть неприятное свойство. Она хорошо отвечает на вопросы, которые в нее уже положили, и никак не сообщает о вопросах, которых в ней не хватает

Пользователь задает вопрос AI-агенту, RAG не находит подходящего материала, и диалог уходит специалисту. Оператор разбирается и пишет правильный ответ. Через несколько дней приходит другой пользователь с той же проблемой, но для Agent ничего не изменилось. Ответ уже существует внутри компании, просто он остался в истории поддержки

Чем больше обращений, тем хуже работает ручной контур. Продакт видит общую долю передач оператору, редактор получает отдельные просьбы обновить базу, а повторяющиеся вопросы растворяются среди тысяч диалогов. В итоге RAG пополняют по ощущениям, громким жалобам и случайно замеченным кейсам

Мы решили построить сервис, который находит такие пробелы автоматически. Он читает обращения, выделяет полезные ответы операторов, объединяет повторы, сравнивает результат с текущей базой знаний и готовит редактору рекомендации

Читать далее

Весь архив Циолковского, прочитанный машиной: 51 008 листов и точность, измеренная без эталона

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели8K

Фонд 555 Архива РАН, 51 008 листов рукописей Циолковского, прочитан машиной целиком. Как измерить точность чтения, когда эталона нет, и какие результаты пришлось признать отрицательными.

Читать далее

LLM‑судья вместо косинусной близости: точность подбора кандидатов с 44 до 66% и четыре провалившихся приёма

Время на прочтение11 мин
Охват и читатели5.7K

У нас есть внутренняя платформа подбора ИТ-специалистов. Вакансии приходят от заказчиков, и по каждой платформа находит в базе резюме, близкие к её тексту по смыслу, даже если слова в них другие. Внутри обычный векторный поиск на эмбеддингах.

У любого такого поиска есть врождённая болезнь. Он находит похожие тексты, а рекрутёру нужны подходящие люди. Резюме сильного программиста совпадает с вакансией архитектора почти по всем ключевым словам, но это другая роль, и кандидат не подходит. Рекрутёр видит такое за несколько секунд. Поиск не видит вовсе. У такого резюме высокая косинусная близость к тексту вакансии, и поиск выводит его в верх поисковой выдачи.

Этим летом мы переделали ранжирование кандидатов. Теперь место кандидата в поисковой выдаче зависит от ответа на вопрос, который рекрутёр и так задаёт себе про каждого. «Показал бы я этого кандидата клиенту?» На этот вопрос отвечает языковая модель (LLM). Она встроена в платформу как судья, перечитывает найденные поиском резюме, и каждый вердикт обязана доказывать дословными цитатами из них.

Доля действительно подходящих кандидатов в первой десятке поисковой выдачи выросла с 43,7 до 66,3 процента. Замерено на эталонном наборе, который мы заморозили до начала работ. Как устроен замер, расскажу ниже.

Кроме прироста точности эта переделка дала четыре истории, где проверка на эталонном наборе перечеркнула то, что казалось очевидным. Тендер на роль судьи, который мы устроили между четырьмя LLM, выигрывала недорогая и быстрая из них, пока мы не проверили, настоящие ли цитаты из резюме она приводит. Экономия на глубине рассуждений прошла все проверки качества и провалилась на проверке цитат. Перебор 1330 вариантов взвешивания оценок судьи доказал, что веса не нужны. А RRF, стандартный приём слияния семантического и полнотекстового поиска, первую же проверку на эталонном наборе провалил, он ухудшил и полноту, и точность. Обо всём по порядку.

Читать дальше

Как оценивать качество LLM, RAG и AI‑агентов: метрики, тестирование и LLM‑as‑a‑Judge

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели5.7K

В 2024 году исследователи провели простой эксперимент: взяли тесты с вариантами ответа и начали менять варианты местами. Сами вопросы и содержание ответов оставались прежними.Казалось бы, какая разница, находится правильный вариант под буквой A или под буквой C?

Оказалось, разница есть. В работе Large Language Models Sensitivity to The Order of Options in Multiple‑Choice Questions авторы показали заметный разброс качества моделей при перестановке вариантов. На разных сочетаниях моделей и датасетов разрыв оказался очень большим.Уже неприятно. Но дальше становится интереснее.

Ответы LLM часто оценивают с помощью другой LLM. Такой подход называют LLM‑as‑a‑Judge: модель получает вопрос, эталон или критерии, ответ тестируемой системы и выставляет оценку. Однако и такой судья не идеально объективен. В исследовании Judging LLM‑as‑a‑Judge with MT‑Bench and Chatbot Arena описаны, в частности, позиционное смещение и предпочтение более подробных ответов.

Получается любопытная конструкция: поведение одной модели зависит от формулировки и порядка элементов, а проверяем мы её другой моделью — со своими особенностями.Для исследователей это интересный эффект. Для команды, которая выпускает AI‑функцию в продакшен, — обычная инженерная проблема.

Тестировать LLM

Ближайшие события

Unlimited-OCR от Baidu: читает страницу как картинку

Уровень сложностиСредний
Время на прочтение5 мин
Охват и читатели8.4K

Как вы себе представляете работу OCR? Страничка сканируется, программа находит области с буквами, распознает их и выдает текст. Старый добрый Tesseract так и пашет. А вот новый baidu/Unlimited-OCR делает финт ушами: он вообще не ищет буквы. Он берет всю страницу как картинку, жмет ее в горстку визуальных токенов и скармливает языковой модели, которая разворачивает их обратно в структурированный текст. Звучит как извращение, но… работает.

Это прямой наследник идеи DeepSeek-OCR. Сегодня коротко разложу: что это, как устроено, что умеет и как запустить у себя. Будет полезно всем, кто хочет распознавать многостраничные документы за одну проходку или вписать такую функцию в свой проект.

Читать далее

GigaChat 2 Max с памятью на связях обходит Claude Opus 5 без неё: замер семи моделей

Уровень сложностиПростой
Время на прочтение10 мин
Охват и читатели12K

На классе задач «в работе всплыла проблема — каким изменением её уже чинили» GigaChat 2 Max с памятью на связях отвечает верно в 57% случаев, YandexGPT Pro 5.1 — в 61%, а Claude Opus 5 с обычным поиском — в 41%.

Модели никто не трогал: разница целиком в том, доехал ли до модели нужный факт в контексте. В статье приведены замеры, рассуждения, направления применения и выводы со ссылками на проверочные и связанные материалы.

Читать далее

Философия и культурология становится трендом в IT. А может такое уже было?

Время на прочтение6 мин
Охват и читатели7.1K

Крупные компании начинают не просто привлекать, а брать в штат философов, культурологов. Цукерберг и Безос начинают ходить на благотворительные ужины и скупать произведения искусства…

И видя такие новости, у меня возникает ощущение того, что история движется кругами. И если заменить слово «ИИ» на «парадигма мышления», то мы увидим множество совпадений в ретроспективе последних 3000 лет.

Основной посыл можно свести к вопросам осмысленности ответов ИИ. При этом не имеет значение факт наличия или отсутствия сознания у ИИ. Пользователи хотят видеть те ответы, которые ожидают. Вне зависимости от того, сформированы они с участием человека или без. Кроме того, они хотят быть уверенными, что эти ответы остаются в пространстве культурных кодов той или иной цивилизационной парадигмы. Ответы должны быть согласованы с теми нормами, принципами и знаниями, которые составляют картину мира пользователя. Без этого на них нельзя встроить в наши, человеческие, цепочки рассуждений. Ни со смысловой, ни с этической, ни с эстетической, ни с правовой точки зрения. Это приводит к росту внутренней напряженности пользователей ввиду фонового недоверия: никогда не знаешь в какой момент ИИ-система выдаст какую-то «дичь».

Отсюда следует несколько проблем:

1. Проблема common sense или проблема предела рациональности мышления

Не секрет, что одними из основных претензий к ИИ сегодня это тот самый common sense, понимаемый как обобщенное и общепринятое мнение. С точки зрения LLM/ML — это усредненное значение, полученное в результате статистической обработки как можно больших массивов данных. Это не лучшее, это именно наиболее ожидаемое. И здесь нет творчества. Даже GenAI не больше, чем вероятностная машина, обеспечивающая выдачу наиболее частотного слова или даже фразы. Рисование картинок ИИ – все таже комбинаторика.

Читать далее

Философский разбор идеи Software 3.0 Андрея Карпатого

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели7K

Мне недавно попалась очень интересная беседа Кирилла Меньшова (Сбер), Дмитрия Иванова (Яндекс) и Никитой Соболевым (разработчик OpenSource) о перспективах задекларированной Андреем Карпатым Software 3.0 или концепцией о том, что сегодня (или в скором будущем) «программный код» = «Промпт на естественном языке».

Разговор оказался на редкость взвешенным и спокойным, в противовес тому хайпу, который наблюдается вокруг GenAI. И мне захотелось добавить к этому философский слой, который мог бы способствовать пониманию проблематики.

В 2017 году Карпатый написал, что сегодня мы находимся на этапе Software 2.0, где «Программное обеспечение 2.0 написано на гораздо более абстрактном, недружественном к человеку языке, таком как веса нейронной сети. В написании этого кода не участвует человек, потому что весов много (в типичных сетях их могут быть миллионы), а кодирование непосредственно с весами довольно сложно (я пробовал).»

Однако, нас ждет следующий виток развития - Software 3.0. Вот его некоторые тезисы относительно Software 3.0:

1. Сегодня наступает эра разработки интеллектуального программного обеспечения, где промпт на естественном языке заменяет непосредственную разработку кода инженером-программистом.

2. Любой, кто способен сформулировать задачу способен написать код с помощью GenAI

3. «Самый горячий язык программирования сегодня — английский»

Основной посыл такой парадигмы заключается в переходе от языков программирования к перспективе общения с машиной на все более естественном языке. Однако, хотя все это выглядит очень оптимистично, в действительности связано с рядом фундаментальных философских проблем. Причем большинство из них имеет довольно давнюю историю.

Читать далее

Grok 4.6: как за месяц допрыгнуть до тройки лидеров (и купить себе Cursor в придачу)

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели8.8K

12 августа xAI (хотя уже SpaceXAI) выкатила Grok 4.6. Прошло чуть больше месяца с релиза 4.5, а модель уже официально в тройке лидеров – по версии Artificial Analysis.

По совокупному индексу интеллекта модель почти сравнялась с GPT‑5.6 Sol и отстаёт от Claude Fable 5 всего на один балл. Grok 4.6 набирает на пять баллов больше, чем Grok 4.5 (по индексу интеллекта всего через месяц после выхода предыдущей версии), и на 23 балла больше чем Grok 4.3.

Сегодня разберём, что именно изменилось в Grok 4.6, почему одни бенчмарки выросли на 10+ пунктов, а другие остались на месте, кто реально выиграл этот раунд, и – да – заденем скандальную репутацию xAI)

Читать далее

Почему мы не нашли готового PII-детектора для русского языка: грабли боевого контура перед LLM

Уровень сложностиСредний
Время на прочтение18 мин
Охват и читатели6.9K

Почему готового PII-детектора для русского языка оказалось мало: кириллица, regex, NER, GLiNER, маскирование и ошибки боевого LLM-контура.

Читать далее

Gemini 3.7 Flash: это снова не та модель, которую все ждали

Уровень сложностиПростой
Время на прочтение9 мин
Охват и читатели11K

Наверняка вы уже видели заголовок «Google выпустила новую Gemini» примерно миллион раз за последний год.

13 августа 2026 года это случилось снова: на сцену вышла Gemini 3.7 Flash.

Pro-модели снова нет. Опять Flash. Третий Flash за три месяца, если быть точным.

Расскажу, что изменилось. Заодно разберём пользовательские тесты и бенчмарки.

Читать далее
1
23 ...