Обновить
128K+

Natural Language Processing *

Компьютерный анализ и синтез естественных языков

174,51
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

GigaChat 2 Max с памятью на связях обходит Claude Opus 5 без неё: замер семи моделей

Уровень сложностиПростой
Время на прочтение9 мин
Охват и читатели5.4K

На классе задач «в работе всплыла проблема — каким изменением её уже чинили» GigaChat 2 Max с памятью на связях отвечает верно в 57% случаев, YandexGPT Pro 5.1 — в 61%, а Claude Opus 5 с обычным поиском — в 41%.

Модели никто не трогал: разница целиком в том, доехал ли до модели нужный факт в контексте. В статье приведены замеры, рассуждения, направления применения и выводы со ссылками на проверочные и связанные материалы.

Читать далее

Новости

Философия и культурология становится трендом в IT. А может такое уже было?

Время на прочтение6 мин
Охват и читатели6.7K

Крупные компании начинают не просто привлекать, а брать в штат философов, культурологов. Цукерберг и Безос начинают ходить на благотворительные ужины и скупать произведения искусства…

И видя такие новости, у меня возникает ощущение того, что история движется кругами. И если заменить слово «ИИ» на «парадигма мышления», то мы увидим множество совпадений в ретроспективе последних 3000 лет.

Основной посыл можно свести к вопросам осмысленности ответов ИИ. При этом не имеет значение факт наличия или отсутствия сознания у ИИ. Пользователи хотят видеть те ответы, которые ожидают. Вне зависимости от того, сформированы они с участием человека или без. Кроме того, они хотят быть уверенными, что эти ответы остаются в пространстве культурных кодов той или иной цивилизационной парадигмы. Ответы должны быть согласованы с теми нормами, принципами и знаниями, которые составляют картину мира пользователя. Без этого на них нельзя встроить в наши, человеческие, цепочки рассуждений. Ни со смысловой, ни с этической, ни с эстетической, ни с правовой точки зрения. Это приводит к росту внутренней напряженности пользователей ввиду фонового недоверия: никогда не знаешь в какой момент ИИ-система выдаст какую-то «дичь».

Отсюда следует несколько проблем:

1. Проблема common sense или проблема предела рациональности мышления

Не секрет, что одними из основных претензий к ИИ сегодня это тот самый common sense, понимаемый как обобщенное и общепринятое мнение. С точки зрения LLM/ML — это усредненное значение, полученное в результате статистической обработки как можно больших массивов данных. Это не лучшее, это именно наиболее ожидаемое. И здесь нет творчества. Даже GenAI не больше, чем вероятностная машина, обеспечивающая выдачу наиболее частотного слова или даже фразы. Рисование картинок ИИ – все таже комбинаторика.

Читать далее

Философский разбор идеи Software 3.0 Андрея Карпатого

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели6.6K

Мне недавно попалась очень интересная беседа Кирилла Меньшова (Сбер), Дмитрия Иванова (Яндекс) и Никитой Соболевым (разработчик OpenSource) о перспективах задекларированной Андреем Карпатым Software 3.0 или концепцией о том, что сегодня (или в скором будущем) «программный код» = «Промпт на естественном языке».

Разговор оказался на редкость взвешенным и спокойным, в противовес тому хайпу, который наблюдается вокруг GenAI. И мне захотелось добавить к этому философский слой, который мог бы способствовать пониманию проблематики.

В 2017 году Карпатый написал, что сегодня мы находимся на этапе Software 2.0, где «Программное обеспечение 2.0 написано на гораздо более абстрактном, недружественном к человеку языке, таком как веса нейронной сети. В написании этого кода не участвует человек, потому что весов много (в типичных сетях их могут быть миллионы), а кодирование непосредственно с весами довольно сложно (я пробовал).»

Однако, нас ждет следующий виток развития - Software 3.0. Вот его некоторые тезисы относительно Software 3.0:

1. Сегодня наступает эра разработки интеллектуального программного обеспечения, где промпт на естественном языке заменяет непосредственную разработку кода инженером-программистом.

2. Любой, кто способен сформулировать задачу способен написать код с помощью GenAI

3. «Самый горячий язык программирования сегодня — английский»

Основной посыл такой парадигмы заключается в переходе от языков программирования к перспективе общения с машиной на все более естественном языке. Однако, хотя все это выглядит очень оптимистично, в действительности связано с рядом фундаментальных философских проблем. Причем большинство из них имеет довольно давнюю историю.

Читать далее

Grok 4.6: как за месяц допрыгнуть до тройки лидеров (и купить себе Cursor в придачу)

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели7.8K

12 августа xAI (хотя уже SpaceXAI) выкатила Grok 4.6. Прошло чуть больше месяца с релиза 4.5, а модель уже официально в тройке лидеров – по версии Artificial Analysis.

По совокупному индексу интеллекта модель почти сравнялась с GPT‑5.6 Sol и отстаёт от Claude Fable 5 всего на один балл. Grok 4.6 набирает на пять баллов больше, чем Grok 4.5 (по индексу интеллекта всего через месяц после выхода предыдущей версии), и на 23 балла больше чем Grok 4.3.

Сегодня разберём, что именно изменилось в Grok 4.6, почему одни бенчмарки выросли на 10+ пунктов, а другие остались на месте, кто реально выиграл этот раунд, и – да – заденем скандальную репутацию xAI)

Читать далее

Почему мы не нашли готового PII-детектора для русского языка: грабли боевого контура перед LLM

Уровень сложностиСредний
Время на прочтение18 мин
Охват и читатели6.4K

Почему готового PII-детектора для русского языка оказалось мало: кириллица, regex, NER, GLiNER, маскирование и ошибки боевого LLM-контура.

Читать далее

Gemini 3.7 Flash: это снова не та модель, которую все ждали

Уровень сложностиПростой
Время на прочтение9 мин
Охват и читатели9.9K

Наверняка вы уже видели заголовок «Google выпустила новую Gemini» примерно миллион раз за последний год.

13 августа 2026 года это случилось снова: на сцену вышла Gemini 3.7 Flash.

Pro-модели снова нет. Опять Flash. Третий Flash за три месяца, если быть точным.

Расскажу, что изменилось. Заодно разберём пользовательские тесты и бенчмарки.

Читать далее

ИИ‑агент внутри КОМПАС-3D: пишет код, строит деталь и проверяет результат

Уровень сложностиСредний
Время на прочтение13 мин
Охват и читатели85K

Я сделал ИИ‑агента для КОМПАС-3D: он живёт прямо в окне программы, принимает запрос текстом или фотографией и строит параметрическую деталь — не мёртвую геометрию в step, а дерево построения с переменными, которое пригодно для редактирования.
Агент пишет код и сам смотрит на то, что построил, — анализирует рендеры «глазами» через VLM.
В статье: как хорошо агент справляется с моделированием по тексту и чертежам уже сейчас, почему один блок кода лучше десяти tool'ов и почему агенту мало просто «видеть» результат.

Читать далее

Лучше проще. Как переупаковать базу знаний в сервис персонализированной помощи

Время на прочтение8 мин
Охват и читатели6.5K

Салют, Хабр!

Я Антон, продакт сервисов клиентской документации. Одна из задач нашей команды — решать проблемы пользователя как можно проще: без долгих диалогов с чат-ботом или техподдержкой, где приходится излагать, что случилось, как и когда; без поисковиков в надежде, что где-то на форумах найдётся ответ. Поэтому мы запустили на интеллектуальных телевизорах и медиацентрах Сбер сервис персонализированной контекстной помощи — ГигаСправку. Теперь, если устройство выдаёт ошибку, вместе с ней на экране появляется кнопка ГигаСправки. Нажав на неё, пользователь получает совет, как можно исправить проблему с учётом конкретного устройства и его состояния.

Эффект от нового сервиса для техподдержки огромен, а техническая реализация проста: всего одна точка знаний, RAG-сервис, ГигаЧат и семантическое кэширование позволяют предельно быстро помогать юзеру на той же поверхности. Показывать то, что нужно, там, где нужно. Рассказываем, как превратили базу с ответами на вопросы в ГигаСправку.

Читать далее

476 000 новостей против нейронки: пять попыток заставить текст предсказывать цену

Уровень сложностиСредний
Время на прочтение10 мин
Охват и читатели5.6K

Гипотеза «новости двигают рынок» — самая интуитивная в трейдинге. Настолько интуитивная, что я потратил на её проверку недели GPU-часов, полный архив финансовых телеграм-каналов с 2021 года и пять принципиально разных постановок задачи — от простых счётчиков упоминаний до NLP-разметки и пер-минутного event study.

Результат: ноль из пяти. Ни одна постановка не улучшила боевую модель (с одной унизительной для NLP оговоркой — она в конце).

Но интересен не сам ноль — интересно, как именно проваливалась каждая попытка. Две из пяти сначала показали «улучшение» в бэктесте, и если бы я остановился на агрегатной цифре, сейчас бы искренне рассказывал вам, что нейронка с новостями торгует лучше. Эта статья — подробный разбор всех пяти механизмов: что строил, какие признаки считал, какие цифры получил и где именно каждая версия обманывала.

Это обещанное продолжение статьи про сидовый шум ±10 п.п. — протокол проверки оттуда, здесь он работает на живом сквозном примере.

Читать далее

Квантизация LLM: как запихнуть 70B модель в свою видюху

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели5.6K

Ну что, думаете что для запуска LLaMA 3 70B вам нужна серверная стойка за лярд рублей? Поздравляю, вас обманули маркетологи GPU-вендоров. Модели с сотнями миллиардов параметров — LLaMA 3 70B, DeepSeek-V3 с его 671 лярдом параметров — жрут vRAM как не в себя, но есть способ запихнуть это все в обычную потребительскую видюху.

Сегодня в статье разберем, как работает чудо квантизации под капотом, чем отличаются PTQ и QAT, почему MoE-модели (DeepSeek-V3, Mixtral, LLaMA 4 Scout) квантизовать сложнее и как выбрать между GPTQ, GGUF и AWQ.

Материал будет полезен как мимо проходящим ИИ-любопытствующим, так и ML-инженерам и специалистам по инференсу LLM, которые хотят запускать большие модели на ограниченном железе. Покажу, как все это гонять на практике и с кодом.

Читать далее

Разговорили гуманоида: как за месяц мы построили русскоязычный голосовой стек для китайского робота

Уровень сложностиСредний
Время на прочтение25 мин
Охват и читатели6.2K

Можно ли управлять гуманоидом Walker Tienkung через свой голосовой ассистент по-русски?

Мы решили проверить — и быстро выяснили, что ответ сложнее, чем кажется. Штатная система понимала только китайский, Whisper ошибался на коротких командах, LLM добавляла задержку, а динамик съедал начало фразы после паузы. «Беги» превращалось в «begin», а «встань» — в «Таня».

Рассказываем, как нам удалось построить свой собственный модульный русскоязычный стек, разделить команды и диалог, ускорить синтез речи, и добиться реакции за доли секунды. С архитектурой, тестами и новыми нерешёнными задачами. Полный гайд как заставить робота ростом 173 см и весом 75 кг слушать вас и понимать!

Читать гайд

Кронекером по Фишеру: как при сжатии LLM учесть кривизну второго порядка и не умереть

Уровень сложностиСложный
Время на прочтение10 мин
Охват и читатели7.6K

Привет Хабр! На связи Вика Чекалина из команды «Мультимодальный ИИ» AIRI. Сегодня мы поговорим о том, как выкручиваться, когда вычислительных ресурсов мало и для деплоя необходимо сжать LLM, но так, чтобы потеря в качестве была минимальной. Логично, что нужно использовать дополнительную информацию — например, матрицу Фишера (FIM), которая содержит в себе информацию о важности и взаимодействии параметров модели. 

Но FIM реальных LLM слоев просто огромные, и работать с ними напрямую вычислительно тяжело или просто невозможно. Люди придумывают различные упрощения: например, можно отталкиваться от предположения, что матрица Фишера диагональна — это сильно сокращает объём памяти, однако корреляция между различными параметрами слоя теряется навсегда. Мы решили не идти на такие компромиссы и придумали метод, который быстро и легко позволяет параметризировать полную недиагональную матрицу Фишера без потери информации о корреляции.

Читать далее

Нужную книгу больше не обязательно искать: как ИИ меняет сам принцип работы с информацией

Уровень сложностиСредний
Время на прочтение25 мин
Охват и читатели14K

Что, если нужную книгу больше не нужно искать — её можно собрать под собственный вопрос?

Я проверил эту идею на реальном корпусе: 206 длинных видео, 160 часов 56 минут и 2,15 млн слов транскриптов.

Вместо сотен summary я построил конвейер, который выделяет сущности, схлопывает дубли, отслеживает происхождение выводов, проверяет важные утверждения и понимает, когда оставшиеся источники уже не нужно читать подряд.

По ходу выяснилось, почему 9 URL могут оказаться одним источником, почему векторная кластеризация не решила задачу смысловых дублей, чем такой подход отличается от RAG и почему длинная работа ИИ-агента неожиданно начинает напоминать разработку обычной программной системы.

Но главный вывод оказался шире самого проекта: единицей работы с информацией может становиться не источник, а наш вопрос.

Читать далее

Ближайшие события

Бесплатные API к Claude, GPT, DeepSeek и другим моделям: 6 AI-роутеров с бесплатным доступом

Уровень сложностиПростой
Время на прочтение4 мин
Охват и читатели99K

Собрал 6 AI-роутеров с бесплатным доступом к Claude, GPT, DeepSeek, Qwen и другим моделям. Показываю, что реально дают после регистрации: баланс, доступные модели, лимиты и нюансы работы через API.

Читать далее

Честный RAG eval set: как собрать первые 100-300 кейсов и не обмануть себя цифрой

Уровень сложностиСредний
Время на прочтение13 мин
Охват и читатели7.7K

В прошлой статье серии мы сжимали эмбеддинги и замеряли, насколько изменится выдача относительно полного fp32-поиска. Там это был правильный вопрос: ломает ли квантизация уже существующий retrieval.

Но у такого замера есть неприятное слепое пятно. Можно аккуратно сохранить 99% выдачи исходного эмбеддера и все равно плохо находить нужные документы на своем домене. Внешний бенчмарк, даже сильный, этого не гарантирует. BEIR как раз был создан, чтобы показать, насколько результаты retrieval меняются между разными задачами и доменами; один усредненный скор там не заменяет проверку на собственных данных.

Нужен свой eval set. И тут обычно возникает ложная развилка:

Читать далее

Перевод книги целиком: как я создал конвейер с помощью LLM

Уровень сложностиСредний
Время на прочтение16 мин
Охват и читатели17K

Я потратил пару недель на создание конвейера с открытым исходным кодом, который переводит книги целиком с помощью платных подписок на LLM. Поддерживаются Claude Code, Antigravity CLI и Codex. В статье описаны принципы построения конвейера для максимального качества перевода, а также тонкости по лимитам, скорости, цензуре и т.п. Проект BookTrans на GitHub.

Читать далее

Single Task Algorithmic Reasoning Models: как с помощью маленькой модели обойти большую LLM?

Уровень сложностиСредний
Время на прочтение12 мин
Охват и читатели15K

Привет, Хабр! Результаты коллег по цеху и наши исследования позволяют сделать однозначный вывод: в 2026-м для рецепта отличной reasoning-модели уже недостаточно лишь текстовых рассуждений. Для качественных ответов на большинство вопросов пользователей нужна работа с инструментами, мультимодальные режимы рассуждений, и нередко даже такая экзотика, как рассуждения в латентных представлениях сети.

Мы рады поделиться с сообществом фреймворком для обучения рекурсивных reasoning-моделей STARM, существенно опережающих по качеству предыдущие open source-аналоги.

Читать далее

Как работают текстовые ИИ-вотермарки и как их обходить

Уровень сложностиСредний
Время на прочтение5 мин
Охват и читатели8.2K

Наверное уже многие знают, что в силу недавно вступивших в ЕС законов, регулирующих использование ИИ, провайдеры LLM обязаны помечать ИИ-сгенерированные тексты. Та же Claude недавно обновила справочную информацию о работе своей помечалки сгенерированного ИИ контента, в том числе и текста. Но в подробности его работы почему-то вдаваться не стала, как и размещать в публичном доступе средства добавления и обнаружения этих самых вотермарок.

Не то чтобы я часто балуюсь текстовым нейрослопом, но сама идея того, что твой текст могут им объявить чисто случайно или в следствии того, что ты отредактировал иишкой его часть, меня не сильно радует. Поэтому в этой статье мы разберемся, как собственно эти метки работают, и как с ними бороться.

Читать далее

Как собрать персональную wiki без Claude Code

Уровень сложностиСредний
Время на прочтение17 мин
Охват и читатели5.7K

Идея Andrej Karpathy с LLM-wiki набирает сторонников. На Хабре уже было несколько публикаций (1, 2, 3), в том числе и моя про сравнение LLM-wiki и RAG-системы. Ещё больше статей я нашёл на medium.

У вас есть Claude Code? Собрать персональную википедию можно менее чем за час. А что делать, если Claude Code и ему подобные инструменты по разным причинам недоступны? Можно ли алгоритмизировать процесс и использовать «слабые» модели? На сколько получившаяся структура будет хуже и как их сравнивать? В статье попробую ответить на эти вопросы, а также расскажу как построить персональную wiki на Ollama или GPT-моделях.

Читать далее

«Тосок бессмысл»: как я не смог заставить Gemma 4 писать хорошие стихи

Уровень сложностиСредний
Время на прочтение14 мин
Охват и читатели5.3K

Дано: стихотворение. Тема — «тщетность накопления жизненного опыта», амфибрахий, четыре строки. Заканчивается словом «тосок». Такого слова в русском языке нет. Мой оценщик поставил этому тексту техничность 1.000 — идеал.

К этому моменту я месяц жёг GPU-часы на арендной L40S, пытаясь заставить Gemma 4 писать русские стихи. У меня был план из четырёх пунктов, свежая статья с рабочим рецептом, размеченный корпус на 13 тысяч пар и собственная метрика, проверенная на Пушкине. План развалился весь, но каждый раз не в том месте, где я ждал: главный подозреваемый до последнего выглядел очевидным, а виновным оказался совсем другой персонаж.

Это детектив про то, как четыре файнтюна подряд проиграли необученной базе, как я месяц принимал решения по шуму и не знал об этом — и почему рифму нельзя выучить в принципе, а можно только навязывать.

Настоящие цифры, реальный loss и плохие стихи прилагаются.

Читать далее
1
23 ...