Pull to refresh
16K+
0
Жемал Хамидун@hamidun

Head of AI · Alpina Digital · CPO AlpinaGPT

5
Rating
6
Subscribers
Send message

Впрочем, кто-то по-прежнему пишет гусиным пером, и мы не возражаем. По-моему, важна суть написанного, а не инструмент. В статье девять спикеров с именами и десять ссылок на первоисточники — их можно открыть и проверить. Записи конференций тоже есть, там те же эксперты говорят это вживую.

Про «доскребание каши со дна» — спорно. Так говорили перед каждой большой технологией: электричество, интернет — мол, основное уже сделано. Каждый раз новая инфраструктура открывала ниши, которых до неё просто не было: интернет создал целый e-commerce, которого в «каше» не существовало вовсе. ИИ скорее не закрывает старые потребности, а создаёт новые рынки. Пузырь в оценках — да, согласен. Но «узкая ниша» — это пока технология дорогая и сложная; дешевея, она расползается вширь.

Интересная оптика — ИТ как оружие в конкурентной борьбе, а не чистый прирост благ. Доля правды есть: часть инвестиций в ИИ сейчас идёт именно в «обогнать соседа», и с точки зрения общей продуктивности это игра с нулевой суммой. Но так бывает с любой технологией на ранней стадии: сначала ей топят конкурента, а когда она дешевеет и расходится по рынку — начинается общий прирост. Электричество тоже сперва было преимуществом отдельных фабрик, а стало базовой инфраструктурой для всех.

Согласен на сто процентов — и это ровно то место, где ИИ ничего не меняет. Можно сколько угодно ускорять написание ТЗ моделью, но если перед этим не было живого разговора с заказчиком и сверки ожиданий, на выходе получится красиво оформленное недопонимание. ИИ ускоряет шаги, но не отменяет тот, который про людей.

Тонкое наблюдение, и риск реальный. Только я бы развернул: дешёвый порог входа убивает мотивацию стандартизировать руками, но он же делает возможной стандартизацию на другом уровне — не «все договорились об одном фреймворке», а «агент сам переводит между ними». Когда переключение стоит часы, фрагментация перестаёт так больно бить: ты не привязан к одному стеку. Хаоса в моменте больше, согласен. Но, возможно, мы идём не к единому стандарту, а к миру, где разнообразие дёшево обслуживается.

Полностью согласен — и это, по-моему, главный недооценённый момент. Сегодняшний потолок не в моделях, а в том, что они почти не подключены к внутреннему контуру: данным, CRM, ERP, базе знаний. Как только агент получает доступ к реальному контексту компании и право действовать в нём — ценность меняется на порядок. Поэтому и говорю, что готовить почву надо сейчас: кто за время «пузыря» наведёт порядок в данных и интеграциях, на следующем витке окажется сильно впереди.

Ну конечно не 100% «это всё я руками» — ИИ в подготовке участвует, и я об этом пишу открыто. Но «сгенерирована на 85%» и «написана с ИИ» — разные вещи. Структура, вычитка, иногда формулировки — да, с моделью. А методология четырёх этапов, цифры, кейсы и грабли — это реальный опыт внедрения в Альпине и работы с корпоративными командами, ИИ их не придумывал.

Детектор «сгенерированности» ловит стиль и гладкость, а не происхождение смысла — поэтому на любой вычитанный текст он покажет высокий процент. Вопрос ведь не в том, касалась ли текста модель, а в том, стоит ли за ним живой опыт и проверяемые факты. Если хотите ткнуть в конкретное место, которое звучит пусто или неверно, — покажите, разберу предметно.

Ну конечно не 100% «это всё я руками» — ИИ в подготовке участвует, и я об этом пишу открыто. Но «сгенерирована на 85%» и «написана с ИИ» — разные вещи. Структура, вычитка, иногда формулировки — да, с моделью. А методология четырёх этапов, цифры, кейсы и грабли — это реальный опыт внедрения в Альпине и работы с корпоративными командами, ИИ их не придумывал.

Тут важно понимать, что детектор «сгенерированности» ловит стиль и гладкость, а не происхождение смысла. Пара показательных примеров. GPTZero в 2023-м оценил текст Конституции США 1787 года как на 96% написанный ИИ. А в исследовании в Journal of Pathology Informatics прогнали 14 400 реальных научных абстрактов из Nature, Science и NEJM за 1980–2023 годы — и детектор пометил «ИИ-генерацией» до 8% из них, включая статьи начала 1990-х, написанные за десятилетия до первых LLM (примерно каждую двадцатую — с уверенностью выше 90%). То есть инструмент реагирует на гладкость формулировок, а не на то, кто реальный автор.

Так что вопрос не в том, касалась ли текста модель, а в том, стоит ли за ним живой опыт и проверяемые факты. Если хотите ткнуть в конкретное место, которое звучит пусто или неверно, — покажите, разберу предметно.

Источники: исследование — pmc.ncbi.nlm.nih.gov/articles/PMC10727991/ ; про Конституцию — senseient.com/ride-the-lightning/ai-detector-believes-the-u-s-constitution-was-written-by-ai/

В стагнирующем бизнесе — ровно так и происходит, не буду спорить. Но это работает только когда компания упёрлась в потолок: спрос фиксированный, расти некуда, поэтому ту же работу делают меньшим числом. В бизнесе, у которого есть куда расти, логика обратная — тот самый ускоренный не вытесняет двоих, а тянет команду делать в три раза больше, и нанимают ещё. Вопрос не в ИИ, а в том, есть ли у компании рынок для роста или она делит фиксированный пирог.

Вопрос правильный, и ответ неуютный для всех уровней сразу. Парадокс в том, что часть работы C-level автоматизируется проще, чем кажется — отчётность, дашборды, сценарный анализ, подготовка решений. А вот то, за что топам реально платят — ответственность за выбор в условиях неопределённости, переговоры, политика внутри компании — пока держится лучше всего, потому что это не про обработку информации, а про то, кто понесёт последствия.

Так что ИИ скорее съест среднюю прослойку, которая готовила материалы для C-level, чем сам C-level. Что, кстати, делает позицию топа ещё более одинокой — меньше людей между ним и решением.

Парадокс Солоу тут уместен как никогда — «компьютерный век виден везде, кроме статистики производительности», 1987 год. Только история этого парадокса даёт надежду: между массовым приходом технологии и её следом в макростатистике обычно лаг 10-20 лет. Электричество в промышленности так и шло — заводы десятилетиями не росли в производительности, пока не перестроили саму планировку цехов под электромотор вместо парового вала.

Бриньолфссон описал это как «производительную J-кривую»: сначала технология даже проседает в метриках, потому что все ресурсы уходят на перестройку процессов, и только потом выстреливает. Так что «ложка дырявая или каша на дне» — возможно, мы просто в нижней точке J. Через сколько вынырнем — вот тут честно не знаю.

ulisma, ссылка хорошая, но я бы read’ил такие опросы с осторожностью. Опрос CEO — это самоотчёт, и он структурно запаздывает: руководитель отвечает про то, что уже осозналось и попало в отчётность, а не про то, что происходит в найме прямо сейчас. Реальные данные по вакансиям расходятся со словами — найм junior-специалистов в AI-экспонированных профессиях просел, при том что общая занятость держится.

И «не повлиял на производительность» — это среднее по больнице. Выигрыш от ИИ сейчас сильно концентрированный: у тех, кто реально перестроил процессы, прирост кратный, а у большинства, кто «попробовал ChatGPT пару раз» — ноль. В усреднении эти две группы взаимно гасятся, и на макроуровне получается «ничего не изменилось». Хотя внутри разброс огромный.

Roma, да, для меня это тоже ядро. Один нюанс, чтобы вывод не читался как «увольняем 600»: на практике это работает в двух разных режимах. В стагнирующем бизнесе, упёршемся в потолок спроса — да, та же работа делается меньшей командой, и лишние позиции режут. А в растущем — те же 800 человек начинают делать работу за 3200, и никого не сокращают, просто рынок захватывается быстрее. Какой из сценариев включится, зависит не от ИИ, а от того, есть ли у компании куда расти.

Отличный пример с котом — это и есть тот самый контекст в действии. «Вынеси чесание кота, потому что класс распух» работает кратно лучше, чем сухое «отрефактори класс», именно потому что модель понимает намерение, а не букву.

И второе наблюдение у вас даже важнее первого — про послушность. Это известная проблема, sycophancy: модель по умолчанию соглашается с посылкой запроса, даже если посылка кривая. «Сделай фигню» — сделает фигню без возражений. А «оцени, фигня ли это» — переключает её из режима исполнителя в режим эксперта, и она внезапно начинает видеть проблемы. Я про этот же эффект недавно писал в контексте безопасности — там через лесть и «уверенные посылки» модель вообще можно увести за ограждения. Один и тот же механизм: модель достраивает то, что вы ей неявно внушили. Поэтому формулировка запроса — это наполовину то, что вы в него не положили.

По сути мы об одном — контекст давать надо в обоих случаях. Я только про то, что «угадай сам» как управленческий стиль не работает ни с крутым, ни с обычным. Крутому, как вы точно заметили, надо платить (и тогда он будет в контексте по своей инициативе), а обычному — этот контекст явно проговаривать. А вот стиль «хороший сотрудник сам догадается, что я имел в виду» — это способ не платить и не объяснять одновременно. Обычно плохо кончается для обеих сторон.

Marwin, это лучшая позиция из возможных — когда железо есть, надо брать максимум по качеству, тут двух мнений нет. Все эти пляски с лёгкими моделями начинаются ровно там, где VRAM в дефиците или клиент на on-prem с двумя картами. Если у вас объём текстов уже оправдывает тяжёлые версии и они тянутся — вы просто на ступеньку выше по инфраструктуре, и это хорошо. Удачи с масштабированием )

В точку. Это и есть главная причина выбора в проде, а не на лидерборде. На одном инстансе у нас обычно сидит и LLM, и эмбеддер, и реранкер, плюс несколько одновременных запросов пользователей. С 8B-эмбеддером это либо отдельная видеокарта только под него, либо очереди и просевший P95 latency. С e5-large/jina-v3 — спокойно укладываемся в один GPU и держим P95 под 100ms на эмбеддинг.

CPU-инференс на multilingual-e5-large тоже реально рабочий: на нормальном Xeon с AVX-512 через onnxruntime в batch-режиме получаются десятки текстов в секунду. Для бэкграунд-индексации этого хватает, а на горячем пути можно держать GPU. С 8B на CPU такой фокус не пройдёт даже в фоне.

Это и есть та часть, которую в статье я свернул в полстроки — операционные ограничения часто диктуют архитектуру сильнее, чем лидерборд.

Marwin, вопрос по делу — и вы во многом правы. Qwen3-Embedding-8B (релиз июнь 2025) действительно сейчас лидер на MTEB Multilingual benchmark, где русский — один из языков покрытия, и по чистому качеству опережает и multilingual-e5-large, и jina-v3 на несколько пунктов на большинстве задач.

Выбор у нас операционный, а не на пьедестале качества. Несколько причин, по которым в проде стабильно живёт более лёгкая связка:

— Размер модели. e5-large — около 560M параметров, jina-v3 — 570M. Qwen3-8B — это другая лига по VRAM и времени инференса. На batch-инжесте корпоративных баз (десятки тысяч документов) разница в часах превращается в дни.
— Throughput. RAG в проде это не один поток, а несколько параллельных пользователей и фоновая переиндексация. На одной A100/L40 e5-large держит throughput на порядок выше, чем 8B-эмбеддер при сопоставимом batch.
— On-premise ограничения клиентов. У большой доли enterprise-внедрений (особенно по 152-ФЗ) железо — пара видеокарт уровня RTX 4090 / A30, и туда же нужно посадить LLM. На бюджете VRAM просто нет места под 8B-эмбеддер.
— Дообучение. У e5-large и jina-v3 fine-tune под узкий домен на наших данных даёт заметный прирост к Recall@10 — обычно перекрывает разницу с Qwen3 без fine-tune.

При этом для проектов где нужен максимум качества и есть железо — Qwen3-Embedding и Giga я смотрю всерьёз, особенно на сложных доменах вроде юридических текстов с длинными цепочками рассуждений. khmelkoff в треде уже точно сформулировал основную часть ответа — спасибо ему.

По терминологии вы правы. В строгом смысле ИИ — широкий зонт, и в статье я использую слово как сложилось в публичном дискурсе. С академической точки зрения корректнее говорить «LLM-внедрения», и в более технических текстах я так и делаю.

Про локальные модели — здесь поспорю аккуратно. На простых задачах (классификация, RAG, извлечение из документов) локальные Llama 3 / Qwen действительно дают сопоставимое качество с облачными за единицы процентов отставания. Но на сложных reasoning-задачах и длинных контекстах frontier-модели (Claude Opus 4.7, GPT-5.4) пока отрываются заметно — речь о десятках процентов на бенчмарках типа SWE-bench и AIME. Для корпоративного внедрения «локально» работает только если задачи однородные и предсказуемые. Если задачи разные — приходится держать гибрид.

А в части «дутый пузырь» мы во многом сходимся — статья как раз про разрыв между инвестиционным капексом и реальной выручкой ИИ-сегмента. То, что под крышкой LLM это статистика на больших данных, не делает её бесполезной, но и не оправдывает текущие оценки в десятки P/E.

Точно, и это самое неприятное наблюдение. PowerPoint-стратегии без связи с реальностью — отдельный жанр, который существует с тех пор, как появились PowerPoint и MBA-программы. ИИ тут не первопричина, а ускоритель и мультипликатор — он просто позволяет генерировать сорняки в десять раз быстрее и красивее, чем раньше.

Самый чёткий маркер для меня — когда у проекта есть слайды с roadmap’ом до 2030 года, но нет ни одной живой команды, которая в нём работает. Если такое было видно ещё до ChatGPT, после него стало масштабироваться сильно быстрее.

Спасибо за реакцию. Ракурсов на эту тему правда много, мой — только один, и закрывать дискуссию одной статьёй я не пытаюсь.

А про оборотную сторону медали — если поделитесь, что имеете в виду конкретно, буду благодарен. Тема большая, любопытно понять, какую часть я сейчас вижу плохо.

Information

Rating
1,322-nd
Location
Россия
Date of birth
Registered
Activity