В первой части я описал имаго‑подход для малого и среднего бизнеса: харнесс собирает знания, RAG приносит факты, а LoRA‑адаптер приносит привычки. Сразу после публикации мне задали вопрос: «А что делать большому предприятию, у которого не один проект, а сотни репозиториев, десятилетия истории и своя инфраструктура? Неужели тоже адаптер?»

Этим вопросом задался крупный международный медиахолдинг Thomson Reuters. Чтобы понять размеры этого мамонта, скажу, что капитализация компании превышает 80 миллиардов долларов, а работают в ней более 24 000 сотрудников по всему миру. Компания предоставляет профессиональную информацию, аналитику и программное обеспечение для юристов, налоговых и бухгалтерских служб, а также владеет всемирно известным новостным агентством Reuters.

Вместо того чтобы взять облачную фронтир‑модель, компания наняла три десятка ученых мужей и за три месяца используя 368 GPU B200 они создали собственную модель Thomson. Это не кодовая модель, она сделана для права, налогов и журналистики. По замыслу это тот же имаго‑подход: сделать модель частью организации, а не арендовать фронтир‑модель, которая выдает среднее по больнице в их сфере.

За основу взяли два открытых чекпойнта: Qwen3.5–397B (MoE, 17B активных параметров) и Qwen3.6–35B. Получились Thomson-1.0-Large и Thomson-1.0-Small. Финальный прогон Large оценивается меньше чем в 450 тысяч долларов и занял три недели. Вся разработка, с людьми, экспертами и вендорами, обошлась в 40 миллионов долларов, причем большую часть авторы относят на переиспользуемые исследования и инфраструктуру.

По агрегированным бенчмаркам (включая кодинг, где Thomson заметно слабее!) Thomson Large набрал 78.5% против 75.7% у Claude Sonnet 5. Лидером тестов стал Claude Opus 4.8 с 79.5%.

Казалось бы, результат хороший: дообученный Qwen работает на уровне фронтир‑моделей, чистый имаго. Но какой смысл тратить 40 млн долларов, чтобы встроиться между двумя моделями от Антропик?

Смысл на самом деле есть. Большая часть этой суммы ушла не на обучение, а на систему, которую авторы назвали фабрикой моделей. Это воспроизводимый конвейер, который превращает открытый чекпойнт и закрытые данные организации в управляемую систему. Важна не конкретная модель, а методология, которая позволяет корпорации владеть своей моделью, данными и инструментами.

Это тот же имаго‑подход, что я использую в кодинге, только в масштабе большой корпорации. Я беру веса на ~30-35B, они берут 397B веса той же архитектуры. У меня переобучение под новую модель занимает пару дней, у них пару недель. Моя адаптация стоит копейки, у них не больше 450 тысяч долларов, что тоже копейки для такой корпорации.

Структурно их система состоит из трех этапов: ценности, знания и навыки (поведение).

На первом этапе модель переучивают под свою конституцию. Сначала нежелательное поведение убирается прямой правкой весов без обучения, затем закрепляется дополнительным обучением. В ходе поиска эти правки были реализованы через LoRA‑адаптацию (чистый имаго‑кодинг).

На втором этапе идет продолжение предобучения на закрытых данных. Авторы называют его промежуточное обучение (mid‑training), потому что оно идет поверх уже инструктированной модели. Из корпуса размером больше 19 трлн токенов, собранного в компании, оставили всего 200 млрд, то есть отбросили более 98%.

Именно так в имаго подходят к обучающим данным. Даже состав выборки одинаков: она состоит примерно из трех равных частей. Это отобранные проприетарные документы, их синтетические пересказы (документ превращается в самодостаточный урок с вопросами и ответами) и реплей общих данных против забывания. Дальше идет то, до чего я еще не додумался: после обучения полученный чекпойнт смешивается по весам с чекпойнтом до обучения. Подход интересный, нужно будет проверить его на средних моделях.

На третьем этапе идет окончательная полировка и обучение агента глубокого исследования с помощью двух этапов, прямой оптимизации предпочтений (DPO) и обучения с подкреплением (RL). Это позволяет модели работать с собственным набором инструментов организации.

Отдельного обучения с учителем (SFT) нет: авторы указывают, что он слишком быстро портит остальные способности, даже с реплеем. Это совпадает с моими экспериментами над средними моделями.

Авторы модели сравнивали слияние весов из второго этапа с несколькими способами регуляризации на той же смеси данных: с низкоранговой адаптацией, с пониженным learning rate и с более короткими расписаниями. Каждый из них уменьшал потерю общих способностей, но настолько же ослаблял адаптацию к домену. После постобучения ни один такой чекпойнт не превзошел модель, обученную без промежуточного обучения. Слияние с агрессивным обучением, наоборот, оказалось лучше сразу по обеим осям.

Для имаго‑кодинга из этого следует важное уточнение. Мой режим из первой части представляет собой инструктивное дообучение на сотнях или тысячах отобранных примеров, и именно там LoRA работает хорошо. Режим Thomson представляет собой продолженное предобучение на сотнях миллиардов токенов, а там низкий ранг упирается в потолок. То есть LoRA лишь первый этап имаго для больших моделей. Дальше идет слияние полученного чекпойнта с исходным и окончательная полировка. Это дает лучший результат из возможных на текущий момент.

На самом деле совпадений даже больше:

Модель является частю организации. В имаго строитель знает проект, его сущности и конвенции. В Thomson модель знает корпус организации и ее ценности. Это одна и та же идея в разном масштабе.

Концепция трех слоев остается на месте: в моей схеме это харнесс, RAG и адаптер. У Thomson это глубокое исследование с собственными инструментами, знания в весах и обучение работе с этими инструментами. Обратите внимание: авторы обучают модель пользоваться именно своим набором инструментов. Это прямая параллель с тем, как я обучаю строителя вместе с найденным контекстом (идея RAFT).

Данные по‑прежнему важнее объема. Авторы отбрасывают 98% корпуса и пересказывают остальное в форме «урока». Это то же самое «больше не значит лучше» из моей первой части, только в промышленном исполнении. Также для Thomson тезис «данные не покидают контур» является одним из основополагающих принципов. Для меня он тоже был одной из двух причин отказаться от фронтира.

Наличие «вкуса» у модели. Я писал, что адаптер, обученный на прошедших проверку решениях, дает модели вкус к отбору. Thomson делает то же на предпочтениях: пары «выбранный / отклоненный» строятся так, чтобы модель училась отличать верное правдоподобное от неверного правдоподобного. Это более строгий механизм, чем мой, и я думаю, что его стоит перенять.

При всем этом у нас абсолютно разные домены. Авторы специально не затачивали модель под работу с кодом, поэтому перераспределение весов произошло в том числе за счет ухудшения навыков написания кода. Кодинг остается единственным доменом, который сами авторы называют пострадавшим от забывания, но он и не был целью обучения. При этом улучшилась работа с длинным контекстом, а агентные задачи тоже стали решаться лучше.

Thomson также отказался от изолированного обучения с учителем из‑за забывания. Для меня это повод попробовать LoRA‑DPO вместо чистого SFT в схеме из первой части.

Чем больше информации появляется о подобных подходах, тем лучше выстраивается схема имаго‑подхода. Сейчас она выглядит так:

Начинать стоит с адаптеров: один общий адаптер на корпоративные конвенции и отдельные адаптеры на команды или уровни доступа. Слой знаний нужно оставить в RAG, потому что версии, схемы и документация меняются слишком быстро, чтобы держать их в весах. Затем идет подготовка обучающих данных: пересказ документов в самодостаточные «уроки», восстановление вопросов из документов и небольшой датасет. Затем используется верификатор, но с нюансами: в юридической области отчеты нельзя проверить детерминированно, поэтому приходится строить сложные механизмы наград для обучения с подкреплением. У кода же есть тесты, компилятор и линтеры, поэтому тут с верификацией все гораздо проще.

Заключение

Thomson показывает, что идея «модель как часть организации» масштабируется вплоть до создания моделей фронтир‑класса за разумные для крупной компании деньги. Для имаго‑кодинга это подтверждение общего принципа: разные знания меняются с разной скоростью, и хранить их надо в разных слоях. Быстрые факты лежат в RAG, привычки команды в адаптерах, медленные знания предметной области в весах.

Если вы одиночка или небольшая команда, адаптер и RAG остаются вашей рабочей лошадкой. Если вы предприятие со своим языком, десятилетиями кода и людьми, которые могут собрать датасет, полные веса становятся реальной опцией. Но даже тогда начинать стоит с датасета организации: он переживет любую базовую модель.