
Допустим, в один прекрасный день земные радиотелескопы начнут принимать сигналы радиовещания инопланетян (мощные и незашифрованные, конечно).
Как нам понять о чем там речь? Конечно, с помощью LLM!
Как работают LLM в двух словах
На этапе обучения модели скармливают гигантский массив текста, разбитый на кусочки из нескольких букв (токены), и в результате формируется нейросеть, которая отражает статистические взаимосвязи между этими токенами.
А в процессе работы (инференса) модели происходит простая вещь: на вход подаем кусок текста, а на выходе получаем наиболее вероятный следующий токен (точнее, распределение вероятностей по разным токенам). Приклеиваем этот новый токен к концу поданного на вход текста, и всё повторяем заново, пока наиболее вероятным токеном не окажется конец.
Кто‑то называет LLM “Т9 на стероидах”, и так оно и есть. Но кто бы мог подумать, что при простом масштабировании такой системы у неё появляются неожиданно продвинутые способности отвечать на самые сложные вопросы, и что сегодня LLM уже не отличить от человека.
Вернёмся к инопланетянам
За длительное время приёма накопятся тонны гигабайт данных.
Правда, тут есть нюанс: мы понятия не имеем, что внутри. Текст? Речь? Видео? Поэтому сначала поработаем со статистикой: демодулируем сигнал, выделим в нём повторяющиеся дискретные элементы и проверим, похоже ли это вообще на язык.
Для этого можно использовать, например, анализ энтропии и закон Ципфа (в человеческих языках второе по частоте слово встречается в два раза реже первого, третье — в три раза и так далее) И закон этот на удивление универсален.
Астрофизик Лоранс Дойл из SETI Institute предлагал использовать такую статистику как фильтр «языкоподобности» космических сигналов, и теми же методами уже анализировали свисты дельфинов: https://www.sciencedirect.com/science/article/abs/pii/S0003347298910004
Дальше дело техники: статистическими алгоритмами разбиваем поток на токены (ровно так же BPE‑токенизатор нарезает человеческий текст) и обучаем на них LLM.
Как работает алгоритм BPE‑токенизации
Инициализация: Текст разбивают на отдельные символы или байты, создавая базовый словарь.
Подсчет: Считают частоту всех соседних пар символов в корпусе текстов.
Слияние: Самую частую пару объединяют в новый единый токен, добавляя его в словарь.
Повторение: Процесс повторяют нужное число раз, пока словарь не достигнет заданного размера.
В результате мы получим модель, которая так же хорошо говорит на их языке, как ChatGPT на английском. С её помощью мы можем стать превосходными собеседниками и нейтив‑спикерами андромеданского, не имея ни малейшего представления, о чём говорим.
Ситуация абсурдная: контакт установлен, беседа льётся рекой, все довольны, но ни один Землянин не понимает из этой беседы ни слова.
Но есть ли способ всё‑таки что‑то понять? Я думаю, что да. И секрет кроется в латентном пространстве.
Что такое латентное пространство
Рассмотрим в качестве примера нейросеть, которая умеет генерировать картинки котиков.
Она построена на базе свёрточного автоэнкодера. Для обучения ей скармливают миллион фотографий котов и тренируют так, чтобы на выходе он выдавала как можно более близкое изображение к исходному.
Сеть состоит из нескольких слоев, где чем ближе к центральному слою, тем меньше нейронов. Поэтому ей приходится сжимать картинку в короткий вектор чисел (чтобы оно «пролезло» через центральное узкое горлышко), а потом разжимать обратно в ту же самую картинку с минимальными отличиями.

Чтобы протиснуть кота через это горлышко и восстановить его на выходе, сеть вынуждена выучить самое главное: пиксели хранить негде, приходится хранить смысл. Вот это горлышко и называется латентным пространством. Любое поданное на вход изображение кота будет представлять собой точку (набор значений активаций каждого нейрона) в этом пространстве.
После обучения начинается интересное. Подаём на вход кота, а дальше вручную крутим значения нейронов в латентном слое (при этом все, что левее латентного слоя, можно отрезать).
Крутим один — кот на выходе поворачивает голову и становится более пушистым. Крутим другой — становится менее пушистым и открывает рот. Т.е. значение каждого нейрона влияет на какую‑то группу признаков.

А для того, чтобы менять признаки точечно, в этом пространстве можно выделить направления, соответствующие каждому признаку.

Вектора, определяющие эти направления, образуют как бы «пространство понятий».
Заметьте: никто не объяснял сети, что такое «поворот головы» или «пушистость», — она сама разложила котов на такие смыслы, потому что это самый экономный способ их описать.
Таким образом, можно взять латентные векторы двух котов или двух состояний одного кота и плавно перетечь от одного к другому — на выходе получится осмысленный морфинг, а не каша из пикселей.

Похожее происходит и с текстом. В LLM каждое слово тоже превращается в вектор чисел — такой вектор называется эмбеддингом (от англ. embedding — “вложение”): слово как бы вкладывается в многомерное пространство, причём так, что близкие по смыслу слова оказываются рядом, а далёкие — далеко.
И в этом пространстве тоже есть направления‑смыслы. Например, вектор «женщина» − вектор «мужчина» — это направление «пол». Прибавим его к «королю» — попадем примерно туда, где стоит «королева». То же самое, что сдвинуть кота вдоль направления «пушистость».

То есть слова — точки, а смыслы — направления между ними, и у этих направлений есть геометрия: их можно складывать, вычитать и сравнивать.
Кстати, с большими языковыми моделями фокус с редактированием смыслов тоже проделывали. В 2024 году в Anthropic нашли внутри Claude направление (комбинацию нейронов), отвечающих за мост Золотые Ворота, вручную усилили их, и модель начала сводить любой разговор к мосту (https://www.anthropic.com/news/golden‑gate‑claude ).
Ищем знакомые созвездия
Вернёмся к нашей андромеданской LLM. Где‑то в её недрах тоже есть латентное пространство, а в нём — направления всех смыслов, которые обсуждают инопланетяне. Проблема одна: все направления без подписей.
Поможет нам вот что: Если в перехваченном эфире найдется большой кусок данных, в котором говорится о чём‑то нам понятном и универсальном — физика, математика, астрономия, химия (а у цивилизации, построившей радиопередатчик, всё это обязано быть), то в латентном пространстве их модели неизбежно заведутся те же сущности, что и у нас: числа, планеты, звёзды, атомы, поля, интегралы, взаимодействия, волны, уравнения, число пи.
Правда, у них вместо π, скорее всего, в почёте 2π, но это уже детали.
Скрытый текст
Так исторически сложилось, что земляне дали особое название числу π (3.14..), хотя логичнее было бы дать название числу в два раза большему (6.28..).
Число 2π гораздо более естественное:
Это угол полного оборота, а не его половины
Равно отношению длины окружности к радиусу, а не к диаметру (окружность наиболее естественно и просто определяется радиусом)
Почти во всех физических формулах число π стоит с коэффициентом 2
И главное: эти сущности связаны между собой одинаково. «Звезда» у любой цивилизации сидит рядом с «планетой», «орбитой», «гравитацией» и «термоядом», потому что так устроена сама реальность, а не язык. «Простое число» одинаково простое во всей вселенной.
Отсюда план: сопоставляем картину связей наших латентных смыслов с картиной связей их смыслов, находим совпадающие структуры и выполняем перевод на человеческий.
Звучит сомнительно? Тогда у меня для вас новость.
Это уже работает — на человеческих языках.
В 2013 году было замечено (https://arxiv.org/abs/1309.4168), что облака словесных эмбеддингов разных языков имеют почти одинаковую форму: английское пространство переводится в испанское простым линейным преобразованием. Грубо говоря, «созвездие» из точек «кот», «пёс», «хвост» и «мяу» в любом языке выглядит одинаково — его нужно только правильно повернуть.

В 2024-м сформулировали гипотезу платоновской репрезентации (https://arxiv.org/abs/2405.07987): чем больше и умнее модели, тем сильнее их внутренние представления сходятся к одной и той же структуре, независимо от архитектуры и даже модальности. Языковые модели и модели зрения, обученные независимо, приходят к похожей карте понятий, потому что моделируют одну и ту же реальность.
А в 2025-м вышел метод vec2vec (https://arxiv.org/abs/2505.12540): перевод эмбеддингов из пространства одной модели в пространство совсем другой — без единого известного соответствия, чистым выравниванием структур.
У всех этих работ одно следствие: разные описания одной реальности имеют совпадающую геометрию. С андромеданцами у нас разные языки, разная биохимия и, возможно, разное число щупалец. Но реальность общая — как минимум ее физико‑математическая часть.
Что может пойти не так?
1) Дыры в словаре
Наивно ждать, что у каждого нашего слова найдется аналог в их языке, и наоборот. Например, цвет. Наша сетчатка различает три базовых цвета, а что, если у них — пять? Тогда и цветов, и слов для них будет больше. Может быть и наоборот: зрения у них нет вовсе, и там, где у нас «цвет», у них будет «частота». Такие понятия при выравнивании пространств останутся без пары.
Эта проблема решается: не требовать взаимно‑однозначного соответствия, а сопоставлять понятия через общих соседей по графу — их «частота» и наш «цвет» одинаково цепляются за «длину волны», «спектр» и «излучение», и по этим связям видно, что речь об одном и том же.
2) Не сырые данные
Их эфир может оказаться сжат или зашифрован. Идеально сжатые данные статистически неотличимы от шума, так что, нам тут ничего не поможет.
3) Другой уровень физики
Мы рассчитываем найти в их пространстве знакомые «частицы», «силы» и «поля». Но что, если они ушли в познании мира настолько далеко, что классическими сущностями давно не пользуются: никаких «сил» и «частиц», всё описывается сразу на языке квантовой теории поля или того хуже, а наша механика для них — школьное приближение, которому не полагается отдельных слов? Или наоборот: кванты они ещё не открыли, и половины наших физических понятий у них попросту нет. В обоих случаях наши «созвездия» физики совпадут с их созвездиями лишь частично.
Что делать: якориться в первую очередь на то, что не зависит от уровня теории — на математику и наблюдаемую астрономию, а расхождения в физике сопоставлять не слово к слову, а теорию к теории: классику и кванты мы сами умеем переводить друг в друга, так что их учебник ляжет на наш как более грубая или более точная карта одной и той же местности.
4) Модальность
Если их эфир — аналог видео, вместо языковой модели получится видеомодель. Но это не катастрофа: мультимодальные сети показывают, что осмысленные латентные понятия вырастают и из сырых пикселей. Просто будет сложнее.
Какие еще могут быть применения?
Есть основания полагать, что у людей, независимо от языка и культуры, в мозгах содержится практически то же самое векторное пространство смыслов на биологических нейронах. И у высших животных, вроде шимпанзе, тоже.
И этот метод может открыть способ полноценного чтения мыслей: берём уже имеющееся латентное пространство LLM, находим структурно соответствующие связи в мозгу человека и наблюдаем какие именно нейроны активированы в данный момент.
Можно было бы попробовать с дельфином, но вряд ли получится: они живут в слишком другой среде, науки у них нет, так что между нашими латентными пространствами будет слишком мало общего.
Заключение
Если вы дочитали досюда и внутренне со всем согласились — не смотрите фильм «Прибытие», вам станет плохо (обложка статьи — кадр из этого фильма с незначительными доработками).
Но именно эта боль сподвигла меня задуматься о теме и написать эту статью.
Осталась мелочь: дождаться сигнала и проверить гипотезу на практике.
Спасибо за внимание!

