Comments 7
Безотносительно, при попытке поправить в этом направлении кв на микросети, Gemini сразу предупредила о комбинаторном взрыве.
У человека, прежде чем он скажет фразу, в голове уже есть модель в общих чертах, где яблоко и стол. А зеленое - это уже очень вероятное прилагательное к яблоку.
У LLM следующий токен генерируется исходя из промпта и уже сгенерированных токенов. Так, если в промпте было про яблоки или фрукты, или круглые предметы, то "яблоко" очень вероятно.
А то, что "зеленое", так если в промпте не было про зеленое, то вероятность красного тоже немаленькая...
В предложении "На столе лежит зелёное яблоко" все слова уже есть. Модель видит их все одновременно. Ограничение, что слово "зелёное" не может ссылаться на слово "яблоко" - искусственное. И введено оно в целях оптимизации - чтобы не пришлось постоянно пересчитывать Keys и Values.
Да - это правильный ответ
Нет. :)
Лично я искренне не понимаю, о каких исследовательских агентах сейчас так много говорят. Я много работают с LLM, и вижу только эти два типа ответов.
Агент не чатик, задача которого побыстрее выдать среднестатистично удерживающий ответ. Он может прочитать тысячи источников, оценить их, проверить цитаты, написать скрипт, которым что-то проверить, и т.д., и со сколь угодно долгой рефлексией и числом итераций. Может это сделать сколь угодно неидеально, но с просто чатом сравнивать просто нечего.
Дай в более-менее нормальной агентской системе какую-то задачу Опусу - все увидишь.
А Мистраль, Соннет и GPT-5-chat не юзай ни для чего сложнее разговора о погоде.
в предложении “Зелёное яблоко лежит на столе” слово зелёное уже знает про слово “яблоко”
ЗЕЛЁНОЕ может быть и знает про ЯБЛОКО, что далеко не факт, но ЗЕЛЁНОЕ в вашем промпте не видит что идёт за ним дальше. Токены генерируются последовательно и промпт читается тоже последовательно (хоть выход и отбрасывается).
По архитектуре трансформеров промпт читается весь сразу. Потом генерируется следующий токен, добавляется к промпту, и снова читается весь сразу. Если мы попробуем сгененировать следующий токен после промпта "Зелёное яблоко лежит на столе", то "зелёное" уже может сослаться на "яблоко". Но этого не происходит, т.к. это нарушает работа KV-кеша.
При приходе нового токена значения Key и Value не пересчитываются, а берутся из кэша. Считаются только Query, ну и MLP слои. А сохранённые в кэше Key и Value ссылаются только назад.
KV-кэш, экспертное сообщество и критическое мышление