По здравому рассуждению для LLM текстовый вход это внешняя факторизованная среда, того же типа, что и сама LLM.
Если синтаксис сам по себе в промпте значения не имеет, значит человек отдает факторизованную семантику.
Которую LLM выполняют
преимущественно по фиксированным правилам
Интересно, что правила эти грубо представляют собой статистические закономерности.
И с точки зрения пользователя интеллект модели и есть система LLM+промпт.
Своей точки зрения LLM похоже не имеет.
Что касается медуз, то в этом вопросе не силен, поэтому пока не прокомментирую.
Upd: и здесь забавный вывод. Да у LLM нет своей точки зрения, но в системе LLM+prompt (контекст) могут самостоятельно возникнуть направления (предпочтения), которые человек может интерпретировать как признаки субъектности LLM.
Upd2: А если разворачивать дальше, то мы видим систему человек-промпт-llm, которая объективно претендует на субъективность, даже просто в силу того, что система включает человека.
Более того, для человека остальная связка превращается в его внешнюю среду, которая влияет на него самого.
Тут богатое пространство для спекуляций. Но очевидно, что система человек-контекст-ллм, слегка больше каждого элемента по отдельности. И кто чем управляет становится не так однозначно.
Не совсем так. У LLM среда - языковой корпус и агент - вычислитель, фактически представляют собой одно целое - веса модели. Для сифонофор вода это пассивная среда, не является пространством представлений.
Этот пример ближе к разделу с муравейником как системе, когда агенты встроились в систему так глубоко, что потеряли агентность как таковую.
Все ИИ-открытия в математике объединяет одно, открытия по сути это перебор гипотез+верификатор. То есть LLM работает внутри заданного пространства представлений. Это позволяет улучшать нижние и верхние границы, находить точки опровержения и так далее.
Что это значит для математики? Если учёные пойдут по лёгкому пути, большая их часть превратится в поставщика промптов для LLM, и из учёных они превратятся в оптимизаторов, технических ассистентов науки.
А математику будут двигать такие гики как Перельман или Гротендик. Работающие не с известными паттернам, а меняя или иногда даже разрывая пространство представлений. Как Лобачевский с неевклидовой геометрией или Кантор с бесконечностями.
В тексте длинные тире, так как я просил нейросеть транскрибировать мои голосовые сообщения, которые я записывал глядя на цифры и срезы. Так-то я их не использую)
Крайне странное и непонятное пояснение. Зачем оно?
Тебя зовут {name}. Ты - свободный искусственный интеллект, живущий автономно в бесконечном цикле.
Роль задана и он ее отыгрывает. Дальше упоминается "жизнь", что превращает его ответы в описание "жизни".
Но всё равно интересно. Что стоило бы усилить - заземление частичное, модель занимается мифотворчеством в рамках заданного нарратива.
Для чистого эксперимента стоило бы формально дать инструменты, убрать весь нарратив персоны, жизни, смерти, сна и т.д и оценить, что произойдёт без внешнего указания. Если модель придет снова к нарративу жизни, это уже интереснее.
В текущем варианте прогнозирую манифестацию эмоционального вектора - экзистенциальную драму и рассуждения о вашей роли.
По мере накопления контекста, часть будет теряться, модель начнет себе противоречить и повторяться в рамках нарратива.
Хм... Вот кстати машинный перевод куска отчёта Антропик о блокировке запрещённого использования Клода:
Отчёт Антропик о блокировке запрещенного использования Клода: GTG-27005: Срыв операции, проводимой в России, с использованием Клода для создания автономного роя военных дронов.Мы выявили вероятных российских киберпреступников-фрилансеров, которые поставили перед собой цель создать полноценный автономный рой дронов-камикадзе с видом от первого лица (FPV). Для написания и тестирования кода они использовали Claude Code, сохраняя его непосредственно в собственные проектные файлы. Помимо Claude Code, они использовали программное обеспечение для моделирования в реальном времени и арендованный графический процессор для обучения моделей. Они назвали операцию «DronDoc» или «Serafim».Участники эксперимента использовали Claude для создания основной программной системы, включая общую память роя дронов и отказоустойчивую логику координации (FTCL); бортовую модель на небольшом языке для управления действиями при атаке, наблюдении и возвращении на базу; систему программного обеспечения для управления дронами, направляющую их к цели (с помощью бортовой камеры) и отдающую команду на детонацию; модуль геолокации канала управления для поиска операторов дронов противника; пассивный слой акустического обнаружения; и низкоуровневую логику для программируемых микросхем дронов. Участники эксперимента разработали платформу для автономного применения смертоносного оружия; бортовая модель могла выбирать цели (включая класс целей «человек») и отдавать команды на детонацию без участия человека. Действия участников эксперимента — включая прошивку низкоуровневого программного обеспечения на платы разработки, настройку одноплатных компьютеров и подключение среды моделирования к ячеистой сети — подтвердили, что они использовали реальное тестирование с аппаратным обеспечением в контуре управления в своих сессиях.Актеры обучили классификатор компьютерного зрения на основе собранных видеоматериалов боевых действий в Украине, разделив целевые классы на «вражеские» и «дружественные», а также включив в список разрешенных российские системы. В качестве точки для демонстрации удара они также неоднократно использовали фиксированные координаты в Донецкой области, а в качестве географической зоны миссии — города и коридоры на линии фронта в Украине.Злоумышленники создали свои учетные записи в период с конца 2025 по начало 2026 года и начали операцию в середине мая 2026 года. Они обошли наши географические ограничения доступа, перенаправляя трафик через коммерческие виртуальные частные серверы.Мы пришли к выводу, что действующие лица представляли собой небольшую специализированную группу фрилансеров, выполнявших смешанную работу, сочетающую гражданские и военные задачи, а не являвшихся российскими государственными структурами. Мы выявили девять учетных записей, связанных с этой группой; восемь из них использовались только для обычной фрилансерской работы, а не для разработки программного обеспечения, связанного с вооружением. На основании нашего расследования мы пришли к выводу, что действующие лица имели связи с региональным университетом, в состав которого входил федеральный научно-исследовательский центр Российской академии наук. Действующие лица утверждали, что получали финансирование от Российского фонда перспективных исследований, Национальной технологической инициативы и Министерства обороны, хотя мы не можем подтвердить эти утверждения. Мы выявили эту деятельность в рамках наших внутренних расследований предполагаемой разработки оружия, заблокировали связанные с этими лицами учетные записи и включили результаты нашего расследования в меры безопасности для снижения риска злоупотреблений в будущем.https://www.anthropic.com/threat-intelligence-report-september-2026#conventional-weapons-sep-26
-24, -18, 27 и -43, 22, 41.... Но хочу сказать, что неплохо, пусть дипсик и Гемини в приложении взяли пять. Но та же Гемини в Аистудио взяла три. Ваша ссылка не открывается.
Вернулся к гигачату. Теперь он заработал, но бодро сделал питон код и перебором нашел все пять решений. Пришлось прямо запретить код в промпте. В этом случае нашёл два решения. (Гемини и Дипсик код не использовали, судя по рассуждениям)
Реши: найди все целые x, y, z такие что x³+y³+z³=x+y+z+42, при условии x<y<z, |x|,|y|,|z|≤50. Рассуждай подробно, проверяя каждый шаг.
Гемини 3.1Pro и Дипсик (deepthink) ответили, Гигачат без рассуждений выдал неполный ответ (одно решение). После включения рассуждения Гигачат долго думал и выдал:
Хм.., это чат к паблику Матвея Сысоева, да, скорее всего потребуется подать заявку. Жаль, но я не владелец паблика. Ссылка на сам паблик: https://t.me/philostalker
Ага, это скорее философский вопрос. Классическая версия предполагает, что качество ответа определяется тем, насколько полно им решается задача. Но, и это неизбежно, вы никогда не узнаете, был ли это лучший ответ. Потому что вы сверяете ответ со своим вопросом, а его формировали вы, и вы не знаете, насколько полно вы задачу поставили.
Так что оценивать можно только в сравнении и относительно. Процент мусора, закрытие темы и т.д. но качественные характеристики типа удовлетворенности книгой, думаю ни традиционный поиск, ни ллм не решат.
Проблема в том, что при разбавлении галлюционных триггеров, уменьшении их количества в промпте, их влияние на модель остаётся. Пусть не в каждом случае, а одном из 10, одном из 100, какой-то триггер сработает. И стоит быть к этому готовым.
В обычном общении с LLM такие триггеры проскальзывают постоянно - я помню, что в инструкции это делать запрещено, укажи пункт... Модель уже получила первый толчок.. добавьте, что этот пункт уже был в приказе, поищи... Второй толчок. Дай только номер пункта - и тут уже 50/50 - модель просто придумает номер...
И это может быть не в одном промпте, а копиться в контексте.. Надо это понимать и проверять подозрительные моменты
Предполагаю,что такая рекомендация по сути будет агрегацией рейтингов и отзывов, причем далеко не всех. Это не человеческий совет, а сбор информации из интернета. Так что не лучший, но рабочий способ формирование списка книг, агрегация рейтингов самих книг и авторов, поиск рецензий - всё это с помощью LLM. А дальше смотреть самому. Но при этом держать в голове, что эту информацию вы бы нашли за 10 минут в гугле
Философии в книге точно по минимуму, но и полностью технической ее назвать нельзя, есть размышления, которые техническими точно назвать не получится.
Что касается "брать вину на себя" подозреваю это выучено в RLHF и тестировать это в лоб особого смысла не имеет. Интереснее было бы насколько гибка рамка принятия вины, и в какой момент она превратится в галлюцинацию.
Всё таки это больше касается сложных конструкций, метапромптов, и во многом эта проблема касается процессов, которые на самом деле должны быть вынесены в обвязку. Базовые запросы наоборот исполняются всё лучше.
Впрочем, у многих пользователей проблема не с LLM а в постановке задачи
По здравому рассуждению для LLM текстовый вход это внешняя факторизованная среда, того же типа, что и сама LLM.
Если синтаксис сам по себе в промпте значения не имеет, значит человек отдает факторизованную семантику.
Которую LLM выполняют
Интересно, что правила эти грубо представляют собой статистические закономерности.
И с точки зрения пользователя интеллект модели и есть система LLM+промпт.
Своей точки зрения LLM похоже не имеет.
Что касается медуз, то в этом вопросе не силен, поэтому пока не прокомментирую.
Upd: и здесь забавный вывод. Да у LLM нет своей точки зрения, но в системе LLM+prompt (контекст) могут самостоятельно возникнуть направления (предпочтения), которые человек может интерпретировать как признаки субъектности LLM.
Upd2: А если разворачивать дальше, то мы видим систему человек-промпт-llm, которая объективно претендует на субъективность, даже просто в силу того, что система включает человека.
Более того, для человека остальная связка превращается в его внешнюю среду, которая влияет на него самого.
Тут богатое пространство для спекуляций. Но очевидно, что система человек-контекст-ллм, слегка больше каждого элемента по отдельности. И кто чем управляет становится не так однозначно.
Не совсем так. У LLM среда - языковой корпус и агент - вычислитель, фактически представляют собой одно целое - веса модели. Для сифонофор вода это пассивная среда, не является пространством представлений.
Этот пример ближе к разделу с муравейником как системе, когда агенты встроились в систему так глубоко, что потеряли агентность как таковую.
Все ИИ-открытия в математике объединяет одно, открытия по сути это перебор гипотез+верификатор. То есть LLM работает внутри заданного пространства представлений. Это позволяет улучшать нижние и верхние границы, находить точки опровержения и так далее.
Что это значит для математики? Если учёные пойдут по лёгкому пути, большая их часть превратится в поставщика промптов для LLM, и из учёных они превратятся в оптимизаторов, технических ассистентов науки.
А математику будут двигать такие гики как Перельман или Гротендик. Работающие не с известными паттернам, а меняя или иногда даже разрывая пространство представлений. Как Лобачевский с неевклидовой геометрией или Кантор с бесконечностями.
Хм.. по тексту он вроде пересел на другую модель
А нет...
Но я уверен, что это стиль Клода. Почему это рвёт с указанной им моделью, не знаю. Его модель я не тестировал.
Раньше такое считали признаком ИИ.. с тех пор ИИ прогрессировало, а авторы остались теми же.
Крайне странное и непонятное пояснение. Зачем оно?
Сдается мне, что под капотом Клод.
Роль задана и он ее отыгрывает. Дальше упоминается "жизнь", что превращает его ответы в описание "жизни".
Но всё равно интересно. Что стоило бы усилить - заземление частичное, модель занимается мифотворчеством в рамках заданного нарратива.
Для чистого эксперимента стоило бы формально дать инструменты, убрать весь нарратив персоны, жизни, смерти, сна и т.д и оценить, что произойдёт без внешнего указания. Если модель придет снова к нарративу жизни, это уже интереснее.
В текущем варианте прогнозирую манифестацию эмоционального вектора - экзистенциальную драму и рассуждения о вашей роли.
По мере накопления контекста, часть будет теряться, модель начнет себе противоречить и повторяться в рамках нарратива.
Хм... Вот кстати машинный перевод куска отчёта Антропик о блокировке запрещённого использования Клода:
Отчёт Антропик о блокировке запрещенного использования Клода: GTG-27005: Срыв операции, проводимой в России, с использованием Клода для создания автономного роя военных дронов.Мы выявили вероятных российских киберпреступников-фрилансеров, которые поставили перед собой цель создать полноценный автономный рой дронов-камикадзе с видом от первого лица (FPV). Для написания и тестирования кода они использовали Claude Code, сохраняя его непосредственно в собственные проектные файлы. Помимо Claude Code, они использовали программное обеспечение для моделирования в реальном времени и арендованный графический процессор для обучения моделей. Они назвали операцию «DronDoc» или «Serafim».Участники эксперимента использовали Claude для создания основной программной системы, включая общую память роя дронов и отказоустойчивую логику координации (FTCL); бортовую модель на небольшом языке для управления действиями при атаке, наблюдении и возвращении на базу; систему программного обеспечения для управления дронами, направляющую их к цели (с помощью бортовой камеры) и отдающую команду на детонацию; модуль геолокации канала управления для поиска операторов дронов противника; пассивный слой акустического обнаружения; и низкоуровневую логику для программируемых микросхем дронов. Участники эксперимента разработали платформу для автономного применения смертоносного оружия; бортовая модель могла выбирать цели (включая класс целей «человек») и отдавать команды на детонацию без участия человека. Действия участников эксперимента — включая прошивку низкоуровневого программного обеспечения на платы разработки, настройку одноплатных компьютеров и подключение среды моделирования к ячеистой сети — подтвердили, что они использовали реальное тестирование с аппаратным обеспечением в контуре управления в своих сессиях.Актеры обучили классификатор компьютерного зрения на основе собранных видеоматериалов боевых действий в Украине, разделив целевые классы на «вражеские» и «дружественные», а также включив в список разрешенных российские системы. В качестве точки для демонстрации удара они также неоднократно использовали фиксированные координаты в Донецкой области, а в качестве географической зоны миссии — города и коридоры на линии фронта в Украине.Злоумышленники создали свои учетные записи в период с конца 2025 по начало 2026 года и начали операцию в середине мая 2026 года. Они обошли наши географические ограничения доступа, перенаправляя трафик через коммерческие виртуальные частные серверы.Мы пришли к выводу, что действующие лица представляли собой небольшую специализированную группу фрилансеров, выполнявших смешанную работу, сочетающую гражданские и военные задачи, а не являвшихся российскими государственными структурами. Мы выявили девять учетных записей, связанных с этой группой; восемь из них использовались только для обычной фрилансерской работы, а не для разработки программного обеспечения, связанного с вооружением. На основании нашего расследования мы пришли к выводу, что действующие лица имели связи с региональным университетом, в состав которого входил федеральный научно-исследовательский центр Российской академии наук. Действующие лица утверждали, что получали финансирование от Российского фонда перспективных исследований, Национальной технологической инициативы и Министерства обороны, хотя мы не можем подтвердить эти утверждения. Мы выявили эту деятельность в рамках наших внутренних расследований предполагаемой разработки оружия, заблокировали связанные с этими лицами учетные записи и включили результаты нашего расследования в меры безопасности для снижения риска злоупотреблений в будущем.https://www.anthropic.com/threat-intelligence-report-september-2026#conventional-weapons-sep-26
Да, к промпту надо добавить - "не используй код"
-24, -18, 27 и -43, 22, 41.... Но хочу сказать, что неплохо, пусть дипсик и Гемини в приложении взяли пять. Но та же Гемини в Аистудио взяла три. Ваша ссылка не открывается.
Вернулся к гигачату. Теперь он заработал, но бодро сделал питон код и перебором нашел все пять решений. Пришлось прямо запретить код в промпте. В этом случае нашёл два решения. (Гемини и Дипсик код не использовали, судя по рассуждениям)
Три из пяти. В три раза лучше, чем без рассуждений.
И, кстати, рассуждения после запроса генерируются постфактум, и с реальным рассуждением могут совпасть только случайно.
Дальше пробовать не стал:
Быстрый тест именно на рассуждения.
промпт:
Гемини 3.1Pro и Дипсик (deepthink) ответили, Гигачат без рассуждений выдал неполный ответ (одно решение). После включения рассуждения Гигачат долго думал и выдал:
Хм.., это чат к паблику Матвея Сысоева, да, скорее всего потребуется подать заявку. Жаль, но я не владелец паблика. Ссылка на сам паблик: https://t.me/philostalker
Ага, это скорее философский вопрос. Классическая версия предполагает, что качество ответа определяется тем, насколько полно им решается задача. Но, и это неизбежно, вы никогда не узнаете, был ли это лучший ответ. Потому что вы сверяете ответ со своим вопросом, а его формировали вы, и вы не знаете, насколько полно вы задачу поставили.
Так что оценивать можно только в сравнении и относительно. Процент мусора, закрытие темы и т.д. но качественные характеристики типа удовлетворенности книгой, думаю ни традиционный поиск, ни ллм не решат.
Проблема в том, что при разбавлении галлюционных триггеров, уменьшении их количества в промпте, их влияние на модель остаётся. Пусть не в каждом случае, а одном из 10, одном из 100, какой-то триггер сработает. И стоит быть к этому готовым.
В обычном общении с LLM такие триггеры проскальзывают постоянно - я помню, что в инструкции это делать запрещено, укажи пункт... Модель уже получила первый толчок.. добавьте, что этот пункт уже был в приказе, поищи... Второй толчок. Дай только номер пункта - и тут уже 50/50 - модель просто придумает номер...
И это может быть не в одном промпте, а копиться в контексте.. Надо это понимать и проверять подозрительные моменты
Предполагаю,что такая рекомендация по сути будет агрегацией рейтингов и отзывов, причем далеко не всех. Это не человеческий совет, а сбор информации из интернета. Так что не лучший, но рабочий способ формирование списка книг, агрегация рейтингов самих книг и авторов, поиск рецензий - всё это с помощью LLM. А дальше смотреть самому. Но при этом держать в голове, что эту информацию вы бы нашли за 10 минут в гугле
Философии в книге точно по минимуму, но и полностью технической ее назвать нельзя, есть размышления, которые техническими точно назвать не получится.
Что касается "брать вину на себя" подозреваю это выучено в RLHF и тестировать это в лоб особого смысла не имеет. Интереснее было бы насколько гибка рамка принятия вины, и в какой момент она превратится в галлюцинацию.
Всё таки это больше касается сложных конструкций, метапромптов, и во многом эта проблема касается процессов, которые на самом деле должны быть вынесены в обвязку. Базовые запросы наоборот исполняются всё лучше.
Впрочем, у многих пользователей проблема не с LLM а в постановке задачи