The actual root cause from this session — fatigue-driven inconsistency across repeated near-identical call sites...
Ответ из Fable 5 на мой (знаю что бессмысленный) вопрос о том, как же так получилось что в политиках написано что аргументы нужно в методы передавать одним образом, а заказанный мною рефакторинг пропустил процентов 5 мест.
Длина контекста меньше 300к на тот момент, если что, ни одного сжатия, всё как полагается — сессия под одну задачу.
Так что «не устают» это такая чушь…
И когнитивная перегрузка от инструкций у них бывает, и от нескольких порученных задач, и от скрыто противоречивых инструкций, и от объёма работы :)
Мне кажется что в разработке ПО значительную часть занимает поддержка. По идее количество клиентов после 22 года должно было сильно возрасти, включая клиентов с деньгами, Оракл-то условный на что-то надо менять.
Но да, без знания того как у них устроено, кто клиенты и какие контракты это беспредметные рассуждения.
Программист, а особенно хорошая команда программистов, имеет нормальную память. У агентов с памятью, как ни обрабатывай и ни дистиллируй логи сессий, пока весьма дерьмовенько. Даже прекрасный Fable 5 забывает прямо на ходу прямые инструкции из скилла, загруженного меньше минуты назад, в почти пустом контексте. Потом при анализе пишет: the skill’s own gotcha text was independently re-verified empirically by the main agent (function f { return , @(1,2) } test), then still tripped it up once in its own placement-recheck script (see 1C) — the lesson was known but not internalized until it broke.
Ну системный промпт всегда вставляется перед вашим, если это только не модель, которую вы эксплуатируете сами. Что именно будет иметь и какой приоритет, зависит от размера системного промпта, его же размера при RL-этапе модели, используемой схеме positional encoding, компрессии контекста (если есть), модели внимания и т.д.
А что это за модель кстати с такими агрессивными настройками цитирования?
Проблема в борьбе с системным промптом заключается в том, что подача конфликтующих инструкций, задание дополнительных фоновых заданий (которые нужно соблюдать, а не исполнить разово) и рост контекста вообще всегда пагубно сказывается на качестве решения моделью основных задач, условный эквивалент когнитивного стресса.
Ещё и не факт что неоднородность веса инструкций относительно их позиции в контексте не сыграет злую шутку в виде того что через 150к токенов оно не забудет про эту же инструкцию.
У меня есть большие сомнения, что "Use this tool for semantic lookup by identifier fragments" реализует семантический поиск в том же смысле, в котором его реализует инструмент, упомянутый в статье. В целом разница между таким инструментом и grep/semgrep только в том, что оно отфильтровывает файлы, которые включены в проект. Это полезно, но не позволяет агенту спросить "как реализован рейтлимитер", а найти файл с названием "sliding_window.cpp", где слов "rate" и "limiter" нет.
Я если что не использовал инструмент, который описывается в статье, но разницу между векторным поиском и поиском по LSP + fuzzy matching (а search_symbol это скорее всего он) представляю хорошо, они совсем разные.
Технически ничего не мешает семантичесеому индексу иметь наборы фильтров по worktree, коммитам и папкам. Это нетривиально сделать в плане того чтобы определять что когда перестраивать и как не начать хранить слишком много, но в целом реально. MCP IDE это LSP или что-то другое? LSP в общем задачу нечёткого поиска не решает.
К сожалению в задаче только постановка проблемы, которая в целом известна. С качественными решениями, особенно провалидированными на уровне лучше чем «мамой клянусь, на моих 3 проектах TODO-листа, агентского фреймворка и семантического хранилища памяти» есть проблема — их нет. А без валидации в этом никакого смысла нет, но это никого не останавливает, потому что сделать новый фреймворк, написать про него статью и получить свою тысячу звёзд на GitHub конечно интереснее и веселее чем оценивать его и убедиться, что с очередным Опусом фреймворк стал ухудшать процент задач, решённых за тот же бюджет токенов :)
Пока значительная часть человечества не испытывает голода и угрозы жизни от внешних факторов, развлечения (в т.ч. соцсети) будут прибыльны. Другое дело, что "ИИ" неплохо справляется с производством таких развлечений, и будет справляться ещё лучше, а для обслуживания машины, генерирующей забвение для масс, столько айтишников не нужно, да.
Ответ из Fable 5 на мой (знаю что бессмысленный) вопрос о том, как же так получилось что в политиках написано что аргументы нужно в методы передавать одним образом, а заказанный мною рефакторинг пропустил процентов 5 мест.
Длина контекста меньше 300к на тот момент, если что, ни одного сжатия, всё как полагается — сессия под одну задачу.
Так что «не устают» это такая чушь…
И когнитивная перегрузка от инструкций у них бывает, и от нескольких порученных задач, и от скрыто противоречивых инструкций, и от объёма работы :)
Мне кажется что в разработке ПО значительную часть занимает поддержка. По идее количество клиентов после 22 года должно было сильно возрасти, включая клиентов с деньгами, Оракл-то условный на что-то надо менять.
Но да, без знания того как у них устроено, кто клиенты и какие контракты это беспредметные рассуждения.
Интересно, неужели импортозамещение не нужно? Или кто-то другой перехватил его?
Программист, а особенно хорошая команда программистов, имеет нормальную память. У агентов с памятью, как ни обрабатывай и ни дистиллируй логи сессий, пока весьма дерьмовенько. Даже прекрасный Fable 5 забывает прямо на ходу прямые инструкции из скилла, загруженного меньше минуты назад, в почти пустом контексте. Потом при анализе пишет:
the skill’s own gotcha text was independently re-verified empirically by the main agent (function f { return , @(1,2) } test), then still tripped it up once in its own placement-recheck script (see 1C) — the lesson was known but not internalized until it broke.Not, б, internalized.
Ну подождите, Хром же использует системное хранилище сертификатов, добавил новый корневой сертификат и всё.
У меня к Яндексу слегка негативное отношение, но Греф, как мне кажется, там совсем берега потерял.
20 секунд примерно потребовалось чтобы найти ссылку https://yastatic.net/s3/lpc-ext/static/maxmax/pp-browser/yandex_с_42001_25.pdf, плохо старались.
Я думаю что они могли бы сделать несколько пресетов системного промпта для разных задач конечно…
Ну системный промпт всегда вставляется перед вашим, если это только не модель, которую вы эксплуатируете сами. Что именно будет иметь и какой приоритет, зависит от размера системного промпта, его же размера при RL-этапе модели, используемой схеме positional encoding, компрессии контекста (если есть), модели внимания и т.д.
А что это за модель кстати с такими агрессивными настройками цитирования?
Проблема в борьбе с системным промптом заключается в том, что подача конфликтующих инструкций, задание дополнительных фоновых заданий (которые нужно соблюдать, а не исполнить разово) и рост контекста вообще всегда пагубно сказывается на качестве решения моделью основных задач, условный эквивалент когнитивного стресса.
Ещё и не факт что неоднородность веса инструкций относительно их позиции в контексте не сыграет злую шутку в виде того что через 150к токенов оно не забудет про эту же инструкцию.
Чёрные дрозды поют просто отлично. Иногда придушить хочется, когда он во дворе в 4:30 начинает заливаться.
Поменьше FUD c "внесут изменения в лицензию".
Для решения проблемы заблокируют в РФ доступ к серверам Apple?
У меня есть большие сомнения, что "Use this tool for semantic lookup by identifier fragments" реализует семантический поиск в том же смысле, в котором его реализует инструмент, упомянутый в статье. В целом разница между таким инструментом и grep/semgrep только в том, что оно отфильтровывает файлы, которые включены в проект. Это полезно, но не позволяет агенту спросить "как реализован рейтлимитер", а найти файл с названием "sliding_window.cpp", где слов "rate" и "limiter" нет.
Я если что не использовал инструмент, который описывается в статье, но разницу между векторным поиском и поиском по LSP + fuzzy matching (а search_symbol это скорее всего он) представляю хорошо, они совсем разные.
Технически ничего не мешает семантичесеому индексу иметь наборы фильтров по worktree, коммитам и папкам. Это нетривиально сделать в плане того чтобы определять что когда перестраивать и как не начать хранить слишком много, но в целом реально.
MCP IDE это LSP или что-то другое? LSP в общем задачу нечёткого поиска не решает.
Ещё есть https://github.com/chunkhound/chunkhound
Win+X U U
К сожалению в задаче только постановка проблемы, которая в целом известна. С качественными решениями, особенно провалидированными на уровне лучше чем «мамой клянусь, на моих 3 проектах TODO-листа, агентского фреймворка и семантического хранилища памяти» есть проблема — их нет. А без валидации в этом никакого смысла нет, но это никого не останавливает, потому что сделать новый фреймворк, написать про него статью и получить свою тысячу звёзд на GitHub конечно интереснее и веселее чем оценивать его и убедиться, что с очередным Опусом фреймворк стал ухудшать процент задач, решённых за тот же бюджет токенов :)
НАЧАЛАСЬ НОВАЯ ЭРА
Пока значительная часть человечества не испытывает голода и угрозы жизни от внешних факторов, развлечения (в т.ч. соцсети) будут прибыльны. Другое дело, что "ИИ" неплохо справляется с производством таких развлечений, и будет справляться ещё лучше, а для обслуживания машины, генерирующей забвение для масс, столько айтишников не нужно, да.