Набор костылей, которые либо общеизвестны, но тупая модель не знает по глупости своей, либо это очень локальное знание, годное только для проекта или компании.
По агентным задачам модель тоже показывает себя достойно: GDPval-AA
Я бы не очень доверял этим тестам. Этот агентный но вовсе не про программирование: найти документы/источники, накидать саммари. Программистских тестов кот наплакал. SWE вообще теперь умеют все кому не лень. Я уже не знаю на что ориентироваться
И вообще, судя по статистике arena.ai программирование в запросах к LLM составляет 10-15%
Я долго думал, что Митя Чак Норрис случайно попал в IT. Потом сообразил — нет. Это IT случайно попалось на глаза Мите Чаку. И теперь сильно жалеет об этом
кожаный в погоне за KPI плодит сотни таких же багов, и всем всё норм, бизнес в массе своей заявил, что "пили быстрей фичи - качество вторично".
Очень нерациональное использование кожаных. Программисты показывают хорошие результаты если долго живут в проекте и не спешат. А в таком режиме у них отнимают возможности оптимальной работы.
Поэтому машина должна периодически проводить учебную тревогу с блокировкой двери и устраивать панику.
Эффект зловещей долины.
Или Долиной
Набор костылей, которые либо общеизвестны, но тупая модель не знает по глупости своей, либо это очень локальное знание, годное только для проекта или компании.
Тема падения рождаемости в Непале не раскрыта.
Чтобы быть Непальцем надо быть сделанным не пальцем и не палкой©
Как же до них добралась мировое моровое поветрие?
Сломали совместимость, бида
И умирают за несколько вечеров
Да уж
К инженерному проектированию вайб не имеет отношения
В LLM философия не может объяснить ничего, она плетётся далеко позади и пытается что-то объяснить задним числом.
Все достижения экспериментальные. База теоретическая очень мала
Rust blazing fast!©
Наукоподобный бред
Я бы не очень доверял этим тестам. Этот агентный но вовсе не про программирование: найти документы/источники, накидать саммари. Программистских тестов кот наплакал. SWE вообще теперь умеют все кому не лень. Я уже не знаю на что ориентироваться
И вообще, судя по статистике arena.ai программирование в запросах к LLM составляет 10-15%
Поправил
Очень нерациональное использование кожаных. Программисты показывают хорошие результаты если долго живут в проекте и не спешат. А в таком режиме у них отнимают возможности оптимальной работы.
Появилась идея агентского кодинга и все быстро научили модели, даже самые дешёвые
Видимо, в человеческих текстах, коде есть смысл, закономерности.
А в новостях их нет
Нет такого.
Я могу гарантировать, что задачу А я выполню за Х. Понятно, риски есть, небольшие, допустимые.
С LLM я выполню задачу за.. Дальше представьте диалог:
Когда будет результат?
Ну, вы понимаете... Кривая распределения с мат ожиданием Х/2. Но вот хвост два сигма может вылезти за 10Х... А при ограничении на техдолг за 30Х... В общем, быстро. Наверное. Или нет©
Ты пьян, собака!?
-дженеееееееериииииккккииии...
-эй, улитка! шевелись!
-а будете ругаться, я вообще никуда не поползу...
Максимально говеные слайды