Команда людей за 48 часов этот тест тоже с треском провалит.
Мне кажется что главное из поста и вашего комментария это то что ML-bro надо ловить как раз на том моменте когда "Человек больше не нужен, ллмки сами прекрасно справятся" плавно перетекает в "Ну что вы хотели, тут бы и человек не справился, куда уж там ллмке!"
У любого порядочного (хоть возможно временами не очень) инженера есть чувство того вносит ли исправление бага больше энтропии в конечный продукт, или меньше.
Одну и ту же задачу можно зачастую решить двумя путями - закрыть костылём и заглушкой, либо попытаться интуитивно почувствовать наличие другой "подкапотной" проблемы для которой текущая проблема это лишь частный случай, и решать общую.
Итеративно полученый "приемлимый" продукт таким образом очень легко может превратиться в совершенно неподдерживаемый нерасширяемый MVP астрономических размеров, на переработку которого уйдёт больше денег/усилий/времени чем на разработку с нуля.
ЛЛМ вот прекрасно справляется с этой частной проблемой мелкой итеративной разработки. Причем вполне прекрасно, до тех пор пока проект все ещё помещается в контекст (причем контекст до автокомпакта) и пока слова в названиях переменных и функций действительно отвечают за то что эти переменные и функции делают
Но не решает гораздо более сложную, глобальную и порою философскую проблему - что вообще такое хороший software и как его писать.
Вы звучите разумно и обоснованно, я могу во многом не согласиться с тезисом "в реальности все довольно плохо" потому что на самом деле там все-таки есть сильная обычно разница между
"это плохо, но работает, и здесь в принципе лучше и не нужно"
"это плохо, проблем с качеством кода слишком много, это стоит невероятно много денег"
"это в принципе нереалистичный макет пародирующий реальность, он фундаментально не будет работать"
И в этих трех тезисах как раз и лежит фундаментальная разница между тем как работает с ллмками автор против того как менеджмент мечтает о невероятном сильвербуллете решающем все проблемы.
Ну и я сохраняю оптимизм касательно айти сферы. Но в целом вы поднимаете реальные проблемы, конечно же.
Самый невероятно отвратительный перфоманс у меня был как раз в команде где лид считал, что он мозг, а пятеро сеньоров вокруг это только руки которые набирать код пальцами способны.
Там в принципе всю команду микроменеджментом разворотило правда...
В этом на самом деле и есть моя основная претензия к тем кто думает что большинство разрабов можно заменить ллмкой: вы правда думаете что мы просто от сих до сих код по тз реализуем не пытаясь думать о системе/юзкейсах/продукте/пользователе/корнерах/рисках и не принимая никаких решений?
Ну и ЛЛМки правда пишут криво. Где-то это абсолютно невероятный инструмент, особенно в кейсах как у автора, где-то как будто бы реально лучше руками.
Ну если совсем дословно про то как я прочитал фразу то было: "Мне не хватало денег на еду, поэтому я купил старую спортивную тачку"
Ситуация скорее всего была не факт что такой ирл, да и как бы не то чтобы мы всегда какие-либо решения можем/должны принимать исходя из чистой стериальной рациональности, а не эмоций.
Но что-то в этой фразе такое продактовое прям есть, не знаю как выразить получше.
(я про еду, а не вызовы, амбиции и прочую эйчар-ерунду) и с поджатым хвостом. Чтобы как-то восстановить эго, купил старую спортивную тачку.
Продакты...
Не хочу чтоб этот комментарий воспринимался как негативный, меня просто как-то так цепанула эта фраза. Там где риск там и жажда риска и жажда, наверное.
ЛЛМки до сих пор генерируют правдоподобный, но не оптимальный/копипастящий/игнорирующий стайлгайды код.
Он зачастую даже не работоспособный, но если вы никогда не погружаетесь в код то вы разницы и не заметите на самом деле.
Нет, не поймите меня превратно - ллмки многое могут, и даже уже существующий код вместе с ними прожёвывать можно очень интересно и эффективно, переписывая гигантского размера кодовые базы (особенно если они хорошо покрыты тестами), но дизайн кода, покрытие кода, там такое невероятное количество воздушных замков ML-bro уже выстроено и ещё будет построено...
Самый великолепный юзкейс для ллмок - накалывать инвесторов не в теме. Вот тут работает с невероятным профитом конечно...
В развитии искуственного интеллекта было столько зим, мне кажется мы рано или поздно наткнемся на ещё одну из них.
Я не думаю что LLM хорошо заскейлятся, один из фундаментальных боттлнеков технологии. Там что клода что чатгпт встали на 200к токенов. Да, им за счет RAG'а и автокомпакта искуственно расширили контекст до ляма, но о ужас, абсолютно "внезапно" оказывается что после такого автокомпакта модели становятся бесполезными и тупеют катастрофически
Единственное что изменилось это харнесс который позволяет пулять контекст в ллм с околокосмической скоростью. В остальном клонировать приложения или воспроизводить уже написанный код они умеют, ну получше, но фундаментальных изменений там нет.
Но культ святого ИИ уже даже на хакерньюз подугас если честно за последние полгода, вам бы вернуться в начало 2026...
Capabilities которые меряют по бенчмаркам под которые подстраивают модели для того чтобы они улучшали capabilities.
ЛЛМ ровно такие же как в 2020 году. Они галлюцинируют. Выдают желаемое за действительное. Не обладают признаками абстрактного либо какого либо ещё мышления. Да, это невероятный инструмент по генерации правдоподобных текстов (в конце концов на 100% правдоподобный текст это и есть правда), но от фундаментальных ограничений технологии никто никуда до сих пор не ушел, это тупиковая ветвь которую со всё большим отчаянием пытаются впаривать.
Для этого всего уже термин AI bro/ML bro появился, наподобие криптобро. Хайп-циклы не меняются.
Мне кажется "старение света" можно можно попробовать как-то экспериментально проверить, и на всех доступных нам масштабах подобного не замечали, насколько понимаю
Поэтому обычно говорят о спектре и степени проявленности тех или иных особенностей.
Легкая степень чего либо в психиатрии вполне себе может быть вариантом нормы или даже полезной во многих делах. Но при определенных обстоятельствах то, что полезно в меру, становится шизофренией
Нагенерить бойлерплейт (особенно дто), костяк системы, код который ты приблизительно представляешь как должен выглядеть и что делать но который лень писать руками при помощи ллм - милое дело.
К тем местам где каждая строчка кода важна ллм лучше не подпускать на пушечный выстрел. Искать такие места при помощи ллм - прикольно. Генерить тесты на покрытие таких мест - любо дорого. Но ведь там и над тестами придется думать!
Вместо хабровского ИИ-скепсиса когда люди считают что ллм даже текст генерить не могут на хакерньюз обратный АИ-психоз: любой комент сомневающийся в том что ллмки могут решить P/NP проблему, заварить всем идеальный чай и захватить человечество объявляется ересью.
Есть ли разница между математической коннектомом червя и ллмкой?
Достаточно ли подробно математический коннектом червя симулируется, или он игнорирует некоторые неотъемлимые для реальности механизмы (вроде попытки симулировать квантовые процессы на детерминированном не квантовом конечном автомате)?
А вы уверены что сознание не прерывается, или мы просто не замечаем собственной гранулярности? А вы уверены что время дискретно?
Тут достаточно вопросов и без "решения трудной проблемы сознания"
Мне кажется что главное из поста и вашего комментария это то что ML-bro надо ловить как раз на том моменте когда "Человек больше не нужен, ллмки сами прекрасно справятся" плавно перетекает в "Ну что вы хотели, тут бы и человек не справился, куда уж там ллмке!"
У любого порядочного (хоть возможно временами не очень) инженера есть чувство того вносит ли исправление бага больше энтропии в конечный продукт, или меньше.
Одну и ту же задачу можно зачастую решить двумя путями - закрыть костылём и заглушкой, либо попытаться интуитивно почувствовать наличие другой "подкапотной" проблемы для которой текущая проблема это лишь частный случай, и решать общую.
Итеративно полученый "приемлимый" продукт таким образом очень легко может превратиться в совершенно неподдерживаемый нерасширяемый MVP астрономических размеров, на переработку которого уйдёт больше денег/усилий/времени чем на разработку с нуля.
ЛЛМ вот прекрасно справляется с этой частной проблемой мелкой итеративной разработки. Причем вполне прекрасно, до тех пор пока проект все ещё помещается в контекст (причем контекст до автокомпакта) и пока слова в названиях переменных и функций действительно отвечают за то что эти переменные и функции делают
Но не решает гораздо более сложную, глобальную и порою философскую проблему - что вообще такое хороший software и как его писать.
Вы звучите разумно и обоснованно, я могу во многом не согласиться с тезисом "в реальности все довольно плохо" потому что на самом деле там все-таки есть сильная обычно разница между
"это плохо, но работает, и здесь в принципе лучше и не нужно"
"это плохо, проблем с качеством кода слишком много, это стоит невероятно много денег"
"это в принципе нереалистичный макет пародирующий реальность, он фундаментально не будет работать"
И в этих трех тезисах как раз и лежит фундаментальная разница между тем как работает с ллмками автор против того как менеджмент мечтает о невероятном сильвербуллете решающем все проблемы.
Ну и я сохраняю оптимизм касательно айти сферы. Но в целом вы поднимаете реальные проблемы, конечно же.
Самый невероятно отвратительный перфоманс у меня был как раз в команде где лид считал, что он мозг, а пятеро сеньоров вокруг это только руки которые набирать код пальцами способны.
Там в принципе всю команду микроменеджментом разворотило правда...
В этом на самом деле и есть моя основная претензия к тем кто думает что большинство разрабов можно заменить ллмкой: вы правда думаете что мы просто от сих до сих код по тз реализуем не пытаясь думать о системе/юзкейсах/продукте/пользователе/корнерах/рисках и не принимая никаких решений?
Ну и ЛЛМки правда пишут криво. Где-то это абсолютно невероятный инструмент, особенно в кейсах как у автора, где-то как будто бы реально лучше руками.
Ну если совсем дословно про то как я прочитал фразу то было: "Мне не хватало денег на еду, поэтому я купил старую спортивную тачку"
Ситуация скорее всего была не факт что такой ирл, да и как бы не то чтобы мы всегда какие-либо решения можем/должны принимать исходя из чистой стериальной рациональности, а не эмоций.
Но что-то в этой фразе такое продактовое прям есть, не знаю как выразить получше.
Продакты...
Не хочу чтоб этот комментарий воспринимался как негативный, меня просто как-то так цепанула эта фраза. Там где риск там и жажда риска и жажда, наверное.
Мне если честно так сильно это видео которому уже 16 лет вспоминается
https://youtu.be/b2F-DItXtZs
ЛЛМки до сих пор генерируют правдоподобный, но не оптимальный/копипастящий/игнорирующий стайлгайды код.
Он зачастую даже не работоспособный, но если вы никогда не погружаетесь в код то вы разницы и не заметите на самом деле.
Нет, не поймите меня превратно - ллмки многое могут, и даже уже существующий код вместе с ними прожёвывать можно очень интересно и эффективно, переписывая гигантского размера кодовые базы (особенно если они хорошо покрыты тестами), но дизайн кода, покрытие кода, там такое невероятное количество воздушных замков ML-bro уже выстроено и ещё будет построено...
Самый великолепный юзкейс для ллмок - накалывать инвесторов не в теме. Вот тут работает с невероятным профитом конечно...
В развитии искуственного интеллекта было столько зим, мне кажется мы рано или поздно наткнемся на ещё одну из них.
Я не думаю что LLM хорошо заскейлятся, один из фундаментальных боттлнеков технологии. Там что клода что чатгпт встали на 200к токенов. Да, им за счет RAG'а и автокомпакта искуственно расширили контекст до ляма, но о ужас, абсолютно "внезапно" оказывается что после такого автокомпакта модели становятся бесполезными и тупеют катастрофически
Я дёргал клоду, я дёргал соннет, я дёргал чатгпт.
Единственное что изменилось это харнесс который позволяет пулять контекст в ллм с околокосмической скоростью. В остальном клонировать приложения или воспроизводить уже написанный код они умеют, ну получше, но фундаментальных изменений там нет.
Но культ святого ИИ уже даже на хакерньюз подугас если честно за последние полгода, вам бы вернуться в начало 2026...
В своё время читал Superintelligence Бострома которая меня и разочаровала тем, что там логика рассуждений она примерно такая:
еслиесли
если
если
если
то нам обязательно всем хана
Capabilities которые меряют по бенчмаркам под которые подстраивают модели для того чтобы они улучшали capabilities.
ЛЛМ ровно такие же как в 2020 году. Они галлюцинируют. Выдают желаемое за действительное. Не обладают признаками абстрактного либо какого либо ещё мышления. Да, это невероятный инструмент по генерации правдоподобных текстов (в конце концов на 100% правдоподобный текст это и есть правда), но от фундаментальных ограничений технологии никто никуда до сих пор не ушел, это тупиковая ветвь которую со всё большим отчаянием пытаются впаривать.
Для этого всего уже термин AI bro/ML bro появился, наподобие криптобро. Хайп-циклы не меняются.
Мне кажется "старение света" можно можно попробовать как-то экспериментально проверить, и на всех доступных нам масштабах подобного не замечали, насколько понимаю
Плюс этот тест старение света ставит сильно под вопрос - https://en.wikipedia.org/wiki/Tolman_surface_brightness_test
Поэтому обычно говорят о спектре и степени проявленности тех или иных особенностей.
Легкая степень чего либо в психиатрии вполне себе может быть вариантом нормы или даже полезной во многих делах. Но при определенных обстоятельствах то, что полезно в меру, становится шизофренией
У меня паттерн как будто бы такой => эмоционально успокаивает/повышает настроение => приятнее работать и легче концентрироваться
Что такое ручное программирование?
Нагенерить бойлерплейт (особенно дто), костяк системы, код который ты приблизительно представляешь как должен выглядеть и что делать но который лень писать руками при помощи ллм - милое дело.
К тем местам где каждая строчка кода важна ллм лучше не подпускать на пушечный выстрел. Искать такие места при помощи ллм - прикольно. Генерить тесты на покрытие таких мест - любо дорого. Но ведь там и над тестами придется думать!
Вместо хабровского ИИ-скепсиса когда люди считают что ллм даже текст генерить не могут на хакерньюз обратный АИ-психоз: любой комент сомневающийся в том что ллмки могут решить P/NP проблему, заварить всем идеальный чай и захватить человечество объявляется ересью.
Так и живем.
"In July 2023, the classical evaluation was completely removed in favor of the NNUE evaluation."
Там уже и стокфиш не детерминированный получается, черт подери, интересно!
А кто-то проводил уже матчи где по честному сравнивал как ллмки играют в шахматы vs детерминированные специализированные алгоритмы?
Реально интересно стало, кажется неиронически крутым бенчмарком
Есть ли разница между математической коннектомом червя и ллмкой?
Достаточно ли подробно математический коннектом червя симулируется, или он игнорирует некоторые неотъемлимые для реальности механизмы (вроде попытки симулировать квантовые процессы на детерминированном не квантовом конечном автомате)?
А вы уверены что сознание не прерывается, или мы просто не замечаем собственной гранулярности?
А вы уверены что время дискретно?
Тут достаточно вопросов и без "решения трудной проблемы сознания"