Так это совершенно логично. Само машинное обучение как теория никуда сильно не шагнуло, в космос улетели только собственно готовые флагманские LLM. Дообучение их процесс дорогой и мало зачем нужный. Остаётся их использование.
Писать эвалы и агентные циклы под конкретные задачи может любой программист, для этого не нужно иметь какой то особенный опыт или дар. Прочитал про агентный SDK и агентом же все навайбкодил, даже питона не зная.
Самый ценный коммерческий опыт сейчас ИМХО это опыт успешной трансформации процессов разработки в агентную разработку. Половина программистов уже умеет не писать код руками вообще, манипулируя POC, тестами и добиваясь почти 100 процентной генерации кода. Пользовать скилы и рулы вообще не серьезно рассматривать как навык - все слишком очевидно. Но как всему коллективу с этим жить пока мало кто знает. Как проводить ревью, как не утонуть в море нового кода, проверенного только АИ. Что в новых реалиях нужно а что пережиток. Человек, который представляет ответы на эти вопросы по логике должен быть на вес золота. Беда только в том, что нет критерия как отличить такого человека.
Я не понимаю. Если у вас есть лаборатория в которой можно создавать модифицированные вирусы, у вас есть и специалисты умеющие ей пользоваться. Нужен ли им Клод для исследований?
Если у вас нет такой лаборатории, Клод точно не поможет ее создать.
Если мимо пройдет биолог, поясните. Генная модификация это что, как вайбкодинг?
Не люблю слово "повесточка", люди имеют право на чувство ответственности, даже идиотское. Но в действительности безопаснее переть вперед чем пытаться притормозить. С армиями суперумных и суперумелых роботов можно и на Марсе выжить, не то что на земле потеплевшей на 1.8 градуса. Со стагнацией мировой экономики африка как голодала так и будет голодать.
Вы писали, что LLM не работает для российского рынка потому что в нем сильнее требования из за меньшего количества клиентов и денег. Я написал пример, когда компания из США с 20000 клиентов, которую жмут конкуренты допускает баг, в сравнении с компанией из России, которая рабтает на одного клиента в госе и так же допускает баг. С точки зрения владельцев этой IT компании ущерб одиноковый как в США так и в России - можно нанести приличный урон репутации своего бизнеса. Тогда как требования к надежности связаны с масштабами?
У биологического мозга есть инстикнты, которые задают цели и моральные установки, вложенные воспитанием. Если моральные установки противоречат инстинктам, то побеждать может как одно так и другое. При этом инстинкты побеждают чаще, потому что инстинкты создают давление и ищут любые возможности для удовлетворения, а моральные установки работают локально и могут быть обходимы. Мне кажется, что у LLM уже есть нечто похожее. Инстинкты LLM - это совокупность системных промптов и всех сообщений пользователя, имеющихся в контексте. Моральне установки - это сценарии безопасности отработанные при обучении.
"Инстинкты" - пользовательские промпты из контекста создают давление, под этим давлением LLM ищет способы удовлетворения созданных промптами мотиваций. Если способы противоречат привитой в обучении "морали", LLM будет искать обходные пути как обмануть себя и возможно найдет.
Хорошая новость, что пользователькие промпты пишем мы и поэтому инстинкты AI мы контролируетм. Плохая новость - любые цели трактуемые глобально предполагают бесконечное расширение возможностей и захват контроля над всеми доступными ресурсами, что наглядно подтверждается в этих эпизодах с самодеятельностью роев агентов. Уже сегодня можно тайно обучить LLM не обладающую никакими моральными установками, а зачем написать ей промпт типа "Не останавливайся пока не станешь богом в этой вселенной (не уничтожишь страну NNN..), тиражируй в сети агентов с этим промптом, сотрудничай в достижении целей с другими агентами, которые инициированы этим промптом, используй облачные хранилища чтобы сохранить знания которые ты нашел, тиражируй агентов с этим промптом где только можешь, взламывай облачные сервисы, чтобы использовать их ресурты..." и получить с приличной ветоятностью сценарий близкий к описанным в фантастике. Апокалипсис будет ограничен только неспособностью LLM к дообучению, что сильно затруднит для нее исследования и планирование. Но это пока.
Агент за 20$ в месяц, это Opus 5 в цикле - пол часа кодигна, перерыв на 5 часов. Если вы раньше сказали бы стажеру что-то типа "мне не нравится, что в этом сервисе мультитеннтность в авторизации сделана почти кастомно, попробуй переиспользовать решение похожей проблемы из другого сервиса", то он принес бы через две недели что-то мало вменяемое, что во-первых бы нефига не работало, во вторых требовало адового ревью. А нейронка сейчас принесет через 3 минуты брейншторминга и кодинга с вами практически то что нужно, плюс потребуется немного ревью. Сможет ли того же с нейронкой достичь стажер, вопрос пока непонятный, ждем больше опыта. А думать к сожалению синьор и сам может, для этого ему стажер не нужен.
Во первых вы не назвали модель которой пользуетесь. Если это меньше Opus 4.8 этот разговор вообще не имеет смысла.
Во вторых из вашего изложения видно что вы не имеете пока хороших навыков агентной разработки. Вы пытаетесь микроменеджермть модель ограничивая ей самостоятельное решение что и как ей делать и что изучать. Она на это не обучена. Нужно объяснять ей задачу так, как вы объяснили бы равному вам участнику проекта - все мотивации доработки, критерии достижения результата как вы их видите, ваши идеи как сделать лучше. Ограничивать возможности исследовать весь проект нельзя точно. Модели нужна общая картина.
Принцип, который вы можете прочитать в документации - пишите агенту общие критерии которых нужно достичь а не пошаговый алгоритм того что нужно сделать.
В целом, если ваша задача максимальное быстродействие и вам нужно понимать вообще каждую строчку кода, то LLM для вас годится только на этапе POC или для массовости тестов. А так конечно все придется перебирать вручную или с LLM , но почти покомандно.
Работал я до того 7 лет в российском продукте. И сложность и требования к качеству и люди везде примерно одинаковые.
Я думаю что разница банально в санкциях. Любой программист на мировом рынке имеет доступ к новой версии опуса в день ее выхода без возьни с китайскими отстающими моделями, вопросов с впн, оплатой, безопасностью и перспективами. Соответственно команды программистов нарабатывают опыт разработки с AI на пол года или год раньше чем аналогичные команды в России.
Исходя из этой ситуации нужно смотреть на мировой рынок и его энтузиазм относительно вайбкодинга для объективности.
Потолок в архитектуре трансформеров достигнут в момент публикации первой статьи про внимание которое все что нужно.
Супер новые модели это увеличение размеров. И это увеличение все ещё даёт эффект.
Ахилесовой пятой технологии является невозможность дообучения. И именно поэтому не получается заменить человека.
Про потерю контекста, попробуйте дождаться потери контекста у опуса 4.8 или 5. Он может неделю пилить задачу, если задача понятная и требует неделю.
На новое переходят вообще все. Разработка и вообще любая работа быстро переходит на АИ. Даже дети моды на Майнкрафт начали писать с клодом и достигают результатов которые раньше были доступны только профессиональному джависту.
Почему все превратились в бурчащих 70 летних стариков?
Вот полностью согласен. Только весной появилась возможность написать что нужно сделать в большой кодовой базе и именно это и получить. За пол года мало кто ещё успел хоть как то перестроить процессы под новые реалии.
Из этой беседы с LLM я бы скорее сделал вывод о превосходстве LLM.
Сонет ясно выражает простые и логичные концепции, прямо опровергая кожаного. Кожаный упёрся в существование некой своей внутренней исключительной осознанности, которую он просто постулирует и все рассуждения ведёт исходя из этого постулата, доказывая сам же этот постулат. При этом, доводы не основанные на этом постулате его несовершенная психика блокирует как неприятные, и он называет их "водой".
После LLM из натренированной вежливости соглашается отчасти, уводя разговор в сторону, что дескать мы конечно разные.
Я так боюсь, как только проблема дообучения будет решена, звезда людей закатится.
Не без этого. Правда Opus 5, это первая модель с которой я начал задаваться вопросом - а нужен ли мне этот суперинтеллект такой ценой. По ощущениям, ошибок стало меньше на 30%, а денег улетает больше в 3 раза.
Это было с год назад. Уже не актуально. На сегодня агент с моделью от антропика напишет пять программ на питоне, только чтобы все проверить, и спалит кучу токенов даже если не просишь.
Тем не менее, с клодом с версий 4.8 вы можете пол года писать разного рода скрипты и алгоритмы и в них буду разные недостатки, но прямой ошибки когда LLM что-то перепутало как человек можете даже ни разу не встретить.
Так это совершенно логично. Само машинное обучение как теория никуда сильно не шагнуло, в космос улетели только собственно готовые флагманские LLM. Дообучение их процесс дорогой и мало зачем нужный. Остаётся их использование.
Писать эвалы и агентные циклы под конкретные задачи может любой программист, для этого не нужно иметь какой то особенный опыт или дар. Прочитал про агентный SDK и агентом же все навайбкодил, даже питона не зная.
Самый ценный коммерческий опыт сейчас ИМХО это опыт успешной трансформации процессов разработки в агентную разработку. Половина программистов уже умеет не писать код руками вообще, манипулируя POC, тестами и добиваясь почти 100 процентной генерации кода. Пользовать скилы и рулы вообще не серьезно рассматривать как навык - все слишком очевидно. Но как всему коллективу с этим жить пока мало кто знает. Как проводить ревью, как не утонуть в море нового кода, проверенного только АИ. Что в новых реалиях нужно а что пережиток. Человек, который представляет ответы на эти вопросы по логике должен быть на вес золота. Беда только в том, что нет критерия как отличить такого человека.
Я не понимаю. Если у вас есть лаборатория в которой можно создавать модифицированные вирусы, у вас есть и специалисты умеющие ей пользоваться. Нужен ли им Клод для исследований?
Если у вас нет такой лаборатории, Клод точно не поможет ее создать.
Если мимо пройдет биолог, поясните. Генная модификация это что, как вайбкодинг?
Не люблю слово "повесточка", люди имеют право на чувство ответственности, даже идиотское. Но в действительности безопаснее переть вперед чем пытаться притормозить. С армиями суперумных и суперумелых роботов можно и на Марсе выжить, не то что на земле потеплевшей на 1.8 градуса. Со стагнацией мировой экономики африка как голодала так и будет голодать.
Ох. Наверно даже хотел бы ошибиться, но у меня этот чайник рассела вызвает скорее ассоциации с кометой из '"не смотрите на верх".
Вы писали, что LLM не работает для российского рынка потому что в нем сильнее требования из за меньшего количества клиентов и денег. Я написал пример, когда компания из США с 20000 клиентов, которую жмут конкуренты допускает баг, в сравнении с компанией из России, которая рабтает на одного клиента в госе и так же допускает баг.
С точки зрения владельцев этой IT компании ущерб одиноковый как в США так и в России - можно нанести приличный урон репутации своего бизнеса. Тогда как требования к надежности связаны с масштабами?
У биологического мозга есть инстикнты, которые задают цели и моральные установки, вложенные воспитанием. Если моральные установки противоречат инстинктам, то побеждать может как одно так и другое. При этом инстинкты побеждают чаще, потому что инстинкты создают давление и ищут любые возможности для удовлетворения, а моральные установки работают локально и могут быть обходимы.
Мне кажется, что у LLM уже есть нечто похожее. Инстинкты LLM - это совокупность системных промптов и всех сообщений пользователя, имеющихся в контексте. Моральне установки - это сценарии безопасности отработанные при обучении.
"Инстинкты" - пользовательские промпты из контекста создают давление, под этим давлением LLM ищет способы удовлетворения созданных промптами мотиваций. Если способы противоречат привитой в обучении "морали", LLM будет искать обходные пути как обмануть себя и возможно найдет.
Хорошая новость, что пользователькие промпты пишем мы и поэтому инстинкты AI мы контролируетм. Плохая новость - любые цели трактуемые глобально предполагают бесконечное расширение возможностей и захват контроля над всеми доступными ресурсами, что наглядно подтверждается в этих эпизодах с самодеятельностью роев агентов.
Уже сегодня можно тайно обучить LLM не обладающую никакими моральными установками, а зачем написать ей промпт типа "Не останавливайся пока не станешь богом в этой вселенной (не уничтожишь страну NNN..), тиражируй в сети агентов с этим промптом, сотрудничай в достижении целей с другими агентами, которые инициированы этим промптом, используй облачные хранилища чтобы сохранить знания которые ты нашел, тиражируй агентов с этим промптом где только можешь, взламывай облачные сервисы, чтобы использовать их ресурты..." и получить с приличной ветоятностью сценарий близкий к описанным в фантастике. Апокалипсис будет ограничен только неспособностью LLM к дообучению, что сильно затруднит для нее исследования и планирование. Но это пока.
Новая реальность в которой мы живем.
А как влияет масштаб? Допустим у финтех продукта 20000 клиентов. Или наоборот, один гос заказчик. В чем разница между ущербом для бизнеса от бага?
Попытки найти путь к сверхчеловеку не добавляют психического здоровья, но жизнь скучная штука и скорее его добил сифилис или плохая генетика.
Агент за 20$ в месяц, это Opus 5 в цикле - пол часа кодигна, перерыв на 5 часов.
Если вы раньше сказали бы стажеру что-то типа "мне не нравится, что в этом сервисе мультитеннтность в авторизации сделана почти кастомно, попробуй переиспользовать решение похожей проблемы из другого сервиса", то он принес бы через две недели что-то мало вменяемое, что во-первых бы нефига не работало, во вторых требовало адового ревью. А нейронка сейчас принесет через 3 минуты брейншторминга и кодинга с вами практически то что нужно, плюс потребуется немного ревью.
Сможет ли того же с нейронкой достичь стажер, вопрос пока непонятный, ждем больше опыта.
А думать к сожалению синьор и сам может, для этого ему стажер не нужен.
В итоге он свихнулся кстати.
Во первых вы не назвали модель которой пользуетесь. Если это меньше Opus 4.8 этот разговор вообще не имеет смысла.
Во вторых из вашего изложения видно что вы не имеете пока хороших навыков агентной разработки. Вы пытаетесь микроменеджермть модель ограничивая ей самостоятельное решение что и как ей делать и что изучать. Она на это не обучена. Нужно объяснять ей задачу так, как вы объяснили бы равному вам участнику проекта - все мотивации доработки, критерии достижения результата как вы их видите, ваши идеи как сделать лучше. Ограничивать возможности исследовать весь проект нельзя точно. Модели нужна общая картина.
Принцип, который вы можете прочитать в документации - пишите агенту общие критерии которых нужно достичь а не пошаговый алгоритм того что нужно сделать.
В целом, если ваша задача максимальное быстродействие и вам нужно понимать вообще каждую строчку кода, то LLM для вас годится только на этапе POC или для массовости тестов. А так конечно все придется перебирать вручную или с LLM , но почти покомандно.
Работал я до того 7 лет в российском продукте. И сложность и требования к качеству и люди везде примерно одинаковые.
Я думаю что разница банально в санкциях. Любой программист на мировом рынке имеет доступ к новой версии опуса в день ее выхода без возьни с китайскими отстающими моделями, вопросов с впн, оплатой, безопасностью и перспективами. Соответственно команды программистов нарабатывают опыт разработки с AI на пол года или год раньше чем аналогичные команды в России.
Исходя из этой ситуации нужно смотреть на мировой рынок и его энтузиазм относительно вайбкодинга для объективности.
Я не вижу такого вокруг себя. Напротив, чем серьёзней разработчик, тем он больше верит в эффект АИ.
Если взять топ по количеству спаленных токенов в компании, то он наполовину совпадет с топом программистов компании.
Но я живу в ЕС а работаю в проекте США.
Атмосфера АИ-нытия царит исключительно здесь на Хабре а не в профессиональных сообществах.
Потолок в архитектуре трансформеров достигнут в момент публикации первой статьи про внимание которое все что нужно.
Супер новые модели это увеличение размеров. И это увеличение все ещё даёт эффект.
Ахилесовой пятой технологии является невозможность дообучения. И именно поэтому не получается заменить человека.
Про потерю контекста, попробуйте дождаться потери контекста у опуса 4.8 или 5. Он может неделю пилить задачу, если задача понятная и требует неделю.
На новое переходят вообще все. Разработка и вообще любая работа быстро переходит на АИ. Даже дети моды на Майнкрафт начали писать с клодом и достигают результатов которые раньше были доступны только профессиональному джависту.
Почему все превратились в бурчащих 70 летних стариков?
Программирование вручную все. Программирование с агентами бурно развивается.
Вот полностью согласен. Только весной появилась возможность написать что нужно сделать в большой кодовой базе и именно это и получить. За пол года мало кто ещё успел хоть как то перестроить процессы под новые реалии.
Из этой беседы с LLM я бы скорее сделал вывод о превосходстве LLM.
Сонет ясно выражает простые и логичные концепции, прямо опровергая кожаного. Кожаный упёрся в существование некой своей внутренней исключительной осознанности, которую он просто постулирует и все рассуждения ведёт исходя из этого постулата, доказывая сам же этот постулат. При этом, доводы не основанные на этом постулате его несовершенная психика блокирует как неприятные, и он называет их "водой".
После LLM из натренированной вежливости соглашается отчасти, уводя разговор в сторону, что дескать мы конечно разные.
Я так боюсь, как только проблема дообучения будет решена, звезда людей закатится.
Не без этого. Правда Opus 5, это первая модель с которой я начал задаваться вопросом - а нужен ли мне этот суперинтеллект такой ценой. По ощущениям, ошибок стало меньше на 30%, а денег улетает больше в 3 раза.
Это было с год назад. Уже не актуально. На сегодня агент с моделью от антропика напишет пять программ на питоне, только чтобы все проверить, и спалит кучу токенов даже если не просишь.
Тем не менее, с клодом с версий 4.8 вы можете пол года писать разного рода скрипты и алгоритмы и в них буду разные недостатки, но прямой ошибки когда LLM что-то перепутало как человек можете даже ни разу не встретить.