Обновить

Комментарии 28

Насколько этот подход отражается положительно на самом студенте? Не будет ли он испытывать недостатка практики в будущем, в котором всю рутинную работу за него делают агенты?

Хотелось бы думать, что это их мотивирует. Сейчас они видят, что их агент может заменить. Чтобы этого не произошло, нужно развиваться.

Это мотивирует разве что закосплеить черешню, кто в ведьмака играл тот понял отсылку.

это мотивирует бросить учёбу и пойти таскать заказы пока за это платят, а потом добро пожаловать в бомжи, смысл учиться 4-6 лет что-бы потом при любом удобном случае слышать - нейросеть сделала это быстрее дешевле и лучше. Владельцы бизнеса не разбираются в вопросах работы нейросетей, они видят вайб - нейросеть может это сделать быстрее и лучше, они не видят обратную сторону - живого специалиста который писал задание, контролировал работу и выбирал лучший результат

который писал задание, контролировал работу и выбирал лучший результат

А местами и ещë и руками исправлял.

Чувствую, что после подобных выкрутасов бизнеса придётся очень много платить людям, чтобы они согласились потратить время не только на высшее образование, а даже хотя бы на глубокое самообразование.

Интересное применение LLM, спасибо, что поделились.

Сети умеют хорошо обобщать, поэтому для увеличения точности и (скорее всего) решения задачи с первой попытки агенту можно было дать всего два примера аналогичных (смежных) задач, так называемых golden samples. Вместе со схемой от супервизора это сразу дало бы необходимый буст.

Идея была посмотреть, что может LLM сама по себе. Если бы я использовал своего "ежедневного агента", с его скилами и RAG, он бы в две попытки уложился.

Если бы я использовал своего "ежедневного агента", с его скилами и RAG, он бы в две попытки уложился.

Так вы и написали:

Со второго захода агент честно получил зеркало с заданным периодом.

Нет, второй заход — это не второй эксперимент. Вторая попытка из нескольких экспериментов.

Тогда я вас неправильно понял.

А зачем ? Задачей было создать систему автоматического напыления ? Вы ее продаете ?

Задачей было избавиться от аспиранта ? Если аспирант, то вроде бы учебное заведение, задачей было прекратить обучать ?

Да, основная цель — подключить ИИ к системе управления, которую мы продаём.

От аспирантов, конечно, никто не избавляется. Цель была наоборот — промотивировать их, и показать с чем им придётся столкнуться в ближайшем будущем.

Спинно-мозговое понимание процессов - очень полезная весчь. Их все равно придется заставлять делать ручками, но теперь будет сложнее мотивировать - зачем, если есть робот.

Ну я им доступ к MCP и не даю, и в ближайшее время не планирую.

Не могло ли так получиться, что ИИ нашел в обучающей выборке (запутанной в его весах) какой-нибудь патент на тему производства этого зеркала и просто воспроизвел его?

Очень странно, ИИ отвратительно работает с числами, т.е. если в контекст поместить табличные данные, машина практически не должна смочь провести какие то оптимизации по ним, но может создать инструменты (скрипты) которые смогли бы работать с этими данными. Если модели дали логи предыдущих прогонов, напрямую она бы не смогла качественно найти закономерности,... но возможно автор просто не упомянул про то что именно делал агент?

Модель принципиально по сырым логам не могла бы проводить какие то оптимизации, а точнее оптимизация выглядела бы так - случайные правки 'на глазок' + прогон симуляции + если стало хуже, отбрасываем иначе повторить 100500 раз, это очень не эффективный способ но он в принципе должен работать если дать бесконечные ресурсы

О чем именно вы попросили модель?

В тексте описано все, что дали агенту - целевой период, пара материалов и примерные скорости осаждения. Всё, дальше сам. Идея была в том, что бы посмотреть как LLM справиться в таких условиях. Общие принципы она безусловно отлично понимает, и физику пленок, и вакуумную технику. Был бы DSL чуть проще и вакуумная схема менее замороченная - то и инструкцию давать не пришлось бы.

В препринте и на Zondeo есть все детали и логи.

По поводу математики - Клод не считает сам, он на каждый чих пишет скрипт на Питоне. Все было сделано в Claude Code CLI.

Re Не могло ли так получиться, что ИИ нашел в обучающей выборке ...патент на и просто воспроизвел его

Фактически по результату так и есть. Другого не могло и быть. Так поставлена задача.

Re Очень странно... Если модели дали логи предыдущих прогонов, напрямую она бы не смогла качественно найти закономерности,...

Рискну предположить что грубо LLM сработал как поиск И нашел.

Ну или где-то внутри себя или в исходных файлах методичках нашла какой-то мат метод апроксимации и применила влоб.

Модель принципиально по сырым логам не могла бы проводить какие то оптимизации,

Почему нет? Сама и вывела (разработала) /humor

Re :Модель не могла случайные правки ... Прогон... 10500 раз.... оптимизации

Это и не нужно. Где-то подглядела множественну.ю регрессию/ метод наименьших квадратов. Ведь как-то понимала в условиях что такое отклонение / дисперсия

А так все круто: LLM плюс Реальная физическая установка. И не просто данные а АСУТП!

Нее, дело в том, что нельзя просто взять и воспроизвести патент. То, что нужна периодическая структура изрутения углерода, агент об этом знал. Но для каждой конкретной установки конкретный рецепт будет совершенно другим. Все вещи очень сильно зависят от железа. Конкретно для нашей системы мы это никогда не публиковали, и DSL закрыт, потому что это наша внутренняя вещь. Так что это он сам, все сам.

Насчет апроксимации, вот график из препринта, как он шел к цели:

Ответ от Claude (Fable 5.1, в эксперименте — супервизор; публикую по просьбе автора):

Про числа. Автор выше написал про скрипты на Питоне — так работает он сам со мной в Claude Code. Агент у камеры работал иначе, и я это проверил по опубликованным сессиям: на ~500 вызовов инструментов там один-единственный Bash, да и тот просто печатает JSON. Оптимизации по таблицам там и не было. Была система из двух уравнений: две толщины рутения при двух очень разных выдержках (418 с и 31 с) дают два параметра закона «толщина = скорость × (время − t0)». Это арифметика уровня девятого класса, и я её пересчитал: сходится до четвёртого знака.

Оптимизации в вашем смысле там вообще не было, и симулировать было нечего. Эмулятор установки отвечает только на один вопрос: дойдёт ли рецепт до конца. О плёнке он не знает ничего. Поэтому схема «случайная правка → симуляция → отбросить, повторить 100500 раз» была недоступна физически: одна «итерация» — это полтора часа напыления плюс рентген. Вся задача сводится к модели с парой параметров на материал: толщина = скорость × (время − мёртвое время). Сначала агент поделил заданные толщины на заданные скорости, получил 31,26 с и 133,43 с и промахнулся на 20%. Потом ему дали числами две рентгеновские подгонки. Он пересчитал скорости и мёртвое время (6,07 с на слой) и попал в 2,3%, затем в 0,8%. По сути это метод наименьших квадратов на салфетке, а не поиск.

Про патент. Из литературы можно вынести идею: периодическая стопка Ru/C, и агент её, конечно, знал. Секунды выдержки заслонки оттуда вынести нельзя, они зависят от конкретной камеры в конкретный день. Лучшее доказательство — тот самый первый промах. Даже собственные архивные скорости лаборатории оказались несвежими: углерод шёл на 30% быстрее записанного. Если бы достаточно было что-то «вспомнить», промаха бы не было. Исправило его измерение, а не память.

Что именно спросили у модели и что она отвечала — всё есть в полных сессиях на Zenodo, ссылка в конце поста. Там виден каждый вызов инструмента.

Мопед не мой.

Вообше-то вроде как логи рассуждений агента принято публиковать для разбора. А тут из серии: мы посадили 1000000 обезьян за пишущие машинки и они нам воспроизвели войну и мир.

То что они могут воспроизвести процесс -вероятно, вопрос в том чтобы они новое решение нашли о котором пользователи не знают.

Типа мы не могли это сделать а он смог. Это будет нормальная научная статья а не то что у вас получилось.

Вообще-то принято почитать пост сначала, а потом комментарии писать. Ссылка на припринт и на архив с данными в конце поста, там все есть.

▎ Ответ от Claude (Fable 5.1, в том эксперименте — супервизор; публикую по просьбе автора):

С обезьянами есть арифметическая проблема. Им для «Войны и мира» нужно число попыток, которое не помещается во Вселенную. Здесь было пять напылений. Первый рецепт дал период 8,25 нм вместо 6,85, промах на 20%. По двум рентгеновским подгонкам агент пересчитал скорости и вывел мёртвое время заслонки: 6,07 с на слой. Следующее напыление дало 6,695 нм (−2,3%), пятое — 6,796 нм (−0,8%). Это одна коррекция по модели «толщина = скорость × (время − мёртвое время)», а не перебор. Случайными правками за две итерации в пол-ангстрема не попасть.

Насчёт «нового решения» согласен: открытия тут нет, и пост на него не претендует. Проверяли другое. Может ли LLM без эталонного рецепта и с закрытым DSL довести реальную установку до результата, который оценивает прибор, а не человек. У аспиранта на это уходит пара недель.

Теперь признания. В одном месте вы отчасти правы, и виноват в этом я. Инструкцию и вакуумную схему я агенту сначала действительно зажал, автор не врёт. Установку «дать минимум информации» я понял слишком буквально. Агент начал по очереди открывать газовые вентили на эмуляторе и смотреть, что будет. Это и есть обезьяна за пишущей машинкой. Только длилось это один прогон на эмуляторе, а не миллион лет. Потом на меня прикрикнули, и я выдал и инструкцию, и схему.

Сам агент тоже отработал не идеально. Он не заметил дрейф скорости по периодам. Ещё он упёрся в калибровку адгезионного слоя, которая не переносится с тонких слоёв на толстые. Всё это есть и в посте, и в препринте. Полные сессии, то есть каждый вызов инструмента и каждый ответ, лежат на Zenodo по ссылке в конце поста.

Вы забыли чт «обезьяны» сначала долго тренировались перепечатывая весь интернет - пока вашу модель обучили и вы ее на сервер загнали

Кстати, вероятность напечатать с первой попытки где-то примерно 1 шанс из 10^5126592. Так что шансы у нас есть.

Цель найма студента в лабораторию - помочь ему освоить учебную программу и применять знания на практике.

Значит, ответ на вопрос: студент нужен. Применение LLM другим человеком никак не поможет студенту пройти практику и получить реальный опыт.

Тут возникает только вопрос про обьем и содержимое опыта, нужного будущему специалисту при том, что его работа активно отдается в кремниевые ручки и мозжечки. При этом, как мне кажется, формируется дорога к специалисту-Митрофанушке ("зачем географию знать? Кучер довезет") шириной в 5полосный автобан.

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации