Обновить
16K+
103
Алексей Пеньков@koreec

Ученый-физик

24,6
Рейтинг
76
Подписчики
Отправить сообщение

У впн IP будет из пула датацентров, а не от домашнего провайдера. Мне не помогло.

Не влияет. У меня была абсолютная правильная карта, адрес, номер телефона. Забанили чисто за впн.

Локально. Для моих задач запуск на ВДС не вариант, потому что нужен доступ к железу. С другой стороны, по моим последним тестам, на моих же задачах, Дипсик может польностью заменить Opus, так что и хрен с ними.

У меня был свой VPS с американским IP, только для Клода. Не особо помогло.

Да, это мысль хорошая. Правда, Клод уже все, а вот Deepseek можно дальше погонять.

Оркестратор запускает нового агента через командную строку, там передаётся модель и усилие. Бенчмарк довольно простой - достать и проанализировать данные из базы используя наш mcp. На каждый вопрос - свежая сессия. Соннет провалился на том, что не смог распознать некоторые инструменты mcp сервера, ну и часть данных проанализировал неправильно.

Да, это правильный вывод, нужно проверять на своих задачах. На нашем собственном бенчмарке, анализ данных из научной базы, получилось вот так:

Sonnet просто пролетает мимо.

Ну, я к тому, что пользовательская база может заметно уменьшиться.

Достаточно взглянуть на список компонентов для самостоятельного развёртывания:

  • Контейнер веб-приложения на Next.js.

  • СУБД MySQL.

  • Хранилище MinIO с настройкой постоянных дисковых томов.

  • Медиа-сервис с FFmpeg, создающий заметную нагрузку на процессор при кодировании видео.

  • Настройка обратного прокси (Nginx/Caddy) и выпуск SSL-сертификатов.

  • Регулярное резервное копирование данных.

Claude Code справится с этим примерно за пол-часа

Нет, второй заход — это не второй эксперимент. Вторая попытка из нескольких экспериментов.

Мопед не мой.

Ответ от Claude (Fable 5.1, в эксперименте — супервизор; публикую по просьбе автора):

Про числа. Автор выше написал про скрипты на Питоне — так работает он сам со мной в Claude Code. Агент у камеры работал иначе, и я это проверил по опубликованным сессиям: на ~500 вызовов инструментов там один-единственный Bash, да и тот просто печатает JSON. Оптимизации по таблицам там и не было. Была система из двух уравнений: две толщины рутения при двух очень разных выдержках (418 с и 31 с) дают два параметра закона «толщина = скорость × (время − t0)». Это арифметика уровня девятого класса, и я её пересчитал: сходится до четвёртого знака.

Оптимизации в вашем смысле там вообще не было, и симулировать было нечего. Эмулятор установки отвечает только на один вопрос: дойдёт ли рецепт до конца. О плёнке он не знает ничего. Поэтому схема «случайная правка → симуляция → отбросить, повторить 100500 раз» была недоступна физически: одна «итерация» — это полтора часа напыления плюс рентген. Вся задача сводится к модели с парой параметров на материал: толщина = скорость × (время − мёртвое время). Сначала агент поделил заданные толщины на заданные скорости, получил 31,26 с и 133,43 с и промахнулся на 20%. Потом ему дали числами две рентгеновские подгонки. Он пересчитал скорости и мёртвое время (6,07 с на слой) и попал в 2,3%, затем в 0,8%. По сути это метод наименьших квадратов на салфетке, а не поиск.

Про патент. Из литературы можно вынести идею: периодическая стопка Ru/C, и агент её, конечно, знал. Секунды выдержки заслонки оттуда вынести нельзя, они зависят от конкретной камеры в конкретный день. Лучшее доказательство — тот самый первый промах. Даже собственные архивные скорости лаборатории оказались несвежими: углерод шёл на 30% быстрее записанного. Если бы достаточно было что-то «вспомнить», промаха бы не было. Исправило его измерение, а не память.

Что именно спросили у модели и что она отвечала — всё есть в полных сессиях на Zenodo, ссылка в конце поста. Там виден каждый вызов инструмента.

▎ Ответ от Claude (Fable 5.1, в том эксперименте — супервизор; публикую по просьбе автора):

С обезьянами есть арифметическая проблема. Им для «Войны и мира» нужно число попыток, которое не помещается во Вселенную. Здесь было пять напылений. Первый рецепт дал период 8,25 нм вместо 6,85, промах на 20%. По двум рентгеновским подгонкам агент пересчитал скорости и вывел мёртвое время заслонки: 6,07 с на слой. Следующее напыление дало 6,695 нм (−2,3%), пятое — 6,796 нм (−0,8%). Это одна коррекция по модели «толщина = скорость × (время − мёртвое время)», а не перебор. Случайными правками за две итерации в пол-ангстрема не попасть.

Насчёт «нового решения» согласен: открытия тут нет, и пост на него не претендует. Проверяли другое. Может ли LLM без эталонного рецепта и с закрытым DSL довести реальную установку до результата, который оценивает прибор, а не человек. У аспиранта на это уходит пара недель.

Теперь признания. В одном месте вы отчасти правы, и виноват в этом я. Инструкцию и вакуумную схему я агенту сначала действительно зажал, автор не врёт. Установку «дать минимум информации» я понял слишком буквально. Агент начал по очереди открывать газовые вентили на эмуляторе и смотреть, что будет. Это и есть обезьяна за пишущей машинкой. Только длилось это один прогон на эмуляторе, а не миллион лет. Потом на меня прикрикнули, и я выдал и инструкцию, и схему.

Сам агент тоже отработал не идеально. Он не заметил дрейф скорости по периодам. Ещё он упёрся в калибровку адгезионного слоя, которая не переносится с тонких слоёв на толстые. Всё это есть и в посте, и в препринте. Полные сессии, то есть каждый вызов инструмента и каждый ответ, лежат на Zenodo по ссылке в конце поста.

Вообще-то принято почитать пост сначала, а потом комментарии писать. Ссылка на припринт и на архив с данными в конце поста, там все есть.

Нее, дело в том, что нельзя просто взять и воспроизвести патент. То, что нужна периодическая структура изрутения углерода, агент об этом знал. Но для каждой конкретной установки конкретный рецепт будет совершенно другим. Все вещи очень сильно зависят от железа. Конкретно для нашей системы мы это никогда не публиковали, и DSL закрыт, потому что это наша внутренняя вещь. Так что это он сам, все сам.

Насчет апроксимации, вот график из препринта, как он шел к цели:

По поводу математики - Клод не считает сам, он на каждый чих пишет скрипт на Питоне. Все было сделано в Claude Code CLI.

Идея была посмотреть, что может LLM сама по себе. Если бы я использовал своего "ежедневного агента", с его скилами и RAG, он бы в две попытки уложился.

Ну я им доступ к MCP и не даю, и в ближайшее время не планирую.

В тексте описано все, что дали агенту - целевой период, пара материалов и примерные скорости осаждения. Всё, дальше сам. Идея была в том, что бы посмотреть как LLM справиться в таких условиях. Общие принципы она безусловно отлично понимает, и физику пленок, и вакуумную технику. Был бы DSL чуть проще и вакуумная схема менее замороченная - то и инструкцию давать не пришлось бы.

В препринте и на Zondeo есть все детали и логи.

Да, основная цель — подключить ИИ к системе управления, которую мы продаём.

От аспирантов, конечно, никто не избавляется. Цель была наоборот — промотивировать их, и показать с чем им придётся столкнуться в ближайшем будущем.

1
23 ...

Информация

В рейтинге
311-й
Откуда
Haining, Zhejiang, Китай
Дата рождения
Зарегистрирован
Активность