Comments 14
Все-таки ChatGPT лучше текста пишет чем Claude
Не буду утверждать обратное, так как из облачных сам пользуюсь в основном Claude и Gemini. В ChatGPT уже больше года не заглядывал.
Рекомендуете для работы с текстами?
Я бы не сказал, что лучше. По-другому. Но у Claude уж слишком узнаваемые паттерны и стиль, в каждой почти статье на Хабре все одинаковое.
Насчёт паттернов и стилей я бы подискутировал. Не у всех есть свой уникальный писательский стиль. В конце концов мы все в массе своей копируем тот стиль письма, который нам кажется наиболее подходящим, из тех, что мы начитали за свою жизнь. И откуда взяться разнообразию стилей, если наиболее частый читаемый контент сейчас это выдачи нейросетей (вольно или невольно)?
Недавно как раз попалось исследование про то, что стиль общения офисных сотрудников между собой изменился под влиянием нейросетей. Они стали как будто промптить друг друга. Эффективность такого общения при этом возрасла, так как люди стали доносить свои мысли намного чётче.
Собственно даже за собой заметил изменение. Если раньше запросы к коллегам больше напоминали запросы в Гугл, т.е. практически простое перечисление ключевых слов и фраз, в надежде получить наиболее релевантный ответ, то сейчас это уже полноценные промпты.
С ответами тоже самое.
Что должен показать локальный агент, чтобы человек с настройкой "не доверять" поставил его на основной телефон, а не на запасной?
Я хотел написать, что надо открыть исходники, чтобы параноик имел возможность сделать себе форк, провести аудит и сделать свою сборку. Но это все есть. Тогда не знаю.
Да, поэтому вопрос и возник. Вроде как код открыт. Документации чуть ли не больше чем самого кода. Даже в Google Play удалось пробиться (а это было то ещё приключение с их системой ревью для такого типа приложения).
Есть конечно ещё сторонний сборщик/магазин F-Droid, который вроде как сам проверяет и собирает, но туда попасть пока не удалось из-за моего стремления к "новизне". Оказалось что у них на сборочном сервере старая версия Gradle, несовместимая с самыми последними. Теперь либо ждать пока они сами обновят, либо как-то инициировать этот процесс, если это конечно возможно.
Поймал себя на мысли, что сам не полезу смотреть код. Но хотел бы, чтобы сообщество посмотрело. Например, я беру проекты, у которых много пользователей, отзывов, разборов. Например, тот же Python/Django. Я не проверял его безопасность, скорее поверил сообществу.
Если я правильно понял, то Вы создали некий вариант Клауд коде лайт для смартфона?, когда говоришь агенту что надо делать в рамках устройства на котором он установлен (найти файлы, оптимизация, прочитать, пересказать, заметки, будильники, все голосом а не тыкаешь не ищешь сам на смартфоне) если так, то идея интересная. Статью лайкнул, но читается чуть запутано, иногда выпадал из контекста.
Примерно так, только на данный момент у агента нет доступа ко всей системе и приложениям. У него свои инструменты, свой планировщик и свои файлы.
А насчёт запутанного прошу прощения, слишком много событий произошло за полгода, всё это пересекалось и накладывалось друг на друга, пришлось сильно сокращать чтобы получилась статья, а не роман. Некоторые детали наверняка были упущены.
Из моего опыта с локальными агентами и верификацией исполнения — доверие создаёт не открытый код сам по себе, а воспроизводимость действий, которую даёт правильный harness (обвязка проверки). Аудит кода — это здорово, но параноик на самом деле хочет ответ на вопрос: «а что именно агент сделал вчера в 14:32, и можно ли переиграть это с тем же результатом?»
Практически это три вещи:
Детерминизм: одинаковый вход → одинаковое поведение (или явная фиксация случайности сидом);
Журнал действий — что вызвал, какие файлы тронул, какой планировщик запустил, желательно в человекочитаемом виде, а не только в логах;
Harness проверки: каждое действие агента прогоняется через обвязку (песочница + верификатор), и права на «реальную» систему выдаются только действиям, успешно прошедшим проверку.
У меня в проектах именно журнал + harness-верификация давали больше доверия у пользователей, чем ссылка на «открытые исходники»: аудит кода — разовая активность, а harness работает на каждом шаге. Кстати, про F-Droid и старую Gradle: можно форкнуть проект, обновить сборку в рецепте и предложить PR — они обычно охотно подхватывают рабочие обновления.
Спасибо, особенно за F-Droid - проверил, и оказалось даже проще, чем вы пишете. Их сервер сборки теперь берёт хеши Gradle из своего же transparency log, и мой там уже есть. То есть препятствие, про которое я писал, похоже, уже снято. Пойду пробовать настоящую сборку.
По трём пунктам:
Журнал есть: в консоли прогона лог с миллисекундами, дерево нод с длительностью и статусом, вход и выход каждой ноды с подставленными переменными. Журналы триггеров и внешних запросов.
Детерминизма нет, сид модели наружу не выведен. Переиграть вчерашний прогон с тем же результатом сейчас нельзя. Можно конечно температуру понизить, но это не совсем то.
Песочницы тоже нет, приложение на Android не может её себе выдать. Вместо верификатора - подтверждение человеком: разрушительное ждёт ответа. В ближайшем релизе ответ будет действовать только на тот вызов, на который его дали: если при возобновлении имя, аргументы или риск не совпали, вопрос задаётся заново.
Круто, что с F-Droid разрулилось! Журнал у тебя сильный — добавил бы только хеши входа/выхода нод, чтобы можно было доказать «было именно это». Детерминизм на Android — боль, но хватит вывести сид + температуру в шапку прогона. А подтверждение с проверкой контекста — на мой взгляд, даже лучше песочницы: ловит не технические косяки, а «агент понял тебя неправильно». Не хватает разве что undo-истории, чтобы откатывать. Жду релиза, напиши как соберётся!
Спасибо! Про сид интересно вышло: проверил после вашего комментария - движок его уже берёт, случайный на каждый разговор, и просто нигде не сохраняет. Так что записать его в шапку прогона вместе с температурой несложно. Повторит ли тот же сид тот же ответ на этом движке - пока не мерил, но обязательно попробую.
Хеши входа и выхода - хорошая и дешёвая идея, записал.
Про F-Droid отпишусь, когда соберётся.
Я писал ИИ‑агента с помощью ИИ‑агента: полгода, 1600 коммитов и ноль рейтинга