Pull to refresh
15
Антон Гребенников@TxN

Программист

0,1
Rating
7
Subscribers
Send message

Да, вполне возможно, просто за полтора часа тестирования уже улетело 500М токенов (в основном cache read, но всё равно)

Модель быстрая, пачка субагентов выжирает токены как танк соляру

Deepseek Harness. Тестовая задача - Reverse Engineering + создание порта игры "Механоиды". 100+к строк кода в проекте, плюс гора документации. Делал все на дипсике, в основном 4 pro.

Очень шустрая. 250 токенов в секунду в час-пик, вне пика похоже будет еще быстрее. Минус - даже при таких тарифах на такой скорости деньги с баланса улетают прямо на глазах, просто потому что она успевает сделать в три раза больше прошки за то же время.

Качество пока не успел оценить, но на первый взгляд как минимум не хуже 4 pro.

Очень интересное направление.

Тоже пробовал заниматься чем-то подобным, но с игрой "Механоиды" 2004 года.

Дипсик вооруженный ghidra очень бодро (но, к сожалению не без ошибок) разбирает декомпилированный экзешник, восстанавливает логику, иногда лазит в дизассемблированный код, чтобы разобраться в методах, которые декомпилировались криво.

В целом, таким образом удалось восстановить практически всю логику игры. Причем, чем больше восстановлено, тем бодрее и точнее идёт процесс, так как нейронке уже есть на что опираться. Стартовой информации было маловато: имена классов и некоторых методов, на логи игра оказалась не очень щедрой, и весь код был спрятан в exe-файл, со статической линковкой части библиотек.

За неделю тем же дипсиком на основе этого анализа получилось завести кривой-косой прототип на .Net + OpenGL, который используя ресурсы оригинальной игры, может худо-бедно загрузить игровой мир, пустить в него тех самых механоидов и заставить их летать. Всё на основе информации из реверс-инжиниринга. К сожалению, в архитектуру дипсик не смог, да и я в погоне за быстрым результатом был не слишком к нему строг, и код мягко говоря попахивает. Но, думаю что за месяц работы можно было бы сделать полноценный порт с технологий 2002 года на современный стек, используя только оригинальный exe-файл в качестве источника информации.

Жаль, времени пока что нет довести это до ума. А когда время появится, боюсь что задача станет совсем тривиальной, и никого этим уже не удивишь.

Начал с Grok 4.5, ужаснулся с расходов, ушел на GPT Luna.

Проблемы были что на гроке, что на луне. Разоряться на фейбл или сол не стал, потому что эта штука жрет токены миллионами, за несколько часов экспериментов ушло 130М токенов (большинство Read и Cache Read, но всё равно). Модельки не самые крутые, согласен, но еще несколько месяцев назад подобный уровень был топом, и его вполне должно хватать для порученных задач.

Главный цикл периодически просыпается, видит что задачки зависли, спокойно это констатирует и идёт спать дальше. В следующей итерации это повторяется. Говоришь ему явно "отмени задачи, раз они зависли, и запусти заново", отвечает, что сам ничего отменить не может, и надо открывать карточку задачи и отменять ее вручную.

И всё это мучительно долго. Задачи длятся по два часа, при том, что агент в курсоре подобную бы выполнил ну минут за десять, на тех же моделях.

В общем, в реальных задачах завести быстро не получилось, разбираться нету сил, времени и желания. Подожду полгода, пока вернусь к классическим агентам, они как раз стали достаточно зрелыми, и с ними уже приятно работать.

То ли лыжи не едут, то ли я делаю что-то не так, но с агентными задачами полно проблем (проверяю на винде)

Они зависают, сваливаются в состояния, когда по ним не происходит никакого прогресса, куча проблем с вызовом инструментов, приходится спрашивать в главном чате "ну как там с деньгами задачей", чтобы понять, движется она или нет. Часто задачи зависают с проблемами на Acceptance. Задача не принята, но и работы по ней не продолжаются, она просто висит, пока не спросишь, почему движение по задаче остановилось. То есть, для работы типа "вот несколько доков небольших, агрегируй инфу по ним и актуализируй ее по состоянию проекта" годится весьма условно.

Но как концепт штука интересная. Видимо, технология еще сыровата, надо подождать.

Да уж, индустрия еще в зародыше, а ее сразу обкладывают ограничениями и регуляциями, чтобы не дай б-г не начала развиваться.

Даже сейчас нижний порог в 1млрд параметров это крохи, что-то уровня небольших узкоспециализированных нейронок под конкретную задачу. А этот порог в законе останется на долгие годы, если его примут (наша бюрократия очень неохотно откатывает результаты своих потуг), что парализует развитие этой индустрии силами отдельных исследователей и малых команд. Через десять лет это будет выглядеть откровенно издевательски - модели такого размера школьники будут на телефонах тренировать чисто по фану.

Короче, как обычно, "закон о поддержке", таящий внутри пилюлю с цианидом для поддерживаемой отрасли.

Fable конечно получше был, на тех задачах, на которых получилось его проверить, но только вот по ценам на API за одну задачу сжигалась стоимость базовой месячной подписки z.ai

Очень даже достойная модель, разве что медленная. Перешел пока на нее, может потом кто-то из топов подсуетится, а может наоборот, начнут по указке правительства бодро стрелять себе в ноги и вводить доступ по паспорту. Ну, невелика потеря, китайцы по ощущениям отрыв сократили до трех месяцев, не критично.

Ох, один запрос в курсоре, и сразу минус 12 баксов. Это с учетом того, что субагенты на бесплатной модели сделали львиную долю работы по предварительному анализу. Но баги нашла, в том числе такие, которые бы мне однозначно в будущем крови бы попили, так что польза есть. Но по карману бьет уже очень ощутимо, для повседневных задач точно не годится.

Будет интересно попробовать ее на задачах, с которыми предыдущие SOTA модели не справились. Например, поиск пути на базе Sparse Voxel Octree. Опус смог родить что-то похожее на правду, но на практике работало всё крайне криво. Может быть эта модель все же справится.

Согласен, картельный сговор уже не получится, китайцы ворвались на рынок с моделями, которые отстают от силы на полгода, но с ценами на порядок ниже. Но если это признать, карточный домик может и посыпаться, сейчас все держится на хайпе и обещаниях баснословной прибыли инвесторам, после того как все подсядут на иглу вайб-кодинга. Но пока что успехи в этом направлении довольно скромные, революция может и случилась, но не такая масштабная, как ее пытались представить.

Заход с направления токенмаксинга и роев агентов похож на попытку масштабировать спрос, раз не получилось подсадить миллиард человек на нейронки, то хоть с имеющихся миллионов собрать побольше денег в обмен на умеренный рост эффективности. Но баланс тут поймать будет сложно, судя по всему сейчас поиском предельной цены и заняты. Отваливать провайдеру ии зп полноценного разработчика не готовы даже крупные корпорации, тем более при избытке предложения на рынке труда. Замена должна быть дешевой, иначе никто на нее не перейдет.

Вот это токенмаксинг. Столько сжечь не каждый может, это правда.

Но вот если подумать, а сколько эта лафа еще будет длиться? Сейчас пока что вайб-кодинг активно субсидируется, чтобы подсадить на иглу, потому что первая доза (почти) бесплатно. Чуть позже, когда все плотно подсядут, выстроят процессы под ии, гаечки закрутятся, и внезапно окажется, что вайбкодинг стоит не комфортные 200 бачей в месяц, а вот эти самые 40 килобаксов (ну пусть даже 10, не суть важно). И что с этой новой эрой случится? Не придётся ли снова вспоминать навыки писать код руками, или уходить на дешевые и глупые модели?

Ну и опять, уже в какой раз, выпячивание количества наслопленных строчек кода есть, а результата нету. Снова SaaS-посредник, которых на рынке уже целая гора? Он точно рынку нужен? Нейронки очень хороши в шаблонных задачах, но ценность шаблонной реализации шаблонного сервиса как будто не сильно выше нуля. А применение в нестандартных задачах уже требует очень активного вовлечения разработчика, хотя бы в роли наставника.

Я активно использую курсор, этот инструмент сильно изменил мою работу. Но это всё еще не панацея, даже детально прописанные скиллы и субагенты все еще спокойно генерируют откровеннейший слоп, и сжиганием миллионов токенов это можно исправить только частично. Но по рыночной ставке это делать никто бы не стал. Ведь когда нейросетка за минутную правку списывает с твоего счета сумму, на которую можно купить большую и вкусную шаурму, неволей задумываешься об экономии токенов. Зато удорожание подписки не разрушит налаженный рабочий процесс, а лишь мотивирует его еще сильнее оптимизировать.

А вот с наблюдением, что плата за кэш это какая-то обдираловка, полностью согласен. Вполне возможно, что самим провайдерам это обходится сильно дешевле, а такой ценой за кэш обеспечивается основная маржинальность при использовании по API.

Главное вовремя спохватиться и начать минимизацию последствий. Так или иначе уязвимы все, проходили ли тренинги или нет. Но осведомленность конечно сильно снижает шанс попасться в ловушку, но не до нуля.

Расчет в том, чтобы вызвать панику и отключить критическое восприятие. Реально на этом этапе никакого урона еще нет. Раскрутив жертву на панику, они начинают следующую стадию, подавая мнимую "руку помощи", которая дополнительно припугнув жертву последствиями, предложит "план спасения", который весь урон и нанесет.

Если получилось на этом этапе опомниться и прервать общение с мошенниками, спокойно поменять пароли и сбросить активные сессии в атакуемых приложениях, то это успех.

В подавленном состоянии, или в загрузе/запаре, в стрессе, человек часто теряет бдительность и может попасться на довольно примитивный развод и ловушку. И от этого не застрахован как скуф-подпивасий, закончивший мыслительную деятельность после девятого класса сельской школы, так и кандидат наук в самом расцвете карьеры.

Это сложно принять, пока сам с таким не столкнешься, а как столкнешься, так и не расскажешь никому, стыдно. Я так тоже один раз на стрессе попался на самый примитивный фишинг. Хорошо что быстро спохватился, и отделался перевыпуском банковской карты.

Просто помните про это, и держите в голове, что у каждого бывают моменты, когда даже самый тупой развод может подействовать.

Просто очень интересно, насколько рьяно будут эти требования исполняться. От этого многое зависит, хватит ли простой настройки раздельного туннелирования, или для доступа к нейронкам, ютубу, связи с теми кто за забором, придётся играть в хакермена, и создавать изолированные цифровые личности, чтобы случайно не скомпрометировать дырку в заборе, ведущую вовне.

Если бы ПК мог загружать какую-то базовую диагностическую систему чисто на кэше, без памяти вообще, в этом был бы практический смысл. Хотя бы для того, чтобы выдать подробное человекочитаемое сообщение об ошибке на экран в случае проблем с памятью.

Теорий на ум приходит много, от банальных, до шизоконспиративных, но будто бы исход у них у всех един - в лучшем случае будет хуже, чем сейчас, в худшем не будет совсем никак и никому.

Чуть позже узнаем, по какому пути пойдет наш инстанс мультиверса, пока вообще ничего непонятно, кроме того, что завтра стабильно хуже, чем вчера. Но чувство такое, будто бы всеми элитами во всем мире овладел коллективный психоз. Ну а всем кто ниже от этого достаётся.

О, круговая порука подъехала. Теперь вся российская айтишка будет вынуждена закапывать и уничтожать всё, иначе их уничтожат раньше других. В том числе это будут те, кто возмущался блокировкам, потому что иначе уволят, а работать больше негде.

Я очень долго пытался сохранять хоть каплю оптимизма, но меры последних месяцев это что-то запредельное, иначе как попыткой уничтожить вообще какой-либо потенциал развития, я объяснить не могу. Это уже не китайский фаервол, это уже кванмён. В стране, где еще недавно был сильнейший айти сектор.

Так в итоге, что действительно полезного было создано при этом? В публичных гитхаб репозиториях в основном обвязка описанной в статье системы для вайб-кодинга. Есть и какие-то утилиты, но не сказать, что это что-то фантастическое и заслуживающее особого внимания.

Коммиты тоже, очень много однострочных фиксов тестов, каких-то двиганий документации туда-сюда, микрофич. Как будто подобное обычно объединяют в один коммит, а не делают всё кучей.

Молодец, развлекается как хочет, может быть из этого что-то стоящее и родится, но в целом, пока не вызывает каких-то эмоций.

Фотошоп иногда при каком-то из вариантов экспорта может накинуть в пнг-файл размером 200 кб еще 30+ мб метаданных. Не скажу из-за чего конкретно это происходит, но встречал подобные файлы не раз.

1
23 ...

Information

Rating
3,834-th
Location
Новосибирск, Новосибирская обл., Россия
Date of birth
Registered
Activity