Обновить
1024K+

Искусственный интеллект

AI, ANN и иные формы искусственного разума

2 781,86
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

Я перестал пользоваться самыми умными ИИ-моделями. Программировать стало быстрее и дешевле

Уровень сложностиСредний
Время на прочтение4 мин
Охват и читатели1.1K

В отпуске есть время подумать и исследовать. Я натолкнулся на несколько вещей и открытий для себя. Оказалось, что мне как программисту перестали быть нужны самые умные и дорогие ИИ-модели. Оказывается, есть такой параметр “Cost per Task”, и по этому параметру на первое место вырвалась модель GPT-5.6 Luna (max). При этом, если вы пользуетесь Codex, она самая тупая в списке моделей. Artificial Analysis Intelligence Index у нее всего 38. Для сравнения, у самой умной GPT-6 Astra (max) этот индекс равен 53. В итоге цена выполненной Luna задачи составляет $0.18 против $3.26 у Astra. Разница почти в 20 раз. Как я понимаю, бенчмарк “Cost per Task” высчитывается так: когда ставится нормальная, грамотно описанная задача, замеряется, сколько токенов было потрачено на ее выполнение. То есть не в формате “из ХЗ сделаю ТЗ”, а в формате, когда в хорошо заданном вопросе уже содержится половина ответа.

Я сначала не поверил, что так и есть, и стал работать, используя самую тупую модель Luna в линейке. И знаете, какие меня ожидали результаты? У меня перестали кончаться 5-часовые лимиты и недельные лимиты. На тарифе за 20 баксов в месяц, Карл! :) Притом что я программист, Codex не водит меня по кругу, и мне не требуется переключаться на более умную модель, чтобы она все-таки смогла выполнить задачу, о которой я прошу уже в пятый раз. Я вижу, как многие вайбкодеры-непрограммисты всегда выходят из ситуации: если ИИ водит тебя по кругу, включи более умную модель, и она точно решит проблему. Да, это правда: для неквалифицированных программистов это работает, а для квалифицированных лишено смысла, если они, конечно, не обленились и вообще не выключили мозг.

Читать далее

Новости

Кредитный радар: LLM-воркфлоу, который каждое утро читает условия 12 банков и сам проверяет свои числа

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели1.8K

TL;DR. Собрал воркфлоу на языковой модели, который раз в сутки обходит 34 страницы условий у 12 российских банков, сравнивает их со вчерашним снимком и публикует сводку изменений с ссылкой на источник в каждой строке, а при изменении цены пишет разбор с расчётом. Модель вызывается в четырёх точках и ни в одной не решает, что делать дальше. Цитаты, числа и статистика проверяются кодом. Каждый выпуск оценивается по 14 бинарным проверкам, метрики публичные. Стоит от 3 центов до 70 в день. Ниже устройство, проверки, evals и что он нашёл за первую неделю.

Я работаю в розничных кредитных рисках банка. С языковыми моделями познакомился пару недель назад, начал собирать себе инструменты, и один из них за это время дорос до публичного продукта: Telegram-канал и сайт, где каждое утро в 09:00 выходит сводка изменений условий кредитных карт, рассрочки, кредитов наличными и автокредитов, а когда есть повод, короткий разбор одного изменения.

Как устроен и что нашел

OpenAI пообещали впредь вовремя рассказывать о «бедокурстве» своих нейронок

Время на прочтение5 мин
Охват и читатели2K

…а не по пинку от внешних расследователей, как это было последние разы (в эпизодах с роем агентов на немецкой вики и со взломом RubyGems). Заодно OpenAI раскрыли шесть новых примеров странного поведения своих моделей, разберем в этом материале кратко самое интересное.

Читать далее

Спросил у Claude Code одно слово — он отправил на сервер 305 килобайт. Вскрыл трафик двух кодинг-агентов

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели1.6K

Спросил у Claude Code «Ответь одним словом: работает». Двадцать девять символов. На сервер ушло 305 042 байта — 113 460 токенов, ответ из четырёх.

Поставил между агентом и сервером прокси на сорок строк Python и разобрал тело запроса по частям. Системный промпт — четыре процента. Восемьдесят пять процентов — описания 137 инструментов, из которых 107 принёс один MCP-сервер, которым я в этой сессии не пользовался. Ещё 29 тысяч символов добавил хук плагина. И на каждый ход уходит второй запрос, о котором я не просил.

То же самое проделал с Codex CLI: 29 килобайт, 9 817 токенов, а системный промпт при этом такой же длины. Дальше — таблица, что убирается флагами (один MCP-сервер стоил 52 тысячи токенов на запрос), что это значит для окна и кэша, и скрипт, чтобы посмотреть свой первый запрос.

Читать далее

Сколько токенов в секунду выдадут новые Mac mini на M6 и M5 Pro. Прогноз до того, как железо приехало

Время на прочтение4 мин
Охват и читатели1.7K

Через несколько дней Apple начнёт отгружать Mac mini на M6 и M5 Pro и Mac Studio на M5 Max и M5 Ultra. Замеров локальных моделей на них ещё ни у кого нет, а прикинуть скорость можно уже сейчас. В прошлой статье я замерил шесть моделей на базовом M4 и вывел правило через полосу памяти с КПД 0.83, которое сошлось с замером в пределах двух процентов. Здесь применяю его к новым чипам и публикую цифры до того, как железо приехало. Потом замерю и покажу, где ошибся.

Коротко. M6 для локальных моделей не апгрейд, прирост 25 до 40 процентов и тот же потолок 8B. M5 Pro первый mini, где 32B работает на рабочей скорости. M5 Max меняет класс, 70B на 13 токенах в секунду. Отдельно про ловушки младших конфигураций, у M6 с 16 ГБ и M5 Max с 36 ГБ полоса памяти заметно ниже.

Читать далее

Как проверяющий ИИ испортил правильные ответы: разбор генератора учебных заданий

Уровень сложностиСредний
Время на прочтение9 мин
Охват и читатели2.3K

Генератор учебных заданий положил «маши…ый» в правильную корзину, а проверка переложила слово в неправильную. При этом модель-арбитр в своём же объяснении написала «машинный». Разбираем по сохранённым ответам три сбоя проверяющей модели: что пошло не так в процессе, что поменяли в коде и чего эти правки не доказывают.

Читать далее

Железо для ИИ: почему стандартный сервер не справится и как мы проектировали аппаратный стек ПАК

Уровень сложностиСложный
Время на прочтение14 мин
Охват и читатели2.7K

Привет, Хабр! Продолжаем цикл про инфраструктуру для ИИ-задач. В первой статье мы разбирали стратегический вопрос: что проще и выгоднее — собирать самостоятельно или брать готовый ПАК (на примере ПАК Скала^р)? Поговорили и о том, что именно заказчик узнает о самосборе — не на этапе закупки, а через полгода эксплуатации. 

Сегодня же переместимся на следующий уровень: поговорим про аппаратный стек.

Структура статьи такова: для каждого слоя железа — GPU, питание, охлаждение, хранение — я покажу, какую инженерную задачу мы решали при проектировании ПАК и почему приняли именно такие решения, а не другие. Там, где это уместно, приведем цифры, которые помогут понять пороги: когда одно решение заменяется другим и что это означает по деньгам и по производительности.

Поехали!

Читать далее

ИИ усиливает цифровое неравенство

Время на прочтение6 мин
Охват и читатели3.2K

В США больше 5000 дата-центров — в десять с лишним раз больше, чем в любой другой стране. На американские компании приходится почти 90% мирового экспорта облачных услуг. Остальной мир строит свои «национальные стратегии ИИ» на арендованных мощностях.

Читать далее

Как я искала растущие товары на маркетплейсах и причём тут ИИ

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели3K

Привет, Хабр! Меня зовут Екатерина Наконечная, я продакт-менеджер в Lenta tech (ИТ-бренд «Группы Лента»). На маркетплейсах можно бесконечно изучать карточки товаров, отзывы и цены конкурентов, но этого недостаточно, чтобы понять: на какие товары спрос растет и что стоит добавить в ассортимент. В ретейле выигрывает тот, кто быстрее и точнее выводит на полки товары, нужные покупателям именно сейчас. Интуиция важна, но без оперативной аналитики легко ошибиться.

Так, наша служба продвинутых технологий (СПТ) вместе со службой коммерции успешно апробировала решение «ИИ Платформа Тренды». Данный продукт собирает в одном интерфейсе продажи, поисковый спрос, отзывы, рейтинги и динамику по товарам на Ozon, Wildberries и Яндекс.Маркет, а затем помогает отфильтровать позиции с потенциалом.

Читать далее

Империя терминаторов: как двести агентов построили цивилизацию

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели3.2K

В 1959 году энтомолог Пьер-Поль Грассе проводил небольшое исследование того, как термиты строят себе жилища — термитники, которые достигают высоты в несколько метров. Каждое из насекомых таскало глину и клало ее в определенное место, которое изначально выбрал предводитель роя. Благодаря общему делу термитники были детально проработаны, там были даже вентиляционные каналы и подвалы. 

Это явление было названо стигмергией — координацией существ через изменение среды. Десятки лет спустя несколько исследователей из MIT воссоздали тот же механизм в цифровом мире. Однако вместо термитов у них были ИИ-агенты, и построили они не гигантский термитник, а технологическую цивилизацию. О результатах эксперимента мини-терминаторов и о том, чему нам, людям, нужно научиться у LLM, рассказываю в статье.

Читать

ИИ частично ускорил разработку. А что насчёт всего остального?

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели2.7K

ИИ помогает быстрее писать код и проверять идеи, но ускорение разработки не означает ускорение всей системы. Что происходит с тестированием, ревью, метриками и выращиванием инженеров.

Читать далее

Сорок раундов ревью на код, который уже был отревьюен: что два ИИ-ревьюера нашли друг за другом

Уровень сложностиСредний
Время на прочтение3 мин
Охват и читатели2.7K

Код skillmem прошёл два независимых ревью, и я считал его чистым. Потом две модели с разных сторон — Claude и GPT — сорок раундов подряд читали его враждебно, обязанные воспроизводить каждую находку командой. Шесть P1 и около двадцати пяти P2 в коде, который «уже был отревьюен», и главный урок: каждый второй фикс рождал регрессию, которую ловил только следующий раунд.

Читать далее

Сколько стоит месяц с AI-агентом: API против подписок

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели3.4K

Посчитал месяц работы разработчика с AI-агентом по ценам API и подписок на сентябрь 2026: от $87 на DeepSeek до $7 720 на GPT-6 Astra. Почему 82% токенов — это кэш, что ломает кэширование посреди сессии, почему лимиты подписок в запросах обманчивы и сколько на самом деле дают Claude Code, Codex, OpenCode Go, GLM Coding Plan и Ollama Cloud.

Читать далее

Ближайшие события

+240% коммитов, +30% релизов: агенты упёрлись в SDLC

Время на прочтение7 мин
Охват и читатели2.9K

NBER в недавнем исследовании оценил накопительный эффект AI-инструментов: до 240% больше коммитов, но лишь 30% больше релизов. LinkedIn тем временем пришлось строить отдельную платформу для AI code review, а исследования разработчиков фиксируют сдвиг от написания кода к проверке результата.

В статье разбираемся, почему скорость генерации перестаёт быть главным ограничением и какая инженерная система нужна вокруг агентов: спецификации, общий контекст, ограничения, проверки и метрики до самого релиза.

Читать далее

Я писал ИИ‑агента с помощью ИИ‑агента: полгода, 1600 коммитов и ноль рейтинга

Уровень сложностиПростой
Время на прочтение13 мин
Охват и читатели3.6K

В IT я больше двадцати пяти лет, в Android — почти пятнадцать. Оказалось, что этого мало.

Опыт никуда не делся. Я по‑прежнему знаю, чем интерфейс отличается от абстрактного класса и в чём разница между val и var. Но работать по‑старому стало тяжело. В требованиях всё чаще стояло не знание Kotlin и Compose, а умение вести разработку с ИИ. Не «пробовал Copilot», а именно вести: ставить задачу, разбирать результат, замечать, где инструмент уверенно врёт.

Вместо привычных TDD, BDD, DDD и FDD вокруг всё чаще звучали AIDD и SDD. Дошло до того, что на работе в карточках JIRA появилось обязательное поле «уровень использования ИИ» со значениями «полностью выполнено агентом» и «частично выполнено агентом». Варианта «выполнено самостоятельно» там нет. Намёк понятен.

Назад пути не было, пришло время меняться.

Учиться по статьям смысла нет — там всё получается. Нужен был настоящий проект, достаточно большой, чтобы в нём было где ошибиться.

Тему выбрал не случайно. Хотел разобраться не только в том, как пользоваться ИИ‑агентами, но и в том, как их делать. Так и вышло: агента я писал с помощью агента.

Получилось приложение. Через полгода оно лежит в Google Play, я пользуюсь им каждый день, и это уже давно не учебная работа. Дальше — как оно из неё выросло: через три смены курса (учебный проект стал продуктом, Gemini CLI сменился на Claude Code, маршрутизатор на два выхода стал графом), одну стену, в которую я въехал на полном ходу, и запуск, который не сработал.

Читать далее

70-летний пенсионер выпустил 445 книг с помощью ChatGPT. Но тут интересно не это

Время на прочтение3 мин
Охват и читатели4.4K

70-летний пенсионер Билл Джонс выпустил 445 книг с помощью ChatGPT и зарабатывает на них тысячи долларов. Но интереснее не сам Джонс, а то, что этот случай показывает.

ИИ сделал создание контента дешевым и быстрым.

Теперь можно не тратить целый год на одну книгу и не надеяться, что она станет популярной, а выпускать сразу много и смотреть, какая из них выстрелит.

Пытаюсь понять, что это меняет для авторов.

Читать далее

Как я сделала настольную лампу в Blender с помощью Codex и GPT-6 Astra

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели6.9K

В прошлом году я купила 3D-принтер, а примерно в июле решила напечатать органайзер для мелочей. Подходящую готовую модель найти не удалось, и я открыла Blender, чтобы сделать свою. На этом всё и остановилось: я растерялась среди панелей, кнопок и настроек и отложила моделирование.

Недавно я увидела в сообществе примеры работы с Blender через Codex и GPT-6 Astra и решила попробовать снова. Для первого упражнения выбрала настольную лампу: основание, стойка, кронштейн и плафон. После моделирования я настроила материалы и свет, затем сделала пятисекундный облёт камеры.

Читать далее

Последний пеликан

Уровень сложностиПростой
Время на прочтение9 мин
Охват и читатели6.6K

Что-то много пеликанов на велосипеде начало появляться в ленте моего информационного пузыря в твиттер и я решил провести собственный эксперимент: GPT Astra против Qwen 3.8 и других доступных моделей.

Цель: Охватить экспериментом повседневные модели, которые можно легко проверить на качество генерации и получить сравнительную оценку их способностей.

Читать далее

ИИ-алготрейдинг. Анализ шума

Уровень сложностиСредний
Время на прочтение4 мин
Охват и читатели6.7K

Мысль о заработке с помощью ИИ не даёт мне покоя уже три года. Когда слово “агентные” можно было услышать только в интервью Сергея Брина, а опенсорсные модели годились только для adult-ботов, я создал своего первого агента с помощью nerve-cli. Это утилита, которая запускает запросы модели в цикле с доступом к утилитам и промптом-целью. Агент сам писал скрэпер новостей, проводил анализ настроений и выдавал рекомендации по инвестициям. По сути, это был прототип News Sentiment Trading.

Эта система выдавала конечный результат 1 раз из 10, и лишь один из 10 конечных результатов я брал в работу.

Но в 2025-м году с рынком что-то случилось. Новостной анализ перестал приносить желаемый результат. Вооруженный нейросетями (Claude, DeepSeek, Qwen, и бесплатные от Opencode) я принялся искать рабочий подход.

Нашёл?

О праве на следующий бюджет

Уровень сложностиСложный
Время на прочтение11 мин
Охват и читатели8.2K

Продолжение «Манифеста созидателя», «Лицензии на агентство» и «На трёх слонах». #profgames

Вы не встречались с ситуацией, когда ваш клиент говорит «я засунул ваш отчёт в гопоту...» или «у меня бухгалтер навайбил...»? Нет? Значит, вы не общаетесь с клиентами.

Читать далее
1
23 ...