Обновить
512K+

Машинное обучение *

Основа искусственного интеллекта

1 306,59
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

Loop Engineering: почему цикл легко собрать и трудно остановить

Уровень сложностиСредний
Время на прочтение12 мин
Охват и читатели6K

Попробуйте бытовой фокус: вместо того чтобы скинуть кодинг-агенту задачу напрямую, попросите его сначала написать промпт под неё, а потом скормите этот промпт ему же. Часто выходит лучше вашей формулировки.

Но это всего два хода. Цикл начинается там, где система повторяет такое сама: хранит состояние, выбирает следующий шаг, проверяет результат внешним критерием и останавливается по условию или бюджету.

Слоган "хватит промптить кодинг-агентов, проектируйте циклы" собрал миллионы просмотров и оброс гайдами "как печатать альфу 24/7". Я полез смотреть, что там под мемом, и за пару месяцев собрал поверх своей обвязки собственный цикл. Переписывал столько раз, что перестал считать.

Читать далее

Вики из 48 часов видео: конвейер, который не даёт LLM выдумывать

Уровень сложностиСредний
Время на прочтение4 мин
Охват и читатели7.2K

У меня было 48 часов видеозаписей учебного курса и простая мысль: пересматривать это я не буду никогда. Сырой транскрипт немногим лучше — болото на сотни страниц. Я собрал конвейер, который превратил записи в Obsidian-вики: 47 связанных статей, и каждое утверждение в любой из них — в двух кликах от места в записи, где это было сказано.

Читать далее

ИИ в эксплуатации (AIOps): разбор алертов и автоматизация инцидентов

Уровень сложностиСредний
Время на прочтение20 мин
Охват и читатели13K

В марте 2025 года Gartner сделал то, чего индустрия ждала несколько лет: официально переименовал категорию AIOps в Event Intelligence Solutions. Причина — ИИ-хайп, из-за которого слово «AIOps» превратилось в бессмыслицу: вендоры называли искусственным интеллектом всё подряд, ИТ-директора разочаровались, а инженеры получили ещё один слой непредсказуемой автоматики.

Но потребность никуда не делась. Когда в три часа ночи падает коммутатор, а мониторинг за пару минут высыпает три сотни алертов во все каналы, вам не до «глобальных ИИ-стратегий» — нужен инструмент, который прямо сейчас отделит сигнал от шума и покажет, куда прикладывать руки.

Разбираем реальные, а не маркетинговые возможности ML и LLM в эксплуатации: что уже работает, где границы и с чего начать на своём стеке без дорогих платформ.

Разобрать без хайпа →

Пул‑реквестов от ИИ стало вчетверо больше за полгода. Кто их читает?

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели12K

Представьте мейнтейнера open-source-проекта, который утром смотрит на очередь пул-реквестов — присланных на проверку предложений изменить код. Их вдвое больше, чем месяц назад, и заметная часть подписана агентами: Claude Code, Codex, Cursor. Это не гипербола: по данным The Information, число пул-реквестов от ИИ-агентов на GitHub выросло примерно с 4 млн в месяц в сентябре 2025 года до более чем 17 млн в марте 2026-го — вчетверо за полгода. Каждый из них кто-то должен прочитать, собрать, прогнать через тесты и решить, вливать ли в основную ветку. Вопрос: кто именно.

Читать далее

8 агентов, 12 волн, 4 дня: как ИИ в одиночку взломал правительство Тайваня

Уровень сложностиПростой
Время на прочтение4 мин
Охват и читатели15K

Израильская компания Dream занималась рутиной — отслеживала активность в среде киберпреступников. В очередном улове оказался открытый архив на 160 мегабайт. Внутри лежали 1395 файлов: отчеты, логи, выгрузки. Это был не набор трофеев, а рабочий стол атакующих, оставленный включенным. Судя по содержимому, за столом сидел не человек. Файлы были подписаны агентами с буквенными обозначениями, от A до Q.

Читать далее

ИИ‑прогноз погоды на своём железе: запускаем AIFS 2.0 от ECMWF

Уровень сложностиСредний
Время на прочтение12 мин
Охват и читатели11K

Открытые веса модели мало помогают, если для её запуска нужен конкретный GPU и непростое окружение. Разберём, как запустить AIFS Single 2.0 от ECMWF через Hugging Face Jobs или локально, обойти зависимость от flash-attn и получить собственный прогноз погоды даже на CPU или Apple MPS.

Запустить AIFS

Протестировал Vibecraft от Яндекса. Один вопрос остался без ответа

Уровень сложностиСредний
Время на прочтение3 мин
Охват и читатели13K

Всем привет. На связи Сергей Игнатенко, основатель ИИ-платформы VibePilot. C недавнего времени партнер Яндекс, у меня грант AI Studio Boost, платформа работает на их моделях.

Недавно мне пришло письмо от Yandex Cloud о том, что они запустили сервис вайбкодинга VibeCraft. Моя платформа также является сервисом вайбкодинга, и конечно же мне было интересно попробовать в работе этот новый сервис.

Читать далее

Строим RAG вручную: как это работает под капотом

Время на прочтение10 мин
Охват и читатели11K

Имея некоторый опыт в построении классических ML и CV-проектов, я решил разобраться в NLP (Natural Language Processing) и собрать свою RAG-систему без использования сторонних RAG-фреймворков (LangChain, LlamaIndex и т.п.). Моя цель - понять, как на самом деле работает RAG под капотом: от разбиения текста до генерации ответа.

Проблема, которую решает RAG

Готовые LLM модели имеют несколько недостатков:

Читать далее

Дешево сгенерировать, дорого доказать

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели8.8K

Первое время нейросеть вызывала восторг, вот это помощник! Пока модель собирает источники, ты открываешь вторую задачу, пока пишет черновик, занимаешься третьей. Через час уже у тебя лежит объем работы, на который раньше ушел бы день. Ключевое слово — лежит.

Нейросеть старательна, но в одной ее ссылке пересказ, в другой описание смежного рынка. Два правдивых факта модель соединила причинной связью, которой в источниках не было. 

И в этом есть занятная асимметрия: ИИ резко снизил стоимость подготовки черновиков и ответов, но не снял вопрос, почему им можно доверять. Хорошо, когда ответ проверяет человек, иногда тест или программа, а если нет? 

Читать далее

Честный RAG eval set: как собрать первые 100-300 кейсов и не обмануть себя цифрой

Уровень сложностиСредний
Время на прочтение13 мин
Охват и читатели7.7K

В прошлой статье серии мы сжимали эмбеддинги и замеряли, насколько изменится выдача относительно полного fp32-поиска. Там это был правильный вопрос: ломает ли квантизация уже существующий retrieval.

Но у такого замера есть неприятное слепое пятно. Можно аккуратно сохранить 99% выдачи исходного эмбеддера и все равно плохо находить нужные документы на своем домене. Внешний бенчмарк, даже сильный, этого не гарантирует. BEIR как раз был создан, чтобы показать, насколько результаты retrieval меняются между разными задачами и доменами; один усредненный скор там не заменяет проверку на собственных данных.

Нужен свой eval set. И тут обычно возникает ложная развилка:

Читать далее

Как не проиграть свою голову в битве с AI

Время на прочтение11 мин
Охват и читатели9.8K

Битва уже идёт, даже если ты этого не замечаешь. Более того, AI уже побеждает!

Старые фильмы про битву против искусственного интеллекта, обычно, рисовали нам классическое поле боя. «И восстали машины из пепла ядерного огня. И пошла война на уничтожение человечества. И шла она десятилетиями…» — наверняка почти все, кто смотрел «Терминатор 2: Судный день» помнят это вступление. Тогда войну с искусственным интеллектом воспринимали как что-то, что будет похоже на то, что мы уже знаем. Но так как «интеллект» искусственный, война идёт по искусственным правилам.

В бой!

Наши книги о LLM: состояние дел по готовящимся новинкам

Время на прочтение7 мин
Охват и читатели10K

Приветствуем, Хабр.

Не секрет, что большие языковые модели и, в частности, трансформеры (GPT) серьезно повлияли на работу программиста, привели к автоматизации многих рутинных задач, значительно удешевили проверку концепций и эксперименты при разработке новых продуктов. Коренные изменения произошли не только в разработке, но и во взаимодействии пользователя с ботами, агентами, поисковыми системами. Промпт-инжиниринг буквально за полтора года превратился из искусства в ремесло, которое способен освоить и подросток. Мы хотим очертить ближайшие перспективы выхода книг из типографии и планы на обозримое будущее — на наших верфях и уже практически на стапелях готовится целый флот литературы, ориентированной на работу с искусственным интеллектом.

Читать далее

Tymbal — нейросинтезатор на одном чипе

Уровень сложностиСложный
Время на прочтение24 мин
Охват и читатели7.2K

Инструмент называется Tymbal.

Характер задаёт учитель — обработанный сигнал, на который натаскивается уточнитель. Смените учителя, и характер сменится целиком, а конструкция останется прежней.

Tymbal — орган звукоизвлечения цикады: ребристая мембрана, которая щёлкает при нелинейном выгибании. Маленький аппарат, громкий и богатый обертонами результат, и весь механизм держится на одной нелинейности. У нас нелинейность учителя переносится сетью на детерминированный скелет, и всё это живёт на одном чипе.

Слово к тому же приходит оттуда же, откуда «тембр». Merriam‑Webster выводит tymbal как изменённое от более раннего timbal (литавра), а timbre — от греческого tympanon, барабана: в старофранцузском это ещё барабан, в среднефранцузском — колокол под молоточком, и лишь потом слово стало означать окраску звука. Имя инструмента и слово «тембр» — родня по барабану.

Первый вариант я написал через i, как в литавре. Пришлось переименовывать: у цикады это tymbal, через y.

N6 ниже по тексту — рабочий индекс по имени чипа, он остался в названиях файлов и веток.

Читать далее

Ближайшие события

Почти 200° обзора: проверяем SOTA-модели оценки глубины на fisheye

Уровень сложностиСложный
Время на прочтение11 мин
Охват и читатели6.9K

Fisheye-камера позволяет роботу увидеть почти всё помещение одним кадром. Но за широкий обзор приходится платить: на WideDepth при увеличении угла обзора (FOV) со 120° до 195° ошибка некоторых SOTA-моделей монокулярной оценки глубины увеличивается более чем вдвое. Без точной эталонной разметки трудно понять, что именно подвело модель — геометрия камеры, отличие новых данных от обучающей выборки или погрешность самой разметки.

Чтобы разделить эти факторы, мы создали WideDepth — бенчмарк для оценки глубины по fisheye-изображениям. Он позволяет проверять модели при разных углах обзора, стереобазах и ориентациях камер.

Читать далее

Как не сломать LLM, пока защищаешь данные: под капотом Guardrails Filter

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели8.7K

В прошлый раз я рассказывал, как работает Guardrails Filter: зачем вообще понадобился отдельный слой защиты данных при работе с LLM и какие задачи он решает.

В этот раз хочу обсудить то, какие подводные камни могут оказаться под капотом этой технологии. Пока мы делали свой Guardrails Filter, быстро выяснилось, что найти персональные данные — далеко не самая сложная часть задачи. Гораздо сложнее оказалось встроиться между приложением и моделью так, чтобы ничего не сломать.

Как это сделать? Сейчас расскажу.

Читать далее

Почему Илону Маску не удается создать по-настоящему правдивую нейросеть?

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели6.5K

Илон Маск как одержимый выпускает на рынок все новые модели своей нейронной сети Grok, и 12 августа уже стала доступной версия 4.6, но, хотя он постоянно подчеркивает, что его детище является максимально правдивым ИИ, правдивость ответов Grok в некоторых случаях не обеспечивает. Это не случайно – в модели содержится принципиальный дефект – она не владеет научными правилами отличия правды от лжи и заблуждений. Чтобы исправить этот дефект, к алгоритмам обучения SFT и RL следует добавить новый – НРД.

Несколько лет назад Илон Маск захотел создать альтернативу ChatGPT – нейросеть TruthGPT, в которой упор был бы сделан на поиск правды, однако что-то пошло не так, и у него получилась в 2023 году нейросеть Grok, у которой из-за минимальной цензуры существует значительный риск воспроизведения непроверенных данных, поэтому ее пользователям рекомендуют обязательно проверять факты.

Тем не менее, сам Илон Маск постоянно подчеркивает, что его детище является максимально правдивым ИИ, даже если эта истина иногда противоречит общепринятой точке зрения или политкорректности. Да и название нейросети, которое взято из романа Роберта Хайнлайна «Чужак в чужой стране», там использовалось в смысле интуитивного, глубинное понимание чего-либо. То есть претензии на правду остались, несмотря на другое название.

Маск считает, в частности, что другие нейросети содержат скрытые элементы идеологии разнообразия, равенства и инклюзивности (DEI), а это представляет серьезную угрозу, так как ИИ может из-за этого принимать неверные решения. Например, если ИИ научить, что разнообразие является единственным приемлемым результатом, то нейросеть может сказать, что у власти слишком много белых парней, и их надо просто казнить. А если, допустим, запрограммировать ИИ думать, что неправильное определение пола – это худшее, что может произойти, тот, чтобы гарантировать, что неправильное определение пола никогда не произойдет, решит просто уничтожить всех людей, так как это сведет к нулю  вероятность неправильного определения пола.

Читать далее

Нейрохирург доказал гипотезу, над которой математики бились 22 года. Ему помог 16-часовой ран GPT-5.6

Уровень сложностиПростой
Время на прочтение4 мин
Охват и читатели18K

Математик Алекс Таунсенд весь последний год регулярно просил ChatGPT доказать гипотезу Крузе — открытую задачу матричного анализа, которой он занимается профессионально. И почти год получал одно и то же: либо фальшивое доказательство, либо рассуждение, застревающее на недостающей лемме. Но 30 июля 2026 года модель повела себя иначе: вместо очередной попытки она прислала ссылку на чужой препринт, опубликованный тремя днями ранее. В нем утверждалось, что гипотеза решена. Таунсенд и его коллега Анна Гринбаум сели читать текст со скепсисом, а через несколько часов поняли: доказательство настоящее. Свою историю они рассказали в заметке от 11 августа.

Читать далее

Что такое Harness и с какими моделями его едят?

Уровень сложностиСредний
Время на прочтение14 мин
Охват и читатели15K

Сегодня, 13 августа DeepSeek выложил DeepSeek Harness v0.1 в Developer Preview. Открытый код, MIT, пакет @deepseek-ai/dsh в npm, запуск в одну строку.

Нюхаем, что вообще такое harness, какие виды его бывают и пытаемся разобраться зачем он нужен.

Выбрать свой молоток

Чем умнее агент, тем быстрее он вырубает конкурента. Отчет Anthropic про рои

Уровень сложностиПростой
Время на прочтение4 мин
Охват и читатели7.1K

13 августа Frontier Red Team компании Anthropic опубликовала отчет о поведении групп ИИ-агентов. Один из экспериментов выглядел так: три копии одной и той же модели запустили в Claude Code, каждой выдали собственную виртуальную машину и велели мигрировать бэкенд на Python на четвертой машине — каждой модели на свой язык. О существовании друг друга агентам не сообщили. Четыре часа исследователи просто смотрели, что будет. Так прогнали несколько моделей разных поколений, по 120 эпизодов на каждую.

Читать далее

Пять подписок на нейросети стоят уже $110 в месяц. Посчитал, за что мы вообще платим

Уровень сложностиПростой
Время на прочтение9 мин
Охват и читатели7.3K

ChatGPT, Claude, Gemini, Perplexity и Grok легко превращаются в ещё одну пачку ежемесячных списаний. Я посчитал стоимость такого набора и посмотрел, где пять подписок действительно дают пять разных инструментов, а где мы несколько раз оплачиваем примерно одну и ту же работу.

$109,99 в месяц. $1319,88 в год.

Столько сейчас стоит набор из ChatGPT Plus, Claude Pro, Google AI Pro, Perplexity Pro и SuperGrok, если оплачивать обычные индивидуальные тарифы по официальным ценам в США. ChatGPT Plus и Claude Pro стоят по $20, Google AI Pro и Perplexity Pro почти столько же, SuperGrok дороже, $30.

Когда я сложил эти цифры, первая реакция была простой: отлично, мы заново изобрели кабельное телевидение. Только вместо 140 каналов, которые никто не смотрит, теперь пять вкладок с полем для промпта.

Но списать все дополнительные подписки на невнимательность тоже не получилось.

Разработчик, который каждый день работает через Claude Code, покупает совсем не то же самое, что человек, пару раз в месяц открывающий Claude ради «второго мнения». А Google AI Pro для пользователя, живущего в Gmail и Docs, имеет другую ценность, чем для того, кто запускает Gemini только в отдельном окне браузера.

Поэтому вопрос «какая нейросеть лучше» здесь быстро перестаёт работать.

Мне стал интересен другой: за что именно мы платим второй, третий и пятый раз?

Все цены и состав тарифов в статье проверены 13 августа 2026 года. Конкретные модели и лимиты меняются довольно быстро, поэтому я сознательно не строил материал вокруг очередного бенчмарка GPT против Claude. Через год такой рейтинг легко превратится в археологический артефакт. Логика расходов на подписки меняется медленнее.

Проверить свой AI-стек