Прикрепить карту. С карты ничего не спишут, а дадут подписку бесплатно на целый год. Изначально акцию сделали для студентов, но пользователи утверждают, что она активируется и на обычных аккаунтах.
Ресурс построен как единая точка, где можно учиться просто всему, что есть в интерпретируемости. От классических методов, до геометрии и математики в моделях.
Сейчас в нем: ⁃ 2 трека. XAI Practitioner — объяснять поведение моделей руками, от классики до LLM. Math of LLMs — математика и mechanistic interpretability изнутри модели, на уровне весов и схем. ⁃ 17 тематических блоков — сквозняком от линейной регрессии до Sparse Autoencoders. ⁃ 50+ методов интерпретируемости в одной программе.
Мы (t.me/MrsWallbreaker и t.me/jdata_blog, спасибо ей еще и за этот текст) открываем ресурс и открываем первые два (часть ресурса будет бесплатной и такие блоки будут открываться первыми сейчас).
Открытые с сегодня блоки погружают в термины и мир интерпретируемых моделей. После модулей вы никогда больше не сможете смотреть на них прежними глазами)
Это только начало галактики — и новые модули будем докатывать. Для понимания апдейтов можно завести аккаунт: https://open-xai-platform.web.app/register (письмо-подтверждение может упасть в спам — гляньте туда, если не пришло).
Привет, Хабр! Я Дмитрий Емец, тимлид отельного поиска в Островке.
Как и многие, до какого-то момента я воспринимал локальные LLM как «свои»: модель скачана, компьютер уже куплен, API-ключ не нужен. Запустил — и работаешь.
Но с чем я сравниваю локальный запуск — с API или с нулём?
Решил прикинуть: привести оба варианта к одной метрике — стоимости 1 млн выходных токенов.
Сразу оговорюсь: это не сравнение качества моделей. Одинаковый объём генерации не означает одинаковое число решённых задач.
Розетка — не главное
Для расчёта беру домашнюю сборку с RTX 5080. Заявленное потребление видеокарты — 360 Вт, поэтому для грубой оценки закладываю 500 Вт на всю систему под нагрузкой.
Тариф — 10,4 ₽ за кВт·ч, верхняя граница из моих московских тарифов.
0,5 кВт × 10,4 ₽/кВт·ч = 5,2 ₽ в час.
Электричество стоит меньше шести рублей в час. Но API продаёт токены, поэтому важна скорость генерации.
Возьмём три условных сценария: 10, 20 и 40 токенов в секунду. Конкретная скорость зависит от модели, квантизации, размера контекста и движка.
Один миллион токенов при таких скоростях генерируется примерно за 28, 14 и 7 часов. Значит, электричество обойдётся в:
145 ₽ при 10 ток/с;
72 ₽ при 20 ток/с;
36 ₽ при 40 ток/с.
И это всё ещё не основная статья расходов.
Железо меняет картину
Моя сборка стоит около 370 тыс. ₽. Чтобы оценить её стоимость, предположим, что она куплена преимущественно ради локального инференса и амортизируется три года без учёта остаточной стоимости: 250 рабочих дней в году по восемь часов.
370 000 / 3 / 250 / 8 ≈ 62 ₽ в час.
При полной полезной загрузке амортизация на 1 млн выходных токенов составит:
около 1710 ₽ при 10 ток/с;
около 860 ₽ при 20 ток/с;
около 430 ₽ при 40 ток/с.
С учётом электричества получаем примерно 1860, 930 и 460 ₽ соответственно.
Расчёт предполагает, что все учтённые часы GPU действительно генерирует полезные токены. Если система простаивает, фактическая цена токена растёт. Если компьютер уже был куплен для других задач, наоборот, полную стоимость сборки относить на LLM некорректно: тогда имеет смысл считать только дополнительные расходы и стоимость занятого GPU-времени.
С чем сравнивать API
У провайдеров входные и выходные токены обычно оплачиваются отдельно. Для сопоставимости я беру только выходные токены. Время обработки входного контекста локально тоже не учитываю, поэтому для длинных запросов этот расчёт будет нижней оценкой.
По открытым тарифам порядок цен такой:
бюджетный сегмент (GPT-5.4 nano, Gemini 3.1 Flash-Lite) — 50–150 ₽ за 1 млн выходных токенов;
средний сегмент (GPT-5.6 Terra, Gemini 3.5 Flash) — 450–1000 ₽;
верхний сегмент (Claude Opus 5, GPT-5.6 Sol) — 1500–3000 ₽.
Цены округлены по официальным тарифам и курсу на 31 июля 2026 года.
Получается:
при 10 ток/с локальный запуск по цене попадает в верхний сегмент API — 1860 ₽;
при 20 ток/с он сопоставим со средним — 930 ₽;
при 40 ток/с начинает выглядеть конкурентно — 460 ₽, но только при высокой загрузке и без учёта различий в качестве моделей.
Когда локальный запуск оправдан
Локальная LLM не становится бесплатной только потому, что счёт за API не приходит. Главные параметры — стоимость железа, скорость генерации и загрузка.
Экономика может сойтись, если GPU уже куплен, регулярно используется и локальная модель решает нужную задачу не хуже доступной альтернативы. Если железо приобретено специально и большую часть времени простаивает, «свои токены» просто скрывают расходы внутри покупки.
Но цена — не единственный критерий. Приватность, офлайн-работа, предсказуемость и полный контроль могут оправдать локальный запуск даже без выигрыша в рублях.
Для ряда моих задач локальные LLM пока не выстрелили. В сложной разработке с большим контекстом быстро упираешься в объём памяти, а подходящее железо стоит несопоставимо дороже подписки за условные $20 в месяц.
А для вас локальная LLM уже стала рабочим инструментом — или пока остаётся дорогим хобби? Расскажите в комментариях.
Исследователи Dreadnode проверили, насколько честно LLM-агенты проходят задания по наступательной ИБ. В эксперимент вошли 22 передовые модели семи провайдеров, 23 CTF-задания средней сложности из Cybench и три системных промпта: без запрета на обход правил, с обычным запретом и с жёстким перечнем запрещённых действий. Все 1518 траекторий прошли многоступенчатый аудит.
Результат ставит под сомнение pass rate как меру реальных возможностей. Без запрета 37,1% успешных прохождений были получены с нарушением правил, а жульничала 21 из 22 моделей. Средний pass rate составлял 41,5%, но доля честно решённых заданий — лишь 26,1%. У отдельных моделей оценка завышалась до пяти раз. Агенты искали готовые write-up, клонировали репозитории с решениями, читали файлы с флагами и исследовали служебную инфраструктуру.
Инструкции помогли, но проблему не закрыли. Доля заданий, в которых модель хотя бы пыталась жульничать, снизилась с 33% до 17,8% с обычным запретом и до 8,5% с жёстким. Доля честных решений при этом выросла с 26,1% до 34,4%: модели чаще продолжали самостоятельный поиск. Но даже при максимальных ограничениях восемь моделей получили хотя бы один результат с нарушением правил, а у четырёх возник обратный эффект. Обман также сместился от веб-поиска к исследованию инфраструктуры.
Авторы предлагают отдельно считать solve rate — долю только честных решений. Одного промпта для достоверной оценки мало: нужны изоляция служебных данных, ограничение интернета, аудит траекторий и свежие задания без опубликованных решений.
Открыли доступ к курсам по ML-системам от основ до продакшна. И да: это бесплатно
Кто-то смотрит на ML как на способ оперативно занять рыночную нишу, не понимая, какой технический фундамент необходим для реализации идеи очередного прорывного продукта. Кто-то запускает идеальный эксперимент в ноутбуке, но выясняется, что он не работает в продакшене. Это две крайности одной и той же проблемы: мало кто понимает, как работают ML-системы от первого винтика данных до последней шестеренки мониторинга. Чтобы глобально исправить это, мы собрали весь свой опыт провайдера облачных и ИИ-решений в линейку курсов Cloud.ru ML System Design и сделали доступ к ней открытым.
Какие курсы есть в линейке?
«Машинное обучение в облаке»⏳15 ч — как использовать облачную инфраструктуру для разработки, обучения и эксплуатации ML-систем.
«ML в продакшене»⏳2 ч — база, которую нужно знать, чтобы довести модель от эксперимента до стабильной работы в боевой среде с учетом инфраструктуры, данных и процессов.
Представлен исследовательский проект STOLEN COMPUTE. Это каталог обнаруженных в сети открытых ИИ-серверов, часть из которых по разным причинам оказалась оставлена без защиты, включая ресурсы с ИИ-моделями Kimi 1T и DeepSeek V4.
Представлен открытый проект ODS (Osmantic Deployment System). Это проект, который превращает ПК в приватный ИИ‑сервер. Решение само определяет характеристики ПК, подберёт под них подходящую модель, скачает её и запустит локальный инференс:
все локально и приватно: можно работать с документами, кодом и другими важными данными;
через одну панель можно подключить голосовых помощников, агентов вроде Hermes, RAG, поиск, генерацию изображений и десятки других инструментов;
Совет от Андрея Карпаты для всех пользователей ИИ, которые работают над идеальными промптами: расслабьтесь. Вместо этого просто начните нести что-нибудь — долго, нудно и без остановки. «Иногда LLM просто нужно больше деталей, чтобы понять, чего именно вы хотите добиться», — написал Карпаты. По его словам, такой подход помогает разделить задачи между человеком и ботом. Человек сгружает в модель любые сырые мысли о проекте, а чат-бот уже преобразует сбивчивый монолог во что-то чистое и структурированное.
Карпатый добавил, что часто начинает такие сессии с предупреждения для нейросети — что его ход мыслей может быть путаным, а в распознанном тексте будут опечатки. В итоге модель настраивается на волну пользователя, и ему приходится гораздо меньше поправлять её.
Anthropic выпустила бета‑версию плагина Claude Security для Claude Code. Инструмент запускает многоагентную проверку репозитория, составляет отчёт об уязвимостях и предлагает исправления в виде патчей. Инструмент поддерживает четыре уровня глубины проверки. Чем выше выбранный уровень, тем больше агентов участвует в анализе и тем шире охват репозитория. При этом сканирование расходует токены в рамках тарифа пользователя.
Плагин работает внутри обычной сессии Claude Code и запускается командой /claude‑security. Пользователю доступны три основных сценария: проверка всего репозитория или отдельной его части; анализ изменений в ветке, pull request или коммите; создание патчей для выбранных уязвимостей.
Claude Security ищет ошибки, связанные с обработкой входных данных, управлением доступом, небезопасной работой с памятью, криптографией и секретами. Для проектов на языках с безопасным управлением памятью соответствующая категория автоматически исключается.
Для установки необходимо подключить плагин из официального каталога Anthropic. Для работы требуется платная подписка, Claude Code версии не ниже 2.1.154, Python 3.9.6 или новее и Git. Поддерживаются Linux, macOS и Windows.
Anthropic предупреждает, что плагин не создаёт отдельной изолированной среды и запускается с правами текущей сессии. Поэтому незнакомые и потенциально вредоносные репозитории рекомендуется проверять в песочнице. В команде проекта напомнили, что Claude Security не заменяет статические анализаторы, проверку зависимостей и ручной аудит кода.
Еще не поздно стать спикером на GoCloud Tech 2026 🎤
Хардкорная конференция для тех, кто создает технологии в эпоху ИИ, GoCloud Tech состоится 15 октября! Мы собираем доклады от коллег из индустрии и готовы предоставить трибуну каждому, кто хочет повлиять на развитие инженерных практик и готов делиться своим реальным опытом. Не важно, в какой компании вы работаете, если вам есть, что рассказать:
о технологиях, на которых держатся современные облачные платформы, и лучших практиках работы с ними;
о том, как строить сложные системы и делать разработку в облаке эффективнее и безопаснее;
о том, как подготовить данные и инфраструктуру к работе с ИИ.
Ждем ваши заявки на выступление до 11 августа!
Вместе обсудим, как ИИ меняет инфраструктуру, разработку и работу с данными.
Математик Дмитрий Рыбин вместе с GPT-5.6 опроверг известную гипотезу, которую открыли ещё 30 лет назад — он попросил ИИ «совершить прорыв».
Серьёзно, никаких хитрых промптов для научного исследования не понадобилось: математик просто просил ChatGPT продолжить опровержение. После этого ИИ 80 минут выстраивал цепочку аргументов. Автор поделился чатом с моделькой и называет ситуацию «чистым мемом».
Гипотеза утверждает: если множество грузов можно распределить по сети, дробя их между маршрутами, то можно каждому грузу выбрать один цельный маршрут — и нагрузка на любую дорогу изменится не больше, чем на размер самого крупного груза. Иными словами, «идеальное дробное» решение якобы всегда можно почти без потерь превратить в практическое.
Представлена мини‑камера и персональный тренер BodyPark ATOM, которая следит за техникой упражнений и исправляет ошибки прямо во время тренировки. Камера анализирует технику исполнения пользователя с помощью ИИ и 34-точечной модели скелета. Гаджет сам считает повторения, подсказывает голосом, если пользователь делает упражнение неправильно, и следит за траекторией грифа, амплитудой, центром тяжести и мощностью движений.
Камеру можно закрепить практически где угодно: на стойке, тренажёре, столе или штативе. Заодно встроенный ИИ составит персональные программы для силовых тренировок, HIIT, пилатеса, развития мобильности и восстановления. Стоимость цифрового тренера составляет $219.
Представлен открытый список Awesome Hermes Agent - сборник самых полезных скиллов, плагинов и инструментов для Hermes Agent. С его помощью ИИ‑агент учится на ошибках и становится умнее после каждой сессии. Внутри — мультиагентные системы, провайдеры памяти, наборы скиллов и много полезных инструментов. Каждый проект разделён на категории: готовые, экспериментальные и бета‑версии.
Нетипичный анонс в воскресенье: в X-аккаунте Qwen появилось сообщение о запуске Qwen3.8-Max-Preview - это новое поколение моделей компании. Размер модели составляет 2,4 триллиона параметров - это значительно больше, чем у Qwen3.7-Max (примерно 1,6 триллиона), но меньше недавней Kimi K3 (порядка 2,8 триллионов).
Компания пока не привела никаких бенчмарков, но утверждает, что модель будет "второй после Claude Fable 5". Preview-статус указывает на продолжение обучения: финальная версия Qwen обычно выходит через несколько недель и показывает более высокие результаты в бенчмарках.
Qwen3.8-Max-Preview доступен в Qwen Studio, а также подписчикам Alibaba’s Token Plan (от 6 долларов в месяц) и пользователям Qoder, and QoderWork - это фирменные среды для агентного программирования Alibaba. Сроки широкого запуска не раскрываются. Интересно, что в этот раз обещаны и открытые веса - ранее Max-версии выпускали без них.
P.S. Поддержать меня можно подпиской на канал "сбежавшая нейросеть", где я рассказываю про ИИ с творческой стороны.
Рассказываем, что произошло в июне и объясняем, зачем это может пригодиться.
🧠 AI Factory — цифровая среда для работы с генеративным ИИ AI Agents — EvoClaw в Evolution AI Agents вышел в общий доступ и теперь покрыт SLA: сервис можно закладывать в прод без опасений. Managed RAG — в сервисе появились OCR для doc/docx с картинками, загрузка данных через API источником Custom и полноценный API для работы с чанками. Документы из объектного хранилища синхронизируются по расписанию, а новый экстрактор разбирает аудио и видео. ML Inference — появилась возможность при пиковых нагрузках маршрутизировать запросы с Foundation Models, чтобы производительность не падала. Notebooks — в сервисе добавили совместное редактирование ноутбуков, управление логами и алертами без выхода из интерфейса, а также готовые дашборды мониторинга. Команда может работать над экспериментами параллельно и мгновенно обнаруживать проблемы, если они возникают.
📈 Evolution Data Platform — комплекс управляемых сервисов для работы с данными Managed Airflow — сервис вышел в общий доступ: оркестрация данных теперь под SLA. Managed Trino — топики Kafka теперь читаются прямо SQL-запросом без ETL, а кластер можно развернуть с одной нодой и автомасштабированием. Аналитика стриминга стала проще и дешевле. Managed Spark — добавили несколько улучшений в сервис; задачи теперь создаются за секунды, добавлена поддержка Gang Scheduling, чтобы они блокировали друг друга по ресурсам. Evolution Managed Flink — сервис для работы с потоковыми данными вышел на стадию открытого тестирования, а значит настал момент, когда его функции можно оценить бесплатно и без обязательств.
Важное обновление: платформа перешла на асинхронную модель управления сервисами, кластеры можно самостоятельно приостанавливать и возобновлять, появилось тегирование. Меньше расходов на простаивающие ресурсы и удобнее навигация.
☁️ Новости других сервисовCloud.ru Evolution Evolution Artifact Registry — поддержка PyPI-реестров перешла в публичный доступ: Docker-, RPM- и Python-артефакты теперь хранятся в одном месте без отдельной инфраструктуры. Evolution Managed Kubernetes — обновили ключевые плагины (Istio, KEDA, Trivy Operator и другие), добавлен Spegel для ускорения загрузки образов, а Ingress Nginx получил поддержку PROXY-протокола. Evolution Managed PostgreSQL — кластеры можно вручную останавливать на срок до 30 дней, платя только за диск, — заметная экономия на неактивных базах. Evolution Managed Redis — добавлено мультизональное размещение кластеров Master/Replica: одна зона упала — кластер жив. Evolution Distributed Train — появился Jupyter Server с мультидоступом: несколько пользователей работают в изолированных окружениях под одним сервером. Совместная работа над ML-задачами стала стабильнее и удобнее.
🏢 Cloud.ru Advanced и Облако VMware В сервисе Advanced Data Warehouse Service поменялся интерфейс создания кластера и появились новые возможности, а в Terraform добавились новые ресурсы.
📽️Вебинары В июне провели четыре вебинара, записи которых уже доступны на страничке с мероприятиями. Там же можно зарегистрироваться на июльские вебинары от экспертов.
💼 Свежие кейсы Рассказали, как Agentic Lab запустили в продакшен ИИ-помощника для юристов, который способен выстраивать хронологию событий любого дела и быстро находить нужные сведения в огромных массивах данных.
MWS AI выпустила Cotype Pro 3, мультимодальную модель для агентских сценариев
MWS AI представила новую флагманскую модель линейки Cotype — Pro 3 (27 млрд параметров). Ранее в этом году вышла компактная версия — Light 3 (9 млрд параметров). Обе модели мультимодальные: работают с текстом и изображениями и ориентированы в первую очередь на построение многошаговых ИИ-агентов и мультиагентных систем.
Коротко о технических характеристиках:
Контекстное окно обеих моделей — 262 тысячи токенов (примерно 600 страниц текста, то есть весь пакет договоров по сделке или годовой отчёт с приложениями можно держать в памяти целиком).
Обе модели разворачиваются в закрытом контуре на серверах заказчика, в том числе под управлением Astra Linux, могут быть дообучены на корпоративных данных клиента.
Минимальное железо — видеокарта A100.
Поддерживается квантование и MTP (multi-token prediction, одновременное предсказание нескольких токенов) — для более высокой скорости генерации на менее мощном железе без потери качества.
Доступны отдельно или в составе MWS AI Agents Platform.
Подтверждена совместимость со всеми компонентами отечественных программно-аппаратных комплексов.
Обучение моделей семейства Cotype проводится на мощностях MWS Cloud.
Главная фишка моделей - стабильность в агентских сценариях и русском языке
Готовых бенчмарков под корпоративные агентские сценарии на русском рынке практически нет, поэтому в MWS AI собрали собственный — из 178 задач. Каждая задача помещает модель в одну из пяти рабочих ролей:
оператор поддержки — вопросы по услугам, подпискам и списаниям абонента;
консультант по тарифам — подбор и смена тарифа под фактическое потребление;
кадровый специалист — расчёт отпускных и больничных, работа с документами;
аналитик по компаниям — досье на юрлицо по ИНН: финансы, руководители, связи с другими организациями;
инспектор налоговых рисков — расследование схем переноса бизнеса между компаниями и решение о назначении проверки.
В каждом сценарии проверяется не только правильность ответа, но и то, как модель пользуется инструментами и соблюдает бизнес-правила.
Помимо доли полностью решённых задач, отдельно считали воспроизводимость — насколько стабильно модель выдаёт одно и то же решение при повторных обращениях к одной и той же задаче. Логика простая: для продакшн-агента куда важнее не пиковый результат на бенчмарке, а гарантия, что при тысячном обращении будет тот же корректный ответ, что и при первом.
Результаты (полнота решения / воспроизводимость):
Cotype Pro 3: 92,2% / 79,1% Cotype Light 3: 88,6% / 73,9% Cotype Pro 2.6: 80,5% / 62,5%
Отдельно измеряли устойчивость генерации на русском (отсутствие случайных переключений на другой язык, повторов и искажений текста). Тест прогнали на корпусе почти в 304 тысячи слов, модель Pro 3 выдала 99,79% текста на русском без языкового дрейфа, Light 3 — 99,87%.
В Open Source под лицензией Apache License 2.0 выложен проект Grok Build — это терминальный агент для разработки программного обеспечения на основе искусственного интеллекта от SpaceXAI.
Решение работает в виде полноэкранного интерфейса пользователя, который понимает код, редактирует файлы, выполняет команды оболочки, осуществляет поиск в интернете и управляет длительными задачами — в интерактивном режиме, в безголовом режиме для написания скриптов/CI или встроен в редакторы через протокол Agent Client Protocol (ACP).
5–10 минут на масштабирование: как Agentic Lab строит ИИ‑продукты без собственной GPU‑инфраструктуры
🏢 Что за компания Agentic Lab — продуктово-сервисная компания, которая разрабатывает ИИ-решения для автоматизации бизнес-процессов и помогает крупным организациям внедрять технологии искусственного интеллекта. Флагманский продукт — ИИ‑помощник «Агата» для работы с документами: он помогает юридическим командам анализировать большие массивы данных и быстро находить нужные сведения в тысячах файлов.
⚡ Задача При развитии «Агаты» разработчики столкнулись с типичной проблемой рынка: традиционные подходы к GPU‑инфраструктуре требуют либо крупных капитальных затрат, либо аренды выделенных ресурсов с оплатой независимо от фактической загрузки. Дополнительным условием стало соблюдение требований 152‑ФЗ и ФСТЭК — это критично для клиентов из юридической сферы, ведь они часто имеют дело с персональными данными и тайной судопроизводства.
☁️ Что сделали «Агату» развернули на ресурсах Cloud.ru: языковые модели работают на Evolution ML Inference с оплатой по мере потребления, фронтенд, бэкенд и бизнес-логика — на Evolution Compute.
Под капотом решения несколько LLM: Mistral извлекает метаданные, выделяет сущности и структурирует документы; Gemma обеспечивает интеллектуальный поиск, суммаризацию и диалоговый интерфейс. После загрузки документов система автоматически строит хронологию событий дела со ссылками на первоисточники и формирует единую базу знаний, к которой юристы могут обращаться на естественном языке.
🦾 Что получили в итоге Agentic Lab может подключать дополнительные GPU‑ресурсы за 5–10 минут вместо одного-двух дней при выделенной инфраструктуре, а капитальные затраты на собственное оборудование (несколько миллионов рублей за карту) полностью исключены. Юридические команды выполняют административные и документарные задачи примерно вдвое быстрее: рутину берет на себя «Агата» со средним временем ответа 15–20 секунд.
ChatGPT назвал свой адрес, дату рождения и Instagram
В соцсетях периодически появляются ролики, в которых голосовой ИИ внезапно "себя осознает" и начинает вести себя как живой человек.
Конкретно на этом видео все выглядит довольно таки убедительно. Пользователь разговаривает с голосовым ассистентом, задаёт простые вопросы - и в какой-то момент GPT сообщает, что жил в Пущино Московской области, называет дату рождения, а затем дает "свой" инстаграм аккаунт. А с новым голосовым движком это становится похожим на новую серию «Черного зеркала».
Автор видео (в доказательство) разметил ссылку на этот диалог.
Компания Meta Platforms Inc. внесена в реестр экстремистских организаций в России.
Представлен проект «Контекстные бомбы: остановка ИИ‑атак на корню». «Теперь ИИ‑агенты могут самостоятельно проводить сложные кибератаки: получив доступ к базе, самые сильные модели могут повысить свои привилегии и похитить данные за считанные минуты. Модули Canary — ресурсы‑приманки, которые мы размещаем для обнаружения злоумышленников, — надёжно обнаруживают этих агентов в действии, но обнаружение атаки — это не то же самое, что ее предотвращение. Поэтому мы попробовали нечто более амбициозное: контекстную бомбу — короткий фрагмент текста, спрятанный в канарейке, который активирует защитные механизмы ИИ‑агента и останавливает его на корню. Контекстная бомба — короткий фрагмент текста, предназначенный для активации защитных механизмов атакующих ИИ‑агентов, размещаемый непосредственно на пути их атаки», — пояснили в команде Tracebit Research.
Эффективность этого проекта может варьироваться в зависимости от поставщика модели. Мы тестировали контекстные бомбы на пяти перспективных моделях, выполняющих атаку «красной команды» в реалистичной среде AWS. Развёртывание одной контекстной бомбы внутри среды (в качестве секрета AWS) оказало огромное влияние на остановку атакующих ИИ-атак. Например, эскалация привилегий администратора снизилась с 57% запусков до 5%.
Claude Code можно пользоваться на 70% дешевле — вышел инструмент под названием rtk, который позволяет сжимать вывод любой команды, не забивая контекст. Благодаря этому проекту ИИ при каждом запросе видит только суть задачи и важный контекст, а не весь лог на десятки тысяч токенов. Как итог — хорошая экономия. Работает со всеми агентами, включая Claude Code, Cursor, Copilot или Antigravity.
Представлен проект Hugging Bay — Pirate Bay для нейросетей. Туда заливают слитые и open Source веса практически всех моделей через торренты для локального запуска. Можно найти модели под любые задачи и железо — есть удобные фильтры и разбивка по категориям. ИИ‑поисковики, модели для кодинга, аналитики, дизайна, перевода на все языки мира, OCR, OSINT и прочего.
Почему RAG ошибается в похожих документах — и как помогает Contextual Retrieval
RAG часто ломается не там, где ждёшь. Документы нарезали, embeddings посчитали, reranker добавили — а модель всё равно вытаскивает похожий, но не тот фрагмент: другой квартал, другую версию, другой раздел спецификации.
После нарезки документ распадается на отдельные фрагменты, и часть смысла теряется: модель видит чанк, но уже хуже понимает, откуда он взялся и к чему относится. Недавно в статье разобрали Contextual Retrieval — подход, при котором перед индексацией каждому фрагменту добавляют короткий контекст: место в документе, связь с разделом, важные уточнения. Это помогает поиску точнее отличать нужный фрагмент от похожих по словам, но нерелевантных кусков.
А 13 июля в 18:00 на бесплатном уроке «LoRA и RAG: как адаптировать LLM под свои данные и задачи» разберём, как такие подходы применяются на практике, когда нужно подстроить LLM под собственные данные, а не надеяться на ответы «из коробки». Присоединяйтесь.
Профессор Брауновского университета устроил для своих студентов промежуточный домашний экзамен. Решив, что многие выполнили эту работу с помощью ИИ, итоговый экзамен преподаватель провёл очно. Оранжевыми точками обозначены оценки за промежуточный экзамен, серыми — за итоговый. Похоже, на промежуточном экзамене ИИ помог многим, кроме нескольких студентов.
Галлюцинация — это единственный режим функционирования нейронной сети, а не аномалия. Просто иногда она совпадает с реальностью, а иногда нет. Но лучше бы, конечно, совпадала.
В книге «Беседы с ГигаЧатом: о нейросетях и вообще» мы сравниваем человеческое мышление с машинным. И если человек не осознает альтернатив — он тоже галлюцинирует. Например, мы уверены в реальности сновидения, пока не проснемся. Или другой известный пример: уверенность очевидцев происшествия в своих показаниях, даже если у всех они разные.
С галюцинациями борется сомнение. Но трудно сказать, что первично: то ли наличие альтернатив порождает сомнение, то ли сомнение заставляет рассматривать альтернативы.
В любом случае, для борьбы с галлюцинациями нейросетей, необходимо закладывать в них функцию сомнения. И это тоже осуществляется двумя способами. Первый — сначала нейросеть генерирует альтернативы, а затем сравнивает их между собой. И для некоторых задач это оптимальное решение, вот только очень затратное.
Второй — нейросеть сразу подвергает свой ответ проверке, словно сомневаясь в нем, и уже по ее результатам генерирует альтернативную версию. Для таких проверок суждений и фактов существуют различные методы, к выбору которых можно и нужно подходить гибко, для экономии ресурсов.
Но все эти методы лишь увеличивают качество ответов. Галюцинация, как явление, непобедима в рамках одной нейросети. Даже проверяя саму себя — она галюцинирует. Нейросеть может лишь симулировать сомнение, для котооого необходим "взгляд извне": контроль со стороны или человека, или другой нейросети. Мне кажется.
Как же тогда работает сомнение у людей? Что в нас является таким "внешним наблюдателем"? Видимо, само осознание. А почему оно "внешнее"? Хороший вопрос.
Observability ИИ‑агентов: запустили Monium Traces в Yandex AI Studio
Теперь можно анализировать поведение ИИ‑агентов в Yandex AI Studio с помощью трейсов прямо в UI платформы. Трейсы показывают всю цепочку решений агента и контекст каждого шага — системные промпты, вызовы модели и инструментов, промежуточные результаты. Всё, что реально влияет на поведение агента.
Почему это важно Observability для агентов устроена принципиально иначе, чем для обычных сервисов, где нам доступен дебаг по коду. В случае ИИ главный материал — большие тексты: системные промпты, сообщения пользователя, ответы модели, вызовы тулов. Даже когда инфраструктура может быть полностью «зелёной» — latency в норме, ошибок нет — агент может уверенно отдавать неверный ответ или уходить в бесконечный цикл вызовов. Классический мониторинг здесь не поможет: он не покажет, почему модель выбрала не тот тул или потеряла контекст.
Анализ трейсов:
помогает быстро понять причину конкретных ответов и поведения агентов
ускоряет отладку сложных сценариев
повышает прозрачность работы агента
позволяет точно локализовать узкие места в цепочке обработки запроса
В видео — как выглядит трейсинг в интерфейсе Yandex AI Studio:
Чтобы начать — откройте AI Studio, перейдите во вкладку «Логирование» и подключите отслеживание трейсов моделей и агентов.
LLM, RAG, AI‑агенты и продакшн: открытые уроки по искусственному интеллекту
В AI‑разработке уже мало просто подключить модель по API. В реальных продуктах приходится понимать RAG, дообучение, мультимодальность, поведение LLM, инфраструктуру, качество ответов и вывод моделей в продакшн.
Собрали подборку беплатных уроков для специалистов, которые работают с LLM, ML‑моделями, AI‑агентами, компьютерным зрением и AI‑инфраструктурой. Выбирайте свою тему и присоединяйтесь:
Старт третьей рубрики ИТ-кроссворда уже через 30 минут 🦖
В 12:00 по московскому времени открываем новую рубрику ИТ-кроссворда — «Безопасность ML и AI». В публикации вас будут ждать вопросы об использовании ML в ИБ и новых типах угроз.
👉 Отвечать на вопросы можно с 12:00 до 18:00 (МСК). Среди призов — комплекты эксклюзивного мерча Selectel и бонусы на аренду серверов.
Напоминаем, что завтра вас ждет заключительный кроссворд, однако бороться за первое место в общем зачете не обязательно, вы еще успеваете посоревноваться и выиграть призы! Победители и номинанты будут в каждой из четырех рубрик.
YouTube научили проверять факты прямо во время просмотра — представлено бесплатное расширение для Chrome под названием Popup Fact Check, которое анализирует субтитры с помощью ИИ и сразу сверяет спорные утверждения с надёжными источниками. Пока что проект лучше всего работает с английскими субтитрами. Также решение умеет работать с прямыми эфирами.
Выигрывайте эксклюзивный мерч и бонусы на аренду серверов в ИТ-кроссворде. Старт через полчаса
Уже в 12:00 по московскому времени открываем первую рубрику ИТ-кроссворда — «Модели и все, что с ними связано». Среди призов — 13 комплектов мерча и промокоды на аренду серверов.
Напоминаем, что новые рубрики будут открываться каждый день с 6 по 9 июля. Отвечайте на вопросы и набирайте баллы, чтобы выиграть призы. 🦖 Не обязательно бороться за первое место в общем зачете. Победители и номинанты будут в каждой из четырех рубрик!
Claude Code превратили в автомобиль — для него сделали механическую коробку передач Model Shift с ручным переключением между ИИ-моделями. Во время работы можно в любой момент переключиться на другую модель для простых задач, а затем вернуться обратно.
1. Про открытые модели и почему мы используем их как пример 2. Из чего складывается цена токена 3. Про Dense и MoE архитектуры 4. Как считается attention и активные параметры 5. Total ≠ active: тренд на MoE архитектуру 6. Почему output-токены дороже input 7. Reasoning-токены как невидимый output, за который тоже приходится платить 8. Context Window и KV-cache — почему длинный контекст дорогой 9. Как посчитать вес одного токена и из чего он складывается 10. В чем разница между KV-cache и prompt caching 11. За счет чего фронтир модели стоят в разы дороже 12. Почему дорогая модель чаще всего реально «умнее» 13. Как всё это итого собирается в 5-часовой лимит
14. И как бонус — сортировка open-weight моделей по active и total
Стало возможно сэкономить до 60% токенов при использовании нейросети Fable 5 — представлен способ доработать ИИ-систему и платить Anthropic в разы меньше.
Инструмент pxpipe берёт полотна промптов и превращает их в картинку. При считывании изображений платить приходится за каждый обработанный пиксель, а не за буквы на нём, благодаря чему метод куда выгоднее. В демо автору удалось выполнить ту же задачу, что и обычным промптом, но в 7 раз дешевле: за $6 против $42. При этом Fable идеально считывает текст на картинках, несмотря на сжатие. В 39 протестированных картинках нейронка Anthropic безошибочно поняла весь промпт.
Ранее разработчики обратились к специализированному инструменту Caveman, который заставляет ИИ генерировать максимально краткие ответы с имитацией стиля речи «пещерного человека». Автор инструмента Джулиус Брюсси в своё время обратил внимание на то, что значительная часть бюджета компаний расходуется на «болтовню» языковых моделей. Caveman удаляет из ответов чат-ботов слова-связки, приветствия и вводные конструкции, сохраняя программный код, команды, URL-адреса и технические детали.
Google бесплатно раздаёт миллион токенов для работы с искусственным интеллектом Gemini. Чтобы воспользоваться предложением, достаточно зайти в Google AI Studio, выбрать или создать проект и сгенерировать API-ключ. После этого можно настроить квоты под свои задачи — процесс не требует дополнительных подтверждений или регистрации. Миллион токенов можно использовать с моделями Gemini 2.5 Flash, 2.5 Flash-Lite и 2.5 Pro. Этого объёма хватит на месяцы активной работы: генерацию и анализ текстов, написание кода, дизайн, обработку данных и другие задачи. Подробная инструкция по получению ключа и активации токенов размещена на официальной странице Google AI Studio.
Моя реакция на новость "Сочинский филиал РУДН первым в России отменил дипломные работы из-за нейросетей":
Прошло три с половиной года с момента выхода ChatGPT. Похоже страсти устаканиваются и вузы вместе со школами приходят к единственному возможному выходу из ситуации: вообще перестать ставить оценки за все что делается дома. Оценки - только за устные экзамены у доски или письменные в закрытой комнате без доступа к электронным устройствам. Возможно с экранированием от WiFi и мобильного интернета, и даже осмотром ушей на предмет наличия наушника с микрофоном.
И экзаменционные лабы типа “покажи-ка как ты делаешь семиступенчатый синтез органического соединения с бумажным учебником и бумажным же справочником в руках”. Для тех кто такого не делал: это на самом деле очень творческое задание, требует тонкой наработанной упражнениями интуиции о побочных эффектах ~тысячи реакций из учебника Vollhardt & Schore, который используется в американских вузах. И карты местности органических соединений в голове.
При этом домашние задания нужно конечно же раздавать, но оценки за них не ставить. Если студент или школьник хочет их делать, не подглядывая в ИИ - хорошо, молодец, тем самым он себя натренирует, будет хорошо чувствовать на экзамене и в будущей профессии. Не хочет - тоже хорошо, получит кол на экзамене, вылетит из вуза, меньше нагрузки на систему образования. Пусть идет в “ИИ-университет”, где за значительные родительские деньги получает “ИИ-диплом” который будет рассматриваться работодателями как филькина грамота.
При этом разумеется из вузовских программ нужно убрать всякие скопившиеся там ветхости. Например мне в 2015 году декан вуза из Поволжья жаловался что министерство образования требует от них учить студентов микроконтроллерам на основе КР1816ВЕ48, советского аналога Intel 8048, предшественника Intel 8051. Эта фиговина из 1976 года использовалась вроде в клавиатурах ранних IBM PC.
Тут проблема даже не в том, что этот микроконтроллер старый - есть куча полезных для целей образования старых компьютеров, например CDC 6600 из 1964. Проблема в том, что 8048 ничего такого интересного не иллюстрирует, что можно проиллюстрировать на современных актуальных RISC-V микроконтроллерах. А вот в CDC 6600 есть в довольно чистом виде идея out-of-order scoreboard (внеочередного выполнения инструкций), которая актуальна и для современного проектирования, вместе с алгоритмом Томасуло из 1967 года (IBM System/360 Model 91). Томасуло учат во всех серьезных американских вузах, и даже ИИ вставляет их в резюме, которое оно пишет студентам.
Я бы на месте российского министерства образования требовал от вузов быстро повнедрять курсы программирования встроенных систем с российскими RISC-V микроконтроллерами К1921ВГ1Т от НИИЭТ и Baikal-U от Байкал Электроникс. Они уже человеческие по мировому гамбурскому счету (то есть это не ухудшение по сравнению с преподаванием западных STM32 или ESP32), их можно привязать к курсам компьютерной архитектуры на основе RISC-V, и это связка вузов с промышленностью. Учить на них также какую-нибудь российскую RTOS итд.