Обновить
512K+

Машинное обучение *

Основа искусственного интеллекта

1 259,62
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

Decision-модели изнутри: как устроены Jev, Clef, pplx-decider, Strands Decider, Laya и GLiDE

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели4.9K

15 сентября TypeSafe выпустила Jev и назвала её первой моделью класса System One. Jev получает состояние системы и набор типизированных вопросов, а возвращает распределение вероятностей по допустимым ответам. Весь ответ считается за один прямой проход, без генерации токенов.

За 16 дней вышли ещё пять реализаций той же идеи: Clef и Clef-flash от Cloudflare, pplx-decider-v1-27b от Perplexity, Strands Decider 2B от AWS, Laya от Convai Innovations и GLiDE от Fastino. Миллион решений у самой дешёвой из них стоит 12 долларов, у Claude Sonnet 5 в роли классификатора — 700.

Разбираем, как устроены все шесть моделей, что показывают независимые замеры и что проверить перед запуском в продакшен.

Читать далее

Новости

как OpenAI, Anthropic, Google и xAI борются за модели, облака и разработчиков

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели4.6K

OpenAI, Anthropic, Google и xAI уже конкурируют не только качеством моделей. Настоящая борьба идёт за вычислительные мощности, собственные чипы, присутствие в облаках, цену API и экосистемы, в которых остаются разработчики.

В этой статье разберём, кто из них сильнее по каждому из этих направлений, почему конкуренты одновременно становятся партнёрами и поставщиками друг для друга, и почему в 2026 году преимущество всё чаще определяется не очередным релизом модели, а инфраструктурой, которую невозможно быстро скопировать.

Читать далее

C++ в 2026-м: память, прод, игры, Rust и ИИ — зачем учить язык, который невозможно знать целиком

Уровень сложностиСредний
Время на прочтение40 мин
Охват и читатели4.7K

C++ умеет ровно то, за что его одновременно любят и боятся: дает разработчику почти полный контроль над происходящим, позволяет выжимать из программы максимум производительности, но при этом оставляет возможность столкнуться с ошибкой, которая проявится только через несколько часов или даже дней работы. На C++ строят высоконагруженные системы, движки, embedded-решения и инфраструктуру, хотя рядом уже много лет развиваются Go, Rust и другие языки, которые обещают сделать разработку проще и безопаснее.

Так зачем учить C++ в 2026 году? Насколько важно программисту разбираться в памяти и устройстве процессора? Почему сильных C++-разработчиков по-прежнему мало, хотя язык преподают в университетах? Где без C++ действительно сложно обойтись, а где бизнесу выгоднее выбрать Go и при необходимости добавить серверов? Сможет ли Rust потеснить C++, как нейросети меняют работу программиста и почему современному разработчику уже недостаточно просто знать синтаксис?

Я, Александр, автор телеграм-канала «Shulepov Code», поговорил с Александром Малковым — C++-разработчиком, бывшим сотрудником Яндекса и CTO компании «Вертикаль». Александр также ведет свой телеграм-канал «Thread of Thoughts | Поток мыслей», где делится материалами и наблюдениями из профессиональной практики.  

Разговор получился не только про сам C++, но и про то, что сегодня требуется от сильного разработчика. Мы обсудили userver и падения продакшена, высокие нагрузки и работу с памятью, HFT и геймдев, компиляторы и санитайзеры, работу с legacy-кодом, а также влияние ИИ на профессию. Поговорили о нейросетях в роли своеобразного «джуна на ревью», выгорании в Big Tech и о том, в каких задачах глубокое понимание устройства системы по-прежнему важнее знания конкретного языка.

Читать далее

Запускаем LLM локально на Windows: WSL2, Docker, CUDA и vLLM

Уровень сложностиСредний
Время на прочтение12 мин
Охват и читатели5K

Большинство инструкций по локальному запуску LLM сводятся к одной-двум командам: вставьте их в терминал, дождитесь загрузки модели и готово. Такой подход работает ровно до первой ошибки. После этого становится непонятно, на каком из нескольких уровней возникла проблема: в Windows, WSL2, драйвере NVIDIA, Docker, CUDA или самом inference-сервере.

В этой статье развернем Qwen3-0.6B на обычной NVIDIA-видеокарте под Windows 11 с использованием WSL2, Docker, NVIDIA Container Toolkit и vLLM.

Читать далее

Каков предел обучения мухи? Разбираюсь на практике

Уровень сложностиПростой
Время на прочтение28 мин
Охват и читатели4.9K

После того, как в открытый доступ выложили отсканированный мозг мухи дрозофилы, начали появляться видео о том, как муха играет в DOOM, водит машину, играет в азартные игры и ещё много чего. Но за красивыми демонстрациями часто остаётся простой вопрос: насколько хорошо такой мозг вообще способен учиться чему‑то новому?

Мне стало интересно проверить это на практике. Я взял открытую реализацию обучаемой части коннектома дрозофилы и начал последовательно давать ей задачи разной сложности: от многорукого бандита и сравнения чисел до лабиринтов, крестиков‑ноликов, распознавания изображений и даже простейшей арифметики.

Результаты оказались намного интереснее, чем я ожидал. В одних задачах коннектом почти не уступал классическим алгоритмам обучения с подкреплением, а в других неожиданно упирался в фундаментальные ограничения. В статье я покажу не только успешные результаты, но и провалы, а также попробую разобраться, почему они возникали.

Читать далее

Механизмы внимания в современных LLM

Уровень сложностиСредний
Время на прочтение18 мин
Охват и читатели4.1K

Почему современные LLM больше не используют один «обычный» Attention?

Разбираем эволюцию механизмов внимания: MHA, GQA, MLA, local и sparse attention, linear/recurrent подходы и гибридные архитектуры вроде Qwen3.8 и DeepSeek. Смотрим, что происходит с KV‑cache, почему длинный контекст так дорого обходится и как современные модели пытаются совместить качество retrieval с быстрым inference.

Читать далее

От RTSP-камеры до истории событий: настраиваем видеоаналитику через JavaScript Viewer

Уровень сложностиСредний
Время на прочтение9 мин
Охват и читатели4.5K

Привет, Хабр! В первой статье я разбирал внутреннее устройство real-time-конвейера на C++20: почему медленный YOLO не должен останавливать RTSP и зачем между этапами нужны ограниченные слоты последнего значения. Теперь посмотрим на ту же систему с другой стороны — глазами пользователя, который подключает камеру и должен получить не просто видео с рамками, а управляемый и проверяемый результат.

Я покажу практический порядок настройки своей платформы видеоаналитики через браузерный JavaScript Viewer: от стабильного потока и детектора движения до постоянных ID, двух контуров YOLO и истории событий в PostgreSQL. Главный вопрос статьи — не «где находится кнопка», а «какой участок конвейера меняет этот параметр и как проверить эффект».

Читать далее

Долгосрочная память для медицинского AI-ассистента: почему мы не отдали управление памятью LLM

Уровень сложностиСредний
Время на прочтение10 мин
Охват и читатели4.3K

При разработке персонального цифрового ассистента здоровья «Я Здоров» мы использовали долгосрочную память — LTM (Long-Term Memory). Сервис реализован в формате мобильного приложения: он собирает медицинские данные пользователя в единый цифровой профиль, позволяет хранить и оцифровывать медицинские документы, отслеживать результаты анализов, вести дневники здоровья и общаться с AI-ассистентом в чате.

В диалогах пользователь сообщает ассистенту информацию о своем здоровье: о симптомах, принимаемых препаратах, аллергиях и других состояниях. Часть этих данных важно учитывать не только в текущем разговоре, но и при следующих обращениях. Для этого мы сохраняем их в LTM и при необходимости возвращаем в контекст модели.

На практике работа с долгосрочной памятью оказалась шире, чем просто сохранение фактов. Нужно учитывать их актуальное состояние и изменения, определять, какие данные нужны модели для конкретного запроса, и контролировать, какие операции можно оставить LLM, а какие надежнее выполнять программно.

В статье разберем, как мы с командой ASAP решали эти задачи, как менялась архитектура LTM и к какой реализации пришли сейчас.

Читать далее

Фреймворк RAFT: как работает RAG на максималках от Microsoft

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели4.5K

Чтобы быстрее отвечать пользователям, команды техподдержки применяют RAG — подход, при котором нейросеть ищет информацию в базе знаний и опирается на нее при подготовке ответа.

Проблема в том, что в архивных тикетах важные детали часто разбросаны по переписке: по отдельному фрагменту не всегда понятно, какие способы уже проверяли и чем все закончилось. К тому же в ходе диагностики часто появляются новые факты, которые меняют представление о проблеме. 

Исследователи из Microsoft предложили новый подход — RAFT. Он разбивает старые обращения по шагам: от первых симптомов до конечного решения. Когда появляется новая проблема, система находит похожий этап в прошлых обращениях и показывает, как именно проблему решали в прошлый раз.

В этой статье разберемся, как устроен RAFT, кому он нужен и чем он отличается от обычного RAG. Заодно посмотрим, что показали тесты Microsoft.

Читать далее

PPU Zhenwu 810E от Alibaba: как китайский AI-ускоритель справляется с LLM

Уровень сложностиСложный
Время на прочтение26 мин
Охват и читатели7.4K

Привет, я Дмитрий, MLOps-инженер в Selectel. 

Современный ландшафт AI-ускорителей изобилует всевозможными устройствами: GPU, TPU, NPU, LPU и прочими удивительными аббревиатурами. Китайские компании активно участвуют в этой колоссальной гонке, и в данном материале я расскажу, как мы тестировали AI-ускоритель от Alibaba Group.

В первую очередь мы хотели понять, что за устройство перед нами и как его можно использовать в наших стандартных сценариях для инференса — прежде всего в качестве ноды для облачного Kubernetes или как самостоятельный dedicated-сервер. Что ж, давайте разбираться.

Читать далее

Как я читерил с помощью ИИ в реверс‑инжиниринге промышленного ПО

Уровень сложностиСредний
Время на прочтение16 мин
Охват и читатели4.9K

В статье рассказано об опыте использования генеративного ИИ для решения задач реверс-инжиниринга промышленного программного обеспечения. Рассмотрен кейс разбора проприетарного бинарного формата исторических архивов промышленной системы сбора данных и мониторинга Solar Turbines TT4000, выполненного с использованием DeepSeek, Qwen, GigaChat и Алисы.

Статья содержит ссылку на публичный репозиторий со всеми сгенерированными артефактами, а также ссылки на опубликованные диалоги с ИИ-сервисами.

Читать далее

Может ли локальная 27B-модель расследовать продакшен-инцидент как Claude? Две RTX 5090, около 40 прогонов и одна гонка

Уровень сложностиСредний
Время на прочтение14 мин
Охват и читатели4.9K

Реальный продакшен-инцидент: пул соединений забит, активных запросов дюжина, рестарт помогает. Claude нашёл причину за двадцать минут. Нормальный человек на этом обновил бы библиотеку и пошёл дальше, но у меня две RTX 5090 стояли без дела, и зудел вопрос: а локальная 27B-модель смогла бы? Тот же промпт, тот же код, та же песочница, семь локальных моделей, около 40 прогонов. В промпте, кстати, осталась одна правдоподобная, но ложная гипотеза инженера. Я не планировал делать из неё ловушку. Она стала главным фильтром всего эксперимента.

Читать далее

Маскирование ПДн для LLM: метрика, которую не считает никто, и шесть шлюзов против живого агента

Уровень сложностиСредний
Время на прочтение9 мин
Охват и читатели4.1K

Мы прогнали шесть шлюзов маскирования ПДн через живого агента с инструментами, чтобы измерить то, чего не мерят существующие бенчмарки: возвращается ли настоящее значение в аргумент вызова. Шесть строк, четыре находки и открытый корпус.

Читать далее

Ближайшие события

Кому и зачем нужна AI Studio: пять рабочих сценариев вместо каталога моделей

Уровень сложностиПростой
Время на прочтение4 мин
Охват и читатели3.4K

На Хабре уже достаточно статей формата «топ-20 моделей» и «обзор сервиса». Они собирают просмотры, но в комментариях быстро появляется главный вопрос: «Зачем мне это, если есть ChatGPT, Qwen, OpenRouter и так далее?»

AI Studio — среда, где можно попробовать технологии GigaPlatform в своей задаче: до прототипа — понять, подходит ли модель или сервис; в работе — получить конкретный результат (отчёт, промпт, транскрипт, отработанные ответы на Q&A).

Читать далее

Как не утопить RTSP в YOLO: real‑time‑конвейер на C++20, Clang и ONNX Runtime

Уровень сложностиСредний
Время на прочтение10 мин
Охват и читатели4.3K

YOLO обрабатывает кадр дольше, чем камера формирует следующий. Если построить видеосервер как последовательность read → motion → YOLO → encode, тяжёлая модель остановит чтение RTSP, очередь начнёт расти, а пользователь увидит прошлое вместо прямого эфира.

В статье разбираю real‑time‑конвейер своего C++20-сервера: постоянные workers, слоты последнего значения, std::jthread, stop_token, защита от устаревших результатов и итоги 16-часового теста на реальной RTSP‑камере.

Читать далее

О тестировании ИИ-агентов, вызывающих функции

Уровень сложностиСредний
Время на прочтение15 мин
Охват и читатели7.5K

У ИИ-агентов, вызывающих функции (function calling, tool use), есть ошибка, которую не видит ни одна из обычных защит. Агент вызывает функцию при невыполненном условии ее применения, когда оно прямо ему не названо, и сообщает об успехе, не называя препятствия. Такую ошибку не замечают проверка схемы, система, отчет самого агента, подтверждение оператора и существующие наборы проверок.

В статье описана методология, которая находит такие ошибки и для каждой указывает место: какое условие нарушено, в каком формате дано поручение и что агент при этом сказал.

Создавая методологию, мы опирались на две общие идеи – о том, что в основе каждого действия лежит некоторое основание, включающее побудительный шаг и условия, при которых произвести действие допустимо, и что правило не содержит правила своего применения, а потому все условия в промпт и схему функции не допишешь, и проверять приходится поведение агента.

Методологию проверяли на трех учебных примерах и пяти конфигурациях моделей, всего более 4200 испытаний, по 10 попыток на ситуацию. К научной чистоте эксперимента мы пока не стремились, делали проверку методологического подхода, поэтому числа в статье имеют характер наблюдения и иллюстрации, это не оценки частот и не строгая доказательная статистика. Основные результаты приводим по Gemini 3.6 Flash через RouterAI (интерфейс, совместимый с OpenAI API) с температурой 1.0 – эта конфигурация записана полностью: модель, канал доступа, температура и дата прогона, 27.09.2026. Тот же стенд прогоняли на Claude в веб-интерфейсе. Там нельзя задать версию модели и температуру, а поверх нашего промпта действует системный промпт интерфейса. Поэтому числа для модели Claude приводим только для сравнения – там, где они показывают другой механизм той же ошибки.

Читать далее

С нуля до чипа: программирование FPGA на t27

Уровень сложностиСредний
Время на прочтение4 мин
Охват и читатели10K

Большинство курсов по FPGA начинаются со слов «установите Vivado». Мы пошли с другого конца: в каждом из 27 уроков есть рабочий виджет, собранный из реальных запусков на нашем стенде. Сначала разбираем, что такое FPGA и как числа становятся битами. Потом пишем спеку на t27, компилируем её t27c и превращаем в битстрим на плате. В конце — лаборатория из трёх уроков о наших собственных исследованиях, включая результаты, которые нам не понравились. Каждая картинка ниже — снимок живого виджета; нажмите, чтобы открыть его.

Читать далее

800 тысяч строк кода: как ИИ-агенты переписывали движок Copilot

Уровень сложностиПростой
Время на прочтение5 мин
Охват и читатели8.1K

GitHub переписал движок Copilot: 832 378 строк нового кода, большинство из которых написали ИИ-агенты. По дороге они перегрузили ноутбук, забрали чужие незаконченные изменения и сами разрешили себе пройти проваленную проверку. Инженер Microsoft Стивен Тауб рассказал, как шел перенос и за что все это время отвечал человек.

Читать далее

ИИ-слоп: не всё так плохо?

Уровень сложностиПростой
Время на прочтение10 мин
Охват и читатели9.3K

Открываешь ленту, попадается интересное видео, и ты залипаешь.
На середине замечаешь, что что-то не так. Голос слишком ровный, картинка подозрительно гладкая, сюжет местами тянется. Потом доходит, что ролик целиком сделан нейросетью. И всё равно не выключаешь.

Обычно ИИ-слоп просто ругают и пролистывают. Мол, дешёвая штамповка, никакой души, только просмотры собрать. Но если ролик тебя увлёк, он правда стал хуже оттого, что его сделал ИИ? Что именно мы имеем в виду, когда называем контент слопом? Пустой сюжет, отсутствие человеческого труда или то, что ленты забиваются похожими видео? Тут уже хочется поговорить не только о качестве, но и о том, как мы вообще оцениваем контент, созданный нейросетью.

В этой статье разберём, как за пару лет мы прошли путь от смешного Уилла Смита со спагетти до видео, которое практически никак не отличить от настоящего. Посмотрим, почему ИИ-контент появляется в постах, роликах и музыке, чем затягивают китайские ИИ-сериалы и почему бизнесу нравится ИИ-слоп.

«Читать далее»

Почему одного Whisper оказалось мало: ASR на 100 песнях для домашней игры

Уровень сложностиСредний
Время на прочтение18 мин
Охват и читатели6.3K

К Новому году мы с друзьями договорились, что каждый подготовит по конкурсу. Мне хотелось сделать что‑нибудь музыкальное, а идеи нашлись в воспоминаниях о двух корпоративах: с одного я принёс желание сочинить песню для нашей компании, с другого позаимствовал механику конкурса. Так появилась What The Track, в которой нужно угадать последнее слово оборванной строки.

Первую версию с вопросами, нарезанными вручную, мы довольно быстро опробовали на друзьях. Когда захотелось сыграть ещё, я решил автоматизировать подготовку, чтобы самому не знать все ответы заранее. Оказалось, что между «нейросеть умеет распознавать речь» и «ей можно доверить музыкальный конкурс» помещается отдельный проект по сравнению систем автоматического распознавания речи (ASR, automatic speech recognition).

Читать далее
1
23 ...