Обновить
16K+
103,65
Рейтинг
1 813
Подписчики
Сначала показывать

GuardRate: как мы построили независимую арену для guardrail-моделей (часть 1)

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели6.8K

Всем привет, на связи команда  HiveTrace!

Мы уделяем много времени разработке собственных моделей и часто задаемся вопросом: "какой из двух гардрейлов лучше?".

Если вы когда-нибудь выбирали guardrail-модель для LLM, то знаете: одни модели блокируют безобидные запросы, другие пропускают явные угрозы. Хуже всего то, что нет прозрачного стандарта сравнения. Авторы оценивают свои решения субъективно, не публикуют методологию, а результаты замеров одних и тех же моделей на одинаковых бенчмарках в разных статьях часто отличаются.

Поэтому мы создали CLI, который  назвали GuardRateTools - это автоматизированный пайплайн оценки guardrail-моделей. Его интерфейс –  HiveTrace GuardRate Leaderboard, уже открыт для просмотра. GuardRateTools интегрирован в CI/CD процесс дообучения внутренних guardrail-моделей и обеспечивает честное сравнение моделей в равных условиях.

CLI запускает проверку одной командой: подтягивает датасеты и конфигурацию модели из YAML, разворачивает изолированную среду, которая создается индивидуально для каждой модели, прогоняет модель по фиксированному набору бенчмарков и считает метрики.  Сырые ответы от модели, логи и итоговые метрики сохраняются в артефакты, поэтому любой результат можно проверить и воспроизвести. Автоматизация исключает ручной труд, снижает влияние человеческого фактора и сокращает время оценки новых решений в области гардрейлов.

HiveTrace GuardRate Leaderboard уже доступен для всех! В третьем квартале 2026 года мы выложим исходный код CLI. Если хотите протестировать свою модель, свяжитесь с нами. Контакты вы найдёте в конце статьи.

Читать далее

Спорт‑аналитика c AI4BI

Уровень сложностиПростой
Время на прочтение9 мин
Охват и читатели9K

Первое профессиональное программное решение по спортивной аналитике, усиленное ИИ, мы с командой построили для экзотичного у нас крикета. Было это еще в 2017 году, и тогда решение выглядело каким-то космолетом.

Сейчас в 2026-м наш ИИ-аналитик на базе AI4BI "универсализировался", оброс возможностями по добавлению доменной экспертизы через RAG-базы знаний и сильным AI\ML плечом, развился до того, чтобы масштабироваться в сторону как классических видов спорта - футбола, хоккея, волейбола, баскетбола, бенди - под самые разные роли: тренер, скаут, спортивный аналитик, спортивный директор, владелец клуба, так и в сторону «гражданской» фитнес-аналитики. При этом уже не выглядит чем-то космическим - сейчас это доступный инструмент для спортивных организаций от профессиональных команд до фитнес-клубов.

Сегодня разберём 3 кейса, покрывающих 3 разных вида спорта и 3 роли, - и на каждом покажем, как это выглядит внутри AI4BI.

Читать далее

Великий китайский ИИ файрвол и защита Лобстеров

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели8.8K

Снаружи китайский рынок AI Security не прозрачный, у половины продуктов нет даже английского лендинга, а внутри там за последнюю пару лет выросла полноценная индустрия, которая близка по зрелости к штатовским и израильским ИБ-игрокам.

Задача защиты ИИ в Китае ровно такая же, как везде. Нужны гардрейлы, которые проверяют вход и выход модели, нужны системы мониторинга, и нужна отдельная защита агентов, которые уже не просто отвечают текстом, а ходят по инструментам, файлам и корпоративным API. Модель угроз тоже знакомая: промпт-инъекции, утечки данных и секретов, неправильное использование инструментов, отравленные скиллы агентов. При схожей задаче различие кроется в контексте: суверенный стек железа и ОС, определяемое партией понимание безопасного AI и целая экосистема продуктов, о которых мы и не слышали. Об этих отличиях и поговорим.

Читать далее

От Triton Inference Server к NVIDIA Dynamo: как изменился inference для агентов в 2026

Уровень сложностиСредний
Время на прочтение15 мин
Охват и читатели10K

Привет, Хабр! Меня зовут Александра, я Data Scientist в компании Рафт. В этой статье я разберу NVIDIA Dynamo — новый open‑source фреймворк для инференса и проверю, действительно ли его KV‑маршрутизация ускоряет агентные сценарии.

С появлением агентных систем требования к инференсу современных ML‑моделей существенно изменились. Если раньше типичная нагрузка была предсказуемой — один запрос, один ответ и фиксированная цепочка шагов, — то в 2025–2026 годах всё стало по‑другому. Агентные системы теперь выполняют множество последовательных и параллельных вызовов моделей и инструментов в рамках одной задачи.

Triton Inference server, ставший стандартом для инференса различных моделей от компьютерного зрения до LLM, появился ещё до массового распространения агентных систем, поэтому его архитектура проектировалась под классический сценарий. В ответ NVIDIA представила новый open‑source инференс фреймворк Dynamo, заточенный под LLM, рассуждающие модели и агентов.

Читать далее

Я больше не объясняю нейросети контекст. Вот что я сделал вместо этого…

Уровень сложностиПростой
Время на прочтение12 мин
Охват и читатели25K

Я попробовал собрать LLM Wiki: workflow, где нейросеть не просто отвечает на вопросы по документам, а постепенно поддерживает базу знаний. Взял Obsidian, Codex и несколько статей с Хабра, сделал ingest, query и lint, а затем посмотрел, чем такой подход отличается от обычного RAG. В статье показываю структуру vault, примеры wiki-слоя, стоимость ingest на Yandex Foundation Models и риски, которые быстро всплывают на практике.

Читать далее

Оптимизируем Закупки: чеклист топ-10 для формирования потребности с помощью ИИ-аналитика Raft AI4BI

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели12K

Если зададите «закупщику» вопрос о проблемах, которые ему приходится решать на каждодневной основе, то «пустая рюмка и взгляд полный грусти будет вам ответом». Дальше последует уходящий в бесконечность список с описанием того, что болит, и достается в нем и нашим и вашим. Вспоминают и ненадежных поставщиков, и задержки поставок, и перерасход по контрактам, но в большинстве таких списков фигурирует проблема, настигающая «закупки» еще в самом начале цикла: идентификации потребности и формирования заявки на закупку.

Сегодня разберем один из подходов, помогающий снизить градус проблемы с формированием потребностей: внедрение в регламент закупок чек-листа на фазе формирования потребности. Покажем на живых примерах, как ИИ-аналитик Raft AI4BI может помочь в имплементации подхода.

Читать далее

Как рассказать ребёнку, чем занимается папа, если папа работает с ИИ?

Уровень сложностиПростой
Время на прочтение14 мин
Охват и читатели15K

Наверняка все, у кого есть дети, слышали вопрос «чем ты занимаешься на работе?» Мне его точно задавали, и неоднократно.

Дать ответ на этот вопрос ребёнку, не скатываясь в иронию, не так уж и просто. Но оказалось, что все ответы для нас уже подготовили. И не евангелисты из Кремниевой долины, а товарищи в кожаных плащах и пыльных шлемах, думавшие о том, как воспитать миллионы молодых инженеров, лет шестьдесят назад и ещё раньше.

Читать далее

Делаем науку на ровном месте

Уровень сложностиПростой
Время на прочтение4 мин
Охват и читатели12K

Всем привет! Меня зовут Илья, сейчас я инженер-программист в компании Raft, но когда-то был аспирантом и пытался двигать отечественные нанотехнологии на стыке химии высокомолекулярных соединений, биохимии и металлоорганики. Учитывая, что на тот момент в ВУЗе закрыли ученый совет, а кафедре на закупку реактивов в семестр выделяли целых 9 тысяч рублей, выполнять установку руководства «публиковать работы мирового уровня» получалось не очень.

Но я не унывал, ведь жизнь — это праздник! А заниматься наукой в таких условиях как ни крути было интересно — при наличии ресурсов работать может каждый, попробуй что-то сделать без них. Хоть какие-то реактивы можно было купить на eBay. Литературу я находил в англоязычном интернете и даже покупал по оказии в Библио-Глобусе. К счастью, стипендии аспиранта хоть на что-то хватало.

Научный руководитель и заведующий лаборатории мне помогали, но до прорывов дело не дошло. Возможно, нужно было чаще копаться в стопке пожелтевшей от времени бумаги с «наработками в стол», складированной в лаборатории на подоконнике между цветками. 

Диссертация так и осталась неначатой, а эксперимент недоделанным (изучение биологических свойств и электронная микроскопия). Моих способностей и трудолюбия хватило только на химический синтез новых соединений, которые в ожидании дальнейших исследований успевали испортиться. Наука на практике заключалась в серьезных разговорах, написании посредственных статей, но радужных отчетов. Дожив до окончания аспирантуры, я «отдал долг Родине» и начал официальную трудовую деятельность. Поменял несколько сомнительных работ, после чего кривая «русской мечты» привела меня в IT, где до сих пор барахтаюсь.

Читать далее

«Наэйай мне биай»: как мы научили Apache Superset говорить по-человечески

Уровень сложностиСредний
Время на прочтение16 мин
Охват и читатели7K

Привычная многим картина, когда бизнес «с полей» запрашивает дополнительную аналитику, менеджер идет выбивать ресурсы команды под задачу, аналитик вручную «перемалывает» данные и собирает обновленные дашборды…проходят недели, бюрократические жернова перемалывают прибыль, "гиря ударяется о пол" и бизнес в итоге принимает решение «на глазок».

С приходом AI в индустрию бизнес-аналитики забрезжила надежда, что эти темные времена останутся только в воспоминаниях тех, кто еще застал пейджер и охоту на мамонта.

В сегодняшней статье разберём, как на базе версии Apache Superset с поддержкой MCP и связки Foundation Models от Cloud.ru можно собрать рабочего AI-агента аналитика, который фразу «построй мне аналитику по продажам» за минуты превращает в полноценный дашборд с возможностью скейлинга в продакшене.

Читать далее

GLiNER Guard: один schema-driven энкодер вместо зоопарка LLM-гардрейлов

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели13K

Деплоите LLM? Значит, обвешиваете её гардами. Сначала safety, потом PII, потом prompt injection, потом toxic BERT - и в один прекрасный день обнаруживаете, что у вас 5 классификаторов на каждой ноде и 20 forward-ов на один пользовательский запрос.

GLiNER Guard - возможность схлопнуть этот стек в единый schema-driven энкодер. И да, его можно тоже промптить: через zero-shot + description.

Читать далее

Machine Unlearning. Как измерить и достичь «забывания»?

Уровень сложностиСредний
Время на прочтение13 мин
Охват и читатели7.8K

Всем привет! Меня зовут Вадим, я — Data Scientist в компании Raft. Эта статья написана по мотивам моего выступления на конференции AiConf 2025. В ней мы разберём, какими метриками измеряется машинное разучивание и какие основные методы позволяют добиться контролируемого «забывания» без полного переобучения модели. Погрузимся в методы, метрики и бенчмарки, связанные с машинным разучиванием.

Недостаточно просто удалить конкретные примеры: модель может по-прежнему хранить их в параметрах и воспроизводить при другом контексте или атаке. И даже если забывание произошло, как убедиться, что при этом не разрушилась вся остальная функциональность модели?

Читать далее

Можно ли заменить диктора open‑source TTS‑моделью: тестируем OmniVoice на русском языке

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели10K

Привет, Хабр! Меня зовут Музафаров Данил, я работаю DS инженером в компании Raft. В этой статье я протестирую OmniVoice — Open Source TTS модель, вокруг которой сейчас много внимания, и проверю, насколько хорошо она справляется с русскоязычными бизнес‑сценариями: числами, датами, ФИО, аббревиатурами, смешанным русско‑английским текстом, а также длинной озвучкой.

Читать далее

OCR в кармане: как HunyuanOCR на 1B параметров потеснил гигантов в задачах парсинга документов

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели13K

Всем привет! Меня зовут Артем, я Data Scientist в компании Raft Digital Solutions. В этой статье расскажу про свой опыт работы с HunyuanOCR end-to-end моделью от Tencent для распознавания текста на 1B параметров. Несмотря на громкие заявления о «SOTA-результатах» и компактности, в публичных обзорах практически не описано, как эта модель ведет себя в реальных задачах: с чем приходится столкнуться при настройке окружения, почему она может уйти в бесконечное зацикливание и как заставить её эффективно парсить сложные таблицы на обычном «железе».

Поделюсь результатами своих экспериментов, покажу боевые промпты и объясню, в каких сценариях этот OCR-инструмент реально помогает экономить время, а где лучше даже не пытаться его использовать.

Читать далее

Как оценивать работу агентов

Уровень сложностиПростой
Время на прочтение11 мин
Охват и читатели6.8K

По мере стремительного развития агентных систем всё больше компаний — как крупных, так и небольших — рассматривают возможность интеграции агентов в свои рабочие процессы. Неудивительно, что многие лица, принимающие решения в этих компаниях, относятся к надёжности агентов с изрядной долей здорового скептицизма. Против недобросовестного сотрудника можно применить дисциплинарные взыскания и другие меры, но что делать с недобросовестным ИИ?

Читать далее

Ближайшие события

Сколько стоит внедрить AI?Отвечаем с LCOAI

Уровень сложностиСредний
Время на прочтение5 мин
Охват и читатели11K

Компании во многих отраслях переходят от AI-экспериментов к масштабным внедрениям, сталкиваясь с трудностями в оценке сопутствующих издержек. Традиционные фин.модели не всегда отражают экономическую сложность развертывания и сопровождения AI решений, что приводит к заблуждениям в сравнении альтернативных вариантов решений.

В сегодняшней статье разберем LCOAI - адаптированный для AI подход к оценке стоимости владения цифровым продуктом - и ответим на вопрос "Сколько же стоит внедрить этот ваш ИИ?“.

Читать далее

AI КОМП-АС — разбор фреймворка. C: Скейлинг AI на проде

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели8.8K

Пилот запущен, ожидаемые бизнес-эффекты подтверждены, техническая реализуемость доказана - ваша AI инициатива готова к «раскатке» на уровень всей организации. Разбираем, как провести контролируемый скейлинг AI решения на продакшене, сохранив и приумножив достигнутые эффекты.

Полное описание фреймворка можно найти здесь.

Читать далее

AI КОМП-АС — разбор фреймворка. А: Архитектурно-продуктовый дизайн

Уровень сложностиСредний
Время на прочтение10 мин
Охват и читатели5.2K

Ваша AI инициатива требует разработки и внедрения своего кастомизированного решения? → В сегодняшней статье разбираем раздел AI КОМП-АС, описывающий подход к формированию архитектурно-продуктового дизайна AI сервисов, позволяющий снизить риски «войти не в ту дверь» и разработать продукт с контролируемой возвратностью инвестиций, отвечающий вашим целям.

Полное описание фреймворка можно найти здесь.

Читать далее

AI КОМП-АС — разбор фреймворка. П: Прокладываем путь

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели6.6K

У вашей организации есть список AI инициатив, с помощью которых вы хотите трансформировать существующие бизнес-процессы, чтобы достичь стратегических целей. Но как подступиться к их имплементации? С чего следует начать? Что делать, а что нет?

You can do anything but you can’t do everything - можно реализовать что-угодно, но нельзя получить все везде и сразу.

В сегодняшней статье мы рассмотрим подход к оценке потенциала и приоритезации списка инициатив с помощью AI Tech Gartner’s Sandwich, после чего построим реалистичную дорожную карту AI трансформации организации, исходя из достижимости и ожидаемых эффектов выбранных инициатив.

Полное описание фреймворка можно найти здесь.

Читать далее

Сравнение TTS-моделей на реальных задачах бизнеса: голосовой бот и аудиоподкасты

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели9.2K

Это вторая часть обзора моделей для задачи синтеза речи (Text-to-Speech). В прошлой части я сравнил 7 Open Source моделей для этой задачи по нескольким критериям. В этот раз я решил посмотреть не только на Open Source-модели, но и на проприетарные TTS-решения.

Читать далее

AI КОМП-АС — разбор фреймворка. М: Можем ли дойти?

Уровень сложностиСредний
Время на прочтение9 мин
Охват и читатели8.1K

Мы подошли к этапу, где наконец перекинем мостик от анализа текущего состояния организации и бизнес-целей к технологиям и имплементации процесса AI трансформации. Ниже я опишу подход, позволяющий оценить достижимость намеченной стратегии и подготовиться к формированию реализуемой дорожной карты изменений. Отвечаем на вопрос: Можем ли дойти?

Полное описание фрейморка можно найти здесь.

Читать далее
1
23 ...

Информация

Сайт
raftds.ru
Дата регистрации
Дата основания
Численность
101–200 человек
Местоположение
Россия
Представитель
Евгений Кокуйкин