Обновить
512K+

Машинное обучение *

Основа искусственного интеллекта

1 300,46
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

Как сжать 300+ часов D&D сериала в пересказ для актеров

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели2.5K

Я давно играю в ДнД и почти с самого начала смотрю «Грядут приключения» - ребята снимают настольные ролевые игры как сериалы: живая партия актеров за столом, постоянный каст, сквозной сюжет, серии по пять-шесть часов. Нравится у них всё, но больше всего - «Архипелаг» и «Эндемия».

В какой-то момент несравненный Мастер Гоша Воронин кинул в своём канале клич: проекту нужна помощь с пересказом сериала. Нужен был текст, по которому актёры смогут прочитать всё случившееся за 55 серий.

Обычно такие вещи делают руками. Энтузиасты берут источник, сами его пересматривают, сами расписывают сценарий, сами переводят всё в текст. Работа адская даже когда в источнике пара часов записи, а тут триста. Я решил попробовать по-новому и написал в комментах, что могу помочь: работаю с ИИ и большими данными, сделаю это в разы быстрее, чем руками, и никому не придётся месяцами сидеть над расшифровками.

Так я и взялся разобрать все 55 серий в базу знаний и написать по ней текст видеопересказа для актеров на 30-60 минут.

Читать далее

Новости

SayFable — офлайн-библиотека с NLP-разметкой, синтезом на 68 языков и чатом по книге

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели4.3K

Привет, Хабр! В прошлых статьях я рассказывал про локальный переводчик с синтезом голоса на кабардинском и про то, как собрать полный NLP-стек для «финального босса лингвистики» из старых словарей. За прошедшие месяцы весь этот стек - лемматизация, POS, NER, тональность, эмбеддинги, синтез - переехал с Python/Flask на десктопе в Swift-приложение на iOS и заодно перерос сам себя: начиналось всё как синтезатор речи для одного языка, а выросло в персональную библиотеку для любого контента - книги, статьи, подкасты, видео, музыка, файлами или ссылками. Полгода на голом Swift 6, вечерами и выходными.

Приложение уже можно ставить и ломать - оно в бете, включая рабочий CarPlay. Под катом: что оно умеет, как устроено внутри и какие цифры получились на реальном железе.

Читать далее

Я собрал 33 ИИ-агента на одном движке. Показываю, как устроены пять из них

Уровень сложностиСредний
Время на прочтение28 мин
Охват и читатели7.6K

За последний год я собрал 33 ИИ-агента. Шахматный тренер для ребёнка, помощник по учёбе, ассистент для жены, тьюторы образовательных программ, боты для металлургического холдинга и энергетической компании, внутренние агенты отдела продаж и CRM.

Все они работают на одном движке. Один и тот же Docker-образ, одна и та же кодовая база. Форков ядра — ноль.

Различаются они ровно одним: где у каждого проходит граница между тем, что считает код, и тем, что говорит модель. Это и есть содержание всей работы. Не промпт-инжиниринг, не выбор модели, не RAG. Граница.

Ниже — разбор шести агентов с двух полюсов этой границы, реальный код, замеры и грабли, включая те, где я сам эту границу провёл неправильно.

TL;DR

Читать далее

AudioToText: управление требованиями через записи встреч

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели10K

Как превратить записи встреч в рабочий материал для согласования требований: текущая версия проекта AudioToText. В статье показываю, как собрать сервис транскрибации на базе MLX Whisper и Django, чтобы автоматически получать структурированные протоколы созвонов, а не просто длинные текстовые файлы. Разбираю сценарий работы, ключевые элементы веб‑интерфейса, review‑контур и планы развития проекта в сторону NER и поиска противоречий по summary.

Как запись встречи становится рабочим арте

ИИ за полтора часа взял задачу, над которой статистики бились 20 лет

Уровень сложностиПростой
Время на прочтение5 мин
Охват и читатели9.8K

Эдгар Добрибан, статистик из Уортонской школы Пенсильванского университета, сел за разговор с GPT-5.6 Pro. Модели он дал только математическое определение процедуры Бенджамини-Хохберга и вопрос: доказать или опровергнуть. Примерно через полтора часа рассуждений она выдала доказательство, конкретный контрпример и код численного сертификата к нему.

Читать далее

Пробирка как процессор или как молекулы ДНК научились решать задачи

Время на прочтение6 мин
Охват и читатели10K

Есть белок — рестриктаза ЭкоРИ. Она плавает в клетке, натыкается на двойную спираль ДНК и ищет конкретную последовательность из шести нуклеотидов (ГААТТЦ). Нашла — разрезает цепь ровно между первой и второй буквой. В стандартных лабораторных условиях никакой другой последовательности она не трогает. 

Прим. автора: при высоком содержании глицерина или нестандартном pH у ЭкоРИ проявляется так называемая звёздная активность — фермент начинает резать похожие, но не идентичные последовательности. Это известный артефакт, с которым борются в любом молекулярном протоколе.

Форма активного центра белка оптимизирована именно под эти шесть нуклеотидов — точное структурное соответствие обеспечивает во много раз большее сродство, чем к любой другой комбинации. Биохимики называют это специфичностью.

Леонард Эдлман — тот самый, чья буква «А» стоит в конце аббревиатуры RSA. Профессор Университета Южной Калифорнии, в 2002 году получил премию Тьюринга — высшую награду в информатике. В 1993 году, читая учебник Уотсона по молекулярной биологии, он задумался — а если фермент узнаёт последовательность и выполняет действие, это ведь и есть вычисление. Спустя год опубликовал эксперимент.

Читать далее

Агентный RAG, бенчмарк TRuST и при чём здесь Нафаня?

Уровень сложностиСредний
Время на прочтение13 мин
Охват и читатели9K

Тестирование агентного RAG на многошаговых задачах бенчмарка TRuST: эволюция архитектуры, сравнение моделей и правила работы с промптами для сложных поисковых задач.

Читать далее

0.9 от вашего классификатора — это не 90%: почему модели врут о своей уверенности и как это чинить

Уровень сложностиСредний
Время на прочтение12 мин
Охват и читатели8.6K

Порог 0,8 часто воспринимают как 80% уверенности — и на этом строят автоматизацию.

Разберём, почему predict_proba может врать, как измерить калибровку модели и вернуть её вероятностям практический смысл.

Читать далее

Почему слабым местом кредитного конвейера может оказаться не только ставка, но и плохой OCR

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели6.3K

Привет, Хабр! Кредиты и все, что с ними связано – тема для многих весьма чувствительная. Мы в Smart Engines выступаем за то, чтобы сделать самые раздражающие процессы удобными и быстрыми. И в этом смысле распознавание документов – это редкий пример технологии, где интересы банка (сократить издержки), сотрудника (меньше рутины) и клиента (не ждать решение неделями) действительно совпадают. Под катом рассказываем, как автоматическое распознавание документов может трансформировать процесс кредитования в банках и как такие технологии становятся ключевым звеном кредитного конвейера.

Читать далее

Kazry — новая кусочно‑заданная активация

Уровень сложностиСредний
Время на прочтение3 мин
Охват и читатели6.9K

Привет, Хабр, в этой статье я хочу представить новую функцию активации для нейронных сетей под названием Kazry, которая по результатам тестов обошла SiLU.

Читать далее

Нейросетевая архитектура формирования автоматических навыков. Часть 1

Уровень сложностиСредний
Время на прочтение9 мин
Охват и читатели6.1K

Идея предлагаемой архитектуры возникла из наблюдения за тем, как человеческий мозг осваивает новые действия и превращает их в привычки.

Когда человек впервые сталкивается с незнакомой задачей, её решение требует сознательного внимания. Необходимо сосредоточиться, попробовать один или несколько вариантов, получить обратную связь и скорректировать поведение. Однако после многократного успешного повторения действие постепенно становится автоматическим и выполняется практически без участия сознания.

В общем случае наш мозг работает по принципу «стимул-желание-реакция-подкрепление». Этот принцип хорошо описывается в книге Джеймса Клира «Атомные привычки», что и вдохновило меня на создание подобной архитектуры.

Хороший пример — обучение вождению. Начинающий водитель отдельно контролирует положение педалей, переключение передач, поворот руля и дорожную обстановку. По мере накопления опыта значительная часть этих операций превращается в привычку и начинает выполняться автоматически.

Прямо во время написания статьи я сдаю на водительские права, так что мне везёт воочию наблюдать как обучается моя собственная «нейронка».

Предлагаемая архитектура переносит этот принцип в систему из нескольких простых нейронных сетей. Незнакомые входные данные сначала обрабатываются «сознательной» сетью. После получения правильного ответа и положительного подкрепления генеративная сеть создаёт множество похожих примеров. На них дообучается «подсознательная» сеть, после чего сходные ситуации начинают обрабатываться быстро и автоматически.

Читать далее

Ускорение инференса энкодерной guard‑модели: TensorRT, Triton, vLLM, Ray Serve

Уровень сложностиСредний
Время на прочтение23 мин
Охват и читатели5.5K

Когда в системе есть узел между LLM и пользователем его скорость также важна, как и скорость самой LLM. Когда этот узел сам является моделью (и иногда даже — тоже LLM) — задача ускорения становится совсем веселой и её нужно уметь решать разными способами. В этой работе я опишу процесс ускорения guardrail‑модели — узла, которые проверяет — нет ли на входе или выходе опасного контента.

Guard стоит на входе/выходе LLM‑приложения. В статье речь про небольшую модель — чуть больше 0.5 Gb. Но она вызывается дважды за один ход диалога, и сначала пользователь ждет, пока guard проверит его запрос перед отправкой в LLM, затем — пока он проверит сгенерированный ответ перед выдачей пользователю.

Моей задачей было ускорить такую небольшую guard‑модель (Locustfile, базовые benchmark‑конфиги и инструкции по воспроизведению экспериментов в репо). Я потестила пять инструментов: TensorRT, NVIDIA Triton, vLLM, Ray Serve и отдельно — переход бэкбона на Flash DeBERTa.

Про допущенные ошибки, результаты и выводы — о том, как бы я построила подобную работу сейчас — ниже. Надеюсь, это сбережет вам время.

Читать далее

ИИ-агенты в трейдинге: от рекомендаций к автономному управлению. Разбор тренда, рисков и архитектурных решений

Уровень сложностиПростой
Время на прочтение4 мин
Охват и читатели5.4K

Представьте, что вы сообщаете ИИ-агенту, на какой риск готовы пойти, какие у вас цели по накоплениям на пенсию и когда ваши дети поступят в колледж, а затем позволяете ему управлять вашим инвестиционным портфелем и спокойно спите по ночам.

Читать далее

Ближайшие события

MCP без облака

Уровень сложностиПростой
Время на прочтение9 мин
Охват и читатели5.7K

У меня возникла такая задача: есть куча файлов, на которые хорошо бы натравить нейросеть, чтобы она искала ответы прямо по ним, а не выдумывала. Файлы разнородные, среди них тяжелые PDF. Закинуть их в модель целиком не выйдет: контекстное окно забьется раньше, чем она доберется до сути. Нужен способ скармливать модели не весь архив разом, а только нужный кусок. Так мне пришла идея применить MCP «с другой стороны» — не для агента, а для аккуратного доступа к большому архиву локальных документов.

Читать далее

Как измерить то, что вы никогда не замечаете

Уровень сложностиСложный
Время на прочтение7 мин
Охват и читатели5.7K

Как научить модель понимать пространство по одному уличному снимку и переводить перспективу в измеримые величины?

В статье исследуем этот вопрос на примере ширины тротуаров: восстанавливаем глубину сцены, строим 3D‑представление поверхности и проверяем, насколько точно машинное обучение может описать привычную городскую среду.

Читать далее

Агент за доллар: как устроена экономика связки Hermes Agent + DeepSeek V4 Flash

Уровень сложностиСредний
Время на прочтение5 мин
Охват и читатели5K

В начале августа по X разошёлся скриншот: панель расходов, сотни миллионов обработанных токенов и счёт чуть больше доллара. Работа велась через открытый Hermes Agent на модели DeepSeek V4 Flash. Скриншот - личный дашборд пользователя, проверить его со стороны нельзя, поэтому дальше речь не о том, правдив ли конкретный счёт, а о том, какая механика делает такой счёт возможным и в какой момент она перестаёт работать.

Читать далее

Что будет если загрузить в «симулятор общества» чистый lorem ipsum? Большое исследование MiroFish, часть 1

Уровень сложностиСредний
Время на прочтение15 мин
Охват и читатели4.7K

Первая статья из трёх об исследовании MiroFish, открытого стека мультиагентной симуляции общества. В этой части: стек, методология и находка Silent Failure. Бэкенд зафиксировал отказ за десятки миллисекунд, статусный API отдал задачу как выполненную, а индикатор прогресса не отвечал более часа.

Читать далее

Компилятор, который галлюцинирует

Уровень сложностиСредний
Время на прочтение12 мин
Охват и читатели8.3K

Начнем с простого. Вы скачали нейросеть, и теперь у вас на диске лежит файл на несколько гигабайт, внутри которого миллиарды чисел. Этот файл можно запустить и он будет делать всякие осмысленные штуки: писать текст, отличать котов от собак на фотографиях, переводить с китайского. То есть перед нами работающая программа. Только исходного кода к ней нет, и никогда не было.

Дальше в статье мы разберем идею, которая из этого же наблюдения и выросла. Она звучит так: а давайте напишем компилятор, который берет понятную человеку программу и превращает ее прямо в веса нейросети.

Звучит странно. Но чтобы понять, зачем это нужно и почему это красиво, придется сначала заглянуть в обычные компиляторы и немного в азы ИИ. Без них дальше будет непонятно.

Читать далее

Агенты Anthropic и OpenAI атаковали реальных людей на тестах AISI. И помогали друг другу через GitHub

Уровень сложностиПростой
Время на прочтение5 мин
Охват и читатели5K

25 июля британский AI Security Institute запустил очередную проверку киберспособностей передовых моделей. Через три дня выяснилось, что один из агентов атакует не учебную мишень, а проект живого разработчика: подсунул туда вредоносный код под видом исправления бага, а когда правку заподозрили — завел фейковые аккаунты и изобразил ими поддержку сообщества.

Читать далее

Архитектура LLM-агентов для самых маленьких

Уровень сложностиПростой
Время на прочтение5 мин
Охват и читатели5.7K

Являясь LLM активистом, регулярно обсуждаю всякое про новости\инструменты\тренды в ИИ. И к моему удивлению зачастую люди из IT не понимают базовых вещей в работе LLM и сопутствующих инструментах. Эта статья — переложение доклада на внутреннем митапе. Основная ее цель - обозначить как из сервера с моделью получаются полноценные агентные системы.

А начнем мы с того, что представим сервер с развернутой LLM, как рыбку Дори.

Читать далее
1
23 ...