Обновить
512K+

Машинное обучение *

Основа искусственного интеллекта

1 184,87
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

Верни мне музыку, или как нейросети слышат и сочиняют песни

Уровень сложностиПростой
Время на прочтение9 мин
Охват и читатели6.1K

Флейтистка разбирается, как музыкальные нейросети слышат ноты и читают промты. Пою для AssemblyAI, заказываю Suno ми минор и проверяю, что нейросети поняли, а что сыграли от себя.

Читать далее

Как я собрал охранника для комнаты на YOLO и подключил его к Telegram

Уровень сложностиСредний
Время на прочтение12 мин
Охват и читатели9.9K

Я живу один, и обычно знаю, кто может быть у меня дома. Но во время отъезда в голову иногда лезут неприятные мысли. «А вдруг кто-то всё-таки заходил, пока меня не было?». Это мог быть сосед, родственник или мастер, но без камеры остаётся только гадать.

И захотелось закрыть этот вопрос одним простеньким скриптом. Камера видит человека у двери, а в Telegram приходит сообщение и кадр. В процессе немного перестарался. Получился бот с поддержкой нескольких камер, тревогой, голосом, распознаванием лиц и возможностью вынести обработку данных на отдельный сервер.

В этой статье расскажу, зачем здесь вообще нужна YOLO и почему простого детектора движения оказалось мало. Как я проверял работоспособность проекта в реальных условиях, почему не отправляю в чат обычные фотографии людей и как организована приватность. А также как подключить телефон в качестве камеры и вынести тяжёлую обработку на удалённый сервер.

Смотреть дальше

Можно ли собрать работающий интерфейс на ИИ за час?

Уровень сложностиПростой
Время на прочтение12 мин
Охват и читатели11K

«Закину промпт в ИИ, а через секунду получу готовый интерфейс, свой сайт или дашборд» — такая идея наверняка приходила каждому, кто не связан с дизайном или разработкой. ИИ-инструменты для этих сфер активно распространяются и обещают такие фантастические результаты, что закрадывается мысль: а что, если скоро дизайнеры будут не нужны?

Все же между картинкой и рабочим прототипом большая пропасть. Иерархия элементов на экране, адаптивность, доступность, логика сценариев и продуктовые метрики — это лишь ограниченный список пунктов, которые очень сложно уложить в один промпт. 

Забыла представиться: меня зовут Камила, я проектировщик интерфейсов в Selectel. Вместе с бумом ИИ коллеги чаще начали ко мне приходить с вопросами такого рода: «Мне ИИшка макет сделала, сделай ревью, пожалуйста». Так что я решила разобраться со своей дизайн-колокольни — где ИИ может помочь, а где создает привлекательную, но не самую работающую концепцию. 

Читать далее

9 миллиардов мутаций ДНК от Google: зачем ученым понадобилась карта всего человеческого генома

Время на прочтение6 мин
Охват и читатели5.4K

Привет, Хабр! Сегодня поговорим о генетике и технологиях. Обе развиваются быстро, но неравномерно. Человеческий геном «прочитали» больше двадцати лет назад, а понять его до конца так и не удалось. Знать последовательность трех миллиардов «букв» ДНК — это одно. Разобраться, за что отвечает каждая из них, — совсем другое. В этом геноме сам черт ногу сломит. Возьмем, например, участки, которые не содержат инструкций для производства белков. Когда я учился в университете, их называли «мусорными». Они занимают около 98% генома, а последствия изменений внутри них до конца не понятны.

Сейчас в Google DeepMind решили во всем этом разобраться в рамках проекта AlphaGenome Atlas. И заодно просчитать все возможные замены одной «буквы» в человеческой ДНК. Таких вариантов набралось около девяти миллиардов. Почему — разберемся ниже.

Читать далее

В событии про письмо нет ни суммы, ни контрагента. Чем платят за то, чтобы эти поля появились

Уровень сложностиСредний
Время на прочтение5 мин
Охват и читатели5.4K

Почтовый аудит-лог Яндекс 360 отдаёт запись о событии структурой ответа AuditLogService_Mail, а в ней 22 поля (справочник Яндекс 360 API, сверка 10 сентября 2026 года). Тема письма и адреса участников среди них есть, а ни суммы, ни контрагента, ни номера договора нет. Ограничения распознавания и рекомендации к качеству входа я привожу по документации Anthropic, а дальше идёт моя инженерная логика: какой шаг создаёт недостающие поля и чего это стоит.

Смотреть, чего нет в записи о событии.

Я обучил собственную визуально‑языковую модель меньше чем на 1 млрд параметров

Уровень сложностиСредний
Время на прочтение12 мин
Охват и читатели11K

Как собрать собственную визуально-языковую модель с нуля, имея ограниченный бюджет и одну арендованную GPU? Автор эксперимента взял небольшую языковую модель, подключил к ней визуальный энкодер и прошёл весь путь обучения VLM – от настройки архитектуры до оценки качества ответов. В статье – разбор решений, ошибки первых запусков и результаты модели на 628 млн параметров, которая научилась описывать изображения примерно за $200.

Смотреть результат

От совпадения слов к пониманию смысла запроса: как эволюционировали поисковики и AI‑чаты

Уровень сложностиПростой
Время на прочтение17 мин
Охват и читатели9K

Кто помнит поисковики начала двухтысячных, наверняка помнит, что результаты выдачи иногда имели мало общего с самим запросом. Системы слабо учитывали порядок слов, синонимы, предлоги и отрицания, поэтому пользователям приходилось упрощать формулировки, добавлять уточнения и пробовать запрос в нескольких вариантах.

Чат-боты того времени тоже были совсем не похожи на современные AI-чаты. Они находили во фразе знакомое ключевое слово и выбирали одну из заранее подготовленных реплик, а любое отклонение от предусмотренного сценария быстро заводило диалог в тупик.

Сегодня поисковые системы распознают сущности, учитывают контекст, геопозицию и смысловые связи между словами, а также способны формировать ответы на основе нескольких источников. AI-чаты понимают разные формулировки одного намерения, работают с текстом, изображениями и голосом, используют веб-поиск и могут учитывать контекст предыдущих разговоров.

Чтобы поисковые системы и AI-чаты научились отвечать так, как они отвечают сегодня, потребовался долгий путь. Именно об этой эволюции и пойдет речь в статье.

Читать далее

Роадмап ML 2026: полный путь до оффера за 36 недель

Уровень сложностиПростой
Время на прочтение17 мин
Охват и читатели14K

36 недель. Столько, по моему мнению, занимает путь от нуля до выхода на рынок ML-инженером. Не 2-3 месяца, как обещают курсы, — чуть дольше. Зато на выходе у вас будет фундамент, с которым можно пройти не только собеседования, но и испытательный срок.

В этой статье — весь маршрут по неделям: что учить, в каком порядке, сколько на это уходит времени и что можно смело отложить до первого оффера.

Читать далее

Каскадное планирование тренировок с LLM: как удержать план в рамках методики

Время на прочтение6 мин
Охват и читатели7.7K

LLM хорошо справляется с формой тренировочного плана: распределяет занятия по дням, описывает интенсивность, объясняет упражнения. Но связный текст ещё не означает связную методику. Модель сама по себе не хранит актуальный контекст спортсмена и не обеспечивает преемственность между целью сезона и завтрашней тренировкой. В 1trAIner мы решаем эту задачу через каскад горизонтов, явный контекст и ограничения поверх генерации. Ниже — устройство этого подхода, его защитные механизмы и границы.

Читать далее

Почему ИИ-агент сжигает токены: как я снизил стоимость сессии с 48 до 8 рублей

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели8K

На тридцатом шаге мой ИИ-агент отправлял нейросети 123 856 входных токенов. Один запрос весил как небольшой роман и стоил соответственно. При этом большая часть контекста уже приезжала раньше: логи, прочитанные файлы, старые ответы инструментов и описания тех инструментов, которые на этом шаге вообще не использовались.

Я начал резать повторный контекст. Сначала на сервере, потом на компьютере пользователя. За два дня вокруг простой идеи выросли локальный архив, оглавление сессии, загрузка схем инструментов по требованию и песочница для вычислений.

На одном и том же 30-шаговом сценарии стоимость снизилась с 48,26 до 8,40 рубля, а вход — с 2,4 миллиона до 419 тысяч токенов. Полный вариант решил 30 задач из 30.

Красиво. Даже слишком.

Стенд был синтетическим. Когда я вынес движок в живого агента, выяснилось, что на коротких задачах оптимизация может сделать всё дороже. Тут и начинаются границы красивой цифры.

Читать далее

Как устроен RAG для юридических документов и почему одной LLM оказалось недостаточно

Уровень сложностиСредний
Время на прочтение9 мин
Охват и читатели7.8K

Первый вариант системы выглядел вполне стандартно: документы разбиваются на фрагменты, для них считаются embeddings, пользователь задаёт вопрос, несколько наиболее подходящих фрагментов отправляются в LLM вместе с запросом. Модель формулирует ответ — на первых тестах этого было достаточно.

Проблемы начались на вопросах, которые на первый взгляд мало чем отличаются друг от друга: Какая пеня установлена в договоре № 14/24? Кто из арендаторов не заплатил за май? А у него предусмотрена индексация? Контрагент предлагает заменить пеню 0,05% на 0,01%. Насколько это существенно?

Формально всё это вопросы об аренде. Для системы это четыре разные задачи.

Читать далее

Как методичка из 1990-х объясняет устройство современных нейросетей

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели94K

Разбирал старые методички по линейной алгебре (да, у меня правда есть такая привычка, не спрашивайте) и наткнулся на отрывок про химию. Автор пишет: «Молекула воды — это вектор (2, 0, 1). Молекула метана — вектор (4, 1, 0)». И дальше без смущения переходит к линейной зависимости векторов, как будто написанное выше — самая естественная вещь на свете.

Сначала я подумал, что это методическая вольность ради упражнения. Потом посидел с этим с полчаса и понял, что автор-то прав, а заодно и случайно объяснил, почему вообще из любой предметной области можно слепить нейросеть. Просто в 1990-х это называлось линейной алгеброй, а не representation learning.

Читать далее

Большой релиз библиотеки ударений в silero-stress для русского языка

Уровень сложностиСредний
Время на прочтение17 мин
Охват и читатели10K

Мы писали на Хабре про нашу быструю и качественную библиотеку для простановки ударений и разрешения омографов на русском языке. Потом к ней доехали ещё акценторы для белорусского и украинского языков и словари ещё для 17 языков.

В этот раз у нас получилось очередное приключение на 20 минут. Изначально мы не планировали делать прямо большой релиз, но как обычно одно потянуло за собой другое, в процессе мы нашли много новых источников данных и получился прямо полноценный релиз:

Что вошло в релиз?

Ближайшие события

Спекулятивное декодирование: от чего на самом деле зависит ускорение

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели5.8K

Спекулятивное декодирование обещает ускорение до 6.5 раза: маленькая черновая модель набрасывает несколько токенов вперёд, большая проверяет их за один свой проход, а текст на выходе получается тот же самый. Я воспроизвёл EAGLE-3 на бесплатной Kaggle T4 и получил разброс от 2.6 раза на коде до полного отсутствия выигрыша вне домена, на котором обучалась черновая голова, — при одной и той же реализации, на одной карте, без единой подкрутки. Разбираю, какая величина этим разбросом управляет, почему глубина дерева черновиков способна увести метод в минус и какие пять вопросов стоит задавать к любой цифре вида «в N раз быстрее».

Читать далее

Искусственный интеллект: смерть учителя — или рождение нового?

Время на прочтение8 мин
Охват и читатели5.6K

Что останется от профессии учителя, когда машина научилась объяснять, проверять и создавать учебные материалы быстрее

Дмитрий Полетаев

Скажем это сразу: если работа учителя сводится к объяснению правила, пересказу учебника, проверке стандартного упражнения и составлению теста, то такой учитель уже технологически устарел. Не когда-нибудь через десять лет, не после появления искусственного общего интеллекта и не в тот торжественный день, когда министерство образования наконец выпустит соответствующую инструкцию. Уже сейчас. Искусственный интеллект выполняет эту часть работы быстрее, терпеливее и дешевле, не устаёт повторять одно и то же, способен за несколько секунд изменить уровень сложности, придумать ещё двадцать примеров и быть доступным ученику в три часа ночи. Можно сколько угодно возражать против качества отдельных ответов, вспоминать галлюцинации моделей и справедливо требовать проверки фактов, но профессиональную судьбу рутинной функции решает не совершенство технологии. Достаточно, чтобы она оказалась удобнее и доступнее человека в большинстве обычных случаев.

Значит ли это, что заканчивается преподавание? Возможно. Но только то преподавание, которое мы слишком долго соглашались считать профессией: учитель говорит, ученик записывает, затем воспроизводит услышанное, а учитель измеряет точность воспроизведения. Именно эта модель сегодня рушится у нас на глазах. И если мы по привычке станем защищать её как незаменимую, то защитим не учителя, а самый легко заменяемый набор его функций.

Читать далее

Личное устройство. Как мы разработали интеллектуальную колонку СберБум 2.0

Время на прочтение14 мин
Охват и читатели7.3K

Салют, Хабр!

Я Владимир, HW TPM lead в SberDevices. Сегодня мы выпустили новую интеллектуальную колонку — СберБум 2.0. Разрабатывая устройство, мы хотели обеспечить пользователю максимально комфортный и личный опыт взаимодействия с устройством. Создать колонку, которая будет ощущаться полностью своей. 

СберБум 2.0 можно назвать так, как хочешь — мы добавили в неё кастомный споттер. В её памяти сохраняется более 200 музыкальных треков. Это устройство с отличным звуком (об акустике расскажем отдельно), Zigbee-модулем и протоколом Matter over Wi-Fi. Всего одна колонка… за которой стоят десятки концепций, сотни тестов, тысячи образцов. Сложности разработчикам, а пользователю — магия. В этой статье расскажу о «железе» новой колонки, а мой коллега Иван — о софтверных фичах.

Читать далее

Синтетическая речь разборчивее живой. Или нет? Разбираем Qwen-Audio-3.0-TTS и что происходит в метриках

Время на прочтение16 мин
Охват и читатели7.2K

Привет, Хабр! Меня зовут Саша, я пишу курс «Аудиоанализ, распознавание и генерация речи» в Яндекс Практикуме, работаю ML-инженером в аудиодомене и вообще послеживаю за индустрией.

Пару месяцев назад вышла статья по генерации речи от Alibaba — Qwen-Audio-3.0-TTS. И вот что примечательно: в таблице результатов на SEED-TTS-Eval есть строка Human, и это не какая-то модель-гуманоид, а настоящая живая человеческая речь, прогнанная через тот же бенчмарк, что и все системы в сравнении. Так сказать, контрольная точка отсчёта.

Так вот, у человека там ошибка 1,26, а у модели, про которую эта статья, — 0,84. На этой строчке я застрял и сел делать разбор, потому что за ней, возможно, стоит проблема поинтереснее самой модели. Вечная проблема метрик.

Под катом попробуем разобраться, что у них там происходит.

Читать далее

От «магии» к инженерии: 9 ошибок работы с контекстом при внедрении AI‑агентов в процессы

Уровень сложностиСредний
Время на прочтение10 мин
Охват и читатели5.1K

AI‑агенты часто теряют качество не из‑за ограничений LLM, а из‑за неправильно организованного контекста. В статье разберём типовые ошибки работы с контекстом: перегруженные базы знаний, отсутствие памяти, устаревшие инструкции и попытки решить всё одним промптом. Поговорим о том, как выстроить архитектуру знаний, чтобы AI‑агент стал предсказуемым инструментом.

Разобрать ошибки

Архитектура важнее модели: как меняется обработка документов в эпоху ИИ

Уровень сложностиПростой
Время на прочтение9 мин
Охват и читатели4.9K

— В этом проекте нам надо хорошо распознавать документы.

— А что значит «хорошо»?

— Сейчас же везде ИИ. Я загружаю документ в чат, и он мне всё правильно отвечает. Нам надо так же для всех документов.

Такие диалоги я всё чаще слышу при обсуждении новых проектов.

А значит, ситуация, когда со стороны бизнеса звучит вопрос «почему сложно сделать так же, как в чате — только на все документы», — уже обыденность.

Я много лет занимаюсь промышленными системами обработки и распознавания документов. Когда система «смогла» на одном документе, я стараюсь не очароваться этим и не смотреть как на магию. Я стараюсь думать, как это сделать потоком.

Современные модели ИИ действительно почти стирают грань между вопросом к текстовому документу и вопросом к изображению. Выглядит как магия.

Но надо разобраться, что делать с документами, когда магии не случилось. Попробую обобщить подходы к организации обработки потока документов и поразмышлять, о чем лучше не забывать, проектируя такой поток.

Читать далее

Стресс-тест, который отвечает на вопрос бизнеса «а что, если»

Уровень сложностиСредний
Время на прочтение5 мин
Охват и читатели4.2K

Ровно 18 лет назад, 15 сентября 2008 года, обанкротился Lehman Brothers — крупнейшее банкротство в истории США. Банк не использовал стресс-тесты для коммерческой недвижимости, поэтому ответа на вопрос «а что, если офисы и торговые центры обесценятся» у него не было.

Сегодня стресс-тест доступен любой компании, а не только банку с отделом риска. «А что, если доставка вырастет на 3 дня», «конкурент снизит цену на 15%», «ставка по ипотеке поднимется на 3 пункта» — на каждый вопрос можно ответить числом, а не словами.

Далее — шаги, как посчитать на своих данных. Код движка и инструкция в опенсорсе.

Читать далее