Обновить
512K+

Машинное обучение *

Основа искусственного интеллекта

1 273,61
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

Claude вскрыл 16 SAML‑проектов за месяц вечеров. Чинить их оказалось некому

Уровень сложностиПростой
Время на прочтение5 мин
Охват и читатели4.8K

Об одной и той же уязвимости в Authentik — популярной опенсорсной системе корпоративного входа — независимо и почти одновременно сообщили восемь исследователей. Уязвимость (CVE-2026-57580) позволяла вставить в поле с идентификатором пользователя (NameID) XML‑комментарий, обрезать значение до чужого адреса и привязать к жертве подконтрольную атакующему учетную запись — подпись при этом оставалась валидной. Срабатывало это не у всех: нужны определенные настройки сопоставления учетных записей, отличные от заданных по умолчанию. Закрыли проблему в версиях 2026.2.6 и 2026.5.5. Один из восьмерых — Эрик Чан (Eric Chiang), технический директор компании Oblique Security; для него эта находка была одной из шестнадцати. Свою историю он рассказал в блоге 19 августа, а то, что желающих оказалось восемь, объясняет просто: очевидно, он не единственный, кто теперь взламывает с помощью ИИ.

Читать далее

Новости

AI‑агенты в крупном бизнесе: где сейчас рынок, что построили мы и как внедрять, чтобы взлетело

Время на прочтение10 мин
Охват и читатели5.8K

Привет, Хабр! Я, Катрушенко Максим, занимаюсь внедрением ИИ в Первой Грузовой компании — крупном железнодорожном операторе на рынке грузовой логистики. Последние полгода активно изучаю тему использования ИИ‑агентов в больших компаниях. Многие рассказывают захватывающими истории, как раньше ничего не работало, а теперь «полетело», кто‑то смело делится провалами. Хочу поделиться, что получилось сделать у нас за довольно ограниченный срок и какой опыт мы извлекли.

Читать далее

[4/8] Semantic Context: как LSP помогает LLM понять код

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели4.7K

В предыдущей заметке обсуждалось как искать похожий код в репозитории. Для этого мы брали код около курсора, превращали его в поисковый запрос, находили кандидатов через BM25 и добавляли наиболее релевантные фрагменты в контекст модели.

Но код - это не просто текст. Импорт ссылается на конкретное объявление, переменная имеет определенный тип, а метод может принадлежать классу или интерфейсу. В этой заметке мы добавим в систему автодополнения источник контекста, который знает об этих связях внутри проекта.

Читать заметку

Засовываем VLA на гуманоида: как выбрать платформу, модель и планировщик

Уровень сложностиСложный
Время на прочтение27 мин
Охват и читатели5.1K

Год назад на проекте гуманоида с Jetson Orin на борту меня регулярно спрашивали одно и то же. “Можно ли гонять нашу VLA локально, без сети?” VLA это модель. Она берёт кадр и текст и выдаёт команды на приводы.

Я листал документацию, тикеты PyTorch и чужие статьи, а когда разобрался, ответил пересчётом. “Теоретически да, но от кадра до движения выходит 0,84 с. Робот за это время успеет упасть, а пользователь решит, что он завис.”

После того гуманоида ко мне не раз приходили за помощью в проектировании. Чаще это была детекция на 30 FPS на плате за $10 или передовая LLM на устройстве.

Нужна документация, местами китайская, которую приходится гонять через переводчик, и нужны подробные инженерные расчёты. Пиковые тераоперации из даташита почти не двигают задержку от кадра до движения.

Читать далее

Сколько автономности должно быть у ИИ‑агента

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели4.2K

ИИ‑агент не должен получать больше автономности только потому, что выглядит компетентным. Автономность должна расти тогда, когда система вокруг агента умеет надежно обнаруживать его ошибки.

Читать далее

Невидимые метки в AI-картинках 2.0: JPEG, blur, перерисовка и ошибки первого теста

Уровень сложностиПростой
Время на прочтение5 мин
Охват и читатели4.6K

После первой статьи в комментариях попросили больше технической части и меньше выводов по одной картинке. Разбираюсь, что SynthID переживает, что может разрушить метку и что вообще доказывает её наличие.

В первой статье я проверил одно изображение через сторонний сервис и сделал из этого слишком широкий вывод. В комментариях предложили более нормальный набор тестов: JPEG-сжатие, resize, crop, blur, скриншот, повторную генерацию и анализ частотной области. Там же мне скинули reverse engineering SynthID. Так что здесь разбираемся уже не с одним сервисом, а с самой технологией.

Услышал ваши комментарии, исправляюсь

Почему токенайзер реж ет сло ва не там, где нужно

Уровень сложностиСредний
Время на прочтение9 мин
Охват и читатели7.4K

Заголовок этой статьи, частично, наглядная демонстрация того, как его видит языковая модель. Куски слов, нарезанные по логике, которая к русскому языку не имеет вообще никакого отношения.

И из этой нарезки растет длинный список вещей, которые иногда списывают на «глупую нейронку» (особенно если речь идет о небольших локальных моделях): модель не может посчитать буквы в слове, путается в арифметике, коверкает редкие фамилии, а русский текст обходится вдвое дороже английского при том же смысле.

А еще оттуда же растут вещи, которые с токенами вообще вроде бы не связаны. Например: почему «давай рассуждать по шагам» реально работает, и почему лишний пробел в конце промпта портит ответ.

Виноват во всем этом компонент стека, который первым в пайплайне, никогда не обучается вместе с моделью и которому обычно посвящают полтора абзаца в начале туториала. Что ж, давайте по порядку.

Читать далее

Эксперимент: заставляем трансформер читать палиндромы через Чебышёва и комплексные экспоненты

Уровень сложностиПростой
Время на прочтение4 мин
Охват и читатели5.4K

Большинство нейросетей работают с числами и читать как человек они не умеют, поэтому инженерами были придуманы способы помочь нейросети уловить не только смысл конкретного слова, но и всего предложения. Для достижения такой цели используется positional encoding, то есть помимо отдельных слов нейросети дают их порядок в тексте. В данной статье приведен сравнительный анализ чисто смысловых векторов, линейного базиса (порядковый номер слова), базиса Фурье (синусы и косинусы), комплексного (экспоненты) и полиномы Чебышева для кодирования двух английских палиндромов.

Читать далее

Человек, которого никогда не было. Как ИИ создаёт синтетические личности?

Уровень сложностиСредний
Время на прочтение9 мин
Охват и читатели4.9K

Ещё недавно у фальшивой личности обязательно был настоящий владелец.

Мошеннику требовался чужой паспорт, фотография, номер телефона или хотя бы несколько строк из утёкшей базы. Дальше начиналась ручная работа: заменить снимок, исправить дату рождения, подобрать похожее лицо, придумать объяснение для оператора.

Человек мог не знать, что от его имени берут кредит, но он существовал.

Привет, Хабр! Мы Михаил Никитин и Карина Саркисян из команды Tevian. На всякий случай уточним: мы настоящие. А вот с героями этой статьи не всё так однозначно..

Генеративный ИИ сильно упростил создание таких профилей. Теперь мошенническую анкету можно собирать с пустого листа. Нейросеть придумает биографию, нарисует лицо, исправит документ, оживит портрет для видеозвонка и поможет отвечать на вопросы службы поддержки. Реальными останутся только отдельные детали: адрес, телефон, номер документа или данные из утечки. Получится человек, у которого есть паспорт, селфи и цифровой след. Нет только прошлого.

Разобрать синтетическую личность

Быстрое обучение, экономия ресурсов и другие преимущества сетей эхо-состояний

Уровень сложностиСредний
Время на прочтение4 мин
Охват и читатели5.1K

Существует класс рекуррентных нейросетей, в котором обучается только линейный выходной слой, а внутренняя структура (резервуар) остаётся фиксированной. Отсюда появилось название более общего подхода — «резервуарные вычисления».

Такая архитектура делает нейросети крайне быстрыми и энергоэффективными, но сложными в настройке. Поэтому они пока не получили широкого распространения и долгое время оставались в тени более универсальных архитектур.

Сотрудник отдела перспективных исследований компании «Криптонит» Илья Андросов провёл глубокий сравнительный анализ архитектур и методов обучения сетей эхо-состояний (Echo State Networks, ESNs). Автор выполнил обзор ряда известных ESNs и для некоторых из них предложил модификации, существенно улучшившие их основные характеристики.

Читать далее

476 000 новостей против нейронки: пять попыток заставить текст предсказывать цену

Уровень сложностиСредний
Время на прочтение10 мин
Охват и читатели4.6K

Гипотеза «новости двигают рынок» — самая интуитивная в трейдинге. Настолько интуитивная, что я потратил на её проверку недели GPU-часов, полный архив финансовых телеграм-каналов с 2021 года и пять принципиально разных постановок задачи — от простых счётчиков упоминаний до NLP-разметки и пер-минутного event study.

Результат: ноль из пяти. Ни одна постановка не улучшила боевую модель (с одной унизительной для NLP оговоркой — она в конце).

Но интересен не сам ноль — интересно, как именно проваливалась каждая попытка. Две из пяти сначала показали «улучшение» в бэктесте, и если бы я остановился на агрегатной цифре, сейчас бы искренне рассказывал вам, что нейронка с новостями торгует лучше. Эта статья — подробный разбор всех пяти механизмов: что строил, какие признаки считал, какие цифры получил и где именно каждая версия обманывала.

Это обещанное продолжение статьи про сидовый шум ±10 п.п. — протокол проверки оттуда, здесь он работает на живом сквозном примере.

Читать далее

Как мы написали свой OCR и автоматизировали горы первички

Время на прочтение9 мин
Охват и читатели5.5K


Когда внутренних заказчиков становится слишком много — каждый со своими хотелками и типом документов — поддерживать кучу отдельных сервисов уже нереально.

Отдел кадров приносит документы о приёме на работу, бухгалтерия хочет сверять финансовую отчётность, другие подразделения — своё. Нужен был единый сервис, который умеет распознавать документы и гибко настраивать извлечение данных под любой шаблон.

Ситуацию усложнил уход западных вендоров — тот же ABBYY стал недоступен. Просто взять и купить готовый зарубежный софт мы не могли — ни по соображениям безопасности, ни по факту: рынок сам закрыл эту возможность. 

Нужно было решение, которое работает строго внутри защищённого контура. С открытым API, через который можно интегрироваться с практически любой внутренней системой.

Так в Гринатоме (ИТ-интеграторе Росатома) мы начали разработку Атом.Око. Это система, которая не просто видит текст на скане, а понимает структуру документа. Вытаскивает реквизиты, проверяет наличие подписей и печатей.

Читать далее

Первая мРНК-вакцина от рака выиграла третью фазу. При чем здесь ИИ?

Уровень сложностиПростой
Время на прочтение4 мин
Охват и читатели8K

Merck и Moderna объявили об успехе третьей фазы испытаний интисмерана аутогена — персонализированной мРНК-вакцины от рака, известной ранее как mRNA-4157. В исследовании INTerpath-001 участвовали 1137 пациентов с полностью удаленной меланомой стадий IIB–IV: одна группа получала стандартную терапию, пембролизумаб (он же "Китруда"), другая — то же самое плюс вакцину. При заранее запланированном промежуточном анализе комбинация обошла стандарт и по первичной конечной точке (время до возврата болезни), и по ключевой вторичной (время до появления отдаленных метастазов). Это первый в истории положительный результат третьей фазы для мРНК-вакцины против рака — направления, от которого прорыва ждали больше десяти лет, но которое ни разу не доходило до победы в решающем испытании.

Читать далее

Ближайшие события

Хайп вокруг ИИ: реальное состояние дел и будущее

Уровень сложностиПростой
Время на прочтение39 мин
Охват и читатели27K

Меня зовут Ричард Кэмпбелл. Я из Ванкувера из канадской провинции Британская Колумбия. В Копенгагене я не впервые и, как уже говорил, выступал на множестве конференций NDC1.

Этот доклад сложился сам собой, потому что в последнее время вокруг происходящего с искусственным интеллектом возникла неразбериха. Начать надо с этого ужасного названия. Термин старый, ещё из 1950-х. Придумала его группа учёных, пытавшихся выбить финансирование у американских военных, что, кстати, у них получилось.

Читать далее

Лето в стиле Light Academia. Как прошла школа по искусственному интеллекту «Лето с AIRI» 2026

Уровень сложностиПростой
Время на прочтение10 мин
Охват и читатели7.8K

Всем привет! Меня зовут Заруцкий Семён, я выпускник и новоприбывший аспирант физического факультета МГУ. Изначально я занимался экспериментальными квантовыми технологиями, со временем появилась необходимость моделировать физические процессы на компьютере, а следом в мою жизнь вошли прикладные ML‑проекты. Пришло всё к тому, что недавно мне посчастливилось принять участие в летней школе по искусственному интеллекту «Лето с AIRI» 2026, которую Институт провёл в Первом университетском лицее им. Н.И. Лобачевского в Усть‑Лабинске совместно с Фондом «Вольное дело». 

О том, как прошла школа и что интересного успело произойти, я расскажу в этой статье. Делать это я буду не один, мне поможет Настя Золотарева, сотрудник Института ИИ МФТИ, биофизик по образованию и моя коллега по школе. Мы оба прошли через это увлекательное и полное депривации сна приключение, а теперь хотим поделиться им с вами. Если вкратце, это был интенсив на грани возможностей, но в потрясающе тёплой атмосфере. 

А теперь с самого начала.

Читать далее

Как определить местоположение людей по Wi-Fi

Уровень сложностиСредний
Время на прочтение3 мин
Охват и читатели7.9K

Насколько точно можно определять местоположение людей с помощью Wi-Fi? А что если дополнить это BIM-данными и инфой об использовании помещений?

Рассказываю о том, что мы с коллегами напроверяли, как решали задачу и какие результаты получили в очередном проекте.

Читать далее

7 ошибок в оценке качества LLM‑систем в продакшене

Уровень сложностиСредний
Время на прочтение13 мин
Охват и читатели8K

LLM‑фича может месяцами показывать хорошие метрики и при этом регулярно ошибаться на реальных запросах.

В статье разберём 7 типичных провалов в оценке качества LLM‑систем: где ломаются эвалы, почему врут дашборды и как выстроить контроль, которому можно доверять в продакшене.

Найти ошибки

Claude сам собрал конвейер из десяти нейросетей и спроектировал 354 белка

Уровень сложностиПростой
Время на прочтение5 мин
Охват и читатели7.8K

Anthropic опубликовала результаты биологического эксперимента (плюс подробный отчет), в котором модель работала без человека до двух суток подряд. Claude получил список из шестнадцати белков-мишеней и задание: придумать для каждой по тридцать маленьких белков, которые к ней прилипнут. Дальше человек не вмешивался ни в одно научное решение — только подтверждал агенту сетевые доступы и следил, чтобы не упала инфраструктура. Готовые молекулы синтезировали и проверили две сторонние лаборатории. Одну мишень пришлось выбросить: белок слипался сам с собой, и оба прибора выдали нечитаемый сигнал. По остальным пятнадцати из 1320 проверенных дизайнов связались 354, а мишеней с хотя бы одним попаданием оказалось 14.

Читать далее

Онлайн‑магистратура НИЯУ МИФИ «Специалист по работе с данными и применению ИИ»: как успеть поступить в 2026 году

Уровень сложностиПростой
Время на прочтение3 мин
Охват и читатели7.2K

Привет, это команда Яндекс Практикума. Приём документов на поступление в 2026 году закончится меньше, чем через неделю, но вы ещё можете успеть поступить в онлайн-магистратуру «Специалист по работе с данными и применению ИИ» НИЯУ МИФИ в партнёрстве с Практикумом. В статье мы расскажем, что входит в программу и как на неё поступить.

Читать далее

Собеседник замолчал или просто задумался: как мы учили голосового ассистента не перебивать людей

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели7.1K

«Мой номер заказа... сейчас, секунду...» — и бодрое «Да, я вас понял, минуточку!» прямо в середину фразы.

Все, кто звонил в поддержку за последние пару лет, это слышали. Выглядит как мелкая недоработка, а на деле это одна из самых неприятных задач в голосовом стеке, и решается она заметно хуже, чем кажется со стороны.

Формулируется она так: понять, что человек в трубке закончил говорить, а не взял паузу. Ниже — про то, почему готовые VAD эту задачу не решают в принципе, что мы перебрали, прежде чем взяться за свое, и где у нас до сих пор не получается.

Дисклеймер: работаю в аутсорсинговом контакт-центре, мы несколько лет делаем свой голосовой стек — телефония, распознавание, ассистенты на LLM. Продукт не называю и ссылок не будет, статья про задачу.

Читать далее
1
23 ...