Обновить
512K+

Машинное обучение *

Основа искусственного интеллекта

1 325,49
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

Хайп вокруг ИИ: реальное состояние дел и будущее

Уровень сложностиПростой
Время на прочтение34 мин
Охват и читатели556

Меня зовут Ричард Кэмпбелл. Я из Ванкувера из канадской провинции Британская Колумбия. В Копенгагене я не впервые и, как уже говорил, выступал на множестве конференций NDC1.

Этот доклад сложился сам собой, потому что в последнее время вокруг происходящего с искусственным интеллектом возникла неразбериха. Начать надо с этого ужасного названия. Термин старый, ещё из 1950-х. Придумала его группа учёных, пытавшихся выбить финансирование у американских военных, что, кстати, у них получилось.

Читать далее

Новости

Лето в стиле Light Academia. Как прошла школа по искусственному интеллекту «Лето с AIRI» 2026

Уровень сложностиПростой
Время на прочтение10 мин
Охват и читатели3.5K

Всем привет! Меня зовут Заруцкий Семён, я выпускник и новоприбывший аспирант физического факультета МГУ. Изначально я занимался экспериментальными квантовыми технологиями, со временем появилась необходимость моделировать физические процессы на компьютере, а следом в мою жизнь вошли прикладные ML‑проекты. Пришло всё к тому, что недавно мне посчастливилось принять участие в летней школе по искусственному интеллекту «Лето с AIRI» 2026, которую Институт провёл в Первом университетском лицее им. Н.И. Лобачевского в Усть‑Лабинске совместно с Фондом «Вольное дело». 

О том, как прошла школа и что интересного успело произойти, я расскажу в этой статье. Делать это я буду не один, мне поможет Настя Золотарева, сотрудник Института ИИ МФТИ, биофизик по образованию и моя коллега по школе. Мы оба прошли через это увлекательное и полное депривации сна приключение, а теперь хотим поделиться им с вами. Если вкратце, это был интенсив на грани возможностей, но в потрясающе тёплой атмосфере. 

А теперь с самого начала.

Читать далее

Как определить местоположение людей по Wi-Fi

Уровень сложностиСредний
Время на прочтение3 мин
Охват и читатели4.5K

Насколько точно можно определять местоположение людей с помощью Wi-Fi? А что если дополнить это BIM-данными и инфой об использовании помещений?

Рассказываю о том, что мы с коллегами напроверяли, как решали задачу и какие результаты получили в очередном проекте.

Читать далее

7 ошибок в оценке качества LLM‑систем в продакшене

Уровень сложностиСредний
Время на прочтение13 мин
Охват и читатели4.6K

LLM‑фича может месяцами показывать хорошие метрики и при этом регулярно ошибаться на реальных запросах.

В статье разберём 7 типичных провалов в оценке качества LLM‑систем: где ломаются эвалы, почему врут дашборды и как выстроить контроль, которому можно доверять в продакшене.

Найти ошибки

Claude сам собрал конвейер из десяти нейросетей и спроектировал 354 белка

Уровень сложностиПростой
Время на прочтение5 мин
Охват и читатели4.8K

Anthropic опубликовала результаты биологического эксперимента (плюс подробный отчет), в котором модель работала без человека до двух суток подряд. Claude получил список из шестнадцати белков-мишеней и задание: придумать для каждой по тридцать маленьких белков, которые к ней прилипнут. Дальше человек не вмешивался ни в одно научное решение — только подтверждал агенту сетевые доступы и следил, чтобы не упала инфраструктура. Готовые молекулы синтезировали и проверили две сторонние лаборатории. Одну мишень пришлось выбросить: белок слипался сам с собой, и оба прибора выдали нечитаемый сигнал. По остальным пятнадцати из 1320 проверенных дизайнов связались 354, а мишеней с хотя бы одним попаданием оказалось 14.

Читать далее

Онлайн-магистратура НИЯУ МИФИ «Специалист по работе с данными и применению ИИ»: как успеть поступить в 2026 году

Уровень сложностиПростой
Время на прочтение3 мин
Охват и читатели4.6K

Привет, это команда Яндекс Практикума. Приём документов на поступление в 2026 году закончится меньше, чем через неделю, но вы ещё можете успеть поступить в онлайн-магистратуру «Специалист по работе с данными и применению ИИ» НИЯУ МИФИ в партнёрстве с Практикумом. В статье мы расскажем, что входит в программу и как на неё поступить.

Читать далее

В AI-картинках есть невидимые метки. Я проверил, как они работают и можно ли их удалить

Время на прочтение11 мин
Охват и читатели8.3K

Вы генерируете картинку в нейросети, скачиваете PNG и открываете его.

Никакого логотипа. Никакой надписи «создано ИИ». Никакой полупрозрачной плашки в углу.

Обычное изображение.

Но это ещё не значит, что внутри него ничего нет.

Современные генераторы всё чаще добавляют в AI-изображения информацию о происхождении, которую человек глазами не увидит. Где-то это метаданные. Где-то криптографически подписанные Content Credentials. А где-то настоящий невидимый водяной знак, встроенный непосредственно в изображение.

Например, Google использует SynthID, а OpenAI сейчас добавляет к поддерживаемым изображениям сразу два сигнала происхождения: C2PA и SynthID.

Мне стало интересно, насколько эта маркировка действительно живучая.

Можно ли определить, что изображение создано ИИ? Что именно нейросеть оставляет внутри файла? Исчезает ли маркировка после редактирования? И можно ли удалить невидимый водяной знак с AI-изображения обычным сервисом?

Я попробовал несколько вариантов. Один действительно сработал.

Но когда начал разбираться, понял, что вопрос «как удалить watermark с картинки» устроен гораздо сложнее, чем кажется.

Читать далее

Собеседник замолчал или просто задумался: как мы учили голосового ассистента не перебивать людей

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели5.4K

«Мой номер заказа... сейчас, секунду...» — и бодрое «Да, я вас понял, минуточку!» прямо в середину фразы.

Все, кто звонил в поддержку за последние пару лет, это слышали. Выглядит как мелкая недоработка, а на деле это одна из самых неприятных задач в голосовом стеке, и решается она заметно хуже, чем кажется со стороны.

Формулируется она так: понять, что человек в трубке закончил говорить, а не взял паузу. Ниже — про то, почему готовые VAD эту задачу не решают в принципе, что мы перебрали, прежде чем взяться за свое, и где у нас до сих пор не получается.

Дисклеймер: работаю в аутсорсинговом контакт-центре, мы несколько лет делаем свой голосовой стек — телефония, распознавание, ассистенты на LLM. Продукт не называю и ссылок не будет, статья про задачу.

Читать далее

NN vs фракталы: может ли нейросеть выучить красивые математические функции?

Уровень сложностиПростой
Время на прочтение3 мин
Охват и читатели4.6K

В процессе прохождения курса от MIT про нейросети наткнулась на интересную тему, представленную одним из лекторов. Он задался вопросом: «А может ли нейросеть выучить функцию Вейерштрасса (непрерывная функция на вещественной прямой, не имеющая производной ни в одной точке)?». Я решила проверить это на практике. Мною было принято решение не останавливаться на фракталах, а поискать другие функции, обладающие интересными для математика свойствами: лестница Кантора, функция Римана (Томаэ) и др. В данной статье представлена только функция Вейерштрасса.

Читать далее

Открыт предзаказ на второе издание «Грокаем алгоритмы искусственного интеллекта»

Время на прочтение2 мин
Охват и читатели5.4K

Привет, Хаброжители! На протяжении всей своей истории человечество неустанно искало способы решать задачи, прикладывая как можно меньше усилий. Люди всегда стремились создавать инструменты и автоматизировать повторяющиеся действия, чтобы выживать и экономить силы. Здесь некоторые могут поспорить, заявив, что человек умен, ищет возможности совершенствования, умеет творчески решать задачи и создавать произведения искусства в области литературы, музыки и т.п. Но второе обновленное издание «Грокаем алгоритмы искусственного интеллекта» не ставит целью обсуждение философской сути бытия. Оно дает обзор методов искусственного интеллекта, которые можно применять для решения прикладных задач.

Читать далее

Найти человека по голосу среди 134 тысяч записей

Уровень сложностиСредний
Время на прочтение12 мин
Охват и читатели5.3K

В последний вечер дататона у нас оставалось три попытки отправить решение. К этому моменту мы уже перебрали несколько моделей, собрали тяжёлый ансамбль и упёрлись в 0.6605. Новые энкодеры добавляли по одной-две тысячных, а fine-tuning показывал отличные цифры локально и проваливался на лидерборде.

Добавлять ещё одну модель смысла почти не было. Мы решили изменить сам поиск соседей: попробовать K-reciprocal re-ranking, а затем ещё раз применить AS-Norm. От этого варианта ждали примерно 0.67–0.69.

Получилось 0.7042 и 10-е место из 93. Почти весь день мы пытались выжать из моделей тысячные, а перерасчёт соседей добавил больше четырёх сотых без дополнительного обучения.

Читать далее

Harness, Да пребудет с тобой JavaScript

Уровень сложностиСредний
Время на прочтение18 мин
Охват и читатели5K

Современные AI-агенты действуют в реальном мире с помощью доступных им инструментов (tools). Ядро вокруг модели (LLM), которое позволяет всему этому работать (harness), серьезно влияет на качество и стоимость конечных ответов. При этом добавление в harness простого JavaScript может существенно прокачать AI-агента и заменить часть долгих и дорогих рассуждений простейшим кодом, который будет лучше, точнее и быстрее.

В этой статье разберу как такие интерпретаторы могут помогать. Начну с примера, который можно повторить у себя в LM Studio, а потом перейду к более общему устройству на LangChain, где простой JS-интерпретатор становится уже не таким простым, а забирает часть логики с LLM и помогает ей фокусироваться на том, что нужно, делегируя детерминированную логику скрипту.

Читать далее

Думал, Android пишет двигатель хуже iOS. Передумал. Потом оказалось, что прав, но по своему

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели4.5K

Полторы тысячи записей моторов с телефонов. Виноват был не бренд и не цена телефона, а то, чей DSP отрабатывает запрос браузера.

На iOS та же правка сработала наоборот.

Ближайшие события

[3/8] Context Ranking: как выбрать полезные фрагменты из репозитория

Уровень сложностиПростой
Время на прочтение9 мин
Охват и читатели4.4K

Продолжаем разбирать, как система автодополнения собирает контекст для LLM. В реальном репозитории потенциально полезных файлов слишком много, поэтому мало просто найти фрагменты с похожими словами - нужно понять, какие из них действительно стоит показать модели.

Разберём один из классических алгоритмов ранжирования - BM25: почему редкие идентификаторы важнее популярных слов, зачем учитывать размер файла и почему десять одинаковых совпадений не должны быть в десять раз полезнее одного.

Читать заметку

Три месяца с Claude: хороший ассистент, плохой программист

Уровень сложностиСредний
Время на прочтение16 мин
Охват и читатели23K

LLM всё чаще становятся частью рабочего процесса разработчика, но вместе с ускорением приносят новую проблему: как понять, где ассистент действительно помогает, а где уверенно ведёт по ложному следу.

В статье разобрали опыт трёх месяцев работы с Claude: в каких задачах он экономит время, где начинает галлюцинировать и почему с генерацией кода всё сложнее.

Узнать подробнее

Шесть LLM‑судей из четырёх лабораторий несут 1,9 независимого голоса из 6

Время на прочтение10 мин
Охват и читатели12K

6 LLM‑судей, 4 лаборатории, 3 страны — а ошибки коррелируют: ρ̄ ≈ 0,42, эффективно 1,9 из 6.

В июле я писал, что консенсус шести LLM‑судей на RAGTruth бьёт любого одиночного судью. Это по‑прежнему верно. Но тогда я не проверил главного: сколько независимых голосов стоит за этим консенсусом. Оказалось — примерно два.

1,9 из 6

Посадите шесть разных инструктивных LLM судить одну задачу и выносить вердикт голосованием — интуиция подсказывает, что шесть моделей из четырёх лабораторий надёжнее одной: разные компании, архитектуры, страны, ошибки же должны быть независимыми.

Я это измерил. На публичном бенчмарке RAGTruth комитет из шести моделей несёт — по design‑effect приближению — примерно столько же независимой информации, сколько 1,9 независимого судьи из шести. Средняя попарная корреляция их ошибок ρ̄ ≈ 0,42.

Это не «1,9 судьи» в буквальном смысле — это эффективный размер: сколько независимых голосов реально стоит за шестью коррелированными. Разнообразие провайдеров не покупает независимость ошибок.

И вот вывод, который держится вообще без спора о точной цифре: ошибки шести судей скоррелированы достаточно, чтобы гарантии независимого голосования выродились. Теорема Кондорсе для коррелированных голосов не отменяется (Ладха, Боланд) — но её границы становятся куда слабее: шесть таких голосов работают как эффективные ~два. «1,9» лишь оценивает масштаб этого вырождения.

Весь метод, данные и пересчёт одной командой — в репозитории: https://github.com/itsjustmarsel/llm-judge-independence. Скрипт analyze.py пересчитывает ρ̄ и n_eff прямо из сохранённых вердиктов, без единого обращения к API.

Читать далее

Словарь «Колобок» и идея перевода словарей

Уровень сложностиСредний
Время на прочтение5 мин
Охват и читатели12K

Оказывается, если поработать с промптами и гейтами, то можно перевести большущий японо-английский словарь к виду японо-русского с очень неплохим качеством. Идея применима к другим языкам. Сделал пайплайн, запускал 100 Sol-воркеров-переводчиков одновременно через CLI. Вышло недорого.

Тут словарь, тут гитхаб с пайплайном, тут примеры статей.

Читать далее

ОК или НеОК: как мы строили LLM‑судью и дважды меняли формулу вердикта

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели7.3K

У нашего AI‑агента поддержки было десять метрик и ноль ответов на главный вопрос: какую долю обращений он решает?

Судья, который читал только текст диалога, ставил 18/20, а проверка по реальным вызовам инструментов давала 8/20. Текстовые проверки считали правдоподобный ответ верным и не могли отличить его от подтвержденного. Самодельный «процент фантомных эскалаций» оказался измерением того, насколько слова бота согласованы с его же внутренними флагами. Каждая метрика что‑то измеряла, и ничего продуктового

Тогда мы решили: оценка качества станет отдельным сервисом с собственным источником истины. В этой статье два переписывания формулы вердикта, несколько пойманных слепот и один эталонный набор, который учил нас доверять неправильным ошибкам.

Читать далее

Как я измеряю видимость брендов в шести нейросетях: схема замера, формат логов и ошибки

Уровень сложностиСредний
Время на прочтение3 мин
Охват и читатели6.9K

Задача звучит просто: выяснить, называют ли бренд ChatGPT, Claude, Perplexity, Gemini, Алиса AI и GigaChat, когда пользователь спрашивает совета или ответа у ИИ. На практике эта задача раскладывается на десятки технических решений, каждое из которых меняет результат в разы. Ниже устройство замера, формат хранения и три моих ошибки, которые обесценивают всю работу.

Читать далее

ГигаАгент от Сбера. Первый блин слопом

Уровень сложностиСредний
Время на прочтение5 мин
Охват и читатели10K

12 августа Сбер выпустил своего первого универсального ИИ-агента. Новость эта стала федерального уровня, т.к. про неё написал ТАСС! Более того, было заявлено, что это “первый в России автономный универсальный ИИ-агент”. Как основатель компании, которая запустила ИИ-агентов в феврале этого года на своем ядре, мне конечно же стало интересно протестировать решение от Сбера. Более того, в апреле этого года мы получили Грант от Яндекса на миллион рублей на токены моделей ИИ, и с этого месяца мы сделали поддержку моделей Alisa Ai LLM и Yandex GPT Pro, но это тема для отдельного поста.

 Итак, приступаем. Тестировать я начал 14 августа. У меня на счету cloud.ru лежало 293 рубля еще с проекта, который я делал в прошлом году. Я решил начать с подсказки “Расскажи, что ты умеешь” и просто кликнул на неё. Прошло почти 5 минут и чего-то ИИ-агент задумался. Я устал ждать и отошёл от компа. Скриншот прилагаю:

Читать далее
1
23 ...