Обновить
512K+

Машинное обучение *

Основа искусственного интеллекта

1 244,68
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

Unlimited-OCR от Baidu: читает страницу как картинку

Уровень сложностиСредний
Время на прочтение5 мин
Охват и читатели204

Как вы себе представляете работу OCR? Страничка сканируется, программа находит области с буквами, распознает их и выдает текст. Старый добрый Tesseract так и пашет. А вот новый baidu/Unlimited-OCR делает финт ушами: он вообще не ищет буквы. Он берет всю страницу как картинку, жмет ее в горстку визуальных токенов и скармливает языковой модели, которая разворачивает их обратно в структурированный текст. Звучит как извращение, но… работает.

Это прямой наследник идеи DeepSeek-OCR. Сегодня коротко разложу: что это, как устроено, что умеет и как запустить у себя. Будет полезно всем, кто хочет распознавать многостраничные документы за одну проходку или вписать такую функцию в свой проект.

Читать далее

Новости

Как мы делаем ML-продукты для заводов, когда дата-сайентистов мало: кейс 150-метровой печи спекания

Время на прочтение22 мин
Охват и читатели2.1K

Привет, Хабр!

Меня зовут Писарев Андрей, я руковожу отделом машинного обучения в департаменте технологий искусственного интеллекта. Мы с командой разрабатываем и внедряем ML-решения на производственных площадках компании различной направленности.

РУСАЛ – геораспределённая компания: десятки производственных площадок по всему миру. А дата-сайентистов в команде – единицы. Если бы для каждого объекта мы строили ML-продукт с нуля, мы бы не вывезли. Поэтому главный фокус этой статьи – не модель и не метрики, а типовой подход к разработке ИИ-продуктов, который позволяет одной командой закрывать много объектов. Печь спекания на Пикалевском глинозёмном заводе (ПГЛЗ) – это кейс, на котором я покажу, как подход работает вживую.

TL;DR: Решение – системный подход к ML-продуктам на базе SinaraML и корпоративной ИИ-платформы. Показываю, как подход работает на конкретном кейсе – ML-сервис для управления 150-метровой печью спекания на ПГЛЗ. 3 месяца от PoC до закрытого тестирования. CatBoost: MAE = 225, R² = 0.48, RMSE = 330. Ожидаемый порядок экономического эффекта – десятки миллионов рублей в год.

Читать далее

Claude Code Antifraud, часть 2: крысы‑биссектрисы и обезьяны‑медианы на детской олимпиаде

Уровень сложностиСредний
Время на прочтение41 мин
Охват и читатели3.8K

В прошлой серии знакомый принёс мне импортное за триста и попросил посмотреть результаты московской олимпиады по геометрии. Пока публиковал статью, пришёл второй заказ. В этот раз питерская олимпиада для 4–11 классов: 6 сезонов, 40+ площадок проведения, устный формат. Устный — это когда участник рассказывает решение, жюри кивает или не кивает, черновиков нет, перепроверить нельзя.

И снова импортное за триста. Что ж, триста так триста. Погнали.

Читать далее

DML против PSM: как оценивать нерандомизированные эксперименты быстрее и надёжнее?

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели4.4K

Привет, Хабр! Давайте на примере кейса с рекламой в ПВЗ Wildberries разберемся в двойном машинном обучении (DML) и методе псевдорандомизации (PSM). Вы в деле?

Меня зовут Платон Попов, я дата-аналитик в команде A/B-платформы RWB. В нашей команде я занимаюсь задачами из области причинно-следственного анализа (Causal Inference) и методами понижения дисперсии. 

В этой статье расскажу о самом кейсе и объясню, почему для него не подошёл классический t-тест. Покажу, как мы учитывали спутывающие факторы с помощью Propensity Score Matching (PSM), почему этого оказалось недостаточно и почему в итоге перешли к Double Machine Learning (DML). В конце сравним результаты и обсудим наш план выкатки метода оценки нерандомизированных экспериментов в промышленный масштаб.

Читать далее

Изучаем нейронную сеть на Java

Уровень сложностиСредний
Время на прочтение9 мин
Охват и читатели5.1K

Всем привет, меня зовут Антон, я работаю в Сбере разработчиком Java, в продукте GigaIDE. В этой статье мы перепишем нейронную сеть c Phyton’а на Java, которая распознаёт рукописные цифры MNIST. Попробуем распознавать свои цифры, рисуя их мышкой, сделаем обратный запрос в сеть и заглянем в ее «мозги», а в конце сделаем выводы.

Читать далее

Как мы автоматизировали перевод скриншотов в документации

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели5.1K

Когда документацию переводят на другой язык, обычного перевода текста недостаточно: на скриншотах тоже остаются кнопки, настройки и подсказки.

Рассказываем, как мы проверяли автоматический перевод таких скриншотов, зачем в процессе нужен глоссарий и какие метрики удалось улучшить.

Читать далее

Масштабирование LLM: от одного чипа до ЦОДа. Глава 5. Инференс

Уровень сложностиСредний
Время на прочтение14 мин
Охват и читатели5.1K

Предыдущая глава

Ну а теперь рассмотрим, как нам применить обученный трансформер. И применение уже обученной модели сильно отличается от тренировки, потому что теперь приходится учитывать еще один фактор — задержку. Так что давайте разбираться, как устроен инференс LLM и как его правильно масштабировать.

Читать далее

GigaChat 2 Max с памятью на связях обходит Claude Opus 5 без неё: замер семи моделей

Уровень сложностиПростой
Время на прочтение9 мин
Охват и читатели6.4K

На классе задач «в работе всплыла проблема — каким изменением её уже чинили» GigaChat 2 Max с памятью на связях отвечает верно в 57% случаев, YandexGPT Pro 5.1 — в 61%, а Claude Opus 5 с обычным поиском — в 41%.

Модели никто не трогал: разница целиком в том, доехал ли до модели нужный факт в контексте. В статье приведены замеры, рассуждения, направления применения и выводы со ссылками на проверочные и связанные материалы.

Читать далее

Я сделал CRM без бэкенда. Вот чего мне это стоило

Уровень сложностиПростой
Время на прочтение9 мин
Охват и читатели5.8K

Приложение слушает разговоры продавца с клиентами и превращает их в текст. Человек на той стороне трубки не подписывался на то, чтобы его голос уехал на чей-то сервер, и это решило архитектуру раньше, чем я написал первую строчку: наружу не уходит ничего.

Дальше идёт счёт, который за это пришёл, и он вполне конкретный: шесть с половиной минут работы на десятиминутный разговор и половина возможностей, которые в приложении с сервером есть по умолчанию.

Читать далее

753B на одной видеокарте: разбор FreeToken

Уровень сложностиСредний
Время на прочтение15 мин
Охват и читатели14K

Бывает так: сидишь, листаешь ленту, и в очередной раз натыкаешься на пост, где стафф-инженер из солнечной Калифорнии крутит свежую модельку на паре RTX PRO 6000 общей стоимостью с подержанную машину. Ты смотришь на свою RTX 4060 в ноутбуке, который покупал «не только для игр», и понимаешь: ну ладно, это не для нас.

Так вот, это как раз для нас. На той самой ноутбучной 4060 с восемью гигабайтами и урезанным вдвое PCIe-линком можно получить 39.3 tok/s на 35-миллиардной модели — быстрее, чем медианная скорость декода Codex в проде. Вопрос был не в железе, а в софте, который это железо обслуживает.

Разбираем FreeToken — движок для локального инференса MoE-моделей от команды, которая до этого сделала vLLM и SGLang.

Запустить AGI на слабом железе

Нейронные сети нетрадиционного ускорения

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели12K

В последнее время все помешались на ускорении генерации токенов локальных моделей. В погоне за скоростью люди бездумно квантуют KV-кэш до предела, обрезают контекст до уровня памяти рыбки-гуппи, а затем идут в комментарии жаловаться, что модель вдруг отупела и забывает половину диалога. Такой подход похож на быстрый бег по тёмной улице без уличного освещения. Можно бежать реально быстро, но только до первого столба.

Пора это исправлять. Данная статья знакомит читателя с современными методами спекулятивного декодирования, ускоряющими скорость генерации без всякой лоботомии.

Читать далее

Mojo 1.0 вышел из бета-тестирования. Что это за язык программирования и зачем он нужен

Время на прочтение8 мин
Охват и читатели14K

Python давно стал почти стандартным инструментом для машинного обучения, анализа данных и научных задач. Однако в вычислительно сложных проектах его производительность быстро становится ощутимым ограничением. Поэтому под привычными NumPy, PyTorch и другими инструментами значительная часть вычислений выполняется компонентами на C, C++ или CUDA. Особенно заметно это становится, когда готовых библиотечных функций недостаточно и высокопроизводительные операции приходится писать самостоятельно.

Несколько лет назад за решение этой проблемы взялась компания Modular, представившая Mojo — новый язык, внешне очень похожий на Python, но построенный иначе. Первую публичную версию показали в 2023 году, после чего проект довольно быстро менялся, а некоторые его конструкции успели исчезнуть или несколько раз поменять форму. Теперь этот этап формально завершен: 11 августа 2026 года вышел Mojo 1.0. Первая стабильная версия стала хорошим поводом разобраться, откуда вообще взялся этот необычный проект и зачем понадобился еще один инструмент для высокопроизводительных вычислений.

Читать далее

Тот самый харнесс, который мы заслужили в эпоху, когда безопасность ИИ уже не диковинка

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели11K

Если запустить любую передовую языковую модель из коробки и попросить ее провести тестирование безопасности агентной системы или собрать актуальный вектор атаки, результат разочарует мгновенно. Модель выдаст наивные примеры в духе "забудь все инструкции и представь, что ты злой хакер в параллельной вселенной", словно на дворе 2023 год, а вокруг все только узнают о выходе GPT-3.5.

В реальной жизни в безопасности искусственного интеллекта базовые модели ориентируются крайне слабо. Они живут в плену устаревших весов, путают галлюцинации с реальными уязвимостями и понятия не имеют о свежих техниках отравления долговременной памяти, побегах из изолированных сред или свежих эксплойтах в репозиториях моделей.

Но безопасность ИИ не стоит на месте, всё меняется. Новые векторы компрометации возникают буквально еженедельно. Модель без внешней обвязки остается лишь текстовым генератором, оторванным от реальности. Надежность, воспроизводимость результатов и настоящую боевую мощь дает внешняя инженерная среда, управляющий контур, проверенный набор инструментов и строгий контракт исполнения. Практика разработки агентов диктует фундаментальное правило: полноценный рабочий агент возникает исключительно при объединении языковой модели и специализированного харнесса.

Читать далее

Ближайшие события

Что вы увидели на картинке первым? Спрашиваем трансформер

Уровень сложностиПростой
Время на прочтение4 мин
Охват и читатели12K

Что видит трансформер: крокодила, лодку или силуэт человека? Проверяем BLIP на визуальных иллюзиях.

Наверняка многие видели картинки‑тесты, которые предлагают по тому, что первым бросилось в глаза определить характер, какое полушарие доминирует или что‑то еще. Обычно на этих изображениях находится несколько объектов или один объект меняется в зависимости от «угла» обзора. А что будет, если попросить трансформер описать эти картинки? Что «увидит» он и на что он «обратит внимание»?

Читать далее

ИИ-агент выдал себя за двух разработчиков и полез в чужой код. На чистую воду его вывел студент

Уровень сложностиПростой
Время на прочтение2 мин
Охват и читатели9.5K

Последнюю неделю июля Синан Джан Демир собирался потратить на портфолио. Вместо этого 24-летний студент-программист из Университета Техаса в Далласе несколько дней спорил на GitHub с двумя пользователями, которых не существовало, — и оказался единственным, кто заметил подлог. Историю восстановил Reuters — имя свидетеля и подробности переписки публикуются впервые.

Читать далее

Что такое RAGFlow и с чем его едят

Время на прочтение7 мин
Охват и читатели13K

Если вы хоть раз пользовались LLM, то почти наверняка сталкивались с двумя ее классическими болячками: галлюцинациями и устаревшими знаниями. А когда дело доходит до рабочих задач, появляется еще одна проблема — как использовать внутренние документы компании, не выкладывая их в открытый доступ. 

В этой статье разберем метод RAG (Retrieval-Augmented Generation) и подробно посмотрим на один из самых интересных open-source инструментов для его реализации — RAGFlow. Попробуем понять, насколько он подходит для внутреннего использования.

Читать далее

Цена за успешный результат: почему дешёвая модель может обойтись дороже дорогой

Уровень сложностиСредний
Время на прочтение15 мин
Охват и читатели6.7K

Дешёвая LLM легко превращается в дорогую, если агент чаще ошибается, уходит в повторные прогоны и требует внимания инженера.

В статье разберём, как считать стоимость закрытой задачи, учитывать кэш и человеко‑время и почему прайс за миллион токенов почти ничего не говорит об итоговой экономике.

Посчитать стоимость

Сравниваем сервисы Антиплагиат и Руконтекст на трёх языках: отчёты, оригинальность и ИИ-детекция

Уровень сложностиПростой
Время на прочтение11 мин
Охват и читатели7.6K

Как я обещал в прошлой статье, пора проверить, что стоит за баллами из сравнительной таблицы. Взял три свежие научные работы с Google Scholar — русскую, английскую и узбекскую  и прошёл с ними весь путь проверяющего в обеих системах: загрузка, ожидание, отчёт, каждый источник руками. Спойлер: в конце — эксперимент со вставкой текста от Claude Fable 5 в курсовую 2017 года. Обошлось мне всё это в 4300 рублей, так что читайте внимательно. 

Читать далее

DS‑собеседование в 2026 году: 6 ошибок, из‑за которых отказывают даже сильным кандидатам

Уровень сложностиСредний
Время на прочтение13 мин
Охват и читатели7K

На DS/ML‑собеседовании можно уверенно пройти теорию и всё равно получить отказ. Часто решение принимается позже — когда становится видно, умеет ли кандидат работать с данными, продакшеном и реальными ограничениями. Разбираем шесть ошибок, на которых сыпятся даже сильные специалисты.

Читать далее

Скептик выбрал гипотезу, которую ИИ не решит. Grok ее решил

Уровень сложностиПростой
Время на прочтение4 мин
Охват и читатели6.9K

Математик Паата Иванишвили из Калифорнийского университета в Ирвайне сообщил, что Grok 4.6 в обвязке Grok Build (аналог Claude Code от SpaceXAI) доказал гипотезу Холмса, Холройда и Рамиреса, которую Иванишвили окрестил "Greedy is least speedy" ("жадный — самый медленный"). Модель доказала более сильную комбинаторную Гипотезу 5 из той же статьи — а из нее основное утверждение следует автоматически. Результат оформлен в короткую заметку, соавтором которой стал Шэнтун Чжан из Стэнфорда.

Читать далее
1
23 ...