Мне попался пост рекрутингового агентства. Смысл такой: из России кандидаты идут третьим сортом, поэтому здесь агентство больше не работает и переориентируется на зарубежные рынки найма. Я читал это и понимал, что задело по-настоящему. Настолько, что решил вернуться к текстам именно с этой темы.
Сначала я возмутился. Потом сел, остыл и поймал себя на неприятной мысли: а если, по сути, верно? Наши большие языковые модели идут за флагманами с отставанием примерно в полтора года — это моё ощущение по опыту использования в повседневных задачах. Громких открытий последнего времени в машинном обучении я навскидку не назову. Может, человек просто сказал вслух то, что многие думают.
Спорить ощущениями с ощущениями бессмысленно, поэтому я пошёл собирать список. Не «наши достижения» в жанре парадного отчёта, а конкретно: что сделали люди из российских лабораторий и компаний и что из этого сегодня реально используют в мире.
Что нашлось за последние пятнадцать лет
Автор(ы) | Год | Достижение | Где сделано |
Иван Оселедец | 2011 | Tensor Train разложение — сжатие нейросетей, квантовые вычисления, численная линейная алгебра | ИВМ РАН, затем Сколтех |
Артём Бабенко, Виктор Лемпицкий | 2014 | Additive Quantization и Neural Codes for Image Retrieval — вклад в современный ANN-поиск | Yandex, Сколтех |
Дмитрий Ульянов, Андреа Ведальди, Виктор Лемпицкий | 2016 | Instance Normalization — базовый слой style transfer и многих GAN | Сколтех и Оксфорд |
Алексей Миловидов и команда | 2016 | ClickHouse — один из лидеров сегмента аналитических СУБД, крупный open source проект | Yandex, Москва |
Л. Прохоренкова, Г. Гусев, А. Воробьёв, А. Дорогуш, А. Гулин | 2017-2018 | CatBoost — одна из трёх основных мировых библиотек градиентного бустинга | Yandex, Москва |
Дмитрий Молчанов, Арсений Ашуха, Дмитрий Ветров | 2017 | Sparse Variational Dropout (ICML) — байесовское разрежение сетей | ВШЭ, Сколтех |
Михаил Бурцев и команда | 2017 | DeepPavlov — открытый фреймворк для диалоговых систем | МФТИ, Москва |
Дмитрий Ульянов, Андреа Ведальди, Виктор Лемпицкий | 2018 | Deep Image Prior — архитектура сети работает как приор, без обучающих данных | Сколтех и Оксфорд |
А. Буслаев, В. Игловиков, Е. Хведченя, А. Паринов, М. Дружинин, А. Калинин | 2018–2020 | Albumentations — де-факто стандарт аугментации изображений | Распределённая команда, часть соавторов в США |
Е. Захаров, А. Шишея, Е. Бурков, В. Лемпицкий | 2019 | Few-Shot Talking Heads (ICCV) — анимация лица по одному кадру | Samsung AI Center Moscow |
Алексей Досовицкий | 2020 | Vision Transformer — первый автор ViT | Google Brain, Берлин |
Ю. Горишний, И. Рубачёв, В. Хрульков, А. Бабенко | 2021 | FT-Transformer и ревизия глубоких моделей для табличных данных — новый бенчмарк-стандарт | Yandex Research |
Sber AI, SberDevices | 2021-2023 | ruGPT-3, ruDALL-E, Kandinsky 2.x — одни из немногих незападных открытых генеративных моделей | Сбер, Москва |
Yandex Research | 2022 | YaLM 100B — крупная открытая LLM; «крупнейшая вне США и Китая» верно только для короткого окна до выхода BLOOM 176B | Yandex, Москва |
Александр Коротин, Евгений Бурнаев и группа | 2021–2024 | Нейросетевой оптимальный транспорт; ведущий автор Коротин, Бурнаев чаще в роли руководителя | Сколтех |
Меня в этом списке зацепило не количество строк, а то, где эти работы живут. CatBoost стоит в проде у людей, которые понятия не имеют, кто такие Прохоренкова и Гулин. Instance Normalization — слой, который лежит в основе половины генеративных моделей, включая те, чьими картинками сейчас забиты ленты. Albumentations открывают в любом ноутбуке с компьютерным зрением, не задумываясь о происхождении. Tensor Train Оселедца ушёл далеко за пределы машинного обучения, в квантовые вычисления. Оказалось, что у нас стране разрабатывался и разрабатывается не просто продукт, на уровне продуктов, а фундамент для других продуктов.
Оговорюсь, иначе будет нечестно. Часть команд из таблицы распределённые, часть авторов давно работает за рубежом. Досовицкий делал ViT в берлинском офисе Google, а не в Москве. Лемпицкий соавторствовал с Оксфордом. Я не считаю это контраргументом. Скорее наоборот: если школа готовит людей, которых потом забирают в первые лаборатории мира, вопрос к качеству школы закрыт. Вопрос остаётся к тому, почему они там, а не здесь, — но это другая тема.
Бонус для тех, кто любит копнуть глубже
Раз уж я взялся копать, дошёл и до советского периода. Здесь картина оказалась ещё жёстче.
Автор(ы) | Год | Достижение | Где сделано |
Андрей Тихонов | 1943, 1963 | Регуляризация некорректных задач — в западной литературе Tikhonov regularization, она же ridge и weight decay | МГУ, ИПМ, Москва |
Андрей Колмогоров, Владимир Арнольд | 1957 | Теорема о представлении непрерывных функций — предок теорем универсальной аппроксимации и современных KAN | МГУ, МИАН, Москва |
Марк Айзерман, Эммануил Браверман, Лев Розоноэр | 1964 | Метод потенциальных функций — первая формулировка «ядерного трюка», позже основа kernel methods | ИПУ, Москва |
Борис Поляк | 1964 | Метод «тяжёлого шарика» — momentum, лежит в основе SGD с моментом и Adam | МГУ, затем ИПУ РАН, Москва |
Алексей Ивахненко | 1965–1971 | МГУА (GMDH) — многослойные обучаемые модели; Шмидхубер называет это первым глубоким обучением | Институт кибернетики, Киев |
Владимир Вапник, Алексей Червоненкис | 1968–1974 | VC-размерность и теория статистического обучения — фундамент оценки обобщающей способности | ИПУ, Москва |
Аркадий Немировский, Давид Юдин | 1979–1983 | Зеркальный спуск и нижние оценки сложности выпуклой оптимизации | Москва |
Юрий Нестеров | 1983 | Ускоренный градиентный метод (NAG) — стандартный оптимизатор во всех фреймворках | ЦЭМИ, Москва |
Борис Поляк, Анатолий Юдицкий | 1990–1992 | Усреднение траектории SGD (Поляк–Рупперт); Рупперт получил результат независимо в США | Москва |
Посмотрите на этот список глазами человека, который вчера писал код. Вы поставили momentum в оптимизаторе — это Поляк, 1964 год, Москва. Включили weight decay — это Тихонов. Взяли Adam или SGD с ускорением — там внутри Нестеров, 1983-й. Объясняете студенту, почему модель обобщается, — объясняете через Вапника и Червоненкиса. Половина того, что сегодня крутится в каждом фреймворке, придумана в московских и киевских институтах за десятилетия до того, как слово «нейросеть» вышло за пределы узкого круга.
Откуда тогда взялось ощущение третьего сорта
Мне кажется, автор поста перепутал спрос и качество. Заказов на найм стало меньше, отклики идут хуже, значит рынок мёртвый, значит люди слабые. Логика понятная, только между этими шагами нет связи.
Спад найма в ИИ — глобальная история. То же самое говорят коллеги в США, Европе, Китае, Бразилии. Отрасль наигралась в бесконечный рост команд и начала считать деньги: сколько модель стоит, что она приносит, зачем нам сорок человек там, где справятся восемь. Это коррекция, а не смерть. И когда у агентства падает поток заказов, объяснить это качеством кандидатов проще, чем тем, что заказчик стал разборчивее и научился нанимать сам.
Есть и вторая часть, менее приятная для нас. Прикладная сила у российских команд действительно высокая, а вот с продуктовой упаковкой и с публичностью беда. Про CatBoost знают все, кто им пользуется, и почти никто из тех, кто принимает решения о бюджетах. Мы плохо рассказываем о том, что делаем, и потом удивляемся оценкам со стороны.
Что я вынес из этого как руководитель
Когда я собираю или усиливаю ИТ-команду, самое опасное — нанимать по рыночному шуму. Если верить постам вроде того, с которого я начал, легко решить, что сильных людей на рынке нет и надо либо переплачивать за иностранцев, либо отдавать всё подрядчику. По моему опыту вывод ровно обратный: сильные есть, их просто не найти теми фильтрами, которыми ищут массовый поток. Они не рассылают резюме пачками и редко проходят через агентства.
Второе. Отставание в моделях и уровень инженеров — разные вещи, и путать их дорого. Отставание в больших моделях упирается в вычислительные мощности и деньги на обучение, а не в мозги. Задача, которая стоит перед бизнесом, обычно решается не собственной LLM, а нормальной интеграцией уже существующей — и вот здесь квалификация команды решает всё.
Третье, самое практичное. Прежде чем принимать чужую оценку рынка, проверьте её сами. Мне понадобился вечер и таблица, чтобы аргумент, который казался убийственным, рассыпался. Точно так же рассыпаются оценки подрядчиков, вендоров и консультантов, если не полениться разобрать их по фактам.
А вы тоже считаете, что мы в своей стране максимально отстаём в ИИ? Напишите в комментариях, что вы видите со своей стороны: как выглядит найм ML/AI-специалистов у вас, находите ли людей, приходится ли смотреть за границу. Мне правда интересно прочитать мнения тех, кто нанимает, а не тех, кто про это пишет.

Артём Дьяченко
Руководитель ИТ и цифровой трансформации на промышленных предприятиях
