MTS AI, Москва / Статьи / Хабр

Как стать автором

Профиль Статьи 33Новости 4Подписчики 228Сотрудники 5

mkvasova_hr вчера в 12:21

Как мы в MTS AI собрали команду исследователей меньше, чем за год

Простой

16 мин

650

Блог компании MTS AIКарьера в IT-индустрииЧитальный зал

Кейс

Привет, я Марина, HR-бизнес-партнер в MTS AI. Вот уже несколько лет я занимаюсь подбором сотрудников на вакансии, связанные с ML. Мы стремимся находить самых крутых спецов и, конечно, с каждым годом конкуренция за них растет. И это неудивительно: сфера искусственного интеллекта сейчас на подъеме, всем нужны ML-инженеры.

Когда в MTS AI решили сформировать направление фундаментальных исследований, подбор специалистов тоже доверили мне. В условиях дефицита кадров — это была, что называется, задача со звездочкой. Тем не менее за год нам удалось собрать специалистов с опытом работы в Facebook (принадлежит Meta — признана экстремистской в России), Google, Toyota, Huawei, CERN и победами в международных соревнованиях.

От коллег-HR и знакомых разработчиков из других компаний я часто слышала: как вы смогли их нанять, таких же ребят кофе с печеньками и офисом в центре не заманишь? Почему они выбрали вас, маленькую дочку МТС с пятью сотнями сотрудников, а не какого-нибудь ИТ-гиганта?

В этой статье я расскажу, как нам удалось собрать группу специалистов по фундаментальным исследованиям за год. Далее я также дам слово своим коллегам-исследователям. Они ответят на вопросы о своих проектах и принципах работы в команде.

Читать далее

+8

eCaesar 1 апр в 17:49

Как создать ассистента для поиска по видео

9 мин

869

Блог компании MTS AIРабота с видео*

Всем привет! Меня зовут Георгий, я старший разработчик‑исследователь в MTS AI. Одной из задач, которыми я занимаюсь в компании, является умная видеоаналитика. Это мощный инструмент, особенно с учетом современных технологий искусственного интеллекта, который может использоваться во многих отраслях: от торговли до обслуживания клиентов.

При этом у сегодняшних систем видеоаналитики есть существенное ограничение: они заточены под узкие задачи и конкретные типы событий — например, распознавание автомобильных номеров, пересечение границ, детектирование лиц. Конечно, прогресс не стоит на месте, и за прошедший год появилось много мультимодальных моделей, способных отвечать на широкий спектр вопросов по видео — но они работают лишь на очень коротких роликах и требуют серьезных вложений в «железо».

Тем не менее представьте, что можно создать общую систему видеоаналитики, которая заранее не настроена на определенные события. Она гибкая и умеет понимать задачи во время общения с пользователем. Запросы могут быть разнообразными, например: «предупреди меня, если в кадре произойдет ЧП, например, пожар или драка» или «я хочу найти кадры с желтыми автомобилями такси».

Можно ли найти подход, при котором система сможет отвечать на широкий спектр вопросов по видео, но при этом будет способна обрабатывать длинные видеозаписи и останется нетребовательной к железу? В этой статье я расскажу про один из способов создания такого решения — на примере поиска по видео.

Читать далее

+11

Sitnich 15 мар в 17:30

Сравнение работы MTS AI Chat с другими русскоязычными LLM

Простой

8 мин

3.4K

Блог компании МТСБлог компании MTS AIИскусственный интеллектNatural Language Processing*

Всем привет!

Мы в MTS AI занимаемся созданием технологий и продуктов на базе искусственного интеллекта. Непосредственно наша группа фундаментальных исследований разрабатывает LLM и модели для генерации кода.

В этой статье мы представим нашу первую фундаментальную модель MTS AI Chat-7B. Также сравним результаты ее работы с другими русскими языковыми моделями, такими как YandexGPT, GigaChat и GigaChat‑Pro.

Читать далее

+21

adugin 21 фев в 13:22

Как мы с помощью ИИ выбираем обложки для сериалов в KION: кейс MTS AI

8 мин

854

Блог компании МТСБлог компании MTS AIОбработка изображений*Искусственный интеллект

Привет, Хабр! На связи вновь Андрей Дугин, руководитель группы видеоаналитики компании MTS AI. Сегодня я закончу рассказ о том, как мы с помощью ИИ выбираем обложки для сериалов в KION. Первую часть можно прочитать здесь.

Читать далее

+4

AlanRobotics 5 фев в 20:34

Как ускорить LLM-генерацию текста в 20 раз на больших наборах данных

7 мин

6.3K

Блог компании MTS AIМашинное обучение*Искусственный интеллектNatural Language Processing*

Всем привет, я Алан, разработчик-исследователь в MTS AI. В команде фундаментальных исследований мы занимаемся исследованием LLM, реализацией DPO и валидацией наших собственных языковых моделей. В рамках этих задач у нас возникла потребность в генерации большого количества данных с помощью LLM. Такая генерация обычно занимает много времени. Однако за последний год, с ростом популярности LLM, стали появляться различные инструменты для развертывания таких моделей. Одной из самых эффективных библиотек для инференса языковых моделей является библиотека vLLM. В статье показывается, как с помощью асинхронных запросов и встроенных особенностей vLLM можно увеличить скорость генерации примерно в 20 раз. Приятного чтения!

Читать далее

+16

adugin 5 фев в 18:10

Как мы с помощью ИИ выбираем обложки для сериалов в KION: кейс MTS AI

18 мин

1.3K

Блог компании МТСБлог компании MTS AIОбработка изображений*Искусственный интеллект

Привет, Хабр! Меня зовут Андрей Дугин, я руководитель группы видеоаналитики компании MTS AI. В статье раскрою то, как мы создаём постеры для сериалов и подбираем материалы для обложек фильмов в онлайн-кинотеатре KION. О том, как мы решили эту задачу, я постараюсь рассказать максимально подробно и с техническими деталями. Забегая вперёд, упомяну, что для выбора одной-единственной обложки приходится обрабатывать сотни тысяч кадров фильмов и сериалов. Конечно же, не вручную. Интересно, как всё это реализовано? Тогда прошу под кат.

Читать далее

+3

Ann_Rodina 1 фев в 16:05

Дайджест новостей: ИИ для обучения роботов и спящие агенты в LLM

4 мин

926

Блог компании MTS AIМашинное обучение*Искусственный интеллект

Дайджест

Представляем дайджест новостей сферы искусственного интеллекта за первый месяц 2024 года. В этом выпуске вы узнаете, смогли ли ученые победить «спящих агентов» в LLM, способны GPT влиять на человеческий мозг, какую еще методику придумали для самообучения больших моделей и другие интересные исследования.

Читать далее

+2

AlanRobotics 13 дек 2023 в 16:10

LLMClone: как клонировать себя в Telegram

8 мин

17K

Блог компании MTS AIМашинное обучение*Искусственный интеллектNatural Language Processing*

✏️ Технотекст 2023

У меня, как и у многих, довольно много чатов в телеграмме. Иногда просто нет времени (а иногда и не хочется) отвечать на некоторые сообщения. Именно так возникла идея создания виртуального клона. В статье рассматривается простая идея, состоящая в том, чтобы зафайнтюнить языковую модель на личных сообщениях, выгруженных из Telegram-чатов. Возможно, в дальнейшем такой клон сможет общаться за вас

Читать далее

+31

darinka666 2 ноя 2023 в 12:22

Обзор Llemma: новая математическая open-source модель

Средний

6 мин

6.9K

Блог компании MTS AIИскусственный интеллект

Привет! Меня зовут Дарина, и я занимаюсь фундаментальными исследованиями в MTS AI. Основной фокус нашей работы сейчас — обучение больших языковых моделей, их тестирование и оптимизация.

Сегодня хочу сделать обзор на недавно вышедшую статью LLEMMA: an open language model for mathematics. Расскажу про обучение модели, новый датасет Proof-Pile-2 и в конце сравню ее с ChatGPT и GPT-4 на ЕГЭ заданиях по профильной математике.

Читать далее

+12

kazzand 14 сен 2023 в 17:33

Собираем русскоязычный лонгформер шаг за шагом

8 мин

7.2K

Блог компании МТСБлог компании MTS AINatural Language Processing*

✏️ Технотекст 2023

Привет, меня зовут Андрей Казначеев, я NLP engineer в компании MTS AI. В этой статье я расскажу, как создал лонгформер для русского языка. Все началось с того, что мне подкинули задачу по классификации длинных диалогов. Тексты длинные, а большинство популярных моделей имеют строгое ограничение по длине входной последовательности. Хотелось сделать решение умнее, чем просто побить текст на куски, однако ничего готового для русского языка не нашел. Тогда я задумался, а так ли сложно сделать свою собственную версию лонгформера под русский язык? Оказалось, совсем не сложно.

Читать далее

+38

AlanRobotics 7 сен 2023 в 11:49

LLaMa vs GigaChat: может ли опенсорсная модель работать лучше LLM с 13 млрд параметрами?

9 мин

9.9K

Блог компании МТСБлог компании MTS AIМашинное обучение*Искусственный интеллектNatural Language Processing*

Всем привет, меня зовут Алан, я разработчик-исследователь в MTS AI, мы сейчас активно изучаем LLM, тестируя их возможности. В настоящее время в России вышло несколько коммерческих языковых моделей, в том числе GigaChat и YandexGPT, которые хорошо выполняют текстовые задачи. В этой статье показывается, что языковая модель меньшего размера, обученная на открытых данных за несколько часов, показывает сравнительно неплохую, а в некоторых случаях и лучшую производительность относительно больших коммерческих решений. На небольшом количестве примеров мы проверим способность моделей решать простые математические задачи, отвечать на вопрос по заданному контексту, в котором содержатся числа и выполнять простые текстовые инструкции. Затем мы кратко рассмотрим, как и на чем обучалась наша модель.

Читать далее

+11

madrugado 6 сен 2023 в 16:00

Пять книг про NLP, с которых можно начать

Простой

3 мин

13K

Блог компании МТСБлог компании Open Data ScienceБлог компании MTS AIПрофессиональная литература*Natural Language Processing*

Обзор

Всем привет! Меня зовут Валентин Малых, я — руководитель направления NLP-исследований в MTS AI, вот уже 6 лет я читаю курс по NLP. Он проходит на платформе ODS, а также в нескольких университетах. Каждый раз при запуске курса студенты спрашивают меня про книги, которые можно почитать на тему обработки естественного языка. Поскольку я все время отвечаю одно и то же, появилась идея сделать пост про мой список книг, заодно описав их.

Читать далее

+13

Ann_Rodina 15 авг 2023 в 17:56

«За три года я победил в семи международных соревнованиях по ИИ». Лайфхаки и стратегии финалиста конкурсов NASA и Google

Простой

5 мин

3.4K

Блог компании МТСБлог компании MTS AIМашинное обучение*Искусственный интеллект

Интервью

Аммар Али вместе со своим другом Жаафаром Махмудом взяли золото каггла по созданию 3D-реконструкции. Их команда вошла в топ-10 победителей конкурса Google Image Matching Challenge 2023. Аммар Али работает старшим инженером-исследователем MTS AI и учится в аспирантуре ИТМО на факультете информационных технологий и программирования, его друг Жаафар тоже аспирант ИТМО, но учится на факультете систем управления и робототехники. В Image Matching от Google они принимают участие второй год подряд. В 2022-м вошли в топ-30. Для Аммара это далеко не первая победа в международном конкурсе. Мы решили узнать у него подробности - какое решение принесло им золото Image Matching Challenge 2023, и как вообще победить на международных соревнованиях по ИИ.

— Аммар, поздравляем тебя с победой. Расскажи немного о конкурсе.

— Google Image Matching Challenge проходит ежегодно, начиная с 2019-го. В этом году конкурс длился два месяца с 11 апреля по 12 июня. Целью было создать 3D-реконструкцию объекта по датасету из фотографий. Честно говоря, для меня это было немного сложнее, чем в прошлом году, потому что требовались не только знания в области машинного обучения. Нам было нужно применить дополнительные алгоритмы, математическую оптимизацию структуры для построения 3D-реконструкции, где до сих пор специализировались на Slam в целом в робототехнике. В конкурсе я отвечал за часть задач, связанную с искусственным интеллектом, а Жаафар занимался оптимизацией и настройкой алгоритмов.

— Какое решение вы предложили?

Читать далее

+16

aarmaageedoon 10 июл 2023 в 13:49

Как использовать метод Дэвида-Скина для агрегации разметки. Разбираем по шагам

Средний

9 мин

1.9K

Блог компании МТСБлог компании MTS AIМашинное обучение*Natural Language Processing*

Обзор

Всем привет. Открываю серию статей, посвященную агрегации разметки. Этим вопросом я активно занимался, пока работал в нашем центре компетенций по работе с данными: нам нужен был механизм агрегации разметки из разных задач. По пути накопил материалов и, причесав, делюсь с вами.

В этой части я расскажу про модель Дэвида-Скина, которая заложила основы для многих методов агрегации разметки и является второй по значимости после голосования большинством. Многие создатели проектов следуют этому методу для повышения качества данных. Изначально он был разработан в 1970-х для вероятностного моделирования медицинских обследований. Именно поэтому разберем этот метод на примере с докторами.

Читать далее

+5

letitshine 24 мая 2023 в 16:39

Переходим на личности: как создать не просто бота, а виртуального персонажа с характером и историей

18 мин

6.6K

Блог компании MTS AIМашинное обучение*Искусственный интеллект

Обзор

Надоели стандартные боты с типовыми запросами? Да, мы вас очень понимаем.

Именно поэтому в этой статье мы решили поделиться своим исследованием по созданию не просто ботов, а виртуальных личностей с проработанным характером.

Эти наработки появились немного раньше, чем к нам пришел заказчик с запросом на виртуального персонажа, так что на наших глазах теория становилась практикой.

Читать далее

+7

use_magic 14 апр 2023 в 17:36

Bag of tricks для разметки текстовых данных: Часть 2. Удаление дубликатов

Средний

9 мин

2.9K

Блог компании MTS AIBig Data*Машинное обучение*Искусственный интеллектNatural Language Processing*

Туториал

Привет! Меня зовут Ирина Кротова, я NLP-исследователь из компании MTS AI. В этой статье из цикла про разметку данных я расскажу об ещё одном способе собирать данные более качественно и экономить на разметке — фильтрации похожих друг на друга текстов.

В предыдущей статье я рассказывала о том, что такое аннотация данных, как это связано с работой инженера машинного обучения и о способах сократить количество ручной разметки в проекте.

Читать далее

+3

Ann_Rodina 13 апр 2023 в 11:33

AI-focused digest: ИИ для удаления шумов с космических фото, генерация изображений на основе фМРТ мозга

4 мин

1K

Блог компании MTS AIМашинное обучение*Искусственный интеллект

Дайджест

Всем привет!

В апрельском выпуске AI-focused digest мы расскажем, как можно сократить затраты на обучение больших ML-моделей, как японские ученые научили нейросеть генерировать изображения по фМРТ мозга. Также поговорим о новом CV-алгоритме для улучшения астрономических фото. В заключении порекомендуем исследовательскую статью, которая поможет лучше понять, чего ждать от стремительного развития языковых моделей.

Читать далее

+2

sergeyzyo 29 мар 2023 в 12:00

Беспилотные автомобили, китайцы и платный доступ: какое будущее ждет нейросети

6 мин

2.5K

Блог компании МТСБлог компании MTS AIКонференцииИскусственный интеллектБудущее здесь

Термин «искусственный интеллект» постепенно перебрался из фантастики в маркетинг, а сейчас все больше входит в лексикон технических специалистов. Сегодня считается, что будущий полноценный ИИ невозможен без машинного обучения. И за последний год мы приблизились к нему благодаря новым версиям моделей-трансформеров — GPT, в том числе линейке ChatGPT.

Меня зовут Сергей Загоруйко, я занимаюсь фундаментальными исследованиями искусственного интеллекта в МТС и руковожу группой, в которой есть направления по обработке естественного языка (NLP) и компьютерному зрению. В этой статье я расскажу о том, как сейчас обстоят дела в мире беспилотных автомобилей и искусственного интеллекта в целом, а в конце вас ждет приглашение на мое выступление на конференции True Tech Day, которая пройдет 31 марта 2023 года.

Читать далее

+7

use_magic 3 мар 2023 в 16:02

Bag of tricks для разметки текстовых данных: Часть 1. Четыре способа размечать меньше

Средний

9 мин

3K

Блог компании MTS AIМашинное обучение*Искусственный интеллектNatural Language Processing*

Туториал

Привет! Меня зовут Ирина Кротова, я NLP-исследователь из компании MTS AI. Мы не понаслышке знаем, что сбор и разметка данных часто становятся “бутылочным горлышком" в проектах, связанных с машинным обучением. У нас в компании есть постоянная необходимость в разных видах разметки аудио, текста и изображений.

В этой статье я хочу поделиться лайфхаками по подготовке и разметке текстовых датасетов и возможными "граблями", на которые можно наступить, если вы создаете датасет впервые. Многие из этих советов универсальны, но основной фокус сделан на обработке естественного языка, поскольку я опираюсь в первую очередь на собственный опыт: в разное время я работала с юридическими документами, доменными чат-ботами и участвовала в подготовке и проведении соревнования по автоматической детоксификации текстов.

Читать далее

+10

aarmaageedoon 20 янв 2023 в 11:49

Падаем в кроличью нору. Ищем способ характеризовать текстовые датасеты

10 мин

2K

Блог компании MTS AIМашинное обучение*Natural Language Processing*

Всем привет! На связи Игорь Буянов, разработчик в команде разметки MTS AI. Сегодня я поделюсь с вами своими наработками, появившимися во время изучения метрик оценки генерации данных. Когда я только пришел в команду разметки, эта задача была особо актуальной - нас тогда просили нагенерить данные под тестирование информационного бота по COVID. Дело в том, что тестирование результатов выполнялось вручную, что значительно замедляло работу. Каких-либо автоматических метрик оценки качества генерации тестовых данных не существовало.

В какой-то момент мне надоело это терпеть, и я решил посмотреть, а как качество текстов оценивают разработчики языковых моделей. У них точно есть перплексия, может, есть что-то еще.

Спустя время, проведенное за штудированием статей, я нашел кандидата среди известных метрик для оценки качества генерации, но кроме того, к своему удивлению, у меня появилось несколько теоретических тезисов о качестве данных вообще. В этом посте я делюсь ими с сообществом в надежде на дальнейшее обсуждение. Для лучшего понимания дальнейшего текста рекомендую прочитать эту статью.

Читать далее

+1

1