Обновить
Сначала показывать
Порог рейтинга
Уровень сложности

Интервью с Вячеславом Васильевым: о генеративном интеллекте, написании статей и будущем ИИ

Уровень сложностиПростой
Время на прочтение10 мин
Охват и читатели6K

Привет, Хабр. Предлагаем вам почитать и обсудить наше интервью с Вячеславом Васильевым, Senior Data Scientist в Управлении базовых моделей Kandinsky, блок «Развитие генеративного ИИ». Вячеслав — опытный исследователь в области Gen AI и один из создателей нескольких поколений нейросетей Kandinsky. Его совместные с коллегами научные статьи регулярно попадают на ведущие международные конференции по машинному обучению.

Вячеслав рассказал, как написать хорошую научную статью и почему важно лично представлять свои работы на больших международных конференциях, поделился мнением о генеративных сетях и актуальных проблемах индустрии ИИ, а также раскрылся с неожиданной для исследователя стороны.

Читать далее

Новости

Обновления GigaIDE за август 2026

Время на прочтение4 мин
Охват и читатели7.8K

Как обычно в начале следующего месяца мы рассказываем о том, что изменилось в GigaIDE за прошедший месяц. Соответствующий обзор за июль доступен здесь. Ниже обзор инкремента Pro-функционала GigaIDE за август, который уже доступен на нашем маркетплейсе.

Читать далее

Подготовка датасета для офлайн-оценки рекомендательных моделей: что проверить  перед запуском экспериментов

Уровень сложностиСредний
Время на прочтение13 мин
Охват и читатели6.1K

Привет, Хабр! Меня зовут Алексей Васильев, я тимлид команды «Рекомендательные системы и персонализация» Sber AI Lab — Центра практического искусственного интеллекта Сбера. Мы занимаемся исследованиями в области рекомендаций, разрабатываем новые модели и, конечно, сравниваем свои результаты с результатами коллег и других исследователей. И регулярно сталкиваемся с ситуацией, когда результаты, заявленные в научной статье или полученные от другой команды, не удаётся воспроизвести, хотя ключевые параметры пайплайна полностью совпадают. В этой статье мы с Анной Володкевич, исследователем из нашей команды, расскажем про свой опыт анализа таких расхождений, на основе которого разработали фреймоворк SplitLight.

Когда результаты научной статьи или успех другой команды не удаётся воспроизвести, обычно начинают с поиска багов в реализации модели: смотрят архитектуру, функцию потерь, способ сэмплирования негативных примеров. Хотя часть несоответствий обусловлена именно этим, наш практический опыт показывает, что процедура подготовки данных зачастую сильнее влияет на итоговый результат сравнения рекомендательных моделей. Например, формулировка из статьи «датасет Zvuk, global temporal split с квантилем 0,9» не сообщает, какие фильтры и агрегации применяли, как обрабатывали события с одинаковыми временными метками и повторные взаимодействия, удаляли ли холодные объекты, какие данные передавали модели на вход и по каким событиям рассчитывали метрики. Поэтому два пайплайна с одним датасетом и одинаковым названием разбиения могут оценивать разные постановки задачи. Это затрудняет воспроизведение экспериментов и сравнение результатов между работами.

Читать далее

Оптимизация расчётов в простой нейронной сети

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели8.5K

Всем привет, меня зовут Антон, я работаю в Сбере разработчиком на Java, в продукте GigaIDE. В этой статье я расскажу, как оптимизировал расчёты в простой нейронной сети. Сначала попробую перемножать матрицы в многопоточном режиме, потом перейду к многопоточному обучению сети. Буду использовать сторонние библиотеки EJML и ND4J, последняя к тому же позволит обучить нейронную сеть на видеокарте (GPU).

Читать далее

Будущее приложений — без приложений

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели12K

Всем привет. Я Михаил Харитончик, лидер продукта GenUI в Цифровом Ассистенте ГигаЧат B2C. Моя команда занимается генеративными интерфейсами: тем, как превращать ответ модели в понятную визуализацию, интерактивные элементы и полноценный пользовательский сценарий. И сегодня я хочу поговорить о будущем приложений. Точнее, о будущем, в котором приложений в привычном виде может вообще не остаться.

Этот текст про горизонт от нескольких месяцев до пары лет. В ИИ-индустрии даже полгода — практически геологическая эпоха: изменения происходят не кварталами, а итерациями длиной в несколько часов. Недавно я увидел, как Сэм Альтман репостит сообщение: кто-то обнаружил, что Grok при работе с агентом отдаёт исходный код. Прошло менее суток — и Grok CLI уже ушёл в open source. За происходящим в индустрии физически сложно успевать.

Визионерствовать на долгий срок в таких условиях сложно, поэтому поговорим о ближайшем будущем. Не абстрактном, а о том, которое начинается с обычного вечера после работы.

Читать далее

Обновление бенчмарка MERA Text 2.0

Время на прочтение11 мин
Охват и читатели8.2K

Всем привет, с вами команда MERA.

В прошлом анонсе мы рассказали о новых публичных тестах на рассуждения и обещали, что следующим большим обновлением станет основная текстовая часть MERA. Пришло время выполнить обещание: представляем MERA Text 2.0 — новую версию текстового бенчмарка и, по сути, переосмысление, что сегодня имеет смысл измерять у фундаментальных текстовых языковых моделей.

Первую версию MERA мы начали создавать ещё в 2023 году. В то время бенчмарки хорошо разделяли модели в задачах, которые сегодня кажутся намного проще: знания о мире, логика, причинно-следственные связи, понимание текста, профессиональные и предметные знания. Во многих из этих задач даже сильным моделям было куда расти, и сам факт успешного решения уже многое говорил об их возможностях.

За три года картина заметно изменилась. Модели стали значительно умнее, а вместе с ними изменились и требования к оценке. На прежнем бенчмарке MERA современные SOTA-модели уже достигают, а в отдельных задачах и превышают результаты человека (Human Baseline). Часть тестов постепенно насыщается: верхняя часть бенчмарка сжимается, разница между сильными моделями становится всё менее заметной, а некоторые задачи просто перестают давать нам достаточно новой информации.

Для бенчмарка это естественный жизненный цикл. Если несколько лет назад вопрос был, скорее: «умеет ли модель это делать вообще?», то сегодня всё чаще приходится спрашивать: «где проходят реальные границы её возможностей?».

Поэтому мы решили не просто добавить в старый бенчмарк ещё несколько датасетов. Вместо этого мы пересобрали текстовую оценку вокруг групп навыков, которые пока ещё остаются сложными и содержательными для современных моделей.

Читать далее

Быстродействие, или Смотря как измерять

Уровень сложностиСредний
Время на прочтение14 мин
Охват и читатели7.2K

Один и тот же JavaScript-код в браузере, Node.js, Deno и Bun должен показывать примерно одинаковую скорость – по крайней мере, так кажется до первых замеров. Я взял четыре прикладные задачи, добавил к сравнению Python и измерил не только время выполнения, но и потребление памяти, причём отдельно посмотрел, как результат меняется вместе с границами замера. Оказалось, что у каждой среды своё представление о быстродействии, а лидер зависит не только от алгоритма, но и от того, входят ли в задачу чтение файлов, парсинг или обработка изображений. Все примеры и исходные данные можно запустить локально и сравнить результаты со своей машиной.

Читать далее

Провожу тест‑драйв GigaChat Audio в рабочих условиях

Время на прочтение17 мин
Охват и читатели12K

Привет, Хабр! Сбер недавно выкатил новую модель, GigaChat Audio. Сейчас я надиктовываю модели этот текст голосом — финальный штрих в истории о том, как я проводил её тест‑драйв. 

Когда прочитал, что GigaChat Audio запоминает контекст, ориентируется в больших аудиозаписях и даже чувствует эмоции говорящего, сразу захотел проверить. Я задеплоил эту модель локально на рабочем компьютере и целый день проверял на рабочих задачах. Результат — в этой статье.

Меня зовут Данила @pushnoydan, я мидл‑разработчик и занимаюсь бэкендом микросервисов. А параллельно — большой любитель ИИ‑моделей: в свободное время копаюсь в них, чтобы лучше понимать возможности свежих релизов, стараюсь применять на работе, чтобы упростить рутинные задачи. 

GigaChat Audio — audio‑native LLM. В течение дня я поручал ей разбирать голосовые коммуникации от коллег, составлять саммари по аудиозаписям и выводить ключевой контекст из записей различных встреч. Давайте посмотрим, как модель показала на реальных задачах.

Читать далее

Эволюция архитектора: «от технического писателя до управления сложностью»

Время на прочтение17 мин
Охват и читатели7.2K

Обо мне:

«Всем привет, меня зовут Артём, и я архитектор».

Архитектор я уже давно и много раз. На протяжении долгого времени проектированием каких только систем я не занимался. Сначала системы мультимедиа и ВКС, немного сетей (пока всё логично), далее комплексные проекты с инфраструктурой серверов, пользовательских устройств и прикладного ПО. Дальше резкий сюжетный поворот: проектирование аналитических и BI‑систем в специфике ИБ, резко обратно к «железу» — я главный инженер по слаботочным сетям в крупной строительной компании (гражданское строительство в части всего, что управляется токами ниже 220 В).

Наши дни: Сбер... я четвёртый год корпоративный архитектор инфраструктуры, включающей в себя слои аппаратного обеспечения, виртуализации, операционных систем, серверов приложений, прикладных шлюзов безопасности, Wi‑Fi сетей и многого другого.

Сказать,что я больше знаю, как не надо делать — ничего не сказать. Когда твой путь в архитектуру начинается не с «ванильных» принципов эджайла в разработке ПО, а с жёстокой реальности «водопадных» проектов под закупку, сама концепция стратегического проектирования разбивается о сегодняшние требования рынка, федеральные законы и быстрый проектный заработок для компании. В таком проектировании внедрённый комплекс должен иметь технико‑экономическое обоснование, быть окончательным, сопровождаться уже готовой рабочей документацией и не осуждающими после внедрения косыми взглядами заказчика. И не имеет значения, разрабатываешь ты внутренний продукт или идущий на рынок, из какой предметной области этот продукт — принципы проектирования, в целом, одинаковы для любой разработки.

В Сбере у меня всё плавно начиналось с проектирования отдельных продуктов и их окружения, документирования «наследия» и проверки его на соответствие стандартам банка. Но в один момент все начало меняться, и я, «лёжа на теплом песочке пляжа» под названием «архитектура отдельных продуктов» сначала начал ощущать «брызги волн», а потом «надвигающийся шторм», рождаемый хаосом динамичного, постоянно меняющегося ландшафта банка, в котором крутилась нормативка, стандарты, методики, legacy‑системы, новые стратегии и другие вызовы.

Читать далее

Sequence в PlantUML — проще, понятнее, ярче… И стандартнее

Уровень сложностиПростой
Время на прочтение11 мин
Охват и читатели9K

Всем привет! Меня зовут Анатолий, я работаю ИТ-архитектором в Сбере. Занимаюсь развитием направления клиентской лояльности. Сразу же отмечу, что в этой статье не идёт речь о фундаментально правильных решениях. Скорее, наоборот, речь идёт о решениях компромиссных.

В целом, зрелость архитектурной культуры организации можно оценивать соответствием некому условному уровню. 

Если в вашей компании уже живёт полноценная система для архитектурных решений в виде Aris, Sparx Enterprise Architect или их аналог, и она умеет всё, что нужно: описывать бизнес-сценарии, собирать связанные с ними решения, показывать и согласовывать их с заказчиками, а потом аккуратно складывать в единый архитектурный репозиторий, то тогда, скорее всего, эта статья не для вас. Вы и так всё это проходили.

А вот если такой системы нет или бюджет на неё пока не выделили, но потребность в наглядной архитектуре и порядке в ней уже назрела, то, возможно, мой опыт позволит вам быстрее и легче достичь «третьего» уровня и успешно его пройти.

Читать далее

Как мы настраивали обвязку (harness) под модель: профиль GigaChat для Deep Agents

Уровень сложностиСредний
Время на прочтение19 мин
Охват и читатели7.8K

Привет, Хабр! На связи команда GigaChain. В этой статье мы расскажем, как итеративно настраивали обвязку (harness) Deep Agents под особенности GigaChat: правили промпты и описания инструментов, а часть правил зашивали прямо в код, и как сделали для этого открытый бенчмарк harness-bench-fast, чтобы измерять прогресс. На зафиксированном сете из 391 задачи подключение профиля подняло долю решённых задач с 77,2% до 87,0%, а расход токенов сократило практически вдвое.

Читать далее

Изучаем нейронную сеть на Java

Уровень сложностиСредний
Время на прочтение9 мин
Охват и читатели9.9K

Всем привет, меня зовут Антон, я работаю в Сбере разработчиком Java, в продукте GigaIDE. В этой статье мы перепишем нейронную сеть c Phyton’а на Java, которая распознаёт рукописные цифры MNIST. Попробуем распознавать свои цифры, рисуя их мышкой, сделаем обратный запрос в сеть и заглянем в ее «мозги», а в конце сделаем выводы.

Читать далее

Deep Agents: open source-обвязка на LangGraph

Уровень сложностиСредний
Время на прочтение22 мин
Охват и читатели9.9K

Привет, на связи команда GigaChain! Мы занимаемся агентными системами и развиваем набор open source-решений для подключения агентов к GigaChat API.

LangChain развивается с 2022 года и выросла в одну из самых популярных экосистем для агентов: у основной библиотеки более 140 тысяч звёзд на GitHub. Благодаря LangGraph — движку, который исполняет агента как граф с состоянием, — с её помощью собирают и простые цепочки вызовов, и сложные автономные агенты, ведущие задачу на сотни шагов. Поверх этого стека команда LangChain выпустила Deep Agents — готовую агентную обвязку (agent harness): рабочую среду с файловой системой, оболочкой, планировщиком, субагентами и памятью, в которую остаётся лишь поместить модель.

Сегодня мы подробно разберём эту обвязку: из чего она состоит и как собрать на ней агента, работающего на GigaChat.

Читать далее

Ближайшие события

Почти 200° обзора: проверяем SOTA-модели оценки глубины на fisheye

Уровень сложностиСложный
Время на прочтение11 мин
Охват и читатели7.3K

Fisheye-камера позволяет роботу увидеть почти всё помещение одним кадром. Но за широкий обзор приходится платить: на WideDepth при увеличении угла обзора (FOV) со 120° до 195° ошибка некоторых SOTA-моделей монокулярной оценки глубины увеличивается более чем вдвое. Без точной эталонной разметки трудно понять, что именно подвело модель — геометрия камеры, отличие новых данных от обучающей выборки или погрешность самой разметки.

Чтобы разделить эти факторы, мы создали WideDepth — бенчмарк для оценки глубины по fisheye-изображениям. Он позволяет проверять модели при разных углах обзора, стереобазах и ориентациях камер.

Читать далее

Single Task Algorithmic Reasoning Models: как с помощью маленькой модели обойти большую LLM?

Уровень сложностиСредний
Время на прочтение12 мин
Охват и читатели15K

Привет, Хабр! Результаты коллег по цеху и наши исследования позволяют сделать однозначный вывод: в 2026-м для рецепта отличной reasoning-модели уже недостаточно лишь текстовых рассуждений. Для качественных ответов на большинство вопросов пользователей нужна работа с инструментами, мультимодальные режимы рассуждений, и нередко даже такая экзотика, как рассуждения в латентных представлениях сети.

Мы рады поделиться с сообществом фреймворком для обучения рекурсивных reasoning-моделей STARM, существенно опережающих по качеству предыдущие open source-аналоги.

Читать далее

Мы научили ИИ решать реальные бизнес-задачи клиентов через MCP-сервер Сбера: пример Ouroboros

Уровень сложностиПростой
Время на прочтение4 мин
Охват и читатели7.8K

Всем привет! Меня зовут Оля, я руководитель направления в канале Sber API. Сейчас расскажу, как мы сделали инновационный для российского рынка MCP, и как это решение может упростить вам работу.

ИИ быстро развивается и получает новые функции. Есть LLM-решения для генерирования текста и изображений, для автоматизации персональных задач, для нефинансового сектора и заказа еды, и многие другие. Однако их всё ещё тяжело применять в реальных бизнес-задачах.

Я расскажу, как мы с командой попробовали внедрить в ИИ функцию работы с финансовыми сервисами банка для корпоративных клиентов. 

Читать далее

Монолит больше не приговор: строим быстрые и гибкие микрофронтенды на ES-модулях

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели9.8K

Меня зовут Иван Соснович, я сеньор фронтенд-разработчик в СберТехе, тружусь в команде Platform V Kintsugi — это графический инструмент для сопровождения, мониторинга и диагностики Postgres-like СУБД. По итогам прошлой статьи мнения читателей разделились.

В эпоху ИИ о структуре кода задумываются все реже, однако архитектурные решения остаются критически важными для развития и долгосрочной поддержки систем. Надеюсь, что эта статья будет полезна и появятся советы, как упростить и облегчить систему сборки.

Сразу скажу, что код проекта будет писать ИИ через GigaCode CLI, навыки останутся в репозитории.

Читать далее

Как мы сделали веб-аналог Jaspersoft Studio (и зачем вообще это понадобилось)

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели5.9K

Представьте сотни уникальных шаблонов строгой отчётности — от актов выполненных работ до счетов-фактур, — которые являются неотъемлемой частью работы одного из крупнейших банков страны. Каждый шаблон — JRXML-файл, каждый файл — чья-то зона ответственности. В нашей команде инструмент для создания этих шаблонов был Jaspersoft Studio — но и он нередко становился источником системных проблем.

Расскажем, как и почему мы написали собственный браузерный редактор печатных форм, и как он помог разработчикам и аналитикам быстро и самостоятельно создавать сложные отчёты.

Читать далее

Обновления GigaIDE за июль 2026

Время на прочтение4 мин
Охват и читатели7K

Всем добрый день. Как и в предыдущие месяцы, по итогам июля мы решили рассказать про то, как изменилась GigaIDE за прошедший месяц. Ниже — краткий обзор обновлений Pro-функциональности GigaIDE, который можно найти на нашем маркетплейсе.

Читать далее

Kandinsky WM 1.0: генеративные модели для Physical AI

Уровень сложностиСредний
Время на прочтение18 мин
Охват и читатели11K

В конце прошлого года мы представили семейство моделей генерации изображений и видео Kandinsky 5.0. Флагманская модель Kandinsky 5.0 Video Pro заняла и долгое время удерживала первое место среди open-source-моделей в категории text-to-video на arena.ai. Сегодня мы выкладываем в открытый доступ Kandinsky WM 1.0, набор из трех специализированных моделей генерации видео для доменов Physical AI: автомобильные сценарии, робототехника и сцены со сложной физикой.

Читать далее
1
23 ...