Обновить

Компания Сбер временно не ведёт блог на Хабре

Сначала показывать

Код будущего: Хабр и Сбер запускают новый сезон статей о роли ИИ в создании ПО

Время на прочтение7 мин
Охват и читатели9K

Искусственный интеллект в IT из экспериментального инструмента превратился в рабочий: он меняет роли в командах и заставляет пересматривать привычные подходы. Компании всё меньше обсуждают, полезен ли ИИ при разработке ПО. Вместо этого они думают, как лучше интегрировать его в процессы. Это, пожалуй, самая значительная трансформация отрасли за последние несколько лет, и мы хотим увидеть её через призму вашего опыта.

Поэтому Хабр совместно со Сбером запускают новый сезон статей «Код будущего», в котором вы сможете рассказать о своей практике использования ИИ в создании ПО и взаимосвязи ИИ и open source. Сезон продлится с 11 сентября по 11 ноября 2026 года. Под катом — все подробности: тема, сроки, правила.

Читать далее

MCP без хаоса: как мы создали в корпоративном ландшафте централизованный шлюз для ИИ‑агентов

Время на прочтение18 мин
Охват и читатели6.2K

Привет, Хабр! Меня зовут Анастасия Трегубова, я архитектор продукта Platform V Synapse API Mesh в СберТехе. Хочу поделиться идеями по работе с агентскими инструментами и внедрением протокола МСР в корпоративном ландшафте. Расскажу, как мы обеспечиваем централизацию, но обходим узкие места, и как линейка продуктов платформы Synapse сокращает этот путь. Надеюсь, что вы сможете почерпнуть из статье идеи для решения аналогичных задач.

Читать далее

От рутины к эффективности: как QA-инженер может изменить релизный процесс в большой команде

Уровень сложностиСредний
Время на прочтение10 мин
Охват и читатели4.8K

Привет, Хабр! Меня зовут Елена Бабенко, я QA lead в одной из продуктовых команд Pangolin в Сбертехе. Мы разрабатываем СУБД, процесс это сложный и интересный, ведь помимо теории программирования и тестирования нам нужно разбираться и в работе PostgreSQL. Но здесь я хочу рассказать не про ежедневные задачи тестирования, а про релизы и роль выпускающего QA-инженера (обычно эту роль у нас берёт на себя один из QA‑лидов). Эта статья будет интересна тестировщикам, которые работают с крупными продуктами, чьи релизы занимают не час, а обычно пару недель.

СУБД Pangolin — один из таких больших продуктов, и примерно четыре раза в год у нас случается релиз. В каждую версию входят новые фичи, багфиксы, иногда — рефакторинг и другие улучшалки. В общем, большое количество нового кода. Конечно, каждая отдельная задача уже протестирована, но перед выходом в эксплуатацию необходимо стабилизировать уже всю сборку как цельный продукт.

От релиза к релизу мы улучшаем наши процессы и ускоряем разработку. У нас есть много Quality Gates для проверки — помимо стандартных юнитов, мы запускаем регрессы в различных вариациях (состояние сборки по умолчанию, кастомные комбинации, например с разными типами лицензий), обновления с предыдущих версий (здесь же и откаты), совместимость с разными ОС и другое.

Для многих запуск всех проверок — это муторная и неинтересная работа, которая ещё и занимает порядочно времени. А ведь потом надо все эти проверки сверить, проанализировать падения тестов, разобраться с багами (если такие будут), починить флакающие тесты... И в конце концов запустить это всё ещё раз для финального сбора отчётов.

Читать далее

GigaChat 3.5 Reasoning — первая в России открытая модель с рассуждениями

Уровень сложностиСредний
Время на прочтение19 мин
Охват и читатели12K

Привет, Хабр. Мы выпускаем GigaChat 3.5 Reasoning, первую модель GigaChat с полноценным рассуждением, обученную на технологии online RL.

Главное, что изменилось в обучении: после SFT модель целиком прошла через online RL. Не один домен и не одна финальная стадия, а шесть отдельных экспертов (математика, код, агенты и другие), каждый со своей наградой, которые потом собрали обратно в одну модель.

В статье расскажем не только про цифры, но и про то, как устроен конвейер, как модель взламывала награды и почему всё это заняло больше девяти месяцев.

Читать далее

Интервью с Вячеславом Васильевым: о генеративном интеллекте, написании статей и будущем ИИ

Уровень сложностиПростой
Время на прочтение10 мин
Охват и читатели8.1K

Привет, Хабр. Предлагаем вам почитать и обсудить наше интервью с Вячеславом Васильевым, Senior Data Scientist в Управлении базовых моделей Kandinsky, блок «Развитие генеративного ИИ». Вячеслав — опытный исследователь в области Gen AI и один из создателей нескольких поколений нейросетей Kandinsky. Его совместные с коллегами научные статьи регулярно попадают на ведущие международные конференции по машинному обучению.

Вячеслав рассказал, как написать хорошую научную статью и почему важно лично представлять свои работы на больших международных конференциях, поделился мнением о генеративных сетях и актуальных проблемах индустрии ИИ, а также раскрылся с неожиданной для исследователя стороны.

Читать далее

Обновления GigaIDE за август 2026

Время на прочтение4 мин
Охват и читатели10K

Как обычно в начале следующего месяца мы рассказываем о том, что изменилось в GigaIDE за прошедший месяц. Соответствующий обзор за июль доступен здесь. Ниже обзор инкремента Pro-функционала GigaIDE за август, который уже доступен на нашем маркетплейсе.

Читать далее

Подготовка датасета для офлайн-оценки рекомендательных моделей: что проверить  перед запуском экспериментов

Уровень сложностиСредний
Время на прочтение13 мин
Охват и читатели6.5K

Привет, Хабр! Меня зовут Алексей Васильев, я тимлид команды «Рекомендательные системы и персонализация» Sber AI Lab — Центра практического искусственного интеллекта Сбера. Мы занимаемся исследованиями в области рекомендаций, разрабатываем новые модели и, конечно, сравниваем свои результаты с результатами коллег и других исследователей. И регулярно сталкиваемся с ситуацией, когда результаты, заявленные в научной статье или полученные от другой команды, не удаётся воспроизвести, хотя ключевые параметры пайплайна полностью совпадают. В этой статье мы с Анной Володкевич, исследователем из нашей команды, расскажем про свой опыт анализа таких расхождений, на основе которого разработали фреймоворк SplitLight.

Когда результаты научной статьи или успех другой команды не удаётся воспроизвести, обычно начинают с поиска багов в реализации модели: смотрят архитектуру, функцию потерь, способ сэмплирования негативных примеров. Хотя часть несоответствий обусловлена именно этим, наш практический опыт показывает, что процедура подготовки данных зачастую сильнее влияет на итоговый результат сравнения рекомендательных моделей. Например, формулировка из статьи «датасет Zvuk, global temporal split с квантилем 0,9» не сообщает, какие фильтры и агрегации применяли, как обрабатывали события с одинаковыми временными метками и повторные взаимодействия, удаляли ли холодные объекты, какие данные передавали модели на вход и по каким событиям рассчитывали метрики. Поэтому два пайплайна с одним датасетом и одинаковым названием разбиения могут оценивать разные постановки задачи. Это затрудняет воспроизведение экспериментов и сравнение результатов между работами.

Читать далее

Оптимизация расчётов в простой нейронной сети

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели8.6K

Всем привет, меня зовут Антон, я работаю в Сбере разработчиком на Java, в продукте GigaIDE. В этой статье я расскажу, как оптимизировал расчёты в простой нейронной сети. Сначала попробую перемножать матрицы в многопоточном режиме, потом перейду к многопоточному обучению сети. Буду использовать сторонние библиотеки EJML и ND4J, последняя к тому же позволит обучить нейронную сеть на видеокарте (GPU).

Читать далее

Будущее приложений — без приложений

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели12K

Всем привет. Я Михаил Харитончик, лидер продукта GenUI в Цифровом Ассистенте ГигаЧат B2C. Моя команда занимается генеративными интерфейсами: тем, как превращать ответ модели в понятную визуализацию, интерактивные элементы и полноценный пользовательский сценарий. И сегодня я хочу поговорить о будущем приложений. Точнее, о будущем, в котором приложений в привычном виде может вообще не остаться.

Этот текст про горизонт от нескольких месяцев до пары лет. В ИИ-индустрии даже полгода — практически геологическая эпоха: изменения происходят не кварталами, а итерациями длиной в несколько часов. Недавно я увидел, как Сэм Альтман репостит сообщение: кто-то обнаружил, что Grok при работе с агентом отдаёт исходный код. Прошло менее суток — и Grok CLI уже ушёл в open source. За происходящим в индустрии физически сложно успевать.

Визионерствовать на долгий срок в таких условиях сложно, поэтому поговорим о ближайшем будущем. Не абстрактном, а о том, которое начинается с обычного вечера после работы.

Читать далее

Обновление бенчмарка MERA Text 2.0

Время на прочтение11 мин
Охват и читатели8.4K

Всем привет, с вами команда MERA.

В прошлом анонсе мы рассказали о новых публичных тестах на рассуждения и обещали, что следующим большим обновлением станет основная текстовая часть MERA. Пришло время выполнить обещание: представляем MERA Text 2.0 — новую версию текстового бенчмарка и, по сути, переосмысление, что сегодня имеет смысл измерять у фундаментальных текстовых языковых моделей.

Первую версию MERA мы начали создавать ещё в 2023 году. В то время бенчмарки хорошо разделяли модели в задачах, которые сегодня кажутся намного проще: знания о мире, логика, причинно-следственные связи, понимание текста, профессиональные и предметные знания. Во многих из этих задач даже сильным моделям было куда расти, и сам факт успешного решения уже многое говорил об их возможностях.

За три года картина заметно изменилась. Модели стали значительно умнее, а вместе с ними изменились и требования к оценке. На прежнем бенчмарке MERA современные SOTA-модели уже достигают, а в отдельных задачах и превышают результаты человека (Human Baseline). Часть тестов постепенно насыщается: верхняя часть бенчмарка сжимается, разница между сильными моделями становится всё менее заметной, а некоторые задачи просто перестают давать нам достаточно новой информации.

Для бенчмарка это естественный жизненный цикл. Если несколько лет назад вопрос был, скорее: «умеет ли модель это делать вообще?», то сегодня всё чаще приходится спрашивать: «где проходят реальные границы её возможностей?».

Поэтому мы решили не просто добавить в старый бенчмарк ещё несколько датасетов. Вместо этого мы пересобрали текстовую оценку вокруг групп навыков, которые пока ещё остаются сложными и содержательными для современных моделей.

Читать далее

Быстродействие, или Смотря как измерять

Уровень сложностиСредний
Время на прочтение14 мин
Охват и читатели7.4K

Один и тот же JavaScript-код в браузере, Node.js, Deno и Bun должен показывать примерно одинаковую скорость – по крайней мере, так кажется до первых замеров. Я взял четыре прикладные задачи, добавил к сравнению Python и измерил не только время выполнения, но и потребление памяти, причём отдельно посмотрел, как результат меняется вместе с границами замера. Оказалось, что у каждой среды своё представление о быстродействии, а лидер зависит не только от алгоритма, но и от того, входят ли в задачу чтение файлов, парсинг или обработка изображений. Все примеры и исходные данные можно запустить локально и сравнить результаты со своей машиной.

Читать далее

Провожу тест‑драйв GigaChat Audio в рабочих условиях

Время на прочтение17 мин
Охват и читатели14K

Привет, Хабр! Сбер недавно выкатил новую модель, GigaChat Audio. Сейчас я надиктовываю модели этот текст голосом — финальный штрих в истории о том, как я проводил её тест‑драйв. 

Когда прочитал, что GigaChat Audio запоминает контекст, ориентируется в больших аудиозаписях и даже чувствует эмоции говорящего, сразу захотел проверить. Я задеплоил эту модель локально на рабочем компьютере и целый день проверял на рабочих задачах. Результат — в этой статье.

Меня зовут Данила @pushnoydan, я мидл‑разработчик и занимаюсь бэкендом микросервисов. А параллельно — большой любитель ИИ‑моделей: в свободное время копаюсь в них, чтобы лучше понимать возможности свежих релизов, стараюсь применять на работе, чтобы упростить рутинные задачи. 

GigaChat Audio — audio‑native LLM. В течение дня я поручал ей разбирать голосовые коммуникации от коллег, составлять саммари по аудиозаписям и выводить ключевой контекст из записей различных встреч. Давайте посмотрим, как модель показала на реальных задачах.

Читать далее

Эволюция архитектора: «от технического писателя до управления сложностью»

Время на прочтение17 мин
Охват и читатели7.3K

Обо мне:

«Всем привет, меня зовут Артём, и я архитектор».

Архитектор я уже давно и много раз. На протяжении долгого времени проектированием каких только систем я не занимался. Сначала системы мультимедиа и ВКС, немного сетей (пока всё логично), далее комплексные проекты с инфраструктурой серверов, пользовательских устройств и прикладного ПО. Дальше резкий сюжетный поворот: проектирование аналитических и BI‑систем в специфике ИБ, резко обратно к «железу» — я главный инженер по слаботочным сетям в крупной строительной компании (гражданское строительство в части всего, что управляется токами ниже 220 В).

Наши дни: Сбер... я четвёртый год корпоративный архитектор инфраструктуры, включающей в себя слои аппаратного обеспечения, виртуализации, операционных систем, серверов приложений, прикладных шлюзов безопасности, Wi‑Fi сетей и многого другого.

Сказать,что я больше знаю, как не надо делать — ничего не сказать. Когда твой путь в архитектуру начинается не с «ванильных» принципов эджайла в разработке ПО, а с жёстокой реальности «водопадных» проектов под закупку, сама концепция стратегического проектирования разбивается о сегодняшние требования рынка, федеральные законы и быстрый проектный заработок для компании. В таком проектировании внедрённый комплекс должен иметь технико‑экономическое обоснование, быть окончательным, сопровождаться уже готовой рабочей документацией и не осуждающими после внедрения косыми взглядами заказчика. И не имеет значения, разрабатываешь ты внутренний продукт или идущий на рынок, из какой предметной области этот продукт — принципы проектирования, в целом, одинаковы для любой разработки.

В Сбере у меня всё плавно начиналось с проектирования отдельных продуктов и их окружения, документирования «наследия» и проверки его на соответствие стандартам банка. Но в один момент все начало меняться, и я, «лёжа на теплом песочке пляжа» под названием «архитектура отдельных продуктов» сначала начал ощущать «брызги волн», а потом «надвигающийся шторм», рождаемый хаосом динамичного, постоянно меняющегося ландшафта банка, в котором крутилась нормативка, стандарты, методики, legacy‑системы, новые стратегии и другие вызовы.

Читать далее

Sequence в PlantUML — проще, понятнее, ярче… И стандартнее

Уровень сложностиПростой
Время на прочтение11 мин
Охват и читатели9.1K

Всем привет! Меня зовут Анатолий, я работаю ИТ-архитектором в Сбере. Занимаюсь развитием направления клиентской лояльности. Сразу же отмечу, что в этой статье не идёт речь о фундаментально правильных решениях. Скорее, наоборот, речь идёт о решениях компромиссных.

В целом, зрелость архитектурной культуры организации можно оценивать соответствием некому условному уровню. 

Если в вашей компании уже живёт полноценная система для архитектурных решений в виде Aris, Sparx Enterprise Architect или их аналог, и она умеет всё, что нужно: описывать бизнес-сценарии, собирать связанные с ними решения, показывать и согласовывать их с заказчиками, а потом аккуратно складывать в единый архитектурный репозиторий, то тогда, скорее всего, эта статья не для вас. Вы и так всё это проходили.

А вот если такой системы нет или бюджет на неё пока не выделили, но потребность в наглядной архитектуре и порядке в ней уже назрела, то, возможно, мой опыт позволит вам быстрее и легче достичь «третьего» уровня и успешно его пройти.

Читать далее

Ближайшие события

Как мы настраивали обвязку (harness) под модель: профиль GigaChat для Deep Agents

Уровень сложностиСредний
Время на прочтение19 мин
Охват и читатели7.9K

Привет, Хабр! На связи команда GigaChain. В этой статье мы расскажем, как итеративно настраивали обвязку (harness) Deep Agents под особенности GigaChat: правили промпты и описания инструментов, а часть правил зашивали прямо в код, и как сделали для этого открытый бенчмарк harness-bench-fast, чтобы измерять прогресс. На зафиксированном сете из 391 задачи подключение профиля подняло долю решённых задач с 77,2% до 87,0%, а расход токенов сократило практически вдвое.

Читать далее

Изучаем нейронную сеть на Java

Уровень сложностиСредний
Время на прочтение9 мин
Охват и читатели10K

Всем привет, меня зовут Антон, я работаю в Сбере разработчиком Java, в продукте GigaIDE. В этой статье мы перепишем нейронную сеть c Phyton’а на Java, которая распознаёт рукописные цифры MNIST. Попробуем распознавать свои цифры, рисуя их мышкой, сделаем обратный запрос в сеть и заглянем в ее «мозги», а в конце сделаем выводы.

Читать далее

Deep Agents: open source-обвязка на LangGraph

Уровень сложностиСредний
Время на прочтение22 мин
Охват и читатели10K

Привет, на связи команда GigaChain! Мы занимаемся агентными системами и развиваем набор open source-решений для подключения агентов к GigaChat API.

LangChain развивается с 2022 года и выросла в одну из самых популярных экосистем для агентов: у основной библиотеки более 140 тысяч звёзд на GitHub. Благодаря LangGraph — движку, который исполняет агента как граф с состоянием, — с её помощью собирают и простые цепочки вызовов, и сложные автономные агенты, ведущие задачу на сотни шагов. Поверх этого стека команда LangChain выпустила Deep Agents — готовую агентную обвязку (agent harness): рабочую среду с файловой системой, оболочкой, планировщиком, субагентами и памятью, в которую остаётся лишь поместить модель.

Сегодня мы подробно разберём эту обвязку: из чего она состоит и как собрать на ней агента, работающего на GigaChat.

Читать далее

Почти 200° обзора: проверяем SOTA-модели оценки глубины на fisheye

Уровень сложностиСложный
Время на прочтение11 мин
Охват и читатели7.4K

Fisheye-камера позволяет роботу увидеть почти всё помещение одним кадром. Но за широкий обзор приходится платить: на WideDepth при увеличении угла обзора (FOV) со 120° до 195° ошибка некоторых SOTA-моделей монокулярной оценки глубины увеличивается более чем вдвое. Без точной эталонной разметки трудно понять, что именно подвело модель — геометрия камеры, отличие новых данных от обучающей выборки или погрешность самой разметки.

Чтобы разделить эти факторы, мы создали WideDepth — бенчмарк для оценки глубины по fisheye-изображениям. Он позволяет проверять модели при разных углах обзора, стереобазах и ориентациях камер.

Читать далее

Single Task Algorithmic Reasoning Models: как с помощью маленькой модели обойти большую LLM?

Уровень сложностиСредний
Время на прочтение12 мин
Охват и читатели15K

Привет, Хабр! Результаты коллег по цеху и наши исследования позволяют сделать однозначный вывод: в 2026-м для рецепта отличной reasoning-модели уже недостаточно лишь текстовых рассуждений. Для качественных ответов на большинство вопросов пользователей нужна работа с инструментами, мультимодальные режимы рассуждений, и нередко даже такая экзотика, как рассуждения в латентных представлениях сети.

Мы рады поделиться с сообществом фреймворком для обучения рекурсивных reasoning-моделей STARM, существенно опережающих по качеству предыдущие open source-аналоги.

Читать далее

Мы научили ИИ решать реальные бизнес-задачи клиентов через MCP-сервер Сбера: пример Ouroboros

Уровень сложностиПростой
Время на прочтение4 мин
Охват и читатели7.9K

Всем привет! Меня зовут Оля, я руководитель направления в канале Sber API. Сейчас расскажу, как мы сделали инновационный для российского рынка MCP, и как это решение может упростить вам работу.

ИИ быстро развивается и получает новые функции. Есть LLM-решения для генерирования текста и изображений, для автоматизации персональных задач, для нефинансового сектора и заказа еды, и многие другие. Однако их всё ещё тяжело применять в реальных бизнес-задачах.

Я расскажу, как мы с командой попробовали внедрить в ИИ функцию работы с финансовыми сервисами банка для корпоративных клиентов. 

Читать далее
1
23 ...