Обновить

Инференс трансформеров на чистой Java без Python и JNI

Запуск нейросетей на Java часто воспринимается как компромисс: либо JNI-обвязки, либо Python-стек, либо готовые рантаймы. Но современные JDK уже позволяют строить полноценный пайплайн инференса внутри JVM — без Python, без JNI-слоя и без лишней магии.

Хочу провести технический вебинар и показать, как на чистой Java реализовать инференс трансформеров и оптимизировать его под CPU, используя:

  • Foreign Function & Memory API (FFM) — для безопасной работы с нативной памятью и маппинга весов моделей без лишнего оверхеда и давления на GC;

  • Vector API — для SIMD-ускорения матричных операций на CPU.

И это не только про LLM.

На вебинаре разберём, как на Java можно запускать и оптимизировать разные классы трансформеров (encoder-only, encoder-decoder, decoder-only):

  • RoBERTa — для классификации и NLP-задач;

  • MiniLM — для эмбеддингов и семантического поиска;

  • T5 — для seq2seq-сценариев и генерации;

  • Qwen — для современных LLM-сценариев и практического инференса.

То есть цель вебинара — не показать ещё один способ вызвать llama.cpp по API, а разобраться, как устроен сам Java-слой инференса для трансформеров и где он реально полезен.

Если тема вам интересна — оставьте контакты по ссылке.

Если наберём 20+ заинтересованных, я подготовлю программу и разошлю приглашения с датой.

UPD: Всем, кто заполнит форму предрегистрации, я сразу после вебинара (или даже чуть раньше) скину ссылку на приватный репозиторий с базовым PoC/бенчмарком инференса Qwen на Vector API, чтобы вы могли покрутить код сами.

Теги:
Всего голосов 1: ↑1 и ↓0+3
Комментарии1

Я попал к психиатру из‑за кодинга с AI

Со стороны программирование звучит как медитативное занятие. Сидишь себе за компом целый день, слушаешь музыку, пьешь вкусный кофе. У все меня примерно так и происходит. Сначала я не спеша пытаюсь выстроить в голове то, что требуется сделать. Именно «не спеша». И не потому что я такой опытный и мудрый, а потому что быстро я просто не умею.

У меня не получается сразу продумать все корнер кейсы, которые сильно могут повлиять на архитектуру. Я не могу быстро достать из памяти нужный паттерн, чтобы на лайвкодинге блеснуть своими знаниями. Поэтому сначала я медленно вчитываюсь в описание задачи, общаюсь с ПМом или коллегами, кто больше знает в этой доменной области, чтобы в обсуждении мой мозг начал работать в правильном направлении.

Все это звучит конечно логично, но явно 10x инженером так не стать. Да и будем честны, даже 2x тоже. В IT, где эффективность, это не один из критериев оценки сотрудника, а недостижимая цель, к которой стремятся все. Мой стиль работы — это проблема. Но благодаря появлению AI, эта проблема стала решена.

Я попал к психиатру из‑за кодинга с AI

Публикации