Обновить

Инференс трансформеров на чистой Java без Python и JNI

Запуск нейросетей на Java часто воспринимается как компромисс: либо JNI-обвязки, либо Python-стек, либо готовые рантаймы. Но современные JDK уже позволяют строить полноценный пайплайн инференса внутри JVM — без Python, без JNI-слоя и без лишней магии.

Хочу провести технический вебинар и показать, как на чистой Java реализовать инференс трансформеров и оптимизировать его под CPU, используя:

  • Foreign Function & Memory API (FFM) — для безопасной работы с нативной памятью и маппинга весов моделей без лишнего оверхеда и давления на GC;

  • Vector API — для SIMD-ускорения матричных операций на CPU.

И это не только про LLM.

На вебинаре разберём, как на Java можно запускать и оптимизировать разные классы трансформеров (encoder-only, encoder-decoder, decoder-only):

  • RoBERTa — для классификации и NLP-задач;

  • MiniLM — для эмбеддингов и семантического поиска;

  • T5 — для seq2seq-сценариев и генерации;

  • Qwen — для современных LLM-сценариев и практического инференса.

То есть цель вебинара — не показать ещё один способ вызвать llama.cpp по API, а разобраться, как устроен сам Java-слой инференса для трансформеров и где он реально полезен.

Если тема вам интересна — оставьте контакты по ссылке.

Если наберём 20+ заинтересованных, я подготовлю программу и разошлю приглашения с датой.

UPD: Всем, кто заполнит форму предрегистрации, я сразу после вебинара (или даже чуть раньше) скину ссылку на приватный репозиторий с базовым PoC/бенчмарком инференса Qwen на Vector API, чтобы вы могли покрутить код сами.

Теги:
+3
Комментарии1

Разработчик сжёг токенов на $157 143, заплатив за них $400

Блогер‑разработчик OrcDev рассказал, что за последний месяц обработал 235 млрд токенов, которые при оплате по API‑тарифам обошлись бы ему в $157 143,39. При этом фактически он заплатил за использование моделей всего $400.

Разработчик сжёг токенов на $157 143, заплатив за них $400

Публикации