Инференс трансформеров на чистой Java без Python и JNI
Запуск нейросетей на Java часто воспринимается как компромисс: либо JNI-обвязки, либо Python-стек, либо готовые рантаймы. Но современные JDK уже позволяют строить полноценный пайплайн инференса внутри JVM — без Python, без JNI-слоя и без лишней магии.
Хочу провести технический вебинар и показать, как на чистой Java реализовать инференс трансформеров и оптимизировать его под CPU, используя:
Foreign Function & Memory API (FFM) — для безопасной работы с нативной памятью и маппинга весов моделей без лишнего оверхеда и давления на GC;
Vector API — для SIMD-ускорения матричных операций на CPU.
И это не только про LLM.
На вебинаре разберём, как на Java можно запускать и оптимизировать разные классы трансформеров (encoder-only, encoder-decoder, decoder-only):
RoBERTa — для классификации и NLP-задач;
MiniLM — для эмбеддингов и семантического поиска;
T5 — для seq2seq-сценариев и генерации;
Qwen — для современных LLM-сценариев и практического инференса.
То есть цель вебинара — не показать ещё один способ вызвать llama.cpp по API, а разобраться, как устроен сам Java-слой инференса для трансформеров и где он реально полезен.
Если наберём 20+ заинтересованных, я подготовлю программу и разошлю приглашения с датой.
UPD: Всем, кто заполнит форму предрегистрации, я сразу после вебинара (или даже чуть раньше) скину ссылку на приватный репозиторий с базовым PoC/бенчмарком инференса Qwen на Vector API, чтобы вы могли покрутить код сами.