jitLLM: Java-байткод компилируется прямо в CUDA для инференса LLM
Команда TornadoVM из Манчестерского университета с Red Hat представила jitLLM — Java-движок инференса LLM, компилирующий байткод в CUDA и cuTile без C++ и Python. Заявлено около 90% производительности llama.cpp на RTX 5090; независимых бенчмарков пока нет.
- jitLLM запускает Llama 3, Mistral, Qwen 2.5/3, Phi-3, Granite и Devstral 2 в формате GGUF
- Заявлено ~90% производительности llama.cpp на NVIDIA RTX 5090
- Есть официальный движок для LangChain4j и расширение Quarkus
- Код на Java компилируется в CUDA, OpenCL или SPIR-V через TornadoVM
Читать дальше
Софт