Runtime GGUF minimalista para OpenCL 1.2 e 3.0, feito para extrair o máximo de LLMs locais com 1 a 4 GB de VRAM, GPUs integradas e topologias híbridas.
- Llama, SmolLM2 e Qwen 3.5 (Gated DeltaNet)
- FP16, Q8_0 e Q4_0 com reempacotamento em tempo de carga
- Zero alocações no caminho crítico, com buffers planejados estaticamente
- Validado em NVIDIA GTX 1650 e Intel UHD Graphics