tecnoboletín / 2026-08-17 / omlx
probar #tiered-kv-cache-inference hallazgo 04 · boletín 2026-08-17

jundot/omlx

servidor LLM optimizado para Apple Silicon (M1/M2/M3/M4) con continuous batching + tiered KV cache (RAM hot + SSD cold) que sobrevive a cambios de contexto mid-conversation. macOS app con in-app auto-update, Homebrew tap (brew tap jundot/omlx), MCP support opcional, admin chat UI en localhost:8000/admin/chat. Kernels nativos Metal custom para GLM-5.2, MiniMax M3, Qwen3.5 (medido: 845 vs ~29 tok/s en prefill DSA GLM-5.2 sobre M3 Ultra).

Estrellas
18.816
Forks
1.500
Lenguaje
Python
Licencia
Apache-2.0
Issues
Estado

Cómo funciona

Implementa tiered-kv-cache-inference
Núcleo
jundot/omlx Python · Apache-2.0
Se cruza con complementa ollama/ollama relevante para llama.cpp

Diagrama derivado de madurez_senales (lenguaje, licencia, estado y topics) y de las relaciones que este repo tiene en el grafo de conocimiento. No es una arquitectura del proyecto: es su posición funcional tal como la registran los boletines.

Posición en el ecosistema

jundot/omlx
implementa
tiered-kv-cache-inference Concepto
jundot/omlx
complementa
ollama/ollama Repositorio
jundot/omlx
relevante para
llama.cpp Herramienta
Expandir en el grafo 3D →

Relaciones que aportó este boletín