tecnoboletín / 2026-08-23 / FreeToken
explorar #moe-edge-serving hallazgo 02 · boletín 2026-08-23

FlashML-org/FreeToken

motor de serving edge-native para modelos MoE open-weight (DeepSeek-V4-Flash, Qwen3.6-35B-A3B, GLM-5.2). La propuesta técnica combina expert caching global con política de co-ejecución CPU/GPU bandwidth-adaptive (q*), doble buffering de prefill full-layer, formato de pesos "FTW" y "semantic anchor checkpoints" para evitar recomputar contexto cuando un agente edita tool calls / thinking blocks. Expone APIs compatibles OpenAI/Anthropic y promete 290B+ MoE en una gaming PC.

Estrellas
2.498
Forks
233
Lenguaje
Python
Licencia
Apache-2.0
Issues
Estado

Cómo funciona

Implementa MoE edge serving
Núcleo
FlashML-org/FreeToken Python · Apache-2.0
Se cruza con habilita Agentic KV cache reuse compite con vllm-project/vllm

Diagrama derivado de madurez_senales (lenguaje, licencia, estado y topics) y de las relaciones que este repo tiene en el grafo de conocimiento. No es una arquitectura del proyecto: es su posición funcional tal como la registran los boletines.

Posición en el ecosistema

FlashML-org/FreeToken
implementa
MoE edge serving Concepto
FlashML-org/FreeToken
habilita
Agentic KV cache reuse Concepto
FlashML-org/FreeToken
compite con
vllm-project/vllm Repositorio
Expandir en el grafo 3D →

Relaciones que aportó este boletín