FlashML-org/FreeToken
motor de serving edge-native para modelos MoE open-weight (DeepSeek-V4-Flash, Qwen3.6-35B-A3B, GLM-5.2). La propuesta técnica combina expert caching global con política de co-ejecución CPU/GPU bandwidth-adaptive (q*), doble buffering de prefill full-layer, formato de pesos "FTW" y "semantic anchor checkpoints" para evitar recomputar contexto cuando un agente edita tool calls / thinking blocks. Expone APIs compatibles OpenAI/Anthropic y promete 290B+ MoE en una gaming PC.
Cómo funciona
Diagrama derivado de madurez_senales (lenguaje, licencia, estado y topics) y de las relaciones que este repo tiene en el grafo de conocimiento. No es una arquitectura del proyecto: es su posición funcional tal como la registran los boletines.
Posición en el ecosistema
Relaciones que aportó este boletín