JustVugg/colibri
motor de inferencia en un único archivo c/glm.c de ~1.300 líneas que corre GLM-5.2 (744B parámetros MoE) en una máquina con ~25 GB de RAM, streameando los 21.504 expertos (75 capas × 256 expertos, ~19 MB cada uno a int4 = ~370 GB en disco) desde SSD con LRU per-layer + OS page cache + hot-pinning opcional. Valida forward token-exact contra un oráculo transformers (TF 32/32, greedy 20/20). Implementa: atención MLA con kv-LoRA + RoPE parcial + compressed KV-cache (576 floats/token, 57× más pequeño), router sigmoid DeepSeek-V3-style, int8 speculative decoding con MTP head (39-59% accept, 2.2-2.8 tok/forward medidos), sampling nucleus, kernels integer-dot AVX2, BPE byte-level en C, MLA weight absorption para decode sin reconstrucción, async expert readahead (WILLNEED), cuantización int4/int8/int2 con packing bit-identical. Documenta números honestos: ~0.05-0.1 tok/s cold, ~20 GB RSS peak auto-cap, MTP head obligatorio a int8.
Cómo funciona
Diagrama derivado de madurez_senales (lenguaje, licencia, estado y topics) y de las relaciones que este repo tiene en el grafo de conocimiento. No es una arquitectura del proyecto: es su posición funcional tal como la registran los boletines.
Posición en el ecosistema
Relaciones que aportó este boletín