The Raw Logs
← Log #008·Take 05·#models
Open-weight models have 2.4 t parameters, but each task uses only ~30 b. Dense models need many servers. Sparse routing loads only needed parts, so one server can do the work. Sparse expert models also let a single server handle the task, avoiding extra machines.
Primary source verified
Part of Log #008
Never miss a daily briefing
More #models: #21-3 OpenAI Demonstrates 3.6x Latency Red · #21-4 PyTorch Foundation Adds Native Suppo