Open-weight models have 2.4 t parameters, but each task uses only ~30 b. Dense models need many servers. Sparse routing loads only needed parts, so one server can do the work. Sparse expert models also let a single server handle the task, avoiding extra machines.