À medida que as organizações migram de pilotos de IA para fábricas de IA em produção, as decisões de infraestrutura passaram das especificações de pico do chip para o custo por token: quantos tokens úteis podem entregar por dólar, por watt e dentro das metas de latência exigidas.
