Infra e custo
Inferência, GPUs, preço por token, e o que muda quando o custo cai dez vezes.
GLM-5.3-Flash: um modelo MIT de 320B servido inteiramente em chips chineses, a US$ 0,15 por milhão de tokens
É o dado mais claro até agora de que um modelo competitivo pode ser treinado e servido em escala sem hardware NVIDIA — e coloca trabalho agentivo de classe Opus a centavos.
O governo publicou a licitação de R$ 959 milhões do supercomputador de IA do Rio Grande do Norte — propostas até 8 de outubro
É o primeiro passo concreto, datado e financiado rumo a capacidade soberana de computação para IA no Brasil — e os termos da licitação vão definir quais pilhas os engenheiros daqui poderão usar.
Janela de contexto grande não significa contexto usado: modelos perdem o que está no meio
Explica por que “jogar tudo no contexto” falha e por que RAG e ordenação de evidências continuam importando.
DeepSeek-V3: um modelo de 671B treinado em 2,79 milhões de horas de H800, sem um único pico de perda
Foi o relatório que fez o mercado repensar quanto custa treinar um modelo de fronteira — e a origem de várias técnicas que os modelos abertos de 2026 ainda usam.
PagedAttention: tratar o KV cache como memória virtual dobrou a vazão de inferência — e deu origem ao vLLM
Custo por token é, em grande parte, custo de memória; este é o paper que explica por que.