PagedAttention: tratar o KV cache como memória virtual dobrou a vazão de inferência — e deu origem ao vLLM
- O que é
- Kwon, Li e colegas (Berkeley) observaram que o cache de chaves e valores da atenção desperdiçava memória por fragmentação, e aplicaram a ideia de paginação de sistemas operacionais: blocos não contíguos, compartilháveis entre requisições. O resultado é o vLLM, hoje um dos servidores de inferência mais usados.
- O que foi demonstrado
- Vazão de 2 a 4× maior que FasterTransformer e Orca com a mesma latência, mais ganho quanto maiores as sequências e os modelos.
- O que ainda não foi
- Números de 2023; o cenário competitivo (SGLang, TensorRT-LLM) mudou. O princípio, não a comparação, é o que vale.
- Por que importa
- Custo por token é, em grande parte, custo de memória; este é o paper que explica por que.
No mesmo tema
Infra e custo→GLM-5.3-Flash: um modelo MIT de 320B servido inteiramente em chips chineses, a US$ 0,15 por milhão de tokens
O governo publicou a licitação de R$ 959 milhões do supercomputador de IA do Rio Grande do Norte — propostas até 8 de outubro
Janela de contexto grande não significa contexto usado: modelos perdem o que está no meio
DeepSeek-V3: um modelo de 671B treinado em 2,79 milhões de horas de H800, sem um único pico de perda
Receba o próximo Cinco
Terça, 7h, no seu e-mail. Cinco itens, com fonte. Sem newsletter diária, sem promoção, e o descadastro é um clique.