Pular para o conteúdo
GenAI BR
Infra e custoNo acervo desde 06 de set. de 2026

PagedAttention: tratar o KV cache como memória virtual dobrou a vazão de inferência — e deu origem ao vLLM

Infra e custotécnicotécnicopaper · UC Berkeley · SOSP 2023 · 12 de set. de 2023
Baixar cartão
O que é
Kwon, Li e colegas (Berkeley) observaram que o cache de chaves e valores da atenção desperdiçava memória por fragmentação, e aplicaram a ideia de paginação de sistemas operacionais: blocos não contíguos, compartilháveis entre requisições. O resultado é o vLLM, hoje um dos servidores de inferência mais usados.
O que foi demonstrado
Vazão de 2 a 4× maior que FasterTransformer e Orca com a mesma latência, mais ganho quanto maiores as sequências e os modelos.
O que ainda não foi
Números de 2023; o cenário competitivo (SGLang, TensorRT-LLM) mudou. O princípio, não a comparação, é o que vale.
Por que importa
Custo por token é, em grande parte, custo de memória; este é o paper que explica por que.

No mesmo tema

Infra e custo
  1. GLM-5.3-Flash: um modelo MIT de 320B servido inteiramente em chips chineses, a US$ 0,15 por milhão de tokens

    Infra e custotécnicotécnico, decisoranúncio · Z.ai · 26 de ago. de 2026
  2. O governo publicou a licitação de R$ 959 milhões do supercomputador de IA do Rio Grande do Norte — propostas até 8 de outubro

    Regulação e Brasilintrodutóriotécnico, decisor, inicianteanúncio · Governo Federal · 21 de ago. de 2026
  3. Janela de contexto grande não significa contexto usado: modelos perdem o que está no meio

    Avaliaçãointrodutóriotécnico, iniciantepaper · Stanford / UC Berkeley / Samaya · TACL 2023 · 06 de jul. de 2023
  4. DeepSeek-V3: um modelo de 671B treinado em 2,79 milhões de horas de H800, sem um único pico de perda

    Infra e custotécnicotécnico, decisorpaper · DeepSeek · 27 de dez. de 2024

Receba o próximo Cinco

Terça, 7h, no seu e-mail. Cinco itens, com fonte. Sem newsletter diária, sem promoção, e o descadastro é um clique.

Só o e-mail. Nada de rastreador de terceiros nesta página. Política de privacidade.