Encaixe do modelo
Qual GPU roda qual modelo
Quanta memória de vídeo um modelo precisa e qual o chip mais barato que a comporta, pelo preço de hoje.
10
32.768
Pesos mais cache de atenção, com 15% de folga para ativações e o alocador. Tudo aqui é aritmética — não medimos velocidade, então não classificamos chip por ela. O número de memória vem do anúncio de cada provedor. Publicamos o que eles informam, sem corrigir.
Llama 3.1 8B
22
Tesla P40US$ 0,08/h
11
Tesla P100US$ 0,03/h
5.4
Tesla P100US$ 0,03/h
Llama 3.1 70B
161
MI300XUS$ 2,39/h
81
RTX PRO 6000 Max-QUS$ 0,79/h
40
Q RTX 8000US$ 0,25/h
Llama 3.1 405B
886
MI300X × 5US$ 11,95/h
443
A100 SXM4 × 6US$ 2,73/h
221
MI350XUS$ 5,49/h
Qwen 2.5 7B
18
Tesla P40US$ 0,08/h
9.1
Tesla P100US$ 0,03/h
4.6
Quadro P2000US$ 0,03/h
Qwen 2.5 32B
79
A100 SXM4US$ 0,45/h
39
Q RTX 8000US$ 0,25/h
20
Tesla P40US$ 0,08/h
Qwen 2.5 72B
167
MI300XUS$ 2,39/h
84
RTX PRO 6000 Max-QUS$ 0,79/h
42
Q RTX 8000US$ 0,25/h
Mistral 7B
20
Tesla P40US$ 0,08/h
10
Tesla P100US$ 0,03/h
5.0
Tesla P100US$ 0,03/h
Gemma 2 9B
32
Q RTX 8000US$ 0,25/h
16
Tesla P100US$ 0,03/h
7.9
Tesla P100US$ 0,03/h
Gemma 2 27B
71
A100 SXM4US$ 0,45/h
36
Q RTX 8000US$ 0,25/h
18
Tesla P40US$ 0,08/h
Mixtral 8x7B
MoE105
MI300XUS$ 2,39/h
52
A100 SXM4US$ 0,45/h
26
Q RTX 8000US$ 0,25/h
Mistura de especialistas: só parte dos pesos roda por token, mas todos precisam estar na memória.
Quantizar corta os pesos pela metade a cada passo. Também muda a qualidade da saída, o que esta página não mede.
Ver todos os preços de GPU