face-à-face · LLM local

Phi-3.5 Mini 3.8B vs Qwen 2.5 72B

Comparatif chiffré : VRAM requise par quantization, GPUs compatibles pour faire tourner chacun en local, et verdict construit depuis les specs réelles. Pas de bench truqué, juste les chiffres.

3.8B
params Phi-3.5 Mini 3.8B
72B
params Qwen 2.5 72B
Phi
famille A
Qwen
famille B
▲ Specs côte à côte

Les chiffres bruts.

▲ VRAM par quantization

Combien de VRAM il te faut.

Estimation incluant l'overhead (KV cache + activations) ×1.12. Pour un MoE, on prend les paramètres totaux car le modèle complet doit être chargé en mémoire (les experts inactifs aussi).

QuantPhi-3.5 Mini 3.8BQwen 2.5 72BÉcart
Q31.9 GB35.3 GB33.4 GB
Q42.4 GB45.4 GB43.0 GB
Q52.9 GB55.4 GB52.5 GB
Q63.5 GB65.5 GB62.0 GB
Q84.3 GB80.6 GB76.3 GB
FP168.5 GB161.3 GB152.8 GB
▲ GPU minimum pour chacun en Q4

Quel GPU suffit pour quoi.

Pour Phi-3.5 Mini 3.8B en Q4

GTX 1650

4 GB de VRAM — suffisant pour les 2.4 GB requis en Q4.

→ Fiche GTX 1650
▲ Verdict

Ce que les chiffres disent.

Qwen 2.5 72B est 18.9× plus gros que Phi-3.5 Mini 3.8B — plus de connaissances, mais 45 GB de VRAM contre 2 GB.

Choisir Phi-3.5 Mini 3.8B

Tu manques de VRAM, tu veux du débit token/s, ou tu déploies sur edge (laptop, mini-PC).

→ Fiche Phi-3.5 Mini 3.8B
Choisir Qwen 2.5 72B

Tu privilégies la qualité de raisonnement, tu as une grosse VRAM (48 GB+), tu acceptes un débit plus faible.

→ Fiche Qwen 2.5 72B

Tester avec ton GPU ?

Le calculateur croise ces 2 modèles avec 200+ GPUs et te donne tok/s estimés, €/Mtok et break-even cloud.