Rôle
PowerInfer accélère le servage local de grands modèles sur machine grand public (une GPU consumer) en exploitant la localité d’activation : une minorité de neurones s’active souvent (« chauds »), le reste rarement (« froids »). Les chauds restent en VRAM ; les froids sont calculés côté CPU pour soulager la mémoire GPU et limiter les transferts.
Lignée produit
| Étape | Année | Objet | |-------|-------|--------| | PowerInfer | déc. 2023 | PC + GPU consumer ; gains annoncés jusqu’à environ 11× vs llama.cpp sur modèles ReLU-sparse (ex. Falcon-ReLU 40B) | | PowerInfer-2 | juin 2024 | Smartphones (XPU Qualcomm) ; clusters de neurones, cache segmenté, pipelining I/O ; démos Mixtral sparsifié jusqu’à environ 47B | | TurboSparse | 2024 | Variantes sparsifiées (Mistral / Mixtral) co-conçues pour la prévisibilité d’activation | | SmallThinker | 2025 | Famille MoE « native on-device » (IPADS + School of AI SJTU / Zenergize–Tiiny) ; moteur d’inférence associé |
Points clés
- Approche modèle–système : les gros gains exigent une sparsité d’activation prévisible (ReLU / variantes sparsifiées), pas un drop-in sur tous les LLM SwiGLU courants.
- Compatible en partie avec l’écosystème llama.cpp (exemples, poids) mais sans le même gain hors modèles adaptés.
- Site et papiers : powerinfer.ai, PowerInfer-2 sur powerinfer.ai/v2.
- Code public historique : SJTU-IPADS/PowerInfer (forks / miroirs type Tiiny-AI).
Limites (sobres)
- PowerInfer-2 : papier et démos mobiles fortes ; le code v2 n’a longtemps pas été ouvert de façon reproduisible pour la communauté PC.
- Face à llama.cpp / GGUF, MLX, vLLM, ExLlama, PowerInfer n’est pas devenu le runtime local par défaut.
- Courbe d’adoption liée aux modèles sparsifiés / MoE on-device de la lignée, pas à tout le catalogue Hugging Face.
Chronologie éditoriale (à enrichir)
- 2023-12-19 — Annonce / papier PowerInfer (post omarsar0 et couverture LocalLLaMA).
- 2024-06 — PowerInfer-2 (smartphones) + modèles TurboSparse.
- 2025-07 — SmallThinker Instruct (4B-A0.6B / 21B-A3B) et cadre d’inférence on-device associé.
Voir aussi
- Wiki panorama
llm-marche(modèles frontier / open-weight). - Catégorie wiki
type: moteur-inference·domaine: modeles-ia(voirtaxonomie-produits).