Neurone21
← Wiki

PowerInfer

moteur-inferencemodeles-iaMaturité : recherche / communauté (pas le standard de facto)Licence : open-source (Apache 2.0 sur les dépôts publics)

Moteur d’inférence LLM local (SJTU IPADS) fondé sur la sparsité d’activation : neurones « chauds » sur GPU, « froids » sur CPU ; lignée PowerInfer-2 (mobile) et modèles on-device SmallThinker.

Rôle

PowerInfer accélère le servage local de grands modèles sur machine grand public (une GPU consumer) en exploitant la localité d’activation : une minorité de neurones s’active souvent (« chauds »), le reste rarement (« froids »). Les chauds restent en VRAM ; les froids sont calculés côté CPU pour soulager la mémoire GPU et limiter les transferts.

Lignée produit

| Étape | Année | Objet | |-------|-------|--------| | PowerInfer | déc. 2023 | PC + GPU consumer ; gains annoncés jusqu’à environ 11× vs llama.cpp sur modèles ReLU-sparse (ex. Falcon-ReLU 40B) | | PowerInfer-2 | juin 2024 | Smartphones (XPU Qualcomm) ; clusters de neurones, cache segmenté, pipelining I/O ; démos Mixtral sparsifié jusqu’à environ 47B | | TurboSparse | 2024 | Variantes sparsifiées (Mistral / Mixtral) co-conçues pour la prévisibilité d’activation | | SmallThinker | 2025 | Famille MoE « native on-device » (IPADS + School of AI SJTU / Zenergize–Tiiny) ; moteur d’inférence associé |

Points clés

  • Approche modèle–système : les gros gains exigent une sparsité d’activation prévisible (ReLU / variantes sparsifiées), pas un drop-in sur tous les LLM SwiGLU courants.
  • Compatible en partie avec l’écosystème llama.cpp (exemples, poids) mais sans le même gain hors modèles adaptés.
  • Site et papiers : powerinfer.ai, PowerInfer-2 sur powerinfer.ai/v2.
  • Code public historique : SJTU-IPADS/PowerInfer (forks / miroirs type Tiiny-AI).

Limites (sobres)

  • PowerInfer-2 : papier et démos mobiles fortes ; le code v2 n’a longtemps pas été ouvert de façon reproduisible pour la communauté PC.
  • Face à llama.cpp / GGUF, MLX, vLLM, ExLlama, PowerInfer n’est pas devenu le runtime local par défaut.
  • Courbe d’adoption liée aux modèles sparsifiés / MoE on-device de la lignée, pas à tout le catalogue Hugging Face.

Chronologie éditoriale (à enrichir)

  • 2023-12-19 — Annonce / papier PowerInfer (post omarsar0 et couverture LocalLLaMA).
  • 2024-06 — PowerInfer-2 (smartphones) + modèles TurboSparse.
  • 2025-07 — SmallThinker Instruct (4B-A0.6B / 21B-A3B) et cadre d’inférence on-device associé.

Voir aussi

  • Wiki panorama llm-marche (modèles frontier / open-weight).
  • Catégorie wiki type: moteur-inference · domaine: modeles-ia (voir taxonomie-produits).