Neurone21
← Actualités

LightOn publie LightOnOCR-3 : trois petits modèles d’OCR open source qui lisent aussi la mise en page, les images et les graphiques

Modeles IA

LightOnOCR-3, modèles d’OCR open source de LightOn

Le fait

Le 8 octobre 2026, la société française LightOn publie LightOnOCR-3, nouvelle génération de ses modèles de reconnaissance de documents. La famille compte trois tailles : 0,8 milliard, 1 milliard et 4 milliards de paramètres. Le modèle 1B conserve l’architecture précédente, tandis que les versions 0,8B et 4B reposent sur l’architecture vision-langage Qwen3.5. Comme les versions précédentes, tout est publié sous licence Apache 2.0, utilisable en recherche comme en usage commercial. LightOn indique que la génération précédente dépasse 4,5 millions de téléchargements sur Hugging Face.

Au-delà de la transcription

Avec un prompt vide, les modèles transcrivent la page comme avant. Avec le prompt grounding, ils ajoutent à la transcription des boîtes englobantes étiquetées pour chaque zone du document (paragraphe, titre, tableau, image, graphique…), avec des coordonnées normalisées de 0 à 1 000. Les images reçoivent une courte description, et les graphiques sont convertis en tableau HTML de leurs points de données.

L’objectif affiché : remplacer par un seul appel de modèle les chaînes d’OCR complexes qui combinent aujourd’hui détecteur de mise en page, moteur de reconnaissance et post-traitements. LightOn insiste sur des blocs qui suivent la structure logique du document plutôt que sa seule disposition visuelle, pour faciliter le découpage en morceaux des pipelines de RAG.

Les chiffres annoncés

Selon LightOn, sur olmOCR-Bench, le modèle 4B obtient 86,3, à 1,3 point d’Infinity Parser Pro (35,1 milliards de paramètres) et 0,5 point devant Chandra 2 ; le 0,8B atteint 85,5 et le 1B 84,5. Sur ParseBench, les versions 4B (75,1) et 0,8B (74,6) se classent aux deux premières places du comparatif publié. Sur le banc français fr-bench-pdf2md, le 4B mène avec 74,1, et s’avère le plus solide sur les pages manuscrites et les formulaires.

Côté débit, mesuré sur un GPU H100 avec des pages rendues à 1 540 pixels, LightOn annonce 4,78 pages par seconde pour le 0,8B et 3,36 pour le 4B. L’entreprise prévient elle-même que les scores dépendent des conventions de formatage des bancs d’essai et publie ses fonctions de normalisation pour permettre la reproduction. L’entraînement a utilisé les supercalculateurs MeluXina et Jean Zay.

Lecture Neurone21

Pour une administration, un cabinet ou une PME qui numérise factures, contrats et formulaires, c’est une brique française, ouverte et assez petite pour tourner en interne, sans envoyer ses documents à un service tiers. Le mode grounding est l’apport le plus utile : savoir où se trouve chaque bloc permet de vérifier une extraction et de citer la page source. Avant de remplacer une chaîne existante, il faut toutefois tester sur ses propres documents : les classements de bancs d’essai sont publiés par l’éditeur.

Sources

  1. LightOnOCR-3: High-Performance OCR and Layout Extraction in One Model — LightOn, blog Hugging Face (8 octobre 2026)
  2. LightOnOCR-3 — LightOn (octobre 2026)