FineBooks et EleutherAI : révolutionner l'OCR pour l'IA avec dots.mocr

Le brief IA que les pros lisent chaque soir
Les 7 actus IA du jour, décryptées en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
FineBooks et EleutherAI : révolutionner l'OCR pour l'IA avec dots.mocr
Le projet FineBooks, une collaboration entre Hugging Face et EleutherAI, a évalué 14 modèles d'OCR open-source sur plus de 2 000 pages de livres historiques afin de déterminer leur capacité à convertir des textes scannés en données d'entraînement propres pour les modèles de langage IA.
Des modèles plus petits ont souvent surpassé les plus grands, le modèle le plus performant atteignant plus de 97 % de précision des caractères à un coût de moins de deux dollars par mille pages.
Bien que les chercheurs considèrent que la qualité de sortie est suffisante pour les besoins de formation en IA, ils notent que les modèles restent trop sujets aux erreurs pour une utilisation dans des applications académiques ou scientifiques.
Problèmes liés à l'OCR
Former des modèles de langage IA open-source sur des livres du domaine public implique de traiter des textes de mauvaise qualité. Les bibliothèques ont extrait ces textes des scans il y a des années en utilisant la reconnaissance optique de caractères, et les résultats sont souvent truffés d'erreurs. Le projet Talkie a quantifié les dommages potentiels : un modèle de langage entraîné sur du texte OCR apprend avec seulement 30 % de l'efficacité d'un modèle entraîné sur des transcriptions humaines des mêmes livres.
Évaluation des modèles OCR
Le projet FineBooks a testé si les modèles OCR open-source actuels peuvent résoudre ce problème. L'équipe a exécuté 14 modèles open-weight sur 2 165 pages de livres historiques et a publié les résultats sous forme de classement. Les meilleurs modèles ont atteint une précision des caractères supérieure à 97 % pour moins de deux dollars par mille pages.
Pages de référence
Trois des 2 165 pages de référence incluent :
- Un texte de histoire naturelle en anglais à colonne unique,
- Un tableau des matières multilingue,
- Une planche d'illustration dont toute la transcription est une seule ligne de crédit d'artiste.
Amélioration de la reconnaissance de texte
Des millions de pages du domaine public nécessitent une meilleure reconnaissance de texte. Lorsque EleutherAI et ses partenaires ont publié Common Pile l'année dernière, le plus grand corpus d'entraînement sous licence ouverte à ce jour, il contenait environ 300 000 livres du domaine public avec des textes issus de précédentes exécutions OCR. Les auteurs de FineBooks affirment que le retraitement de ces livres avec de meilleurs modèles est l'une des manières les plus efficaces d'améliorer les ensembles de données d'entraînement pour l'IA.
Le projet a choisi la Biodiversity Heritage Library (BHL) comme première cible, qui détient plus de 300 000 documents numérisés en histoire naturelle totalisant plus de 64 millions de pages. La BHL propose sa collection en téléchargement groupé via AWS.
Mesure de la qualité de l'OCR
Mesurer la qualité de l'OCR nécessite des pages avec des transcriptions correctes connues. L'équipe a utilisé des travaux du projet IMPACT et de BHL-Europe : entre 2011 et 2012, des experts ont transcrit six volumes de la BHL en anglais, français, allemand et latin avec un taux d'erreur d'environ un caractère pour 2 000. Ces données sont disponibles sous une licence CC-BY dans un dépôt GitHub et constituent la base du nouvel ensemble de données de référence.
Performance des modèles
Tous les 14 modèles sont disponibles gratuitement et fonctionnent sur du matériel local sans clé API. La métrique utilisée est le taux d'erreur des caractères (CER), qui représente la part de caractères mal reconnus. Le classement divise les résultats en une variante "diplomatique" qui compte la modernisation des caractères archaïques comme une erreur et une variante "lecture" qui tolère de tels changements.
Le modèle dots.mocr utilise seulement 3 milliards de paramètres, tandis que Qwen3.5-9B obtient un score inférieur malgré une taille presque trois fois plus grande. OvisOCR2 se classe deuxième avec seulement 0,9 milliard de paramètres à 46 cents par mille pages. La taille du modèle et la qualité de l'OCR ne sont pas corrélées pour les documents historiques.
Coût par 1 000 pages
- PaddleOCR-VL-1.6
L'évaluation ne couvre que les polices Antiqua dans quatre langues. Elle ne prend pas en compte le Fraktur, les scripts non latins ou l'écriture manuscrite, et FineBooks est limité aux pages de livres à colonne unique. L'équipe prévoit de retraiter environ 200 000 documents BHL du domaine public avec l'un des meilleurs modèles et de publier le texte en tant qu'ensemble de données ouvertes. De nouveaux modèles sont ajoutés au classement de manière continue, et le cadre d'évaluation est disponible ouvertement.
Utilisation pour l'IA et limites académiques
Les auteurs de FineBooks jugent les résultats en fonction de l'utilisation prévue. Pour l'entraînement des modèles de langage, les meilleurs performeurs fonctionnent suffisamment bien, écrivent-ils. Les modèles produisent beaucoup moins d'erreurs que les anciennes chaînes de traitement, et le retraitement d'une collection de la taille de la BHL est réaliste aux coûts mesurés.
Les bibliothèques font face à un problème différent, note l'équipe. Leurs systèmes reposent sur ALTO XML, un format avec des coordonnées au niveau des mots. Les nouveaux modèles produisent du Markdown ou du texte brut sans positions de mots, ce qui les empêche de s'intégrer dans l'infrastructure existante des bibliothèques.
Pour les transcriptions académiques, la précision reste insuffisante, mais pas parce que les modèles lisent mal les caractères. Ils les modernisent silencieusement, remplaçant le long "s" ou les ligatures par des équivalents modernes. Un ajustement ciblé pourrait résoudre ce problème, selon l'équipe.
Brief IA — L'actualité IA en français
L'essentiel de l'actualité de l'intelligence artificielle, décrypté et expliqué chaque jour.