LlamaIndex muscle l’extraction documentaire avec plus de précision
LlamaIndex a présenté Extract v2.5, une mise à jour de ses agents d’extraction de documents. La version promet de meilleurs scores, plus de citations de preuve et une prise en charge native des tableurs, sans hausse annoncée du prix par page.
LlamaIndex a dévoilé Extract v2.5 le 1er octobre 2026, une nouvelle génération d’agents d’extraction documentaire fondés sur des schémas. Selon la société, la mise à jour améliore la précision sur ses trois paliers et renforce l’ancrage des résultats sur les deux plus avancés, Agentic et Agentic Plus, sans augmenter le tarif par page. Le sujet compte pour les équipes qui automatisent la lecture de dossiers complexes, car l’extraction reste l’un des points faibles les plus coûteux quand il faut encore reprendre des tableaux à la main.
Des gains mesurés sur des documents d’entreprise réels
Sur ExtractBench, le benchmark ouvert de LlamaIndex, le score global de valeur F1 passe de 87,1 à 93,9 pour le palier Cost Effective, de 89,8 à 95,8 pour Agentic et de 95,1 à 96,4 pour Agentic Plus. La société affirme même que Cost Effective dépasse désormais l’ancien Agentic, tandis qu’Agentic surpasse l’ancien Agentic Plus. Le benchmark couvre 370 documents d’entreprise, soit 4 869 pages, répartis dans 8 domaines métiers et 67 types de documents avec un schéma propre à chacun.
Derrière ces chiffres, LlamaIndex dit avoir remanié son agent d’extraction avec un nouveau “harness”, c’est-à-dire une couche d’orchestration pensée pour piloter les modèles, gérer les erreurs et vérifier les sorties. L’entreprise explique s’être inspirée des agents de codage récents pour mieux traverser les défaillances de vision, de raisonnement et de vérification, tout en récupérant du contexte sur plusieurs pages quand un champ dépend de données éparpillées.
Quand la mise en page complique la vie de l’IA
La version 2.5 introduit aussi ce que LlamaIndex appelle Structural Reasoning, une capacité à adapter l’extraction selon le type de document, sa mise en page et sa densité d’information. En pratique, l’agent consacre plus d’effort aux dossiers complexes et traite les formats simples avec moins de latence. Pour les équipes produit, le message est clair : un formulaire scanné ne mérite pas toujours le même traitement qu’un dossier de 17 pages truffé de lignes à suivre.
Sur les tâches de longues listes, les scores annoncés montent de 82,0 à 92,6 pour Cost Effective, de 86,1 à 95,5 pour Agentic et de 94,5 à 96,3 pour Agentic Plus. LlamaIndex donne l’exemple d’un dépôt de fonds de 17 pages où l’ancien palier Cost Effective ne remontait que 87 positions sur 238, contre 238 sur 238 avec v2.5, faisant bondir le score de 52,8 à 98,7. Sur des enregistrements répartis sur plusieurs pages, les gains vont de 80,3 à 92,0 pour Cost Effective, de 85,5 à 96,5 pour Agentic et de 93,6 à 96,7 pour Agentic Plus.
La société dit aussi avoir travaillé la conformité aux schémas d’extraction, y compris pour des tâches allant jusqu’à 3 200 champs. Autrement dit, plus la structure demandée est lourde, plus le système doit éviter de mélanger les cases. Si votre identifiant de dossier est essentiel pour recoller les lignes à une base de données, LlamaIndex recommande de le préciser dans le prompt.
Des citations plus utiles pour relire moins
La mise à jour ajoute Advanced Citations pour les paliers Agentic et Agentic Plus. Cette fonction localise les zones de preuve, via des boîtes englobantes, pour des champs difficiles, y compris quand la valeur n’apparaît pas mot pour mot dans le document. LlamaIndex avait déjà proposé une première version sur Agentic Plus ; la société dit avoir renforcé la précision de l’ancrage et l’avoir étendue à Agentic.
Les scores d’ancrage ExtractBench montent ainsi de 46,8 à 80,6 pour Agentic et de 46,4 à 82,2 pour Agentic Plus. Le tableau comparatif publié par l’entreprise cite aussi 63,2 pour Sonnet 5.5, 77,6 pour GPT-6 SOL, 77,5 pour Opus 5.5, 50,8 pour Reducto Deep Extract, 21,8 pour Extend Max et 54,3 pour son propre palier Cost Effective. L’exercice n’est pas seulement académique : avec des citations de zone et des scores de confiance, les équipes peuvent décider ce qui part en automatique et ce qui doit passer par une relecture humaine.
Le tableur n’est plus obligé de finir en soupe
Extract v2.5 ajoute enfin un mode natif pour les feuilles de calcul. Dans ce mode, les agents travaillent directement sur les cellules du classeur plutôt que sur une représentation aplatie, ce qui limite les pertes d’information sur les tableaux imbriqués ou les onglets volumineux. L’option s’active dans la configuration d’extraction.
La version est disponible via LlamaCloud, l’outil en ligne de commande llp écrit en Go, un serveur MCP pour des clients agents comme Claude Code et Codex, ainsi que via le SDK Python llama-cloud. LlamaIndex conseille de la tester sur des documents proches des usages réels, avec les schémas déjà en place, pour mesurer le gain sur les cas qui nécessitaient jusque-là un nettoyage manuel ou résistaient à l’automatisation.
Points clés
- Extract v2.5 est sorti le 1er octobre 2026.
- 370 documents et 4 869 pages servent de base à ExtractBench.
- Agentic Plus gagne 1,3 point de F1 global.
- Advanced Citations arrive sur Agentic et Agentic Plus.
- Le mode tableur lit directement les cellules.
- LlamaIndex parle d’un déploiement sans hausse du prix par page.
En chiffres
- 87,1 à 93,9 — F1 global du palier Cost Effective sur ExtractBench.
- 89,8 à 95,8 — F1 global du palier Agentic sur ExtractBench.
- 95,1 à 96,4 — F1 global du palier Agentic Plus sur ExtractBench.
- 3 200 champs — taille maximale de tâche citée pour l’extraction par schéma.
- 17 pages — exemple de dossier de fonds mentionné par LlamaIndex.