Datalab выпустила OmniExtractBench для оценки извлечения данных из PDF
Datalab представила открытый бенчмарк OmniExtractBench для структурированного извлечения данных из документов: 620 PDF из четырёх наборов, единый детерминированный скорер с шестью типами вердиктов. Лидер — режим Datalab accurate с точностью 93,85%, Reducto deep_extract v2 близко (93,47%).
- 620 документов из наборов LlamaIndex, micro1, Extend и Datalab
- Скорер ставит каждому значению один из шести проверяемых вердиктов
- Datalab accurate — 93,85%, Reducto deep_extract v2 — 93,47%
- Код на GitHub под Apache 2.0, данные на Hugging Face под CC BY 4.0
Читать дальше
ИИ