TeleOCR: открытая VLM на 1,2 млрд параметров для разбора документов
XingChen-AGI выпустила открытую vision-language модель TeleOCR на ~1,2 млрд параметров для разбора цифровых и снятых на камеру документов. Модель набрала 96,87 балла в OmniDocBench v1.6 и 88,53 в Wild_OmniDocBench, заняла первое место в ICDAR 2026 Sci-ImageMiner Challenge. Лицензия Apache-2.0.
- ~1,2 млрд параметров против 30–241 млрд у универсальных VLM
- 96,87 в OmniDocBench v1.6 и 88,53 в Wild_OmniDocBench
- Table TEDS 97,05 и Table TEDS-S 98,52
- Разбирает искажённые страницы DocUNet и DIR300 без выпрямления
Читать дальше
ИИ