LightOnOCR 3 привязывает распознанный текст к координатам на странице
LightOn выпустила OCR-модель LightOnOCR 3 под лицензией Apache 2.0 в размерах 0.8B, 1B и 4B. Режим grounding возвращает для каждого блока bounding box, что позволяет привязать значение графика или ячейку таблицы к точному месту на отсканированной странице. Grounding даёт примерно на 25% больше токенов, а жёстко зафиксированная версия vLLM ломает модель 1B при самостоятельном обновлении Transformers.
- Три размера: 0.8B, 1B и 4B, рекомендуется 4B
- Grounding добавляет ~25% токенов к обычной транскрипции
- Оценка 75,1 в ParseBench — собственная метрика LightOn
- Обновление Transformers вручную ломает модель 1B
Читать дальше
ИИ