norgitov/ trends
Технологии · люди · идеи
К обзору/arXiv1 час назад

От пикселей к парам: Комплексная оценка извлечения пар ключ-значение на основе LLM в условиях шумных документов

В этой работе оцениваются открытые инструкции, настроенные большие языковые модели (LLM) для извлечения пар ключ-значение из документов в условиях чистого и шумного OCR. Тестируются модели, такие как Gemma, Mistral, Qwen2.5, LLaMA 3 и DeepSeek, на таких тестовых наборах, как FUNSD, CORD и SROIE, используя как золотой текст, так и выходы OCR от PaddleOCR, EasyOCR и Tesseract. Результаты показывают, что современные LLM хорошо работают с чистым текстом, но их производительность значительно падает при шумном OCR, где качество OCR становится основным фактором.

Открыть первоисточник
СИГНАЛ ИЗ ИСТОЧНИКА
17
сентябрь 2026 г.
Наблюдаем с17 сентября 2026 г.
Темп интересаНужны повторные замеры
ОбсуждениеИсточник не передаёт комментарии
Опубликовано17 сентября 2026 г.Zahra Anvari, Vassilis Athitsos
ЗА ЦИФРАМИ

Как меняется интерес

Здесь важнее сама публикация

Этот официальный источник не публикует счётчик популярности. Материал обновляется по его RSS.

Только реальные замеры. История до подключения источника не восстанавливается.

ЗАЧЕМ ОБРАТИТЬ ВНИМАНИЕ

Это исследование помогает понять, как LLM работают в реальных сценариях обработки документов с шумом OCR, подчеркивая важность повышения качества OCR и устойчивости моделей.

Полезная находка?
ПРОДОЛЖИ ИССЛЕДОВАНИЕ

Рядом по теме

Вся тема