Quinex: новый инструмент для автоматического извлечения числовых данных из научных статей

В научных публикациях цифры играют ключевую роль, позволяя сравнивать технологии и уточнять модели, однако они часто скрыты внутри текста вместе с дополнительными пояснениями и единицами измерения. Ручной сбор таких данных из множества статей становится невозможным.

Для решения этой задачи исследователи из Юлиха предложили Quinex (Quantitative Information Extraction) – фреймворк, который автоматически выявляет количественные показатели, определяет их смысл и связывает с единицами измерения, а также восстанавливает контекст: что, где, когда и как было измерено. Например, фраза о предполагаемой эффективности в 63–71% в 2025 году преобразуется в структурированную запись с параметрами, диапазоном, датой и ссылкой на источник.

Quinex построен на открытых языковых моделях, что обеспечивает прозрачность, удобство доработки и минимальные требования к вычислительным ресурсам. Точность системы достигает около 98% по F1 для числовых значений и единиц измерения, а также высоких показателей для классификации параметров.

Система протестирована на тысячах аннотаций из различных областей — энергетики, медицины, материаловедения и др., показывая универсальность и широкие возможности применения.

Разработчики подчеркивают, что Quinex — вспомогательный инструмент, который облегчает рутинную работу, позволяя исследователям самостоятельно оценивать и интерпретировать данные, поскольку ошибки могут возникать при анализе контекста.

В будущем команда планирует расширять функционал и открыто распространять проект для привлечения международного сообщества к доработке и адаптации под разные дисциплины.