В научных публикациях важную роль играют не только общие выводы, но и конкретные числовые показатели — температуры, КПД, выбросы и другие параметры. Однако такие данные часто спрятаны внутри текста, усложняя их сбор и анализ, особенно при большом объёме литературы.
Исследователи из Forschungszentrum Jülich разработали Quinex (Quantitative Information Extraction) — систему, которая автоматически извлекает количественные данные, связывает их с единицами измерения и контекстом, создавая структурированные наборы данных. Инструмент учитывает, что именно измерялось, когда, где и каким методом, превращая, например, фразу о прогнозируемой эффективности в 2025 году в подробную запись с параметрами и ссылками.
Quinex построен на открытых языковых моделях, что упрощает проверку и адаптацию системы, а также снижает требования к вычислительным ресурсам. В сравнении с аналогами, инструмент демонстрирует высокую точность: около 98 % F1 для чисел и единиц измерения, и более 80 % для классификации свойств.
Система успешно протестирована на тысячах научных аннотаций из разных областей — от энергетики до биомедицины. Quinex не заменяет исследователя, а помогает ему, выделяя числовую информацию и предоставляя ссылки на исходные фрагменты текста, минимизируя рутинную работу.
В дальнейшем команда планирует расширять функционал Quinex, добавляя специализированные наборы данных и модели для конкретных дисциплин, а также сделать проект доступным для исследователей по всему миру.