Overview of FinMMEval 2026 Task 1: Multilingual Financial Multiple-Choice Question Answering

📅 2026-07-22
📈 Citations: 0
Influential: 0
📄 PDF
🤖 AI Summary
This study addresses the challenge of multilingual multiple-choice question answering in the financial domain by establishing the first unified evaluation benchmark across four languages—English, Chinese, Arabic, and Hindi—spanning distinct writing systems, with 200 questions per language. The work proposes a comprehensive technical framework integrating retrieval-augmented generation, option scoring, language-specific prompting, self-consistency filtering, confidence calibration, and large language model verification. An international competition was organized to evaluate systems on this benchmark. The top-performing system achieved accuracies of 97.5% in English and Arabic and 92.0% in Hindi, substantially advancing the state of the art in multilingual financial QA and revealing both shared challenges and viable strategies for cross-lingual expert reasoning.
📝 Abstract
FinMMEval 2026 Task 1 evaluates multilingual financial multiple-choice question answering in English, Chinese, Arabic, and Hindi. The task tests whether systems can select the correct answer to finance questions involving domain terminology, numerical interpretation, and conceptual financial reasoning across languages and scripts. The final-test set contains 800 questions, with 200 questions per language; gold answers were withheld during submission, and each language was ranked independently by accuracy. The final leaderboards contain 13 English, 11 Chinese, 11 Arabic, and 10 Hindi ranked submissions. Top accuracies range from 92.0% in Hindi to 97.5% in English and Arabic, with the same leading teams appearing near the top across all four languages. The documented systems used retrieval augmentation, direct answer-option scoring, language-specific prompting, selective self-consistency, confidence checks, and LLM-based review stages.
Problem

Research questions and friction points this paper is trying to address.

multilingual
financial question answering
multiple-choice
domain terminology
numerical interpretation
Innovation

Methods, ideas, or system contributions that make the work stand out.

multilingual financial QA
retrieval augmentation
language-specific prompting
self-consistency
LLM-based review
Zhuohan Xie
Zhuohan Xie
MBZUAI
Financial AIReasoningNatural Language ProcessingComputational LinguisticsDeep Learning
Y
Yuyang Dai
INSAIT, Sofia University "St. Kliment Ohridski", Sofia, Bulgaria
R
Rania Elbadry
Mohamed bin Zayed University of Artificial Intelligence, Abu Dhabi, United Arab Emirates
V
Vanshikaa Jani
University of Arizona, Tucson, United States
G
Georgi Georgiev
FMI, Sofia University "St. Kliment Ohridski", Sofia, Bulgaria
D
Dimitar Dimitrov
FMI, Sofia University "St. Kliment Ohridski", Sofia, Bulgaria
F
Fan Zhang
The University of Tokyo, Tokyo, Japan
Xueqing Peng
Xueqing Peng
Yale University
Lingfei Qian
Lingfei Qian
Yale University
Jimin Huang
Jimin Huang
The Fin AI
computational finance
Jiahui Geng
Jiahui Geng
Mohamed bin Zayed University of Artificial Intelligence
Artificial IntelligenceNatural Language Processing
Yankai Chen
Yankai Chen
Postdoctoral Associate, Cornell University
Information RetrievalKnowledge MiningLarge Language ModelsAgentic AI
Ye Yuan
Ye Yuan
McGill University, Mila - Quebec AI Institute
Generative ModelingBlack Box OptimizationKnowledge-Centric NLPLLMs
Haolun Wu
Haolun Wu
Researcher at Mila, McGill, Stanford | Prev. intern at Google, DeepMind, MSR
Knowledge RepresentationInformation RetrievalHuman-centric AI
Yuxia Wang
Yuxia Wang
MBZUAI
Natural Language Processing
I
Ivan Koychev
FMI, Sofia University "St. Kliment Ohridski", Sofia, Bulgaria
Veselin Stoyanov
Veselin Stoyanov
Tome AI
Natural Language ProcessingMachine LearningStructured PredictionInformation Extraction
M
Mingzi Song
Meiji Gakuin University, Tokyo, Japan
Y
Yu Chen
The University of Tokyo, Tokyo, Japan
X
Xue Liu
Mohamed bin Zayed University of Artificial Intelligence, Abu Dhabi, United Arab Emirates
Preslav Nakov
Preslav Nakov
Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)
Computational LinguisticsLarge Language ModelsFact-checkingFake News