ChartRevise: A Dataset and Evaluation Protocol for Exact Chart Editing via Code

📅 2026-09-29
📈 Citations: 0
✨ Influential: 0
📄 PDF
🤖 AI Summary
This study addresses the limitation of existing chart editing benchmarks in distinguishing valid edits, irrelevant modifications, and omitted updates. To this end, we construct a structured dataset of 92,000 samples grounded in graphical grammars and propose atomic requirement checking alongside coupled update detection mechanisms within a reference-free evaluation protocol, enabling precise code-level editing. Through source code verification and multi-library adaptation, combined with fine-grained metrics, our framework comprehensively assesses editing quality. Experimental results demonstrate that fine-tuned models achieve a 16% improvement in requirement recall and a 22% increase in precise editing rate, significantly enhancing both the precision and completeness of chart editing.
📝 Abstract
Chart editing requires cross-modal edit grounding, realizing a requested visual change in the code that draws it, with necessary related updates and without altering unrelated content. Existing benchmarks emphasize either code executability or chart quality, but their metrics do not clearly distinguish request completion from missed coupled updates and gratuitous changes. We introduce ChartRevise, a structured dataset and evaluation protocol for exact program-grounded chart editing. For dataset construction, we build on the grammar of graphics to systematically cover chart-editing operations, using source-program checks to verify their applicability across chart types and libraries. To improve edit exactness, our pipeline checks individual requirements and guides repair or exclusion when they are unmet. The resulting dataset contains 92,438 records covering 344 edit types across 20 chart types and three plotting libraries. For evaluation, our reference-free protocol separately measures atomic requirement completion, identifies gratuitous changes, and detects missed coupled updates. These checks are combined with successful execution and rendering to determine exact-edit success. Across five models and four external benchmarks, fine-tuning yields relative gains of 16\% in mean requirement recall and 22\% in mean exact-edit rate.
Problem

Research questions and friction points this paper is trying to address.

Chart Editing
Cross-modal Edit Grounding
Evaluation Protocol
Exact Editing
Innovation

Methods, ideas, or system contributions that make the work stand out.

Chart Editing
Cross-modal Grounding
Reference-free Evaluation
Grammar of Graphics
Dataset Construction