Reasoning-Visual Critical Token Fine-Tuning for Multimodal Reasoning
Published in Manuscript, 2026
RVCFT applies direct supervision selectively to response tokens that are both reasoning-relevant and sensitive to visual evidence. Manuscript available online.
