Paper page - iVGR: Internalizing Visually Grounded Reasoning for MLLMs with Reinforcement Learning
…introduced to transfer visual localization capabilities into textual reasoning, improving fine-grained perception in multimodal language models without requiring explicit visual grounding during inference. Generated by Qwen/Qwen2.5-Coder-32B-Instruct…