arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10428 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10428 篇

2509.25987 2025-12-30 cs.SE cs.AI 79%

R-Log: Incentivizing Log Analysis Capability in LLMs via Reasoning-based Reinforcement Learning

R-Log: 通过基于推理的强化学习激励大语言模型的日志分析能力

Yilun Liu, Ziang Chen, Song Xu, Minggui He, Shimin Tao, Weibin Meng, Yuming Xie, Tao Han, Chunguang Zhao, Jingzhou Du, Daimeng Wei, Shenglin Zhang, Yongqian Sun

机构 * Nankai University(南开大学) Huawei(华为)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 R-Log通过基于推理的强化学习提升大语言模型的日志分析能力,有效减少幻觉并提升泛化性能。

Comments Accepted by ICSE 2026 (SEIP Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19855 2025-12-29 cs.LG cs.HC 79%

Inducing Causal World Models in LLMs for Zero-Shot Physical Reasoning

在LLM中诱导因果世界模型以实现零样本物理推理

Aditya Sharma, Ananya Gupta, Chengyu Wang, Chiamaka Adebayo, Jakub Kowalski

机构 * Department of Electrical Engineering(电气工程系) Indian Institute of Technology Bombay(印度理工学院孟买分校) Department of Computer Science and Automation(计算机科学与自动化系) Indian Institute of Science(印度科学研究所) Department of Computer Science(计算机科学系) San Francisco State University(旧金山州立大学) University of Lagos(拉各斯大学) Faculty of Mathematics, Informatics, and Mechanics(数学、信息学与力学学院) University of Warsaw(华沙大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出CWMI框架,通过引入因果物理模块和因果干预损失,使LLM具备因果推理能力,在零样本物理推理任务中取得显著成效。

Comments 12 pages, 4 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21482 2025-12-29 cs.AI 79%

LogicLens: Visual-Logical Co-Reasoning for Text-Centric Forgery Analysis

LogicLens:面向文本导向伪造分析的视觉-逻辑协同推理

Fanwei Zeng, Changtao Miao, Jing Huang, Zhiya Tan, Shutao Gong, Xiaoming Yu, Yang Wang, Huazhe Tan, Weibin Yao, Jianshu Li

机构 * Ant Group(蚂蚁集团) Nanyang Technological University(南洋理工大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 LogicLens通过视觉-逻辑协同推理框架,提升文本导向伪造分析的准确性和鲁棒性,其在多个基准测试中表现优异。

Comments 11 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12140 2025-12-25 cs.CL 79%

Exploring Efficiency Frontiers of Thinking Budget in Medical Reasoning: Scaling Laws between Computational Resources and Reasoning Quality

探索医疗推理中的思维预算效率前沿:计算资源与推理质量之间的缩放规律

Ziqian Bi, Lu Chen, Junhao Song, Hongying Luo, Enze Ge, Junmin Huang, Tianyang Wang, Keyu Chen, Chia Xin Liang, Zihan Wei, Huafeng Liu, Chunjie Tian, Jibin Guan, Joe Yeong, Yongzhi Xu, Peng Wang, Xinyuan Song, Junfeng Hao

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究通过评估医疗推理任务中的思维预算机制,揭示了计算资源与推理质量的缩放规律,并提出了不同效率阶段的优化策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17019 2025-12-25 cs.CV cs.AI cs.CY 79%

Let Androids Dream of Electric Sheep: A Human-Inspired Image Implication Understanding and Reasoning Framework

让安卓梦见电羊:一种受人类启发的图像隐喻理解和推理框架

Chenhao Zhang, Yazhe Niu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Huazhong University of Science and Technology(华中科技大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究提出LAD框架,通过三阶段方法解决图像隐喻理解问题,在多个基准测试中取得优异成绩,推动视觉语言推理和人机交互发展。

Comments 19 pages, 9 figures, 7 tables. Code & Dataset: https://github.com/MING-ZCH/Let-Androids-Dream-of-Electric-Sheep

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20403 2025-12-24 cs.LG 79%

BRIDGE: Budget-aware Reasoning via Intermediate Distillation with Guided Examples

BRIDGE:通过引导示例的中间蒸馏实现预算感知推理

Xuan-An Le, Minh-Nam Tran, Son Nguyen

机构 * Faculty of Information Technology, VNU University of Engineering and Technology(信息技术学院,越南工程技术大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 BRIDGE通过中间蒸馏和预算不对称性,在减少教师查询的同时提升小型模型性能,实现更高效的模型蒸馏

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20092 2025-12-24 cs.CL 79%

Memory-T1: Reinforcement Learning for Temporal Reasoning in Multi-session Agents

Memory-T1: 基于强化学习的多会话代理时间推理

Yiming Du, Baojun Wang, Yifan Xiang, Zhaowei Wang, Wenyu Huang, Boyang Xue, Bin Liang, Xingshan Zeng, Fei Mi, Haoli Bai, Lifeng Shang, Jeff Z. Pan, Yuxin Jiang, Kam-Fai Wong

机构 * The Chinese University of Hong Kong(香港中文大学) Huawei Technologies Co.,Ltd(华为技术有限公司) HKUST(香港科技大学) The University of Edinburgh(爱丁堡大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 Memory-T1通过强化学习提升多会话代理的时间推理能力,实现7B模型在Time-Dialog基准上的67.0%高分,优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19526 2025-12-23 cs.AI 79%

QuantiPhy: A Quantitative Benchmark Evaluating Physical Reasoning Abilities of Vision-Language Models

QuantiPhy:一种评估视觉-语言模型物理推理能力的定量基准

Li Puyin, Tiange Xiang, Ella Mao, Shirley Wei, Xinye Chen, Adnan Masood, Li Fei-fei, Ehsan Adeli

机构 * Stanford University(斯坦福大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 QuantiPhy通过定量评估视觉-语言模型的物理推理能力,揭示其在运动学属性推断中的数值准确性与定性合理性之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18906 2025-12-23 cs.CL 79%

Remedy-R: Generative Reasoning for Machine Translation Evaluation without Error Annotations

Remedy-R:无错误标注的机器翻译评估生成推理

Shaomu Tan, Ryosuke Mitani, Ritvik Choudhary, Qiyu Wu, Toshiyuki Sekiya, Christof Monz

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 Remedy-R是一种无需错误标注的生成式机器翻译评估方法,通过强化学习训练,提供可解释的评估和翻译改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17602 2025-12-23 cs.CL 79%

LexChain: Modeling Legal Reasoning Chains for Chinese Tort Case Analysis

LexChain:为中文侵权案件分析建模法律推理链

Huiyuan Xie, Chenyang Li, Huining Zhu, Chubin Zhang, Yuxiao Ye, Zhenghao Liu, Zhiyuan Liu

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出LexChain框架,用于显式建模中国侵权案件中的法律推理过程,通过构建评估基准和基线方法,提升了语言模型在民事侵权分析中的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15210 2025-12-23 cs.CL cs.IR 79%

Deliberation on Priors: Trustworthy Reasoning of Large Language Models on Knowledge Graphs

对先验的探讨:大型语言模型在知识图谱上的可信推理

Jie Ma, Ning Qu, Zhitao Gao, Rui Xing, Jun Liu, Hongbin Pei, Jiang Xie, Linyun Song, Pinghui Wang, Jing Tao, Zhou Su

机构 * MOE KLINNS Lab, Xi’an Jiaotong University(MOE KLINNS实验室,西安交通大学) School of Computer Science and Technology, Xi’an Jiaotong University(计算机科学与技术学院,西安交通大学) Shaanxi Province Key Laboratory of Big Data Knowledge Engineering(陕西省大数据知识工程重点实验室) School of Artificial Intelligence, Chongqing University of Post and Telecommunications(人工智能学院,重庆邮电大学) School of Computer Science, Northwestern Polytechnical University(计算机学院,西北工业大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究提出DP框架,通过整合知识图谱的结构和约束先验,提升大型语言模型在知识图谱上的推理准确性和响应可靠性。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17532 2025-12-22 cs.CV cs.AI 79%

Robust-R1: Degradation-Aware Reasoning for Robust Visual Understanding

Robust-R1: 为鲁棒视觉理解的退化感知推理

Jiaqi Tang, Jianmin Chen, Wei Wei, Xiaogang Xu, Runtao Liu, Xiangyu Wu, Qipeng Xie, Jiafei Wu, Lei Zhang, Qifeng Chen

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 Robust-R1通过结构化推理链显式建模视觉退化,提升多模态大语言模型在现实世界退化下的鲁棒性与抗干扰能力。

Comments Accepted by AAAI2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17255 2025-12-22 q-bio.NC cs.AI 79%

From Priors to Predictions: Explaining and Visualizing Human Reasoning in a Graph Neural Network Framework

从先验到预测:在图神经网络框架中解释和可视化人类推理

Quan Do, Caroline Ahn, Leah Bakst, Michael Pascale, Joseph T. McGuire, Chantal E. Stern, Michael E. Hasselmo

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出基于图神经网络的框架,通过显式先验建模人类推理中的归纳偏置,揭示个体差异及泛化依赖的结构和内部处理机制。

Comments 44 pages, 7 figures, 3 suppl figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16287 2025-12-19 cs.CL 79%

Evaluating OpenAI GPT Models for Translation of Endangered Uralic Languages: A Comparison of Reasoning and Non-Reasoning Architectures

评估OpenAI GPT模型用于濒危乌拉尔语系语言的翻译:推理与非推理架构的比较

Yehor Tereshchenko, Mika Hämäläinen, Svitlana Myroniuk

机构 * Metropolia University of Applied Sciences(应用科学大学) University of Helsinki(赫尔辛基大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究比较了OpenAI GPT模型在翻译濒危乌拉尔语系语言中的推理与非推理架构性能,发现推理模型在翻译任务中表现更优。

Comments IWCLUL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22737 2025-12-19 cs.CV cs.AI 79%

CompareBench: A Benchmark for Visual Comparison Reasoning in Vision-Language Models

CompareBench: 一个用于评估视觉比较推理能力的视觉-语言模型基准

Jie Cai, Kangning Yang, Lan Fu, Jiaming Ding, Jinlong Li, Huiming Sun, Daitao Xing, Jinglin Shen, Zibo Meng

机构 * OPPO AI Center(OPPO人工智能中心)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 CompareBench是一个用于评估视觉-语言模型中视觉比较推理能力的基准,揭示了当前模型在时间排序、空间关系和基本计数上的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15442 2025-12-18 cs.LG 79%

Copyright Infringement Risk Reduction via Chain-of-Thought and Task Instruction Prompting

通过链式推理和任务指令提示降低版权侵权风险

Neeraj Sarna, Yuanyuan Li, Michael von Gablenz

机构 * Munich RE(慕尼黑RE)

专题命中 推理评测 :chain-of-thought(title,abstract);分类 cs.LG

AI总结 本文通过链式推理和任务指令提示结合负提示和提示重写,降低生成图像的版权侵权风险,并评估不同模型复杂度下的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20935 2025-12-17 cs.AI 79%

GALAX: Graph-Augmented Language Model for Explainable Reinforcement-Guided Subgraph Reasoning in Precision Medicine

GALAX:图增强语言模型用于可解释的强化引导子图推理在精准医学中

Heming Zhang, Di Huang, Wenyu Li, Michael Province, Yixin Chen, Philip Payne, Fuhai Li

机构 * I2DB, Washington University School of Medicine(I2DB,华盛顿大学医学学院) Department of Computer Science and Engineering, Washington University in St. Louis(计算机科学与工程系,华盛顿大学圣路易斯分校) Department of Genetics, Washington University School of Medicine(遗传学系,华盛顿大学医学学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 GALAX通过整合图神经网络与大语言模型,利用强化学习实现子图推理,提升精准医学中目标发现的可解释性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15351 2025-12-15 cs.AI cs.CV 79%

Octopus: Agentic Multimodal Reasoning with Six-Capability Orchestration

Octopus: 六种能力协同的代理多模态推理

Yifu Guo, Zishan Xu, Zhiyuan Yao, Yuquan Lu, Jiaye Lin, Sen Hu, Zhenheng Tang, Huacan Wang, Ronghao Chen

机构 * Sun Yat-sen University(中山大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Tsinghua University(清华大学) Peking University(北京大学) The Hong Kong University of Science and Technology(香港科技大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 Octopus通过六种能力协同实现多模态代理推理,有效提升复杂任务中的自主探索与动态能力选择能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18271 2025-12-12 cs.CV cs.AI 79%

Beyond Words and Pixels: A Benchmark for Implicit World Knowledge Reasoning in Generative Models

超越文字和像素:生成模型中隐式世界知识推理的基准测试

Tianyang Han, Junhao Su, Junjie Hu, Peizhen Yang, Hengyu Shi, Junfeng Luo, Jialin Gao

机构 * MeiGen AI Team, Meituan(美团梅基因AI团队) Fudan University(复旦大学) D^{4} Lab(D⁴实验室) HHMI Janelia Research Campus(HHMI贾能实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出PicWorld基准测试,用于评估生成模型在隐式世界知识和物理因果推理方面的能力,揭示了现有T2I模型在这些方面的局限性,并提出了证据基础的多代理评估器进行细粒度评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16205 2025-12-10 cs.AI 79%

ChemLabs on ChemO: A Multi-Agent System for Multimodal Reasoning on IChO 2025

ChemLabs on ChemO:一个用于IChO 2025多模态推理的多智能体系统

Qiang Xu, Shengyuan Bai, Leqing Chen, Zijing Liu, Yu Li

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 ChemLabs通过多智能体系统和SVE技术在ChemO基准测试中实现93.6分,推动化学问题自动解决的新进展。

Comments 13 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12200 2025-12-10 cs.AI cs.AR 79%

PRO-V-R1: Reasoning Enhanced Programming Agent for RTL Verification

PRO-V-R1:基于推理增强的RTL验证编程代理

Yujie Zhao, Zhijing Wu, Boqin Yuan, Zhongming Yu, Hejia Zhang, Wentao Ni, Chia-Tung Ho, Haoxing Ren, Jishen Zhao

机构 * University of California San Diego(加州大学圣地亚哥分校) NVIDIA(NVIDIA公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 PRO-V-R1是一种基于推理增强的开源框架,通过结合LLM推理与编程工具,提升RTL验证的功能正确性和故障检测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07136 2025-12-09 cs.CV cs.AI 79%

A Large-Scale Multimodal Dataset and Benchmarks for Human Activity Scene Understanding and Reasoning

大规模多模态数据集与基准用于人类活动场景理解和推理

Siyang Jiang, Mu Yuan, Xiang Ji, Bufang Yang, Zeyu Liu, Lilin Xu, Yang Li, Yuting He, Liran Dong, Wenrui Lu, Zhenyu Yan, Xiaofan Jiang, Wei Gao, Hongkai Chen, Guoliang Xing

机构 * The Chinese University of Hong Kong, Hong Kong(香港中文大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Columbia University(哥伦比亚大学) University of Pittsburgh(匹兹堡大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 CUHK-X是一个大规模多模态数据集和基准,用于人类活动场景理解和推理,通过生成逻辑一致的活动序列提升描述一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05954 2025-12-08 cs.AI 79%

SymPyBench: A Dynamic Benchmark for Scientific Reasoning with Executable Python Code

SymPyBench: 一个用于可执行Python代码科学推理的动态基准

Shima Imani, Seungwhan Moon, Adel Ahmadyan, Lu Zhang, Kirmani Ahmed, Babak Damavandi

机构 * Meta Reality Lab(Meta现实实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 SymPyBench是一个用于科学推理的动态基准,通过可执行Python代码测试不同推理技能,提供新的评估指标以量化推理的不确定性和变化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05930 2025-12-08 cs.AI 79%

PRiSM: An Agentic Multimodal Benchmark for Scientific Reasoning via Python-Grounded Evaluation

PRiSM:一种基于Python基础评估的科学推理多模态基准

Shima Imani, Seungwhan Moon, Adel Ahmadyan, Lu Zhang, Kirmani Ahmed, Babak Damavandi

机构 * Meta Reality Lab(Meta现实实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 PRiSM通过基于Python代码的动态多模态基准,评估科学推理能力,揭示VLMs在科学领域中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05371 2025-12-08 cs.AI cs.AR 79%

ChipMind: Retrieval-Augmented Reasoning for Long-Context Circuit Design Specifications

ChipMind:基于检索的长上下文电路设计规范推理

Changwen Xing, SamZaak Wong, Xinlai Wan, Yanfeng Lu, Mengli Zhang, Zebin Ma, Lei Qi, Zhengxiong Li, Nan Guan, Zhe Jiang, Xi Wang, Jun Yang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 ChipMind通过构建领域知识图谱并结合信息论检索与意图过滤,实现对长上下文电路规范的高效推理,提升LLM在硬件设计中的应用效果。

Comments Accepted by the AAAl26 Conference Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15718 2025-12-08 cs.AI 79%

ToolMind Technical Report: A Large-Scale, Reasoning-Enhanced Tool-Use Dataset

ToolMind技术报告:一个大规模、推理增强的工具使用数据集

Chen Yang, Ran Le, Yun Xing, Zhenwei An, Zongchao Chen, Wayne Xin Zhao, Yang Song, Tao Zhang

机构 * Nanbeige Lab, BOSS Zhipin(纳米白实验室,BOSS智聘) Gaoling School of Artificial Intelligence, Renmin University of China(甘露人工智能学院,中国人民大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 ToolMind是一个大规模、高质量的工具使用数据集,通过合成和增强数据提升LLM代理的推理能力和工具使用性能。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04254 2025-12-05 cs.CR cs.AI 79%

Hey GPT-OSS, Looks Like You Got It -- Now Walk Me Through It! An Assessment of the Reasoning Language Models Chain of Thought Mechanism for Digital Forensics

嘿,GPT-OSS,看来你已经掌握了——现在让我带你走一遍!对数字取证中推理语言模型链式思维机制的评估

Gaëtan Michelet, Janine Schneider, Aruna Withanage, Frank Breitinger

机构 * Chair for Cybersecurity, University of Augsburg, Augsburg, Germany(网络安全系,乌尔姆大学,乌尔姆,德国)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文评估了推理语言模型在数字取证中的应用,发现中等推理水平有助于解释模型输出,但更高推理水平未显著提升响应质量。

Comments Accept at DFRWS EU 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03838 2025-12-04 cs.CL 79%

Training and Evaluation of Guideline-Based Medical Reasoning in LLMs

在LLM中训练和评估基于指南的医学推理

Michael Staniek, Artem Sokolov, Stefan Riezler

机构 * Computational Linguistics &(计算语言学) IWR, Heidelberg University(海德堡大学IWR部门) Google DeepMind, Berlin, Germany(谷歌DeepMind,柏林,德国)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文通过训练LLM遵循医学共识指南,提升其推理和预测的正确性与价值正确性,改进未来临床变量的预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08933 2025-12-04 cs.CL 79%

Reveal-Bangla: A Dataset for Cross-Lingual Multi-Step Reasoning Evaluation

Reveal-Bangla:用于跨语言多步推理评估的数据集

Khondoker Ittehadul Islam, Gabriele Sarti

机构 * Center for Language and Cognition (CLCG)(语言与认知中心)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出一个孟加拉语多步推理数据集,评估了多语言模型在不同语言下的推理能力,发现推理上下文对非二元问题有帮助,但模型在利用相关推理步骤方面表现不佳。

Comments Accepted at BLP workshop @ IJCNLP-AACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19094 2025-12-04 cs.CV cs.AI 79%

SATORI-R1: Incentivizing Multimodal Reasoning through Explicit Visual Anchoring

SATORI-R1: 通过显式视觉锚定激励多模态推理

Chuming Shen, Wei Wei, Xiaoye Qu, Yu Cheng

机构 * Huazhong University of Science and Technology(华中科技大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 SATORI-R1通过显式视觉锚定提升多模态推理,采用三个可验证阶段和VQA-Verify数据集,在VQA任务中实现15.7%的准确率提升。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏