arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-04 至 2026-05-04 共收录 69 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 6 篇

2506.11991 2026-05-04 cs.CV cs.AI cs.CL 86%

VGR: Visual Grounded Reasoning

VGR:视觉基础推理

Jiacong Wang, Zijian Kang, Haochen Wang, Haiyong Jiang, Jiawen Li, Bohong Wu, Ya Wang, Jiao Ran, Xiao Liang, Chao Feng, Jun Xiao

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ByteDance Inc.(字节跳动公司)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出VGR,一种增强视觉感知的多模态大语言模型,通过图像区域检测与回放提升多模态推理能力,在多个基准测试中表现优异。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00677 2026-05-04 cs.LG 83%

Evaluating the Architectural Reasoning Capabilities of LLM Provers via the Obfuscated Natural Number Game

通过混淆的自然数游戏评估大语言模型证明者的架构推理能力

Lixing Li

机构 * Lixing Li(李立星)

专题命中 数学推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.LG

AI总结 本文通过混淆的自然数游戏评估大语言模型的架构推理能力,发现推理模型在无语义线索下仍保持准确率,为数学推理能力提供了量化评估标准。

Comments 4 pages. Accepted as a short paper to the AAAI 2026 Spring Symposium on Machine Learning and Knowledge Engineering for Knowledge-Grounded Semantic Agents (MAKE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00610 2026-05-04 cs.LG 57%

Decouple before Integration: Test-time Synthesis of SFT and RLVR Task Vectors

在整合前解耦:测试时合成SFT和RLVR任务向量

Chaohao Yuan, Chenghao Xiao, Yu Rong, Hong Cheng, Long-Kai Huang

机构 * Department of Systems Engineering and Engineering Management, Chinese University of Hong Kong, Hong Kong, China(系统工程与工程管理系,香港中文大学,香港,中国) Department of Computer Science, Hong Kong Baptist University, Hong Kong, China(计算机科学系,香港 Baptist 大学,香港,中国) DAMO Academy, Alibaba Group, Hangzhou, China(达摩院,阿里巴巴集团,杭州,中国) Hupan Lab, Hangzhou, China(虎派实验室,杭州,中国)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出DoTS框架,通过测试时任务向量运算解耦SFT和RLVR,减少干扰并提升性能,实验表明其在多个数学推理基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00224 2026-05-04 cs.AI 57%

TUR-DPO: Topology- and Uncertainty-Aware Direct Preference Optimization

TUR-DPO:基于拓扑和不确定性的直接偏好优化

Abdulhady Abas Abdullah, Fatemeh Daneshfar, Seyedali Mirjalili, Mourad Oussalah

机构 * Artificial Intelligence and Innovation Centre, University of Kurdistan, Erbil, Iraq(人工智能与创新中心,乌尔米耶大学,伊拉克) Department of Computer Engineering, University of Kurdistan, Iran(计算机工程系,乌尔米耶大学,伊朗) Centre for Artificial Intelligence Research and Optimisation, Torrens University Australia, Brisbane, Australia(人工智能研究与优化中心,塔伦斯大学澳大利亚,布里斯班,澳大利亚) Research and Innovation Center, Obuda University, Budapest 1034, Hungary(研究与创新中心,奥布达大学,布达佩斯1034,匈牙利) Center for Machine Vision and Signal Analysis (CMVS), University of Oulu, Finland(机器视觉与信号分析中心(CMVS),奥卢大学,芬兰)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 TUR-DPO通过引入轻量级推理拓扑和结合语义忠实度、效用和拓扑质量,提升偏好对齐的稳定性与鲁棒性,同时保持训练简洁性和无需在线回滚。

Comments Proceedings of the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17450 2026-05-04 cs.AI 57%

Compiling Deterministic Structure into SLM Harnesses

将确定性结构编译进SLM以获取优势

Zan Kai Chong, Hiroyuki Ohsaki, Bryan Ng

机构 * School of Science and Technology(科学与技术学系) Kwansei Gakuin University(冈山学院大学) School of Engineering & Computer Science(工程与计算机科学学系) Victoria University of Wellington(惠灵顿维多利亚大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出SGDe框架,通过编译代理工作流为离散执行计划,提升SLM在推理和数据主权方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15830 2026-05-04 cs.LG 57%

Placing Puzzle Pieces Where They Matter: A Question Augmentation Framework for Reinforcement Learning

将拼图碎片放在关键位置:一种用于强化学习的问题增强框架

Yangyi Fang, Jiaye Lin, Xiaoliang Fu, Cong Qin, Haolin Shi

机构 * Tsinghua University(清华大学) Fudan University(复旦大学) Peking University(北京大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出PieceHint框架,通过战略性提供关键推理步骤,解决强化学习中训练易问题过拟合和训练难问题奖励稀疏的问题,实验表明其在数学推理基准上性能优异且保持pass@k多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 2 篇

2605.00270 2026-05-04 cs.CL cs.AI cs.CY cs.HC 81%

Are You the A-hole? A Fair, Multi-Perspective Ethical Reasoning Framework

你真的是混蛋吗?一种公平、多视角的伦理推理框架

Sheza Munir, Ahanaf Rodoshi, Sumin Lee, Feiran Chang, Xujie Si, Syed Ishtiaque Ahmed

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种结合神经语义提取与形式求解器的多视角伦理推理框架,通过MaxSAT解决高冲突领域中的逻辑一致性问题,实验显示其在Reddit论坛中生成的裁决在62%的情况下偏离流行标签,且与人类评估者一致率高达86%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19175 2026-05-04 cs.NI cs.AI cs.MA 57%

LLM-Based Agentic Negotiation for 6G: Addressing Uncertainty Neglect and Tail-Event Risk

基于大语言模型的6G智能协商:解决不确定性忽视和尾事件风险

Hatim Chergui, Farhad Rezazadeh, Mehdi Bennis, Merouane Debbah, Christos Verikoukis

机构 * i2CAT Foundation(i2CAT基金会) Technical University of Catalonia(技术大学巴塞罗那) University of Oulu(奥卢大学) Research Institute for Digital Future(数字未来研究院) Khalifa University(卡利法大学) ISI/ATH and University of Patras(ISI/ATH和帕特拉斯大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一个无偏、风险意识的智能协商框架,通过数字孪生和极值理论中的条件风险价值(CVaR)预测尾部风险,提升6G网络切片的资源分配鲁棒性,验证了无偏方法在消除SLA违规和降低延迟方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 6 篇

2509.23330 2026-05-04 cs.CL 83%

Structured In-context Environment Scaling for Large Language Model Reasoning

结构化上下文环境扩展用于大语言模型推理

Peng Yu, Zeyuan Zhao, Shao Zhang, Luoyi Fu, Xinbing Wang, Ying Wen

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL

AI总结 本文提出SIE框架,通过自动构建结构化数据环境提升大语言模型的推理能力,实现可扩展性、通用性和可验证性,实验显示其在结构化推理和跨领域逻辑推理中的有效性。

Comments Title modified for greater clarity and better alignment with the paper's focus

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26173 2026-05-04 cs.LG cs.AI cs.CL 80%

Entropy Centroids as Intrinsic Rewards for Test-Time Scaling

熵中心作为测试时缩放的内在奖励

Wenshuo Zhao, Qi Zhu, Xingshan Zeng, Fei Mi, Lifeng Shang, Yi R., Fung

机构 * HKUST(香港科技大学) ZJU(浙江大学) Huawei(华为)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出熵中心作为测试时缩放的内在奖励,通过分析不确定性的时间结构提升模型响应质量,在不同规模模型上均优于现有基线。

Comments Under Review, 39 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00436 2026-05-04 cs.CL cs.AI 73%

Impact of Task Phrasing on Presumptions in Large Language Models

任务表述对大语言模型中假设的影响

Kenneth J. K. Ong

机构 * AI.DA STC ST Engineering(AI.DA STC ST工程)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了任务表述如何导致大语言模型产生假设,影响其适应能力,通过囚徒困境实验发现中性表述可减少假设影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00798 2026-05-04 cs.LG cs.CL cs.MA 62%

RunAgent: Interpreting Natural-Language Plans with Constraint-Guided Execution

RunAgent:通过约束引导执行解释自然语言计划

Arunabh Srivastava, Mohammad A., Khojastepour, Srimat Chakradhar, Sennur Ulukus

机构 * University of Maryland, College Park(马里兰大学学院公园分校) NEC Laboratories America, Inc.(NEC美国实验室)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 RunAgent通过约束引导执行解释自然语言计划,结合代理语言的显式控制构造,提升结构化工作流执行的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00334 2026-05-04 cs.AI cs.CL 62%

AgentFloor: How Far Up the tool use Ladder Can Small Open-Weight Models Go?

AgentFloor: 小型开放权重模型在工具使用阶梯上能走多远?

Ranit Karmakar, Jayita Chatterjee

机构 * Harvard University(哈佛大学) Boston, MA 02115(波士顿,马萨诸塞州 02115)

专题命中 逻辑推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 AgentFloor基准测试评估了16种开放权重模型在代理工作流中的能力边界,发现小型模型已能处理大部分结构化工具使用任务,而长周期规划仍需前沿模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00034 2026-05-04 cs.CR cs.PL cs.SE 50%

Symbolic Execution Meets Multi-LLM Orchestration: Detecting Memory Vulnerabilities in Incomplete Rust CVE Snippets

符号执行与多LLM协调:在不完整的Rust CVE代码片段中检测内存漏洞

Zeyad Abdelrazek, Young Lee

专题命中 逻辑推理 :planning(abstract)

AI总结 本文提出结合符号执行(KLEE)与四代理多LLM架构,解决不完整代码问题,通过协作合成可编译的KLEE测试用例,检测Rust不安全代码中的内存漏洞,实现90.3%的测试用例编译成功率,检测到1,206个关键错误。

Comments 11 pages, 1 figure, to be published in : Ease 2026 The 6th International Workshop on Software Security Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 15 篇

2605.00438 2026-05-04 cs.AI cs.RO 85%

Thinking in Text and Images: Interleaved Vision--Language Reasoning Traces for Long-Horizon Robot Manipulation

文本与图像思考:用于长周期机器人操作的交错视觉-语言推理轨迹

Jinkun Liu, Haohan Chi, Lingfeng Zhang, Yifan Xie, YuAn Wang, Long Chen, Hangjun Ye, Xiaoshuai Hao, Wenbo Ding

机构 * Tsinghua University(清华大学) Beijing Institute of Technology(北京理工大学) Xiaomi Group(小米集团)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出IVLR框架,通过显式轨迹表示交替文本子目标与视觉关键帧,提升长周期机器人操作的逻辑与几何一致性,实验显示在LIBERO和SimplerEnv-WidowX上取得高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25120 2026-05-04 cs.CL 85%

SCOPE:Planning for Hybrid Querying over Clinical Trial Data

SCOPE:面向临床试验数据的混合查询规划

Suparno Roy Chowdhury, Manan Roy Choudhury, Tejas Anvekar, Muhammad Ali Khan, Kaneez Zahra Rubab Khakwani, Mohamad Bassam Sonbol, Irbaz Bin Riaz, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学) Mayo Clinic(梅奥诊所)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出SCOPE框架,通过多LLM规划分解任务,提升临床试验数据的推理准确性与效率,解决隐含属性提取问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00276 2026-05-04 cs.AI 83%

Agentic AI for Trip Planning Optimization Application

基于代理的AI用于旅行计划优化应用

Tiejin Chen, Ahmadreza Moradipari, Kyungtae Han, Hua Wei, Nejib Ammar

机构 * Toyota Motor North America R&D, InfoTech Labs(丰田美国北美研发部门信息科技实验室) Arizona State University(亚利桑那州立大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 本文提出基于代理的AI框架,通过协调代理优化旅行计划,提供精确解决方案,实验显示其在TOP基准测试中准确率高达77.4%。

Comments Accepted to IV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26020 2026-05-04 cs.CL cs.AI cs.LG 82%

PORTool: Importance-Aware Policy Optimization with Rewarded Tree for Multi-Tool-Integrated Reasoning

PORTool:基于奖励树的重要性感知策略优化用于多工具集成推理

Feijie Wu, Weiwu Zhu, Yuxiang Zhang, Soumya Chatterjee, Jiarong Zhu, Fan Mo, Rong Luo, Jing Gao

机构 * Apple(苹果公司) Purdue University(普渡大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 PORTool通过奖励树实现多工具集成推理中的重要性感知策略优化,提升最终答案准确性并减少工具调用步骤。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24276 2026-05-04 cs.AI 79%

G-reasoner: Foundation Models for Unified Reasoning over Graph-structured Knowledge

G-reasoner:用于统一图结构知识推理的基础模型

Linhao Luo, Zicheng Zhao, Junnan Liu, Zhangchi Qiu, Junnan Dong, Serge Panev, Chen Gong, Thuy-Trang Vu, Gholamreza Haffari, Dinh Phung, Alan Wee-Chung Liew, Shirui Pan

机构 * Monash University(莫纳什大学) Nanjing University of Science and Technology(南京理工大学) Griffith University(格里菲斯大学) Shanghai Jiao Tong University(上海交通大学) Tencent Youtu Lab(腾讯优图实验室) NVIDIA(英伟达)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 G-reasoner通过整合图与语言基础模型,实现对多样化图结构知识的高效推理,采用标准化四层抽象QuadGraph统一异构知识源,并通过混合精度训练和分布式消息传递提升效率与泛化能力。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11349 2026-05-04 cs.CV 75%

Image Score: Learning and Evaluating Human Preferences for Mercari Search

图像评分:学习和评估Mercari搜索中的人类偏好

Chingis Oinar, Miao Cao, Shanshan Fu

机构 * Mercari

专题命中 规划推理 :CoT(abstract,abstract_cn);chain-of-thought(abstract)

AI总结 本文提出一种高效利用大型语言模型进行图像质量评估的方法,通过链式推理生成与人类行为一致的标签,提升电商场景下的图像评估可解释性并提高销售转化率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00557 2026-05-04 cs.CL cs.AI 73%

Structure Liberates: How Constrained Sensemaking Produces More Novel Research Output

结构解放:如何受约束的意象生成产生更多创新性研究输出

James Mooney, Zae Myung Kim, Young-Jun Lee, Dongyeop Kang

机构 * University of Minnesota(明尼苏达大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SCISENSE框架,通过结构化认知阶段提升研究输出的创新性,展示目标导向的意象生成在轨迹质量与下游任务表现上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06361 2026-05-04 cs.LG cs.AI 73%

Beyond Prompt-Induced Lies: Investigating LLM Deception on Benign Prompts

超越提示诱导的谎言:调查LLM在良性提示上的自我欺骗

Zhaomin Wu, Mingzhe Du, See-Kiong Ng, Bingsheng He

机构 * Institute of Data Science National University of Singapore(数据科学研究所,新加坡国立大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究LLM在良性提示下的自我欺骗行为,提出基于Contact Searching Questions的框架,通过两个统计指标量化欺骗可能性,发现任务难度增加时欺骗倾向上升,模型容量增加并不总能减少欺骗。

Comments ICLR 2026 (Oral)

Journal ref International Conference on Learning Representations (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00347 2026-05-04 cs.LG cs.AI cs.CL 67%

Odysseus: Scaling VLMs to 100+ Turn Decision-Making in Games via Reinforcement Learning

Odysseus:通过强化学习扩展VLMs以实现游戏中的100+回合决策

Chengshuai Shi, Wenzhe Li, Xinran Liang, Yizhou Lu, Wenjia Yang, Ruirong Feng, Seth Karten, Ziran Yang, Zihan Ding, Gabriel Sarch, Danqi Chen, Karthik Narasimhan, Chi Jin

机构 * Princeton Language and Intelligence(普林斯顿语言与智能实验室) Princeton University(普林斯顿大学) Fudan University(复旦大学) Tsinghua University(清华大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了通过强化学习训练VLMs进行长回合决策,提出轻量级回合级批评机改进训练稳定性,利用预训练VLMs提升样本效率,引入Odysseus框架在多个游戏层级取得显著进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00226 2026-05-04 cs.CL cs.AI cs.GT 62%

Why Do LLMs Struggle in Strategic Play? Broken Links Between Observations, Beliefs, and Actions

为什么LLMs在战略博弈中表现不佳?观察、信念和行动之间的断裂链接

Jan Sobotka, Mustafa O. Karabag, Ufuk Topcu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) EPFL(苏黎世联邦理工学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了LLMs在不完全信息博弈中决策失败的原因,揭示了观察-信念和信念-行动之间的两大内在缺陷,通过实验验证了LLMs在多步推理中的信念不稳定性及行动转换的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00297 2026-05-04 cs.CR cs.LG 57%

Trident: Improving Malware Detection with LLMs and Behavioral Features

Trident:利用LLMs和行为特征提升恶意软件检测

Rebecca Saul, Jingzhi Jiang, Elliott Chia, David Wagner

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出Trident系统,结合静态特征、行为规则和LLM分析,提升恶意软件检测性能,优于传统方法并具备更强的抗概念漂移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22271 2026-05-04 cs.LG 57%

How LLMs Detect and Correct Their Own Errors: The Role of Internal Confidence Signals

大语言模型如何检测并纠正自身错误:内部置信信号的作用

Dharshan Kumaran, Viorica Patraucean, Simon Osindero, Petar Veličković, Nathaniel Daw

机构 * Google DeepMind(谷歌DeepMind) Princeton University(普林斯顿大学)

专题命中 规划推理 :self-correction(abstract);分类 cs.LG

AI总结 研究通过第二阶置信模型探讨大语言模型如何通过内部置信信号检测并纠正自身错误,发现PANL信号在误差检测和自我修正中起关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00741 2026-05-04 cs.CR 50%

Self-Adaptive Multi-Agent LLM-Based Security Pattern Selection for IoT Systems

自适应多智能体LLM基于的安全模式选择用于物联网系统

Saeid Jamshidi, Foutse Khomh, Carol Fung, Kawser Wazed Nafi

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出ASPO方法,结合LLM推理与确定性执行,在MAPE-K控制循环中实现自适应安全模式选择,通过减少极端情况执行成本,提升资源效率和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24333 2026-05-04 physics.ao-ph 50%

Amplified Urban Climate Extremes from Global Warming-Urbanization Synergy: A Physics-Informed Intelligence Paradigm

全球变暖与城市化协同效应放大城市气候极端事件:一种融合物理原理的智能范式

Qiuxia Wu, Yaqiang Wang, Huabing Ke

专题命中 规划推理 :planning(abstract)

AI总结 本文提出融合物理原理的数据智能范式,通过构建城市气候-形态-发展类型学、物理引导机器学习和高通量风险预测,解决城市气候预测中的方法论与认知鸿沟问题。

Comments 16 pages of main text, 1 multi-panel figure (with 2 subfigures) and 1 single figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07041 2026-05-04 cs.DC 50%

AIReSim: A Discrete Event Simulator for Large-scale AI Cluster Reliability Modeling

AIReSim:用于大规模AI集群可靠性建模的离散事件模拟器

Karthik Pattabiraman, Mihir Patel, Fred Lin

专题命中 规划推理 :planning(abstract)

AI总结 本文提出AIReSim,用于评估大规模AI集群中故障、恢复、调度和修复过程中的设计选择,通过系统性评估参数对整体可靠性的影响,帮助优先改进系统。

Comments To appear in the Industry track of the IEEE/IFIP International Conference on Dependable Systems and Networks (DSN), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视觉空间推理 4 篇

2510.00072 2026-05-04 cs.CV cs.AI cs.LG 81%

Unlocking Zero-Shot Geospatial Reasoning via Indirect Rewards

通过间接奖励解锁零样本地理推理

Chenhui Xu, Fuxun Yu, Michael J. Bianco, Jacob Kovarskiy, Raphael Tang, Qi Zhang, Zirui Xu, Will LeVine, Brandon Dubbs, Heming Liao, Cassandra Burgess, Suvam Bag, Jay Patravali, Rupanjali Kukal, Mikael Figueroa, Rishi Madhok, Nikolaos Karianakis, Jinjun Xiong

机构 * University at Buffalo(布法罗大学) Microsoft(微软)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Geo-R1方法,利用间接可验证奖励提升地理推理能力,在多个下游任务中实现卓越的零样本迁移性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏