arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-18 至 2026-05-18 共收录 6 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 6 篇

2605.15203 2026-05-18 cs.IR cs.AI cs.MA 83%

Agent4POI: Agentic Context-Conditioned Affordance Reasoning for Multimodal Point-of-Interest Recommendation

Agent4POI: 基于代理的上下文条件化 affordance 推理用于多模态兴趣点推荐

Jinze Wang, Yangchen Zeng, Tiehua Zhang, Lu Zhang, Yuze Liu, Yongchao Liu, Xingjun Ma, Zhu Sun

机构 * Tongji University(同济大学) Swinburne University of Technology(斯威本理工大学) Southeast University(东南大学) Chengdu University of Information Technology(成都信息工程大学) Fudan University(复旦大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 Agent4POI 提出一种新的兴趣点推荐框架,通过在推荐时生成上下文条件化的多模态表示,而非依赖静态兴趣点嵌入。该方法通过代理生成动态 affordance 查询并执行跨模态推理,提升推荐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06062 2026-05-18 cs.CL 70%

When Importance Sampling Misallocates Credit: Asymmetric Ratios for Outcome-Supervised RL

重要采样误分配信用:用于结果监督强化学习的非对称比率

Jiakang Wang, Runze Liu, Qingpeng Cai, Lei Lin, Wenping Hu, Xiu Li, Fuzheng Zhang, Guorui Zhou, Kun Gai, Ling Pan

机构 * The Hong Kong University of Science and Technology(香港科技大学) Kuaishou Technology(快手科技) Tsinghua University(清华大学)

专题命中 测试时计算 :reasoning(abstract);math reasoning(abstract);分类 cs.CL

AI总结 本文揭示了在结果监督强化学习中,重要采样比率因角色转变导致正优势token与负优势token的权重失衡,提出非对称重要采样策略ASPO以纠正此问题,提升训练稳定性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16806 2026-05-18 cs.LG cs.AI cs.CL 67%

Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty

超越二元奖励:训练语言模型以对其不确定性进行推理

Mehul Damani, Isha Puri, Stewart Slocum, Idan Shenfeld, Leshem Choshen, Yoon Kim, Jacob Andreas

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出RLCR方法,通过联合提升准确性和校准置信度,改进语言模型的推理能力,实验显示其在不同数据集上提升校准效果而不影响准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08401 2026-05-18 cs.CL cs.AI 62%

AIPO: Learning to Reason from Active Interaction

AIPO: 通过主动交互学习推理

Junnan Liu, Linhao Luo, Thuy-Trang Vu, Gholamreza Haffari

机构 * Department of Data Science and AI, Faculty of Information Technology, Monash University, Australia(数据科学与人工智能系,信息科技学院,墨尔本大学,澳大利亚)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 AIPO通过主动多智能体交互提升大语言模型推理能力,引入三个协作代理解决推理瓶颈,改进探索效率并扩展能力边界。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15626 2026-05-18 cs.LG 57%

IO-SVD: Input-Output Whitened SVD for Adaptive-Rank LLM Compression

IO-SVD:输入-输出白化SVD用于自适应秩LLM压缩

Ali Abbasi, Chayne Thrash, Haoran Qin, Hamed Pirsiavash, Soheil Kolouri

机构 * Vanderbilt University(范德比大学) University of California, Davis(加州大学戴维斯分校)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 IO-SVD通过构建KL感知的双侧白化空间,结合高效异质秩分配策略,实现LLM压缩时的性能与效率平衡,实验表明其在压缩过程中性能损失小且推理速度提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21698 2026-05-18 cs.CV 50%

Adapting Foundation Vision-Language Models to Medical Diagnosis via Query-Driven Expert Bridging

通过查询驱动专家桥梁适应基础视觉-语言模型用于医学诊断

Yitong Li, Morteza Ghahremani, Christian Wachinger

机构 * Lab for AI in Medical Imaging, Technical University of Munich (TUM)(医学影像人工智能实验室,慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 测试时计算 :reasoning(abstract)

AI总结 本文提出MedBridge框架,通过结合领域对齐、分辨率保持和多标签推理的互补VLM专家,解决医学影像诊断中的领域差距问题,实现跨领域泛化和领域内特化,提升多标签胸腔疾病诊断性能。

详情

展开后加载摘要…

URL PDF HTML 收藏