arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-09 至 2026-04-09 共收录 11 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 11 篇

2604.06347 2026-04-09 cs.CV 88%

Evidence-Based Actor-Verifier Reasoning for Echocardiographic Agents

基于证据的Actor-验证者推理用于超声波代理

Peng Huang, Yiming Wang, Yineng Chen, Liangqiao Gui, Hui Guo, Bo Peng, Shu Hu, Xi Wu, Tsao Connie, Hongtu Zhu, Balakrishnan Prabhakaran, Xin Wang

机构 * University at Albany, SUNY(纽约州立大学奥尔巴尼分校) Southwest Jiaotong University(西南交通大学) Purdue University(普渡大学) Chengdu University of Information Technology(成都信息工程大学) Harvard Medical School(哈佛医学院) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 测试时计算 :reasoning(title,abstract);verifier(title,abstract)

AI总结 本文提出EchoTrust框架,通过结构化中间表示和不同角色分析,提升超声波临床决策支持系统中推理的可靠性与可解释性。

Comments cvprw 2026(AIMS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06794 2026-04-09 cs.CL 85%

GCoT-Decoding: Unlocking Deep Reasoning Paths for Universal Question Answering

GCoT-Decoding:解锁通用问答中的深度推理路径

Guanran Luo, Wentao Qiu, Zhongquan Jian, Meihong Wang, Qingqiang Wu

机构 * School of Informatics, Xiamen University(厦门大学信息学院)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 本文提出GCoT-Decoding策略,结合Fibonacci采样和启发式错误回溯,生成候选解码路径并计算置信度,通过语义相似路径聚合获得共识答案,提升通用问答性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06389 2026-04-09 cs.AI 79%

SELFDOUBT: Uncertainty Quantification for Reasoning LLMs via the Hedge-to-Verify Ratio

SELFDOUBT:通过Hedge-to-Verify比率对推理大语言模型进行不确定性量化

Satwik Pandey, Suresh Raghu, Shashwat Pandey

机构 * Independent Researcher(独立研究员) Zillow Group(Zillow集团)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 SELFDOUBT是一种单次通过的不确定性框架,通过从推理轨迹中提取行为信号解决推理大语言模型的不确定性量化问题,其核心信号Hedge-to-Verify比率能检测推理轨迹中的不确定性标记及自我检查行为,适用于任何私有API的部署。

Comments 9 pages, 4 figures, 4 tables, plus appendix. Submitted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22025 2026-04-09 cs.AI cs.CL cs.CV 73%

UI-AGILE: Advancing GUI Agents with Effective Reinforcement Learning and Precise Inference-Time Grounding

UI-AGILE: 通过有效的强化学习和精确的推理时间接地提升GUI代理

Shuquan Lian, Yuhang Wu, Jia Ma, Yifan Ding, Zihan Song, Bingqi Chen, Xiawu Zheng, Hui Li, Rongrong Ji

机构 * Sino-Russian Research Center for Digital Economy(中俄数字经济研究中心)

专题命中 测试时计算 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 UI-AGILE通过改进监督微调过程和推理中的分解接地,提升了GUI代理的接地性能和通用能力,在ScreenSpot-Pro和ScreenSpot-v2基准上实现了最佳表现,地面准确率提升23%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06753 2026-04-09 cs.CL 70%

Select-then-Solve: Paradigm Routing as Inference-Time Optimization for LLM Agents

选择后再解决:作为大语言模型代理推理时间优化的范式路由

Heng Zhou, Zelin Tan, Zhemeng Zhang, Yutao Fan, Yibing Lin, Li Kang, Xiufeng Song, Rui Li, Songtao Huang, Ao Yu, Yuchen Fan, Yanxu Chen, Kaixin Xu, Xiaohong Liu, Yiran Qin, Philip Torr, Chen Zhang, Zhenfei Yin

专题命中 测试时计算 :reasoning(abstract);CoT(abstract);分类 cs.CL

AI总结 研究通过比较六种推理范式在四个前沿LLM和十个基准上的表现,发现推理结构对任务效果有显著影响,提出选择后再解决方法通过轻量级嵌入路由提升任务准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06728 2026-04-09 cs.CV cs.AI cs.MM 57%

URMF: Uncertainty-aware Robust Multimodal Fusion for Multimodal Sarcasm Detection

URMF:面向多模态讽刺检测的不确定性感知鲁棒多模态融合

Zhenyu Wang, Weichen Cheng, Weijia Li, Junjie Mou, Zongyou Zhao, Guoying Zhang

机构 * School of Artificial Intelligence, China University of Mining and Technology-Beijing(中国矿业大学(北京)人工智能学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本文提出URMF框架,通过建模模态可靠性提升多模态讽刺检测的准确性和鲁棒性,采用多头交叉注意力和自注意力机制,并结合不确定性建模和联合训练目标,在公开基准上优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06385 2026-04-09 cs.CL 57%

Application-Driven Pedagogical Knowledge Optimization of Open-Source LLMs via Reinforcement Learning and Supervised Fine-Tuning

通过强化学习和监督微调驱动的开源大语言模型教学知识优化

Navan Preet Singh, Xiaokun Wang, Anurag Garikipati, Madalina Ciobanu, Qingqing Mao, Ritankar Das

机构 * East China Normal University, Shanghai, China(华东师范大学) Incept Labs, Houston, TX(Incept Labs)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 本文提出结合强化学习和监督微调的多阶段优化策略,通过EduQwen 32B-RL1、EduQwen 32B-SFT及EduQwen 32B-SFT-RL2等模型,提升大语言模型的教学知识能力,实现跨领域教学知识基准的新状态-of-the-art结果。

Comments * These authors contributed equally to this work and share first authorship

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06240 2026-04-09 cs.CR cs.AI cs.MA 57%

The Art of Building Verifiers for Computer Use Agents

构建计算机使用代理验证器的艺术

Corby Rosset, Pratyusha Sharma, Andrew Zhao, Miguel Gonzalez-Fernandez, Ahmed Awadallah

机构 * Microsoft Research(微软研究院) Browserbase

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 本文提出通用验证器,通过四个原则减少噪声、分离奖励信号、区分可控不可控失败、并采用分治上下文管理,提升验证可靠性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22396 2026-04-09 cs.CV cs.AI 57%

Asking like Socrates: Socrates helps VLMs understand remote sensing images

像苏格拉底提问:苏格拉底帮助VLMs理解遥感图像

Run Shao, Ziyu Li, Zhaoyang Zhang, Linrui Xu, Xinran He, Hongyuan Yuan, Bolei He, Yongxing Dai, Yiming Yan, Yijun Chen, Wang Guo, Haifeng Li

机构 * School of Geosciences and Info-Physics, Central South University(中南大学地球科学与信息物理学院) Baidu Inc.(百度公司) School of Earth Sciences, Zhejiang University(浙江大学地球科学学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本文提出RS-EoT方法,通过迭代视觉证据寻求机制和两阶段强化学习策略,解决遥感图像中伪推理问题,提升视觉证据基础的推理能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06849 2026-04-09 cs.CV 50%

Vision-Language Model-Guided Deep Unrolling Enables Personalized, Fast MRI

基于视觉-语言模型的深度展开实现个性化快速MRI

Fangmao Ju, Yuzhu He, Zhiwen Xue, Chunfeng Lian, Jianhua Ma

专题命中 测试时计算 :reasoning(abstract)

AI总结 本文提出PASS框架,利用视觉-语言模型指导深度展开网络,实现任务导向的快速成像,通过动态个性化成像流程提升MRI图像质量及诊断性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19433 2026-04-09 cs.CV 50%

dMLLM-TTS: Self-Verified and Efficient Test-Time Scaling for Diffusion Multi-Modal Large Language Models

dMLLM-TTS:用于扩散多模态大语言模型的自验证和高效测试时间扩展

Yi Xin, Siqi Luo, Tianxiang Xu, Qi Qin, Haoxing Chen, Kaiwen Zhu, Zhiwei Zhang, Yangfan He, Rongchao Zhang, Jinbin Bai, Shuo Cao, Bin Fu, Junjun He, Yihao Liu, Yuewen Cao, Xiaohong Liu

机构 * Nanjing University(南京大学) Shanghai Innovation Institute(上海创新研究院) Shanghai AI Lab(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) National University of Singapore(新加坡国立大学)

专题命中 测试时计算 :verifier(abstract)

AI总结 本文提出dMLLM-TTS框架,通过轨迹探索扩展和迭代细化扩展两个互补的扩展轴,提升生成多样性和稳定性,同时通过自验证机制提高效率,实验表明在GenEval基准上生成质量显著提升且效率提高6倍。

Comments Project page: https://github.com/Alpha-VLLM/Lumina-DiMOO

详情

展开后加载摘要…

URL PDF HTML 收藏