arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-30 至 2026-04-30 共收录 11 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 11 篇

2604.26774 2026-04-30 cs.CV cs.AI 79%

MemOVCD: Training-Free Open-Vocabulary Change Detection via Cross-Temporal Memory Reasoning and Global-Local Adaptive Rectification

MemOVCD:基于跨时间记忆推理和全局局部自适应校正的无训练开放词汇变化检测

Zuzheng Kuang, Honghao Chang, Boqiang Liang, Haoqian Wang, Lijun He, Fan Li, Haixia Bi

机构 * School of Information and Communications Engineering, Xi’an Jiaotong University(西安交通大学信息与通信工程学院)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 MemOVCD通过跨时间记忆推理和全局局部自适应校正,解决开放词汇变化检测中时间耦合不足和局部碎片化问题,验证了其在多基准上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26106 2026-04-30 cs.AI 79%

Evaluating Strategic Reasoning in Forecasting Agents

评估预测代理中的战略推理

Tom Liptay, Dan Schwarz, Rafael Poyiadzi, Jack Wildman, Nikos I. Bosse

机构 * FutureSearch(未来搜索)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出BTF-2基准测试,通过1417个预测问题评估代理的预测准确性及战略推理能力,发现专家预测者在评估政治和商业领袖的激励、判断其执行计划的可能性及建模制度过程方面存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01544 2026-04-30 cs.LG 79%

MARVIS: Modality Adaptive Reasoning over VISualizations

MARVIS:基于可视化模态自适应推理

Benjamin Feuer, Lennart Purucker, Oussama Elachqar, Chinmay Hegde

机构 * Stanford University(斯坦福大学) Prior Labs(Prior实验室) New York University(纽约大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.LG

AI总结 MARVIS通过将潜在嵌入空间转换为可视化表示,并利用VLM的空间和细粒度推理能力,实现跨视觉、音频、生物和表格域的预测,以3B参数模型在多个领域超越Gemini 2.0。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26653 2026-04-30 cs.IR 67%

AgentSim: A Platform for Verifiable Agent-Trace Simulation

AgentSim:可验证代理跟踪模拟平台

Saber Zerhoudi, Michael Granitzer, Jelena Mitrovic

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出AgentSim平台,通过多模型验证和主动人工参与流程,生成可验证的代理推理轨迹,构建了覆盖三个信息检索基准的Agent-Trace Corpus,并揭示了先进模型在信息检索中的系统性差异。

Journal ref Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR '26), July 20--24, 2026, Melbourne, VIC, Australia

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26779 2026-04-30 cs.LG cs.CL 62%

Accelerating RL Post-Training Rollouts via System-Integrated Speculative Decoding

通过系统集成的推测解码加速RL训练后的 rollout

Hayate Iso, Tiyasa Mitra, Sudipta Mondal, Rasoul Shafipour, Venmugil Elango, Terry Kong, Yuki Huang, Seonjin Na, Izzy Putterman, Benjamin Chislett, Maor Ashkenazi, Joseph Guman, Gerald Shen, Tugrul Konuk, Ashwath Aithal, Ritika Borkar, Ran Zilberstein, Bita Rouhani

机构 * NeMo-RL vLLM

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了通过系统集成的推测解码技术提升RL训练后rollout效率的方法,展示了在大规模模型上实现1.8倍的吞吐量提升,并通过模拟预测异步RL可实现2.5倍的训练加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24005 2026-04-30 cs.LG cs.AI 62%

TCOD: Exploring Temporal Curriculum in On-Policy Distillation for Multi-turn Autonomous Agents

TCOD:探索在线蒸馏在多轮自主代理中的时间课程

Jiaqi Wang, Wenhao Zhang, Weijie Shi, Yaliang Li, James Cheng

机构 * Tongyi Lab(通义实验室) Alibaba Group(阿里巴巴集团)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出TCOD框架,通过时间课程策略缓解在线蒸馏在多轮任务中的KL不稳定性,提升代理性能,实验显示性能提升达18个百分点,甚至超越教师模型。

Comments Update code, model weight

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13963 2026-04-30 cs.CL cs.LG 62%

Through a Compressed Lens: Investigating The Impact of Quantization on Factual Knowledge Recall

通过压缩镜头:探讨量化对事实知识回忆的影响

Qianli Wang, Mingyang Wang, Nils Feldhus, Simon Ostermann, Yuan Cao, Hinrich Schütze, Sebastian Möller, Vera Schmitt

机构 * Quality and Usability Lab, Technische Universität Berlin(柏林技术大学质量与可用性实验室) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) Saarland Informatics Campus(萨尔州信息学院) LMU Munich(慕尼黑大学) Bosch Center for Artificial Intelligence (BCAI)(博世人工智能中心) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Centre for European Research in Trusted AI (CERTAIN)(可信人工智能欧洲研究中心) BIFOLD – Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究院) Technical University of Munich(慕尼黑技术大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究通过量化技术对大型语言模型的事实知识回忆能力影响,发现量化导致信息损失,但部分模型在低精度下表现更优,BitSandBytes保留最多原始精度的知识回忆能力。

Comments TrustNLP @ ACL 2026; camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00761 2026-04-30 cs.SE cs.AI cs.CL 62%

Identifying the Achilles' Heel: An Iterative Method for Dynamically Uncovering Factual Errors in Large Language Models

找出阿基里斯之踵:一种用于动态揭示大语言模型事实错误的迭代方法

Wenxuan Wang, Yuk-Kit Chan, Zixuan Ling, Juluan Shi, Youliang Yuan, Jen-tse Huang, Yifei Zhang, Wenxiang Jiao, Zhaopeng Tu, Michael R. Lyu

机构 * Renmin University of China(中国人民大学) The Chinese University of Hong Kong(香港中文大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学深圳校区) Johns Hopkins University(约翰霍普金斯大学) Nanyang Technological University(南洋理工大学) Xiaohongshu Inc.(小红书公司) Tencent Inc.(腾讯公司)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出HalluHunter框架,通过知识图谱和规则基NLP技术,系统揭示大语言模型的事实错误,测试表明可触发55%的问题错误。

Comments Accepted by Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26378 2026-04-30 cs.LG 57%

CoQuant: Joint Weight-Activation Subspace Projection for Mixed-Precision LLMs

CoQuant:混合精度LLM的联合权重-激活子空间投影

Zhe Ding, Su Pan, Duowei Pan

机构 * School of Internet of Things, Nanjing University of Posts and Telecommunications(南京邮电大学物联网学院) Amazon AGI(亚马逊人工智能)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 CoQuant通过联合建模权重和激活的子空间,提升混合精度LLM的量化效果,在WikiText perplexity和零样本常识推理准确率上优于现有方法。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26091 2026-04-30 cs.AI cs.CE cs.MA 57%

Operating-Layer Controls for Onchain Language-Model Agents Under Real Capital

链上语言模型代理在真实资本下的操作层控制

T. J. Barton, Chris Constantakis, Patti Hauseman, Annie Mous, Alaska Hoffman, Brian Bergeron, Hunter Goodreau

机构 * DX Research Group(DX研究组)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究链上语言模型代理在真实资本下的可靠性,通过操作层控制提升资本管理效能,展示从用户指令到结算的全流程评估重要性。

Comments 18 pages, 6 figures. Public onchain dashboard and supporting documentation linked in paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18239 2026-04-30 cs.CY cs.AI 57%

Can LLMs Help Allocate Public Health Resources? A Case Study on Childhood Lead Testing

大语言模型能否帮助分配公共卫生资源?一项关于儿童铅检测的案例研究

Mohamed Afane, Ying Wang, Juntao Chen

机构 * Department of Computer and Information Sciences, Fordham University(福特汉姆大学计算机与信息科学系) Department of Systems Engineering, Stevens Institute of Technology(史蒂文斯理工学院系统工程系)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文研究大语言模型在分配公共卫生资源中的有效性,通过芝加哥、纽约和华盛顿特区136个社区的案例,发现LLM在处理铅暴露高风险区域时存在显著局限性。

Journal ref 2025 IEEE International Conference on Big Data (BigData), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏