arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-11 至 2026-05-11 共收录 163 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 11 篇

2601.21839 2026-05-11 cs.CY cs.AI cs.GT cs.LG 84%

Test-Time Compute Games

测试时计算博弈

Ander Artola Velasco, Dimitrios Rontogiannis, Stratis Tsirtsis, Manuel Gomez-Rodriguez

机构 * Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所) Hasso Plattner Institute(哈索·普拉特纳研究所)

专题命中 测试时计算 :test-time compute(title,abstract);reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了大语言模型作为服务市场的社会效率问题,提出反第二种价格拍卖机制以减少计算量浪费,通过实验验证了该机制的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07461 2026-05-11 cs.CL 83%

Think-with-Rubrics: From External Evaluator to Internal Reasoning Guidance

基于评分标准的思考:从外部评估者到内部推理指导

Jiachen Yu, Zhihao Xu, Junjie Wang, Yujiu Yang

机构 * Tsinghua University(清华大学) Renmin University of China(中国人民大学)

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.CL

AI总结 本文提出Think-with-Rubrics方法,通过将评分标准整合到推理过程中,使评分标准成为LLM生成的内部指导,提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07153 2026-05-11 cs.CL 83%

Beyond Reasoning: Reinforcement Learning Unlocks Parametric Knowledge in LLMs

超越推理:强化学习解锁大语言模型中的参数知识

Wanli Yang, Hongyu Zang, Junwei Zhang, Wenjie Shi, Du Su, Jingang Wang, Xueqi Cheng, Fei Sun

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS University of Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院,中国科学院大学)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文研究强化学习在零样本、单跳、封闭书 QA 任务中提升参数知识直接回忆的能力,发现其平均相对提升达27%,揭示 RL 通过重新分配概率质量解锁潜在知识而非获取新事实。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08070 2026-05-11 cs.AI 79%

VecCISC: Improving Confidence-Informed Self-Consistency with Reasoning Trace Clustering and Candidate Answer Selection

VecCISC:通过推理轨迹聚类和候选答案选择改进置信度引导的自一致性

James Petullo, Sonny George, Dylan Cashman, Nianwen Xue

机构 * Computer Science Department, Brandeis University(布拉德雷大学计算机科学系)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 VecCISC通过推理轨迹聚类和候选答案筛选优化置信度引导的自一致性方法,减少计算开销并保持高精度。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05439 2026-05-11 cs.AI cs.FL 74%

BEAVER: An Efficient Deterministic LLM Verifier

BEAVER:一种高效的确定性大语言模型验证器

Tarun Suresh, Nalin Wadhwa, Debangshu Banerjee, Gagandeep Singh

机构 * University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 测试时计算 :verifier(title);分类 cs.AI

AI总结 BEAVER 提出了一种计算大语言模型安全属性确定性概率界限的框架,通过新颖的 Token trie 和 Frontier 数据结构系统探索模型输出空间,提供可靠保证并识别更多高风险实例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09782 2026-05-11 cs.LG cs.AI cs.CL 67%

Flexible Entropy Control in RLVR with a Gradient-Preserving Perspective

在RLVR中采用梯度保持视角实现灵活熵控制

Kun Chen, Peng Shi, Fanfan Liu, Haibo Qiu, Zhixiong Zeng, Siqi Yang, Wenji Mao

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) Meituan(美团)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文从梯度保持裁剪角度出发,提出动态裁剪阈值机制和动态熵控制策略,有效缓解熵崩溃问题并提升多基准性能。

Comments https://github.com/Kwen-Chen/Flexible-Entropy-Control

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00663 2026-05-11 cs.RO cs.CV 50%

Affordance Agent Harness: Verification-Gated Skill Orchestration

可及性代理框架:验证门控技能协调

Haojian Huang, Jiahao Shi, Yinchuan Li, Yingcong Chen

机构 * HKUST(GZ)(香港理工大学(广州)) Knowin AI Harbin Engineering University(哈尔滨工程大学)

专题命中 测试时计算 :verifier(abstract)

AI总结 本文提出一种闭环运行时系统,统一异构技能并利用证据存储和成本控制,通过路由器自适应选择技能,利用验证器通过自一致性、跨尺度稳定性等验证证据充分性,从而提升可及性定位的准确性和效率。

Comments 43 pages, 22 figures, 8 tables. Ongoing work

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 复杂问题求解 9 篇

2506.13351 2026-05-11 cs.CL cs.AI cs.LG 88%

Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks

直接推理优化:基于推理反射的令牌级推理与评分门控用于不可验证任务

Yifei Xu, Tusher Chakraborty, Srinagesh Sharma, Leonardo Nunes, Swati Sharma, Kate Drakos Demopulos, Emre Kıcıman, Songwu Lu, Ranveer Chandra

机构 * Microsoft(微软公司) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种约束强化学习框架,通过令牌级推理反射奖励和评分门控优化不可验证任务的推理质量与学习效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05359 2026-05-11 cs.CV 85%

Multimodal Latent Reasoning via Hierarchical Visual Cues Injection

多模态潜在推理 via 分层视觉提示注入

Yiming Zhang, Qiangyu Yan, Borui Jiang, Kai Han

机构 * Nanyang Technological University(南洋理工大学) Huawei Noah's Ark Lab(华为诺亚实验室)

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract,abstract_cn)

AI总结 本文提出HIVE框架,通过分层视觉提示注入实现多模态潜在推理,提升模型在对齐潜在空间中的多步推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06671 2026-05-11 cs.AI cs.MA 79%

GraphDC: A Divide-and-Conquer Multi-Agent System for Scalable Graph Algorithm Reasoning

GraphDC: 一种用于可扩展图算法推理的分而治之多智能体系统

Wenjin Li, Jiaming Cui

机构 * Department of Computer Science, Virginia Tech(弗吉尼亚理工大学计算机科学系)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 GraphDC通过分而治之的多智能体框架提升图算法推理效率,通过分解图并分配子任务给专用智能体,结合主智能体整合结果,提升大规模图处理的性能和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05949 2026-05-11 cs.AI cs.SE 70%

MAS-Algorithm: A Workflow for Solving Algorithmic Programming Problems with a Multi-Agent System

MAS-Algorithm: 一个基于多智能体系统的算法问题求解工作流

Yuliang Xu, Xiang Xu, Yao Wan, Hu Wei, Tong Jia

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团) Huazhong University of Science and Technology(华中科技大学)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出MAS-Algorithm,通过多智能体工作流提升算法问题求解能力,实验显示在多个模型上均取得显著提升,包括接受率提升6.48%和LiveCodeBench-Pro上的4.72%提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03327 2026-05-11 cs.LG cs.AI 62%

DGPO: Distribution Guided Policy Optimization for Fine Grained Credit Assignment

DGPO:基于分布的策略优化用于细粒度信用分配

Hongbo Jin, Rongpeng Zhu, Zhongjing Du, Xu Jiang, Jingqi Tian, Qiaoman Zhang, Jiayu Ding

机构 * Peking University(北京大学) SJTU(上海交通大学) Tsinghua University(清华大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 DGPO通过引入分布引导的策略优化框架,解决传统方法在细粒度信用分配中的不足,通过Hellinger距离和熵门机制实现安全探索与有效区分真实推理突破,提升大语言模型在复杂推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21582 2026-05-11 cs.CL cs.AI cs.HC 62%

VIDEE: Visual and Interactive Decomposition, Execution, and Evaluation of Text Analytics with Intelligent Agents

VIDEE:基于智能代理的文本分析可视化、交互式分解、执行与评估系统

Sam Yu-Te Lee, Chenyang Ji, Shicheng Wen, Lifu Huang, Dongyu Liu, Kwan-Liu Ma

机构 * Department of Computer Science, University of California at Davis(加州大学戴维斯分校计算机科学系)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 VIDEE通过人机协作流程帮助初级分析师进行高级文本分析,包含分解、执行和评估三个阶段,结合人类反馈和LLM评估,验证了系统在非专家用户中的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00814 2026-05-11 cs.CV cs.AI 57%

Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs

持久视觉记忆:在大型视觉-语言模型中维持感知以实现深度生成

Siyuan Huang, Xiaoye Qu, Yafu Li, Tong Zhu, Zefeng He, Muxin Fu, Daizong Liu, Wei-Long Zheng, Yu Cheng

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Nanjing University(南京大学) Tongji University(同济大学) Wuhan University(武汉大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出PVM模块,通过增强视觉证据的持续访问能力,解决LVLMs中视觉信号稀释问题,提升复杂推理任务的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07180 2026-05-11 cs.CL 57%

Learning Agent Routing From Early Experience

从早期经验学习代理路由

Yimin Wang, Jiahao Qiu, Xuan Qi, Xinzhe Juan, Jingzhe Shi, Zelin Zhao, Hongru Wang, Shilong Liu, Mengdi Wang

机构 * AI Lab, Princeton University(普林斯顿大学人工智能实验室) University of Michigan(密歇根大学) Institute for Interdisciplinary Information Sciences (IIIS), Tsinghua University(清华大学交叉信息学院) Shanghai Jiao Tong University(上海交通大学) University of Edinburgh(爱丁堡大学) King’s College London(伦敦国王学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文研究在冷启动条件下如何在轻量级LLM推理与完整代理执行间进行路由,提出无需训练的BoundaryRouter框架,通过早期行为经验和指导性推理决定是否直接使用LLM还是升级至代理,实验显示其在降低推理时间与提升性能方面优于其他方法。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06812 2026-05-11 cs.AI 57%

Towards Security-Auditable LLM Agents: A Unified Graph Representation

迈向安全可审计的LLM代理:一种统一的图表示

Chaofan Li, Lyuye Zhang, Jintao Zhai, Siyue Feng, Xichun Yang, Huahao Wang, Shihan Dou, Yu Ji, Yutao Hu, Yueming Wu, Yang Liu, Deqing Zou

机构 * Huazhong University of Science and Technology(华中科技大学) Nanyang Technological University(南洋理工大学) Fudan University(复旦大学) Chongqing University of Posts and Telecommunications(重庆邮电大学) Donghua University(东华大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Agent-BOM统一图表示,用于解决LLM代理系统中执行意图与物理事件间的语义鸿沟问题,通过构建分层属性有向图实现安全审计与风险评估。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 推理评测 38 篇

2605.06672 2026-05-11 cs.AI cs.CL cs.LG 88%

More Thinking, More Bias: Length-Driven Position Bias in Reasoning Models

更多思考,更多偏见:推理模型中的长度驱动位置偏见

Xiao Wang

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现推理模型中位置偏见随推理轨迹长度增加而增强,指出不应默认认为推理模型在多项选择评估中具有顺序鲁棒性,并提供诊断工具用于审计位置偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19697 2026-05-11 cs.CV 82%

Unveiling Fine-Grained Visual Traces: Evaluating Multimodal Interleaved Reasoning Chains in Multimodal STEM Tasks

揭示细粒度视觉痕迹:评估多模态交错推理链在多模态STEM任务中的表现

Jing Jin, Hao Liu, Yan Bai, Yihang Lou, Zhenke Wang, Tianrun Yuan, Juntong Chen, Yongkang Zhu, Fanhu Zeng, Xuanyu Zhu, Tao Feng, Yige Xu

机构 * Tsinghua University(清华大学) Meituan Inc(美团公司) Central South University(中南大学) Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) Nanyang Technological University(南洋理工大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 本文提出StepSTEM基准,通过严格筛选的283个STEM问题,评估多模态大语言模型的跨模态推理能力,发现现有模型仍依赖文本推理,揭示了真实跨模态STEM推理的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08057 2026-05-11 cs.CL cs.AI 81%

CA-SQL: Complexity-Aware Inference Time Reasoning for Text-to-SQL via Exploration and Compute Budget Allocation

CA-SQL:基于探索与计算预算分配的文本到SQL推理方法

James Petullo, Nianwen Xue

机构 * Brandeis University(布雷纳大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 CA-SQL通过动态扩展探索广度和自定义提示种子方法,提升文本到SQL任务在Bird-Bench基准中的表现,达到51.72%的挑战性问题得分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07274 2026-05-11 cs.AI cs.LG 81%

Structured Role-Aware Policy Optimization for Multimodal Reasoning

结构化角色感知策略优化用于多模态推理

Bingqing Jiang, Difan Zou

机构 * School of Computing & Data Science, The University of Hong Kong(计算与数据科学学院,香港大学) School of Computing & Data Science and Institute of Data Science, The University of Hong Kong(计算与数据科学学院和数据科学研究所,香港大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出结构化角色感知策略优化(SRPO),通过角色感知的token级信用分配提升多模态推理中的证据基础推理能力,无需外部奖励模型。

Comments 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18744 2026-05-11 cs.AI cs.LG 81%

TSRBench: A Comprehensive Multi-task Multi-modal Time Series Reasoning Benchmark for Generalist Models

TSRBench: 一个全面的多任务多模态时间序列推理基准,用于通用模型

Fangxu Yu, Xingang Guo, Lingzhi Yuan, Haoqiang Kang, Hongyu Zhao, Lianhui Qin, Furong Huang, Bin Hu, Tianyi Zhou

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of Illinois at Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Maryland, College Park(马里兰大学学院公园分校) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 TSRBench通过4125个问题和15个任务评估通用模型的时间序列推理能力,揭示了感知和推理中的缩放定律失效以及多模态融合的不足。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04731 2026-05-11 cs.AI cs.CL 81%

Miner:Mining Intrinsic Mastery for Data-Efficient RL in Large Reasoning Models

Miner:挖掘内在掌握以实现大推理模型的数据高效强化学习

Shuyang Jiang, Yuhao Wang, Ya Zhang, Yanfeng Wang, Yu Wang

机构 * Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出Miner方法,通过利用策略内在不确定性作为自监督奖励信号,提升大推理模型的数据高效强化学习性能,实现状态-of-the-art结果。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04850 2026-05-11 cs.CL cs.AI 81%

Detecting Distillation Data from Reasoning Models

从推理模型中检测蒸馏数据

Hengxiang Zhang, Hyeong Kyu Choi, Sharon Li, Hongxin Wei

机构 * Department of Statistics and Data Science, Southern University of Science and Technology(统计与数据科学系,南方科技大学) Department of Computer Sciences, University of Wisconsin–Madison(计算机科学系,威斯康星大学麦迪逊分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于输出token概率偏差的检测方法,用于识别推理模型蒸馏数据中的问题,通过量化生成token与高置信度参考概率的偏差,提升检测性能,实验表明在蒸馏数据集上AUC提升达31%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07477 2026-05-11 cs.CV 80%

ReasonEdit: Towards Interpretable Image Editing Evaluation via Reinforcement Learning

ReasonEdit:通过强化学习实现可解释图像编辑评估

Honghua Chen, Zitong Xu, Huiyu Duan, Xinyun Zhang, Xiongkuo Min, Guangtao Zhai

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出ReasonEdit,通过引入ReasonEdit-22K数据集和RE-Reward模型,训练出可解释的图像编辑评估模型,提升评估的可解释性和透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07143 2026-05-11 cs.CL 79%

Ask Patients with Patience: Enabling LLMs for Human-Centric Medical Dialogue with Grounded Reasoning

耐心询问患者:通过 grounded 推理实现面向人类的医疗对话 LLM

Jiayuan Zhu, Jiazhen Pan, Yuyuan Liu, Fenglin Liu, Junde Wu

机构 * University of Oxford(牛津大学) Technical University of Munich(慕尼黑技术大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出 APP,一种基于 LLM 的医疗助手,通过 grounded 推理和透明诊断提升医疗对话的人性化体验,改进诊断准确性并增强用户参与度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07103 2026-05-11 cs.AI cs.MA 79%

ARMOR: An Agentic Framework for Reaction Feasibility Prediction via Adaptive Utility-aware Multi-tool Reasoning

ARMOR:一种通过自适应效用感知多工具推理的代理框架用于反应可行性预测

Ye Liu, Botao Yu, Xinyi Ling, Daniel Adu-Ampratwum, Xia Ning

机构 * Department of Biomedical Informatics(生物医学信息学系) Department of Computer Science and Engineering(计算机科学与工程系) Division of Medicinal Chemistry and Pharmacognosy(药物化学与药理学系) Translational Data Analytics Institute(转化数据分析研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 ARMOR通过自适应效用感知多工具推理框架,有效整合多个工具的优势,提升反应可行性预测的准确性,尤其在存在工具预测冲突时表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02881 2026-05-11 cs.RO 78%

MolmoAct2: Action Reasoning Models for Real-world Deployment

MolmoAct2:面向现实部署的动作推理模型

Haoquan Fang, Jiafei Duan, Donovan Clay, Sam Wang, Shuo Liu, Weikai Huang, Xiang Fan, Wei-Chuan Tsai, Shirui Chen, Yi Ru Wang, Shanli Xing, Jaemin Cho, Jae Sung Park, Ainaz Eftekhar, Peter Sushko, Karen Farley, Angad Wadhwa, Cole Harrison, Winson Han, Ying-Chun Lee, Eli VanderBilt, Rose Hendrix, Suveen Ellawela, Lucas Ngoo, Joyce Chai, Zhongzheng Ren, Ali Farhadi, Dieter Fox, Ranjay Krishna

机构 * Allen Institute for AI(艾伦人工智能研究所) University of Washington(华盛顿大学) National University of Singapore(新加坡国立大学) University of Pennsylvania(宾夕法尼亚大学) Johns Hopkins University(约翰霍普金斯大学) Amazon(亚马逊公司) University of Michigan(密歇根大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出MolmoAct2,一个完全开放的动作推理模型,通过改进架构和引入新数据集,在五个方面提升性能,展示了在多个基准测试中优于现有模型的成果。

Comments 31 pages, project page: https://allenai.org/blog/molmoact2

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07251 2026-05-11 cs.AI 74%

Can Agents Price a Reaction? Evaluating LLMs on Chemical Cost Reasoning

智能体能否定价反应?评估大语言模型在化学成本推理上的能力

Yuyang Wu, Yue Huang, Shuaike Shen, Xujian Wang, Shuhao Zhang, Qiyao Xue, Weichen Liu, Runtian Gao, Jian Ma, Xiangliang Zhang, Olexandr Isayev

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Notre Dame(Notre Dame 大学) University of North Carolina, Chapel Hill(北卡罗来纳大学教堂山分校) University of Pittsburgh(匹兹堡大学)

专题命中 推理评测 :reasoning(title);分类 cs.AI

AI总结 本文提出ChemCost基准,评估大语言模型在化学成本推理任务中的能力,发现工具访问并非解决问题的充分条件,且在噪声环境下表现下降。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22944 2026-05-11 cs.CR cs.AI 70%

Is Your Prompt Poisoning Code? Defect Induction Rates and Security Mitigation Strategies

你的提示污染代码了吗?缺陷诱导率与安全缓解策略

Bin Wang, YiLu Zhong, MiDi Wan, WenJie Yu, YuanBing Ouyang, Yenan Huang, Hui Li

机构 * Organization(机构)

专题命中 推理评测 :chain-of-thought(abstract);self-correction(abstract);分类 cs.AI

AI总结 研究探讨了低质量提示对生成代码安全性的负面影响,提出评估框架和基准数据集,并展示高级提示技术可缓解安全风险。

Comments Accepted for publication in Empirical Software Engineering (EMSE) Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07268 2026-05-11 cs.CL 70%

From 0-Order Selection to 2-Order Judgment: Combinatorial Hardening Exposes Compositional Failures in Frontier LLMs

从零阶选择到二阶判断:组合硬化揭示前沿大语言模型的组成性失败

Hanmeng Liu, Shichao Weng, Xiulai Liu, Zhicai Zhang, Anli Yan, Xiaozhang Liu

机构 * Hainan University(海南大学) Fudan University(复旦大学)

专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL

AI总结 本文提出LogiHard框架,通过确定性转换零阶选择为二阶逻辑判断,显著增加推理难度,验证了大语言模型在组合硬化任务中的表现下降,揭示了训练诱导的完整性验证缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏