arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-03 至 2026-08-03 共收录 38 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 2 篇

2607.23802 2026-08-03 cs.AI 版本更新 57%

From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement

从可验证奖励强化学习到自验证奖励强化学习:任务转换为开放式语言模型自我改进带来自验证奖励

Qinsi Wang, Jing Shi, Huazheng Wang, Kun Wan, Yiran Wu, Bo Liu, Qingyun Wu, Hai Helen Li, Yiran Chen, Handong Zhao, Wentian Zhao

机构 * Duke University(杜克大学) Adobe Inc.(奥多比公司) Oregon State University(俄勒冈州立大学) Pennsylvania State University(宾夕法尼亚州立大学) National University of Singapore(新加坡国立大学) Amazon(亚马逊)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 研究针对开放式LLM自我改进中奖励验证问题,提出基于任务转换的RLSVR方法,通过SpyRL实例化,在文本摘要等任务实验中,该方法在不可验证任务上优于现有方法,在可验证推理任务上有提升,扩展了基于RLVR的自我改进。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18622 2026-08-03 cs.CR cs.AI 版本更新 57%

CPInj: Uncovering Prompt Injection Risks in Textual Collaborative Prompt Optimization

CPInj:揭示文本协作式提示优化中的提示注入风险

Xinting Liao, Behnoosh Zamanlooy, Masoumeh Shafieinejad, David B. Emerson, Ruinan Jin, Deval Pandya, Xiaoxiao Li

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) McMaster University(麦斯特大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 研究文本协作式提示优化(TCPO)中提示注入风险,提出协作式提示注入攻击CPInj,用恶意指令污染全局提示,降低下游任务性能,现有防御方法无效;还提出防御导向聚合方法APAgg,实验表明TCPO存在关键漏洞,攻击有待更强大防御。

Comments Accepted by COLM 2026 and AI4GOOD workshop

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 2 篇

2603.16870 2026-08-03 cs.CV cs.AI 版本更新 84%

Demystifying Video Reasoning

揭秘视频推理

Ruisi Wang, Zhongang Cai, Fanyi Pu, Junxiang Xu, Wanqi Yin, Maijunxian Wang, Ran Ji, Chenyang Gu, Bo Li, Ziqi Huang, Hokin Deng, Dahua Lin, Ziwei Liu, Lei Yang

机构 * SenseTime Research(商汤科技研究院) Nanyang Technological University(南洋理工大学) University of California, Berkeley(加州大学伯克利分校) University of California, San Diego(加州大学圣地亚哥分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 代码与定理证明 :reasoning(title,abstract);self-correction(abstract);分类 cs.AI

AI总结 本文通过实验揭示视频扩散模型中的推理主要发生在去噪步骤中,提出链式步骤(CoS)机制,并发现工作记忆、自我修正和感知先行等涌现行为,最后提出一种无需训练的集成策略来提升推理能力。

Comments Homepage: https://www.wruisi.com/demystifying_video_reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25018 2026-08-03 cs.LG 版本更新 57%

Conformal Cascade: Distribution-Free Accuracy Guarantees for Multi-Tier LLM Inference

共形级联:多层大语言模型推理的无分布精度保证

Yifan Dou, Shikan Lian, Shibo Li

机构 * Department of Computer Science, Florida State University(佛罗里达州立大学计算机科学系)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.LG

AI总结 研究针对LLM级联推理成本高、置信分数校准不当等问题,提出共形级联框架,以共形预测集大小为推迟规则,提供无分布精度保证,在多基准测试中表现优于启发式级联,且无需模型训练,仅需黑盒API访问。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 4 篇

2502.19135 2026-08-03 cs.AI cs.HC cs.RO 版本更新 86%

Combining Large Language Models and Symbolic Reasoning for Multi-Robot Temporal Planning through Explainable Knowledge Bases

结合大语言模型与符号推理,通过可解释知识库实现多机器人时序规划

Enrico Saccon, Matteo Saveriano, Edoardo Lamon, Luigi Palopoli, Marco Roveri

专题命中 逻辑推理 :planning(title,abstract);reasoning(title);分类 cs.AI

AI总结 本研究提出PLANTOR框架,结合LLM与符号推理,通过可解释知识库实现多机器人时序规划,在基准场景及多臂装配场景验证,可减少手动建模但需人工修正,主张混合工作流。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15776 2026-08-03 cs.AI 版本更新 79%

NeurOWL: An LLM-Based Neural-symbolic Framework for Incomplete OWL Ontology Reasoning

NeurOWL:基于大语言模型的神经符号框架用于不完整OWL本体推理

Hui Yang, Jiaoyan Chen, Yiping Song, Renate Schmidt, Wen Zhang

机构 * The University of Manchester(曼彻斯特大学) Zhejiang University(浙江大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究不完整OWL本体的包含关系推理问题,提出NeurOWL框架,通过大语言模型和本体嵌入联合执行验证和溯因,利用形式与文本语义,在多领域真实本体上评估,展现强大稳健性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01982 2026-08-03 cs.CV cs.AI q-bio.BM 版本更新 57%

MolSight: A Graph-Aware Vision-Language Model for Unified Chemical Image Understanding

MolSight: 一种用于统一化学图像理解的图感知视觉语言模型

Wenda Wang, Yihan Tong, Yuwei Hu, Xuchen Pan, Zhewei Wei, Yaliang Li, Bolin Ding

机构 * Renmin University of China(中国人民大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 提出MolSight框架,通过分子拓扑模块和分子接地模块增强视觉语言模型对分子图像的结构理解,在多项化学视觉理解任务中显著优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05150 2026-08-03 cs.SE cs.AI 版本更新 57%

Compiled AI: Deterministic Code Generation for LLM-Based Workflow Automation

编译AI:基于LLM的工作流自动化确定性代码生成

Geert Trooskens, Aaron Karlsberg, Anmol Sharma, Lamara De Brouwer, Max Van Puyvelde, Matthew Young, John Thickstun, Gil Alterovitz, Walter A. De Brouwer

机构 * XY.AI Labs, Palo Alto, CA(XY.AI实验室,帕洛阿尔托) Stanford University School of Medicine, Stanford, CA(斯坦福大学医学院,斯坦福) Cornell University, Department of Computer Science, Ithaca, NY(康奈尔大学计算机科学系,伊萨卡) Brigham and Women’s Hospital / Harvard Medical School, Boston, MA(布莱根妇女医院/哈佛医学院,波士顿)

专题命中 逻辑推理 :planning(abstract);分类 cs.AI

AI总结 本文研究编译AI,一种大语言模型在编译阶段生成可执行代码,随后工作流确定性执行的范式。重点探讨其在高风险企业工作流中的应用,尤其在医疗领域,强调可靠性与可审计性。

Comments 14 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 6 篇

2605.29301 2026-08-03 cs.RO 版本更新 78%

The Open Motion Planning Library 2.0

开放运动规划库2.0

Weihang Guo, Theodoros Tyrovouzis, Emiliano Flores, Clayton W. Ramsey, Zachary K. Kingston, Ioan A. Şucan, Mark Moll, Lydia E. Kavraki

机构 * Department of Computer Science, Rice University(计算机科学系,里士大学) Department of Computer Science, Purdue University(计算机科学系,普渡大学) Waymo, LLC(Waymo公司) Metron, Inc.(Metron公司) Ken Kennedy Institute at Rice University(里士大学肯尼迪研究所)

专题命中 规划推理 :planning(title,abstract)

AI总结 本文介绍OMPL 2.0,通过硬件加速实现实时运动规划,并集成现代AI研究流程,总结了库与运动规划领域的共同发展及其对研究社区的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26497 2026-08-03 cs.CL 版本更新 57%

BM25 Wins at Scale: A Scaling Study of Retrieval-Augmented Generation Paradigms

哪种RAG范式在规模化场景下表现最优?检索增强生成范式的规模化研究

Pengyu Wang, Benfeng Xu, Shaohan Wang, Mingxuan Du, Xin Zeng, Huarui Wu, Lei Zhang, Licheng Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Metastone Technology(Metastone科技) Information Technology Research Center, Beijing Academy of Agriculture and Forestry Sciences(北京农林科学院信息技术研究中心)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 本文通过28个嵌套语料层级的受控研究,对比四类RAG范式的规模化表现,发现BM25综合性能最优,Agent+BM25全规模准确率达69.4,图基RAG存在构建瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09037 2026-08-03 cs.AI cs.MA 版本更新 57%

A Multi-Agent System for Motor Design Optimization via an FEA-AI Hybrid Approach

基于FEA-AI混合方法的IPMSM设计优化多智能体系统

Jinseong Han, Sunwoong Yang, Namwoo Kang

机构 * Cho Chun Shik Graduate School of Mobility, KAIST(KAIST Cho Chun Shik 移动研究生院) Department of Mechanical Engineering, Hanyang University(汉阳大学机械工程系) Narnia Labs

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 提出一种端到端自动化IPMSM设计优化框架,通过RAG结构化问题定义与不确定性感知的FEA-AI混合优化流水线,平衡计算成本与预测可靠性,在同等FEA预算下优于纯FEA或纯AI方法。

Comments 37 pages, 31 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10475 2026-08-03 cs.AI 版本更新 57%

PEMAND: Persona-Enriched Multi-Agent Negotiation for Household Decision-Making

PEMANT:面向旅行的个性化多智能体谈判

Yuran Sun, Mustafa Sameen, Yaotian Zhang, Rongguan Gu, Mrunal Vibhute, Chia-yu Wu, Yuanyuan Lei, Xilei Zhao

机构 * Department of Civil and Costal Engineering, University of Florida(佛罗里达大学土木与海岸工程系)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出PEMANT框架,结合行为理论与多智能体谈判,改进家庭旅行决策建模,提升预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10429 2026-08-03 cs.MA cs.AI 版本更新 57%

AIvilization v0: Toward Large-Scale Artificial Social Simulation with a Unified Agent Architecture and Adaptive Agent Profiles

AIvilization v0:迈向大规模人工社会模拟的统一代理架构与自适应代理档案

Wenkai Fan, Shurui Zhang, Xiaolong Wang, Haowei Yang, Tsz Wai Chan, Xingyan Chen, Junquan Bi, Zirui Zhou, Jia Liu, Kani Chen

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Bauhinia AI

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 AIvilization v0通过统一代理架构和自适应代理档案,实现大规模人工社会模拟,解决目标稳定性与反应正确性矛盾,支持长周期自主性和多目标环境下的稳健性。

Comments v2: major revision. Agent architecture and environment consolidated into self-contained sections; new problem-setting section formalizing the asynchronous event model; evaluation reorganized by experiment with results reported alongside each protocol; added action-simulator audit, and human-steering analyses; other sections rewritten

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17192 2026-08-03 cs.AI 版本更新 57%

Shall We Play a Game? Language Models for Open-ended Wargames

我们要玩一场游戏吗?用于开放式兵棋推演的语言模型

Glenn Matlin, Isaac Song, Yixiong Hao, Parv Mahajan, Evan Montoya, Ryan Bard, Stuart R. Topp, Anthony Wen-Ming Zang, Mohammed Rehan Parwani, Soham Shetty, Mark Riedl

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 该研究通过对223篇相关论文的范围综述,明确了兵棋推演中语言模型的控制角色现状,指出需关注模型对行动与后果的控制程度以保障模拟保真度。

Comments 49 pages (9-page body), 3 figures. Published at the Social Sim'26 Workshop at COLM 2026 (non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视觉空间推理 3 篇

2607.17977 2026-08-03 cs.RO 版本更新 67%

RynnBrain 1.1: Towards More Capable and Generalizable Embodied Foundation Model

RynnBrain 1.1:迈向更具能力和通用性的具身基础模型

Kehan Li, Bohan Hou, Minghao Zhu, Tianyi Zhang, Zesen Cheng, Zhikai Wang, Sicong Leng, Xin Li, Xiao Lin, Biying Yao, Minghua Zeng, Jiangpin Liu, Ronghao Dang, Jiayan Guo, Siteng Huang, Haoyu Zhao, Heng Ping, Yaxi Zhao, Tong Zhao, Kexiang Wang, Tong Lu, Shengke Xue, Jiahao Tang, Yulei Wang, Zejing Wang, Jianwei Gao, Shijian Lu, Chengju Liu, Jianfei Yang, Mingxiu Chen, Deli Zhao

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Hupan Lab(湖畔实验室)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 介绍RynnBrain 1.1具身基础模型家族,其经统一框架训练,相比1.0版本有改进。开发RynnBrain - VLA并部署。该模型在多方面成果显著,初始化策略表现优,联合训练提升了得分和成功率。

Comments KL,BH,MZ,TZ,ZC,ZW,SL,XL,XL,BY,MZ,JL,RD contribute equally. Project Lead: Kehan Li and Xin Li project: https://alibaba-damo-academy.github.io/RynnBrain github: https://github.com/alibaba-damo-academy/RynnBrain huggingface: https://huggingface.co/collections/Alibaba-DAMO-Academy/rynnbrain-11 modelscope: https://modelscope.cn/collections/DAMO_Academy/RynnBrain-11

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09361 2026-08-03 cs.LG cs.AI 版本更新 62%

GeoRA: Geometry-Aware Low-Rank Adaptation for RLVR

GeoRA: 为强化学习可验证奖励设计的几何感知低秩适应

Jiaying Zhang, Lei Shi, Jiguo Li, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He

机构 * Meituan(美团) Peking University(北京大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 GeoRA通过利用RLVR更新子空间的各向异性与压缩性结构,采用SVD提取主方向初始化低秩适配器,冻结残差部分作为结构锚点,从而在数学、医学和编程领域优于现有低秩基线,同时在跨领域任务中表现更佳。

Comments Accepted at ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23125 2026-08-03 cs.LG 版本更新 57%

Self-Boosting Vision-Language Models with Noisy Student On-Policy Self-Distillation

基于有噪学生策略性自蒸馏的自增强视觉语言模型

Shuai Wang, Daoan Zhang, Zhe Tang, Hao Cheng, Jiaheng Wei

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ByteDance Inc.(字节跳动公司) Zhejiang University of Technology(浙江工业大学) Hong Kong Baptist University(香港浸会大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 研究针对视觉语言模型无外部监督难以改进的问题,提出NOPD自蒸馏方法,利用干净与损坏输入预测差异产生自监督信号,在多视觉推理任务中有效,能提升多个模型在多个基准测试中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 测试时计算 5 篇

2604.12088 2026-08-03 cs.SE 版本更新 88%

Think Before You Code: Dual Reasoning for the NLSafety-Utility Trade-Off in LLM Code Generation

结构化安全审计:在LLM生成代码的正确性与内容安全之间平衡

Honghao Tan, Haibo Wang, Shin Hwei Tan

专题命中 测试时计算 :reasoning(title,summary_cn);chain-of-thought(abstract)

AI总结 本文提出NLSafety-Utility Duality Score和Dual Reasoning,通过结构化安全审计和任务导向的代码审查,提升LLM生成代码的安全性和正确性,实验显示其在多个模型上显著提升SUDS评分。

Comments 13 pages. Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026). Artifact: https://doi.org/10.5281/zenodo.19245736

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03438 2026-08-03 cs.AI 版本更新 83%

Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents

具有自适应验证器的多模态强化学习

Reuben Tan, Baolin Peng, Zhengyuan Yang, Hao Cheng, Oier Mees, Theodore Zhao, Andrea Tupini, Isar Meijer, Qianhui Wu, Yuncong Yang, Lars Liden, Yu Gu, Sheng Zhang, Xiaodong Liu, Lijuan Wang, Marc Pollefeys, Yong Jae Lee, Jianfeng Gao

机构 * Microsoft Research(微软研究院) UMass Amherst(马萨诸塞大学阿默斯特分校) ETH Zurich(苏黎世联邦理工学院) UW–Madison(威斯康星大学麦迪逊分校)

专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 本文提出Argos验证器,通过结合SFT数据筛选与RL训练,提升多模态推理模型在空间推理、视觉幻觉及机器人任务中的性能,同时减少奖励黑客问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23614 2026-08-03 cs.CR cs.AI cs.LG hep-th 版本更新 81%

DualityCert: Verifier-Gated Language-Model Repair of Broken Duality Claims in Quantum Field Theory

DualityCert:量子场论中对偶性声明修复的验证器门控语言模型

Xingyang Yu

专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI、cs.LG

AI总结 研究针对量子场论中对偶性声明修复,提出DualityCert验证器。语言模型代理接收错误声明编辑至通过验证,在预注册基准测试中,验证器门控重试等策略在不同模型上有不同表现,各获胜策略都用低成本证书,还发布了相关内容。

Comments 17 pages, 2 figures, 9 tables. v2: added reference and note on concurrent related work. Code, benchmark, and all per-attempt records: https://github.com/xingyang-yu/QFTCert

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10917 2026-08-03 cs.AI 版本更新 57%

Role-Agent: Bootstrapping LLM Agents via Dual-Role Evolution

Role-Agent: 通过双角色演化引导LLM智能体

Xucong Wang, Ziyu Ma, Shidong Yang, Tongwen Huang, Pengkun Wang, Yong Wang, Xiangxiang Chu

机构 * University of Science and Technology of China(中国科学技术大学) AMAP, Alibaba Group(阿里巴巴集团高德地图)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 提出Role-Agent框架,让单个LLM同时作为智能体和环境,通过世界在智能体(WIA)和智能体在世界(AIW)两个组件实现自举协同演化,在多个基准上平均提升超过4%。

Comments 20 pages, including 12 pages of main text and 8 pages of appendix; work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15100 2026-08-03 cs.AI 版本更新 57%

Dual-Dimensional Consistency: Balancing Budget and Quality in Adaptive Inference-Time Scaling

双维度一致性:在适应性推理时间扩展中平衡预算与质量

Rongman Xu, Yifei Li, Tianzhe Zhao, Yanrui Wu, Bo Li, Hang Yan

机构 * Xi’an Jiaotong University(西安交通大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本文提出双维度一致性框架,通过结合置信度加权贝叶斯协议与趋势感知分层剪枝,平衡推理预算与质量,减少10倍以上token消耗并保持高精度。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 复杂问题求解 2 篇

2606.05976 2026-08-03 cs.AI cs.CL 版本更新 84%

The Self-Correction Illusion: Role Relabeling Gates Explicit Error Flagging in Large Language Models

自我修正错觉:LLM 纠正他人但不纠正自己

Kuan-Yen Chen, Fang-Yi Su, Shih-Yen Lin, Bao Li, Jung-Hsien Chiang

机构 * National Taiwan University(国立台湾大学)

专题命中 复杂问题求解 :self-correction(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过保持错误声明字节一致仅改变角色标签,发现 LLM 无法自我修正并非能力缺陷,而是聊天模板角色标签的人为产物,并提出无需训练或模型修改的提示结构干预方法。

Comments 15 pages, 3 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19345 2026-08-03 cs.CL cs.AI 版本更新 81%

Copy Less, Ground More: Overcoming Repetitive Copying in Long-Context Reasoning via Evidence-Aware Reinforcement Learning

少复制,多扎根:通过证据感知强化学习克服长上下文推理中的重复复制

Lizhe Fang, Weizhou Shen, Tianyi Tang, Yisen Wang

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究长上下文推理中语言模型的重复复制问题,提出GEAR奖励塑造方法,通过区分关键证据和干扰上下文来增强奖励信号,经实验验证该方法能提升模型性能,减少重复复制,凸显准确扎根证据对长上下文推理的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 推理评测 7 篇

2605.16301 2026-08-03 cs.CY cs.AI cs.LG 版本更新 81%

Do LLMs Hold Their Values? MANTA: A Multi-Turn Adversarial Benchmark for Animal Welfare Reasoning

LLMs 是否坚持其价值观?MANTA:一个用于动物福利推理的多轮对抗性基准

Isabella Luong, Joyee Chen, Sankalpa Ghose, David Williams-King, Linh Le, Allen Lu

机构 * SPAR Compassion Aligned Machine Learning(同情对齐机器学习) NUS(新加坡大学) Mila(Mila研究所) ERA Cambridge(剑桥ERA)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出 MANTA 基准,通过多轮对抗性对话评估大语言模型在动物福利推理中的价值观稳定性和道德敏感性,发现单轮基准无法捕捉的排名变化和物种-压力交互效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07699 2026-08-03 cs.CL cs.AI 版本更新 76%

DRIP-R: A Benchmark for Decision-Making and Reasoning Under Real-World Policy Ambiguity in the Retail Domain

DRIP-R:零售领域决策与推理在现实政策模糊性下的基准测试

Hsuvas Borkakoty, Sebastian Pohl, Cheng Wang, Bei Chen, Yufang Hou

机构 * Interdisciplinary Transformation University Austria(跨学科转型大学奥地利) Amazon Berlin(亚马逊柏林)

专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.AI

AI总结 DRIP-R基准测试通过现实零售政策模糊性构建无唯一正确解决方案的场景,评估LLM在模糊政策下的决策与推理能力,揭示其固有的系统性挑战。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19827 2026-08-03 cs.CL cs.AI cs.IR 版本更新 62%

When Iterative RAG Beats Ideal Evidence: A Diagnostic Study in Scientific Multi-hop Question Answering

当迭代RAG优于理想证据:科学多跳问答中的诊断研究

Mahdi Astaraki, Mohammad Arshi Saloot, Ali Shiraee Kasmaee, Hamidreza Mahyar, Soheila Samiee

机构 * Faculty of Engineering, McMaster University, Canada(麦斯特大学工程学院,加拿大) BASF Canada Inc., Canada(巴斯夫加拿大公司,加拿大)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 通过化学多跳问答数据集,诊断发现迭代检索-推理循环在科学领域显著优于静态RAG上限,揭示了阶段式检索的优势与失败模式。

Comments 51 pages, 29 figures, Published in Transactions on Machine Learning Research (05/2026). OpenReview: https://openreview.net/forum?id=pa5TnBdyDP

Journal ref Transactions on Machine Learning Research (05/2026), ISSN 2835-8856

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22546 2026-08-03 cs.CL cs.AI 版本更新 62%

Towards the Holographic Characteristic of LLMs for Efficient Short-text Generation

向LLMs的全息特性迈进:为高效短文本生成而努力

Shun Qian, Bingquan Liu, Chengjie Sun, Zhen Xu, Baoxun Wang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Platform and Content Group, Tencent(腾讯平台与内容组)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出HOLO插件,利用语言模型的全息特性提升短文本生成效率,通过提取目标关键词并补充平行文本生成,实现高效生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19063 2026-08-03 cs.AI 版本更新 57%

Quality Action Assurance: Multimodal Verification of Examiner Claims in VR OSCEs

质量行动保证:虚拟现实客观结构化临床考试中考官声明的多模态验证

Harry Rogers, Sally Shiels, Ashley Tomlinson, James Thomas, James Aylward, Nathan Gauge, Helen Higham, Alison Noble

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究针对VR儿科OSCEs中考官评分受主观因素影响问题,提出多模态框架QAA,结合约束时间动作对齐模型与大语言模型,通过对比动作与真实事件序列验证考官声明,提升了评估的公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02854 2026-08-03 cs.AI 版本更新 57%

M3MAD-Bench: Multi-Dimensional Evaluation of Multi-Agent Debate Across Domains and Modalities

M3MAD-Bench: 多智能体辩论在不同领域和模态中真的有效吗?

Ao Li, Jinghui Zhang, Luyu Li, Yuxiang Duan, Lang Gao, Mingcai Chen, Weijun Qin, Shaopeng Li, Fengxian Ji, Ning Liu, Lizhen Cui, Xiuying Chen, Yuntao Du

机构 * Shandong University(山东大学) MBZUAI Nanjing University of Posts and Telecommunications(南京邮电大学) BOB Cloud(BOB云)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 M3MAD-Bench通过多领域、多模态和多维指标评估多智能体辩论方法的有效性,提供全面的性能-成本分析。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏