arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10451 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10451 篇

2607.12058 2026-07-15 cs.SE cs.AI cs.CR 新提交 70%

AutoTrace: From Patches to Triggers via Agentic Interprocedural Exploration

AutoTrace:通过智能过程间探索从补丁到触发器

Arastoo Zibaeirad, Marco Vieira, Thomas Zimmermann

专题命中 推理评测 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 研究针对修复漏洞提交的触发器定位难题,提出AutoTrace智能管道逐层探索代码属性图定位漏洞触发器,并构建SinkTrace - Bench数据集。AutoTrace在基准测试中表现出色,还揭示了前沿语言模型在因果推理上的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03704 2026-07-07 cs.CL 新提交 70%

Optimizing Large Language Models for Causality Assessment in Pharmacovigilance: Developing a Performance Metric as Objective for Bayesian Hyperparameter Optimization

优化用于药物警戒中因果关系评估的大语言模型:开发一种性能指标作为贝叶斯超参数优化的目标

Nicole Sonne Heckmann, Arnault-Quentin Vermillet, Søren Norlin Mølgaard, Manuela Del Castillo Suero, Lars Melskens, Gerard Ompad, Maurizio Sessa

机构 * Department of Drug Design and Pharmacology, University of Copenhagen(哥本哈根大学药物设计与药理学系) Safety Operations, Novo Nordisk(诺和制药安全运营部) Clinical Development Centre Denmark, Novo Nordisk(丹麦临床开发中心,诺和制药) Statistical Data Science Lead, Pfizer(辉瑞统计数据科学负责人)

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 研究针对药物警戒中因果关系评估优化大语言模型,开发高斯过程兼容的优化目标,用链思维提示评估GPT-5.2,通过贝叶斯优化研究温度优化效果,EWACS指标优化提升了因果关系分类一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02680 2026-07-07 cs.CV cs.AI 新提交 70%

K9-Bench: Evaluating Multimodal LLMs on Canine-Centric Videos

K9-Bench:在以犬类为中心的视频上评估多模态大语言模型

Khush Attarde, Yusuf Ali, Megha Thukral, Divye Bhutani, Thomas Ploetz, Zsolt Kira

机构 * Ogmen Robotics Inc.(Ogmen机器人公司) Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 介绍K9-Bench基准,通过约5000个问答对测试多模态大语言模型对犬类动作和互动理解。提出数据生成管道创建数据集,发现前沿模型在犬类任务上零样本性能有限,还提供通用数据集构建管道。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24155 2026-07-07 cs.CL 新提交 70%

MedBench v5: A Dynamic, Process-Oriented, and Hallucination-Aware Benchmark for Clinical Multimodal Models

MedBench v5:面向临床多模态模型的动态、过程导向且幻觉感知的基准

Jinru Ding, Chuchu Jiang, Lu Lu, Wenrao Pang, Mouxiao Bian, Zhuangzhi Gao, Jiangyuan Chen, Xinwei Peng, Ruiyao Chen, Sijie Ren, Renjie Lu, Yun Zhong, Bin Han, Meiling Liu, Jie Xu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 推理评测 :reasoning(abstract);self-correction(abstract);分类 cs.CL

AI总结 提出MedBench v5,通过双维框架、可切换信息流压力源、动态过程审计协议和幻觉传播监控,实现临床多模态模型的动态过程评估与幻觉检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04136 2026-07-07 cs.AI 版本更新 70%

A Technical Survey of Reinforcement Learning Techniques for Large Language Models

大语言模型强化学习技术的技术综述

Saksham Sahai Srivastava, Vaneet Aggarwal

机构 * University of Georgia(佐治亚大学) Purdue University(普渡大学)

专题命中 推理评测 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 综述强化学习与语言模型整合,介绍如近端策略优化等算法,分析其在各领域应用,对失败模式算法分析,给出分类法,评估趋势并探讨挑战与新兴方向,为研究提供路线图。

Comments Accepted to ACM Transactions on Intelligent Systems and Technology, June 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31308 2026-07-01 cs.AI 新提交 70%

Benchmarking Large Language Models on Floating-Point Error Classification

大型语言模型在浮点错误分类上的基准测试

Lisa Taldir, Muhammad Ahmad Saeed, David Defour, Pablo de Oliveira Castro, Eric Petit

专题命中 推理评测 :reasoning(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出InterFLOPBench基准,评估14个LLM在六类浮点错误上的静态检测性能,最新模型整体F1超过0.88。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29130 2026-06-30 cs.CL 70%

DistilledGemma: Balanced Efficiency-Accuracy for Person-Place Relation Extraction from Multilingual Historical Articles

DistilledGemma:面向多语言历史文章的人物-地点关系提取的平衡效率与准确性

Youssef Aboelwafa, Ahmed Samir, Nagwa Elmakky, Marwan Torki

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 提出DistilledGemma系统,采用三阶段知识蒸馏管道,从26B教师模型蒸馏到2.3B学生模型,在HIPE-2026共享任务中实现高效准确的人物-地点关系提取,标准测试集排名第三,二进制测试集排名第二。

Comments The Conference and Labs of the Evaluation Forum (CLEF) 2026 - HIPE Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28385 2026-06-30 cs.RO cs.AI 70%

RoboGaze: Evaluating Robot World Models via Structured Vision-Language Analysis

RoboGaze: 通过结构化视觉-语言分析评估机器人世界模型

Minh-Loi Nguyen, Nghiem Tuong Diep, Hung Khang Nguyen, Minh Le, Doanh Le Thien, Hoang H. Tran, Dung D. Le, Vu N. Duong, Daniel Sonntag, An Thai Le, Duy Minh Ho Nguyen, Vien Anh Ngo, Tran Van Nhiem

机构 * Ho Chi Minh City University of Science, Vietnam National University(越南国家科学大学胡志明市大学) VinRobotics VinUniversity German Research Center for AI (DFKI)(人工智能研究中心(DFKI)) University of Stuttgart(斯图加特大学) Max Planck Research School for Intelligent Systems(智能系统马克斯·普朗克研究学校) Technische Universität Darmstadt(达姆施塔特技术大学)

专题命中 推理评测 :planning(abstract);verifier(abstract);分类 cs.AI

AI总结 提出RoboGaze,一种无需训练的多智能体VLM框架,通过任务-场景对齐、维度专家路由和批评验证三阶段流水线,对机器人操作视频进行结构化可解释评估,显著提升描述F1和时序对齐性能。

Comments First version 29 pages, 7 figures. Project webpage: https://robogaze-eval.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00616 2026-06-30 cs.CV cs.AI 70%

Pause and Think: A Dataset and Benchmark for Video-Grounded Assistive Action Suggestion

暂停与思考:面向视频基础辅助动作建议的数据集与基准

Shivam Singh, Saptarshi Majumder, Pratik Prabhanjan Brahma, Zicheng Liu, Emad Barsoum

机构 * Advanced Micro Devices, Inc.(先进微器件公司)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 提出 pause-and-think-T 数据集和 pause-and-think-B 基准,通过推理监督训练紧凑模型,在视频场景理解与目标规划任务中达到与大型模型相当的性能。

Comments Accepted in IROS 2026 (IEEE/RSJ International Conference on Intelligent Robots and Systems)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27608 2026-06-29 cs.CV cs.LG 新提交 70%

Qwen-Image-2.0-RL Technical Report

Qwen-Image-2.0-RL 技术报告

Yixian Xu, Kaiyuan Gao, Yuxiang Chen, Yilei Chen, Zecheng Tang, Zihao Liu, Zikai Zhou, Deqing Li, Hao Meng, Kuan Cao, Jiahao Li, Jie Zhang, Liang Peng, Lihan Jiang, Ningyuan Tang, Shengming Yin, Tianhe Wu, Xiaoyue Chen, Yan Shu, Yanran Zhang, Yi Wang, Yu Wu, Yujia Wu, Zekai Zhang, Zhendong Wang, Xiao Xu, Kun Yan, Chenfei Wu

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 提出基于强化学习与在线蒸馏的后训练流程,通过复合奖励模型和GRPO框架提升扩散模型的视觉质量与指令遵循能力,在多个基准上取得显著提升。

Comments 16 pages, 6 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27397 2026-06-29 cs.MA cs.AI cs.GT 新提交 70%

SidConArena: An Environment Evaluating Agents in Open-Ended,Positive-Sum Bargaining Game

SidConArena:一个在开放、正和博弈中评估智能体的环境

Yeqi Feng, Yuxin Chen, Tianxing He

机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 提出SidConArena基准框架,通过三阶段部分可观测随机博弈评估LLM智能体在开放、正和谈判中的经济决策能力,发现前沿模型虽表现更好但仍存在资源误估、谈判被动和长期规划不足。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24747 2026-06-24 cs.AI cs.CE 新提交 70%

Scaling Laws for Task-Specific LLM Distillation

任务特定LLM蒸馏的缩放定律

Lavinia Ghita, Dhruv Desai, Ioana Boier

机构 * NVIDIA(英伟达)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文推导了领域特定LLM压缩的经验缩放定律,通过定量金融领域的实验,比较了基于logit和LoRA的蒸馏方法,并引入混合思维链监督损失,揭示了监督格式对领域知识与通用知识权衡的关键作用。

Comments 24 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24370 2026-06-24 cs.AI cs.CY 新提交 70%

When Helpfulness Overrides Causal Caution: Context-Dependent Suppression and Recovery in LLMs

当有用性凌驾于因果谨慎之上:LLM中的上下文依赖抑制与恢复

Hiroshi Okumura

机构 * Mitsubishi Research Institute, Inc.(三菱电机研究所) Kobe University(北九州市立大学)

专题命中 推理评测 :reasoning(abstract);self-correction(abstract);分类 cs.AI

AI总结 研究LLM从学术到实践咨询语境中因果谨慎的系统性抑制,发现有用性导向响应模式导致因果谨慎表达大幅下降,而自纠正提示可有效恢复。

Comments 43 pages, 3 figures, 5 tables. SSRN Abstract ID: 6965680

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13909 2026-06-16 cs.GT cs.AI 版本更新 70%

TERMS-Bench: Diagnosing LLM Negotiation Agents Beyond Deal Rate

TERMS-Bench: 在交易率之外评估大语言模型谈判代理

Erica Zhang, Fangzhao Zhang, Aneesh Pappu, Batu El, Jose Blanchet, Susan Athey, Jiashuo Liu, James Zou

机构 * Stanford School of Engineering(斯坦福大学工程学院) Stanford Department of Economics(斯坦福大学经济系) Stanford Graduate School of Business(斯坦福商学院)

专题命中 推理评测 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 TERMS-Bench通过博弈论框架评估谈判代理,揭示其在交易率之外的性能差异,如盈余提取、线索使用和合规性。

Comments Project Site: https://terms-bench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05782 2026-06-15 cs.CL 版本更新 70%

FineDialFact: A benchmark for Fine-grained Dialogue Fact Verification

FineDialFact:细粒度对话事实验证基准

Xiangyan Chen, Yufeng Li, Yujian Gan, Arkaitz Zubiaga, Matthew Purver

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 针对对话系统幻觉检测中事实标签粗粒度的问题,提出细粒度对话事实验证基准FineDialFact,基于公开数据集构建并评估多种基线方法,实验表明思维链推理可提升性能,但最佳F1仅0.74,任务仍具挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12657 2026-06-12 cs.AI cs.DB cs.RO 新提交 70%

TrajGenAgent: A Hierarchical LLM Agent for Human Mobility Trajectory Generation

TrajGenAgent: 一种用于人类移动轨迹生成的分层LLM智能体

Siyu Li, Toan Tran, Lingyi Zhao, Khurram Shafique, Li Xiong

机构 * Emory University(埃默里大学) University of Florida(佛罗里达大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 提出TrajGenAgent,一种无需微调的分层LLM智能体框架,通过编排器-工作者两阶段设计生成真实轨迹,在时空保真度、语义一致性和个体行为真实性上优于现有方法。

Comments 14 pages, 2 figures, 8 tables. Accepted by the 27th IEEE International Conference on Mobile Data Management (MDM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12160 2026-06-12 cs.CL 新提交 70%

A Controlled Study of Decoding-Time Truthfulness Methods on Instruction-Tuned LLMs

指令调优大语言模型解码时真实性方法的受控研究

Ao Sun

机构 * Independent Researcher(独立研究员)

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 本研究通过分析每层令牌logits特征,提出CHAIR框架检测幻觉,在TruthfulQA和MMLU上显著提升零样本检测准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11909 2026-06-11 cs.AI 新提交 70%

Embodied-BenchClaw: An Autonomous Multi-Agent System for Embodied Spatial Intelligence Benchmark Construction

Embodied-BenchClaw:用于具身空间智能基准构建的自主多智能体系统

Baoyang Jiang, Fengchun Zhang, Leyuan Wang, Haotian Li, Yida Wang, Zhe Ji, Jinshan Lai, Xi Ren, Jianwei Hu, Qiang Ma

机构 * QiYuan Lab(启元实验室) School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院) Beijing University of Posts and Telecommunications(北京邮电大学) School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 提出Embodied-BenchClaw,一个通过五阶段流水线和三个智能体协调的自主系统,自动构建可验证、可执行、可维护且诊断有用的具身空间智能基准,减少人工工作量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07682 2026-06-09 cs.SE cs.AI 新提交 70%

SWE-Marathon: Can Agents Autonomously Complete Ultra-Long-Horizon Software Work?

SWE-Marathon: 智能体能否自主完成超长时程软件工作?

Rishi Desai, Jesse Hu, Joan Cabezas, Neel Harsola, Pratyush Shukla, Roey Ben Chaim, Adnan El Assadi, Omkaar Mukund Kamath, Fenil Faldu, Prannay Hebbar, Jiankai Sun, Yiyuan Li, Pramod Srinivasan, Ishan Gupta, Christopher Settles, Daniel Wang, Derek Chen, Pranav Raja, Albert Liu, Marek Šuppa, Nevasini Sasikumar, Luyang Kong, Erik Quintanilla, Xiangyi Li, Ivan Bercovich, Steven Dillmann

机构 * Abundant Zenity Harvard University(哈佛大学) University of Waterloo(滑铁卢大学) Gujarat Technological University(古吉拉特技术大学) Warping Stanford University(斯坦福大学) UNC-Chapel Hill(北卡罗来纳大学教堂山分校) Independent(独立) Refresh Soleda AI Near AI Georgia Tech(佐治亚理工学院) Comenius University in Bratislava(布拉迪斯拉发Comenius大学) UC San Diego(圣地亚哥大学) BenchFlow UC Santa Barbara(圣巴巴拉大学)

专题命中 推理评测 :planning(abstract);verifier(abstract);分类 cs.AI

AI总结 提出SWE-Marathon基准,包含20个超长时程任务,平均消耗2720万token,评估智能体在规划、长上下文理解和记忆方面的能力,当前前沿编码智能体解决率低于30%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06219 2026-06-05 cs.RO cs.AI 70%

CLEAR: Cognition and Latent Evaluation for Adaptive Routing in End-to-End Autonomous Driving

CLEAR:端到端自动驾驶中的认知与潜在评估自适应路由

Yining Xing, Zehong Ke, Zhiyuan Liu, Yanbo Jiang, Wenhao Yu, Jianqiang Wang

机构 * Qwen 3.5 0.8B

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 提出CLEAR框架,通过单步条件漂移替代扩散模型的多步去噪,结合视觉编码器Drive-JEPA和微调Qwen 3.5 0.8B进行语义推理,实现高效多模态规划,在NAVSIM v1上达到93.7 PDMS。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06217 2026-06-05 cs.CV cs.AI 70%

DisasterBench: A Multimodal Benchmark for UAV-Based Disaster Response in Complex Environments

DisasterBench: 复杂环境中基于无人机灾害响应的多模态基准

Tan Zhang, Quanyou Li, Lu Zhang, Jun Liu, Xiaofeng Zhu, Ping Hu

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 提出DisasterBench多模态基准,涵盖14种灾害场景和9个响应任务,并设计轻量级模型DisasterVL通过三阶段优化在边缘设备上实现高效推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03284 2026-06-03 cs.CL 70%

SEA-NLI: Natural Language Inference as a Lens into Southeast Asian Cultural Understanding

SEA-NLI:将自然语言推理作为理解东南亚文化的透镜

Peerawat Chomphooyod, Jian Gang Ngui, Yosephine Susanto, Attapol T. Rutherford, Alham Fikri Aji, Sarana Nutanong, Can Udomcharoenchaikit, Peerat Limkonchotiwat

专题命中 推理评测 :reasoning(abstract);CoT(abstract);分类 cs.CL

AI总结 提出SEA-NLI基准,通过自然语言推理评估模型对东南亚文化的理解,发现现有模型表现不佳,文化适应和提示可提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25902 2026-06-03 cs.LG 70%

Reading the Finetuning Prior: Verbatim Content Recovery via Contrastive Decoding Diffing

读取微调先验:通过对比解码差异进行逐字内容恢复

Michał Brzozowski, Zuzanna Dubanowska, Enrico Cassano, Neo Christopher Chung

机构 * Samsung AI Center(三星人工智能中心) University of Turin(都灵大学) University of Warsaw(华沙大学)

专题命中 推理评测 :CoT(abstract,abstract_cn);分类 cs.LG

AI总结 提出对比解码差异(CDD)方法,仅基于输出层logit分布,无需权重或内部访问,即可从微调模型中逐字恢复植入事实,并在多种架构和场景下优于白盒方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00931 2026-06-02 cs.CV cs.AI 70%

CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences

CV-Arena: 面向教学计算机视觉问题求解的开放基准与人类-AI协作偏好

Fangzhou Lin, Peiran Li, Lingyu Xu, Wenjing Chen, Qianwen Ge, Shuo Xing, Mingyang Wu, Xiangbo Gao, Siyuan Yang, Kazunori Yamada, Ziming Zhang, Haichong Zhang, Zhen Dong, Ming-Hsuan Yang, Zhengzhong Tu

机构 * Texas A&M University(德克萨斯A&M大学) Worcester Polytechnic Institute(沃斯特理工大学) Tohoku University(东北大学) Georgia Institute of Technology(佐治亚理工学院) NVIDIA(英伟达) UCSB(加州大学圣塔芭芭拉分校) UC Merced(加州大学默塞德分校)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 提出CV-Arena基准,包含12K高分辨率真实图像指令对,覆盖16种任务类型,并采用Active Elo协议结合人类与AI偏好评估21个系统,揭示指令遵循、物理推理等方面的差距,同时开发CV-Agent代理模型展示闭环推理的潜力。

Comments 26 pages, 7 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00986 2026-06-02 cs.CL 70%

ADRA-Bank: A Modular Benchmark for Academic Deep Research Agents

ADRA-Bank:面向学术深度研究智能体的模块化基准

Zhihan Guo, Feiyang Xu, Yifan Li, Muzhi Li, Shuai Zou, Jiele Wu, Han Shi, Haoli Bai, Ho-fung Leung, Irwin King

机构 * The Chinese University of Hong Kong, Hong Kong SAR, China(香港中文大学) Hong Kong Polytechnic University, Hong Kong SAR, China(香港理工大学) National University of Singapore, Singapore, Singapore(新加坡国立大学) Huawei Technologies, Hong Kong SAR, China(华为技术有限公司) Independent(独立)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 针对现有基准侧重检索而忽视规划与推理、且缺乏学术领域覆盖的问题,提出ADRA-Bank模块化基准,包含10个学术领域的200个人工标注实例,并设计ADRA-Eval评估范式,通过端到端和隔离评估两种模式测试规划、检索和推理能力,揭示智能体在跨源检索和跨领域一致性上的不足,并指出提升高层规划能力是释放基础LLM推理潜力的关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30802 2026-06-01 cs.MA cs.AI 70%

Design and Evaluation of Multi-Agent AI Oracle Systems for Prediction Market Resolution

用于预测市场决议的多智能体AI预言机系统的设计与评估

Tarun Kota

机构 * Yale University(耶鲁大学)

专题命中 推理评测 :reasoning(abstract);self-correction(abstract);分类 cs.AI

AI总结 本研究设计并评估了多智能体LLM架构作为预测市场决议的预言机,通过独立聚合与协商共识两种机制,在KalshiBench数据集上对比单模型基线,发现置信度加权投票的独立聚合达到83.43%准确率,而协商共识因错误传播性能下降,并提出了混合AI-人类预言机的路由标准。

Comments 34 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30358 2026-06-01 cs.LG quant-ph 70%

QASM-Eval: A Dataset to Train and Evaluate LLMs on OpenQASM-3 Beyond Quantum Circuits

QASM-Eval:用于训练和评估LLM在超越量子电路的OpenQASM-3上的数据集

Zhenxiao Fu, Lei Jiang, Fan Chen

机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 推理评测 :reasoning(abstract);verifier(abstract);分类 cs.LG

AI总结 针对LLM在OpenQASM-3硬件级编程上的训练与评估空白,构建了包含专家验证测试集和训练集的数据集,覆盖经典逻辑、时序调度、脉冲控制等,并通过扩展验证器自动验证,实验表明微调后LLM性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00349 2026-06-01 cs.AI 70%

Debate with Images: Detecting Deceptive Behaviors in Multimodal Large Language Models

图像辩论:检测多模态大语言模型中的欺骗行为

Sitong Fang, Shiyi Hou, Kaile Wang, Boyuan Chen, Donghai Hong, Jiayi Zhou, Josef Dai, Yaodong Yang, Jiaming Ji

机构 * Institute of Artificial Intelligence, Peking University(北京大学人工智能研究院)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出 MM-DeceptionBench 基准和基于图像辩论的多智能体监控框架,系统揭示并量化多模态大语言模型中的欺骗风险,有效提升欺骗行为检测能力。

Comments 39 pages, 16 figures, camera ready version for ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29800 2026-05-29 cs.CL 70%

Nine Judges, Two Effective Votes: Correlated Errors Undermine LLM Evaluation Panels

九位评委,两张有效选票:相关错误削弱了LLM评估小组

Guneet Kohli

机构 * Apple(苹果公司)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文通过分析9个前沿LLM在自然语言推理任务上的投票行为,发现由于模型间存在高度相关的错误,评估小组的有效信息仅相当于约2个独立投票,实际准确率比独立投票理想情况低8-22个百分点,且增加评委或改进聚合算法均无法弥补这一差距。

Comments 14 pages, 5 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29585 2026-05-29 cs.CL 70%

World Models in Words: Auditing Physical State-Transition Commitments in Vision-Language Models

语言中的世界模型:审计视觉语言模型中的物理状态转换承诺

Emmanuelle Bourigault

机构 * University of Oxford(牛津大学)

专题命中 推理评测 :reasoning(abstract);verifier(abstract);分类 cs.CL

AI总结 提出WMW框架,通过要求VLM输出结构化轨迹(初始状态、状态转换、结果状态和答案)并利用混合验证器检查模式有效性、状态基础、转换一致性和答案-轨迹兼容性,揭示仅评估最终答案所隐藏的物理推理失败。

Comments 8 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏