arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10379 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10379 篇

2605.28422 2026-05-28 cs.CV cs.AI 83%

VITAL: Visual-Semantic Dual Supervision for Enhanced and Interpretable Latent Reasoning in Medical MLLMs

VITAL: 视觉-语义双重监督增强可解释的医学多模态大语言模型潜在推理

Qiaoru Li, Shaotian Liang, Jintao Chen, Haoran Sun, Yuxiang Cai, Jianwei Yin, Yankai Jiang

机构 * Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室) Tencent(腾讯) Ningbo Global Innovation Center, Zhejiang University(宁波全球创新中心,浙江大学) Zhejiang Key Laboratory of Digital-Intelligence Service Technology(浙江省数字智能服务技术重点实验室)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 提出VITAL框架,通过视觉-语义双重监督(文本解码器重构推理链、视觉投影器回归ROI特征)实现医学MLLM的可解释潜在推理,在7个基准上达到SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22389 2026-05-22 cs.CL 83%

Unified Data Selection for LLM Reasoning

统一的数据选择用于LLM推理

Xiaoyuan Li, Yubo Ma, Chengpeng Li, Fengbin Zhu, Yiyao Yu, Keqin Bao, Wenjie Wang, Fuli Feng, Dayiheng Liu

机构 * University of Science and Technology of China(中国科学技术大学) Alibaba Group(阿里巴巴集团) National University of Singapore(新加坡国立大学)

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract);分类 cs.CL

AI总结 本文提出了一种无需训练的高熵和(HES)指标,用于评估和选择高质量的推理样本,通过在三种主流训练范式(监督微调、拒绝微调和强化学习)中验证,证明了其在提高LLM推理性能和减少计算开销方面的有效性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05679 2026-05-19 cs.LG 83%

Do Sparse Autoencoders Identify Reasoning Features in Language Models?

稀疏自编码器是否在语言模型中识别推理特征?

George Ma, Zhongyuan Liang, Irene Y. Chen, Somayeh Sojoudi

机构 * UC Berkeley(加州大学伯克利分校) UCSF(旧金山大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 研究稀疏自编码器在大语言模型中识别推理相关内部特征的可靠性,提出基于因果token注入的评估框架,发现许多候选特征对token级干预敏感,需通过反证法验证其推理相关性。

Comments In Forty-Third International Conference on Machine Learning (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15513 2026-05-18 cs.AI 83%

CAPS: Cascaded Adaptive Pairwise Selection for Efficient Parallel Reasoning

CAPS:级联自适应成对选择用于高效的并行推理

Fangzhou Lin, Shuo Xing, Peiran Li, Siyuan Yang, Qianwen Ge, Kazunori Yamada, Ziming Zhang, Haichong Zhang, Zhengzhong Tu

机构 * Texas A&M University(德克萨斯大学) Worcester Polytechnic Institute(沃斯特理工大学) Tohoku University(东北大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理评测 :reasoning(title,abstract);verifier(abstract);分类 cs.AI

AI总结 CAPS通过级联自适应成对选择方法,在保持高效并行推理的同时,减少验证器的计算成本,优于现有成对验证方法。

Comments 31 pages, 2 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12524 2026-05-14 cs.LO cs.AI 83%

Stress-Testing the Reasoning Competence of LLMs With Proofs Under Minimal Formalism

用最小形式主义对LLM推理能力进行压力测试:通过证明

Konstantine Arkoudas, Serafim Batzoglou

专题命中 推理评测 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 ProofGrid通过机器可验证的证明评估LLM推理能力,涵盖证明写作、检查、遮蔽和补全等任务,采用简洁形式化符号,提供可重复、细粒度的评估方法,揭示当前模型在复杂推理任务上的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08178 2026-05-12 cs.AI 83%

Aligning Agents via Planning: A Benchmark for Trajectory-Level Reward Modeling

通过规划对齐代理:一个轨迹级奖励建模的基准测试

Jiaxuan Wang, Yulan Hu, Wenjin Yang, Zheng Pan, Xin Li, Lan-Zhe Guo

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) AMAP, Alibaba Group(阿里集团AMAP)

专题命中 推理评测 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 本文提出Plan-RewardBench,用于评估奖励模型在复杂工具使用场景中区分优选与干扰代理轨迹的能力,揭示了代理级奖励建模在长周期轨迹上的挑战。

Comments accepted to ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22919 2026-05-12 cs.CL 83%

ER-Reason: A Benchmark Dataset for LLM Clinical Reasoning in the Emergency Room

ER-Reason:用于急诊科大型语言模型临床推理的基准数据集

Nikita Mehandru, Niloufar Golchini, Namrata Garg, Kathy T. LeSaint, Christopher J. Nash, Anu Ramachandran, Travis Zack, Liam G. McCoy, Adam Rodman, David Bamman, Melanie Molina, Ahmed Alaa

机构 * University of California, Berkeley(加州大学伯克利分校) University of California, San Francisco(加州大学旧金山分校) Duke University(杜克大学) University of Alberta(阿尔伯塔大学) Beth Israel Deaconess Medical Center(贝斯以色列德aconess医疗中心) UC Berkeley and UCSF(伯克利大学和旧金山分校)

专题命中 推理评测 :reasoning(title,abstract);planning(abstract);分类 cs.CL

AI总结 ER-Reason基准数据集通过真实患者病例评估LLM在急诊流程中逐步推理能力,包含25174份脱敏临床记录,采用Script Concordance Test风格问题测试模型在积累临床证据时的诊断信念更新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21828 2026-04-30 cs.CV cs.CL 83%

Structured and Abstractive Reasoning on Multi-modal Relational Knowledge Images

多模态关系知识图像上的结构化与抽象推理

Yichi Zhang, Zhuo Chen, Lingbing Guo, Wen Zhang, Huajun Chen

机构 * Zhejiang University(浙江大学) Zhejiang University - Ant Group Joint Laboratory of Knowledge Graph(浙江大学-蚂蚁集团知识图谱联合实验室)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出STAR-64K数据集及两阶段增强框架,通过合成多模态指令数据提升模型在抽象推理任务中的性能,实验表明小型模型在STAR任务中超越GPT-4o。

Comments Accepted by Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24512 2026-04-28 cs.AI 83%

Beyond the Attention Stability Boundary: Agentic Self-Synthesizing Reasoning Protocols

超越注意力稳定性边界:代理自我合成推理协议

Dahlia Shehata, Ming Li

机构 * University of Waterloo(滑铁卢大学)

专题命中 推理评测 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文提出SSRP框架,通过分离高层规划与执行流程,解决多轮对话中注意力锁定问题,实验显示其在多任务中显著提升稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17282 2026-04-21 cs.CL 83%

MedPRMBench: A Fine-grained Benchmark for Process Reward Models in Medical Reasoning

MedPRMBench: 一种面向医疗推理过程奖励模型的细粒度基准

Lingyan Wu, Xiang Zheng, Weiqi Zhai, Wei Wang, Xuan Ren, Zifan Zhang, Hu Wei, Bing Zhao

机构 * Alibaba Group(阿里巴巴集团)

专题命中 推理评测 :reasoning(title,abstract);verifier(abstract);分类 cs.CL

AI总结 本文提出MedPRMBench,首个医疗领域过程奖励模型基准,通过三阶段流程生成高质量数据,涵盖14种细粒度错误类型,评估模型在医疗推理中的误差检测能力,提升下游任务准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15808 2026-04-20 cs.CV cs.AI 83%

Beyond a Single Frame: Multi-Frame Spatially Grounded Reasoning Across Volumetric MRI

超越单帧:跨体积MRI的多帧空间接地推理

Lama Moukheiber, Caleb M. Yeung, Haotian Xue, Alec Helbling, Zelin Zhao, Yongxin Chen

机构 * Georgia Institute of Technology(佐治亚理工学院) Harvard University(哈佛大学) Georgetown University(乔治城大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出SGMRI-VQA基准,通过多帧空间接地推理提升医学VLMs性能,展示监督微调提升接地能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06421 2026-04-09 cs.CL 83%

State-of-the-Art Arabic Language Modeling with Sparse MoE Fine-Tuning and Chain-of-Thought Distillation

最先进的阿拉伯语言建模:基于稀疏MoE微调和链式思维蒸馏

Navan Preet Singh, Anurag Garikipati, Ahmed Abulkhair, Jyani Akshay Jagdishbhai, Atul Yaduvanshi, Amarendra Chaudhary, Madalina Ciobanu, Qingqing Mao, Ritankar Das

机构 * Incept Labs(因塞普特实验室)

专题命中 推理评测 :chain-of-thought(title);reasoning(abstract);CoT(abstract);分类 cs.CL

AI总结 本文提出阿拉伯-DeepSeek-R1,通过稀疏MoE架构和链式思维蒸馏,在开放阿拉伯LLM排行榜上实现SOTA,展示了稀疏MoE与文化导向的蒸馏方法在阿拉伯语言任务中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04443 2026-04-07 cs.CL 83%

DeonticBench: A Benchmark for Reasoning over Rules

DeonticBench: 一个用于规则推理的基准

Guangyao Dou, Luis Brena, Akhil Deo, William Jurayj, Jingyu Zhang, Nils Holzenberger, Benjamin Van Durme

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出DeonticBench,包含6232个任务,涵盖美国联邦税收、航空行李政策等真实领域,研究复杂规则推理问题,结合语言推理与符号计算,评估LLM在非符号和符号环境下的规则推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02710 2026-04-06 cs.RO cs.AI cs.CV 83%

V2X-QA: A Comprehensive Reasoning Dataset and Benchmark for Multimodal Large Language Models in Autonomous Driving Across Ego, Infrastructure, and Cooperative Views

V2X-QA:面向自动驾驶多视角的多模态大语言模型综合数据集与基准测试

Junwei You, Pei Li, Zhuoyu Jiang, Weizhe Tang, Zilin Huang, Rui Gan, Jiaxi Liu, Yan Zhao, Sikai Chen, Bin Ran

机构 * Department of Civil and Environmental Engineering, University of Wisconsin–Madison(威斯康星大学麦迪逊分校土木与环境工程系) Department of Civil and Architectural Engineering and Construction Management, University of Wyoming(怀俄明大学土木与建筑工程及施工管理系) School of Transportation, Southeast University(东南大学交通学院)

专题命中 推理评测 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文提出V2X-QA数据集和基准测试,用于评估多模态大语言模型在自动驾驶中的多视角推理能力,揭示视角对性能的影响,并提出V2X-MoE模型以提升多视角推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01657 2026-04-03 cs.CL 83%

What Do Claim Verification Datasets Actually Test? A Reasoning Trace Analysis

声明验证数据集实际上测试什么?一种推理跟踪分析

Delip Rao, Chris Callison-Burch

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 推理评测 :reasoning(title,abstract);verifier(abstract);分类 cs.CL

AI总结 研究通过分析24K个验证案例的推理轨迹,发现数据集主要测试直接证据提取,而多句综合和数值推理不足,不同领域存在显著偏差,提出改进评估体系的建议。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08503 2026-03-31 cs.CV cs.AI 83%

Disrupting Hierarchical Reasoning: Adversarial Protection for Geographic Privacy in Multimodal Reasoning Models

破坏层次推理:多模态推理模型中地理隐私的对抗保护

Jiaming Zhang, Che Wang, Yang Cao, Longtao Huang, Wei Yang Bryan Lim

机构 * Nanyang Technological University(南洋理工大学) Peking University(北京大学) Institute of Science Tokyo(东京科学大学) Alibaba Group(阿里巴巴集团)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出ReasonBreak框架,通过概念感知扰动破坏多模态推理模型中的层次推理,利用GeoPrivacy-6K数据集验证其在提升地理隐私保护效果上的优势。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13232 2026-03-24 cs.CV cs.AI 83%

What "Not" to Detect: Negation-Aware VLMs via Structured Reasoning and Token Merging

不应检测什么:通过结构化推理和标记合并的否定意识VLMs

Inha Kang, Youngsun Lim, Seonho Lee, Jiho Choi, Junsuk Choe, Hyunjung Shim

机构 * KAIST AI(韩国科学技术院人工智能实验室) Boston University(波士顿大学) Sogang University(成均馆大学)

专题命中 推理评测 :reasoning(title);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出CoVAND数据集和NegToMe模块,通过结构化推理和标记合并解决VLMs的否定理解问题,提升检测任务的准确率和泛化能力。

Comments 56 pages

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20637 2026-03-24 cs.SE cs.AI cs.CR 83%

AEGIS: From Clues to Verdicts -- Graph-Guided Deep Vulnerability Reasoning via Dialectics and Meta-Auditing

AEGIS:从线索到结论——通过辩证法和元审计的图引导深度漏洞推理

Sen Fang, Weiyuan Ding, Zhezhen Cao, Zhou Yang, Bowen Xu

机构 * NC State University(北卡罗来纳州立大学) University of Alberta(阿尔伯塔大学)

专题命中 推理评测 :reasoning(title,abstract);verifier(abstract);分类 cs.AI

AI总结 AEGIS通过图引导的深度漏洞推理,结合辩证法和元审计,解决LLM推理不严谨的问题,实现从线索到结论的验证,提升漏洞检测的准确性与可靠性。

Comments 29 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18662 2026-03-20 cs.AI 83%

Thinking with Constructions: A Benchmark and Policy Optimization for Visual-Text Interleaved Geometric Reasoning

通过构造进行思考:一种用于视觉-文本交错几何推理的基准和策略优化

Haokun Zhao, Wanshi Xu, Haidong Yuan, Songjun Cao, Long Ma, Yanghua Xiao

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) School of ECE, Peking University(北京大学电子工程学院) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) Tencent Youtu Lab(腾讯优图实验室)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出GeoAux-Bench基准和A2PO策略优化框架,通过交错视觉-文本辅助工具提升几何推理性能,实验表明有效构造能降低推理困惑度,使MLLMs在选择性辅助构造上获得3.51%的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15397 2026-03-17 cs.CR cs.AI 83%

SFCoT: Safer Chain-of-Thought via Active Safety Evaluation and Calibration

SFCoT:通过主动安全评估和校准实现更安全的推理链

Yu Pan, Wenlong Yu, Tiejun Wu, Xiaohu Ye, Qiannan Si, Guangquan Xu, Bin Wu

机构 * Department College of Intelligence and Computing(智能与计算学院) Tianjin University(天津大学) NSFOCUS Technologies Group Co., Ltd.(NSFOCUS技术集团有限公司) College of Management and Economics(管理与经济学院) School of Cyber Security(网络安全学院)

专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 本文提出SFCoT框架,通过实时评估和校准潜在不安全的推理步骤,有效降低对抗攻击成功率,提升大语言模型的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09556 2026-03-11 cs.CL 83%

ALARM: Audio-Language Alignment for Reasoning Models

ALARM:用于推理模型的音频-语言对齐

Petr Grinberg, Hassan Shahmohammadi

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 ALARM通过自我改写和多编码器融合,提升推理模型的音频理解能力,实现更高效的音频推理性能。

Comments Submitted to Interspeech2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13217 2026-02-17 cs.AI 83%

VeRA: Verified Reasoning Data Augmentation at Scale

VeRA: 在大规模上验证推理数据增强

Zerui Cheng, Jiashuo Liu, Chunjie Wu, Jianzhu Yao, Pramod Viswanath, Ge Zhang, Wenhao Huang

机构 * Princeton University(普林斯顿大学)

专题命中 推理评测 :reasoning(title,abstract);verifier(abstract);分类 cs.AI

AI总结 VeRA通过验证推理数据增强框架,实现大规模、可靠的评估基准生成,提升评估的稳健性和成本效益。

Comments 36 pages; VeRA technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11170 2026-02-13 cs.CL 83%

PRIME: Policy-Reinforced Iterative Multi-agent Execution for Algorithmic Reasoning in Large Language Models

PRIME:基于策略强化的迭代多智能体执行框架用于大语言模型中的算法推理

Jiawei Xu, Zhenyu Yu, Ziqian Bi, Minh Duc Pham, Xiaoyi Qu, Danyang Zhang

机构 * Purdue University(普渡大学) University of Malaya(马来亚大学) Faculty of Information Technology, Beijing University of Technology(北京理工大学信息学院) School of Computer Science, Georgia Institute of Technology(佐治亚理工学院计算机科学学院) Department of Industrial and Systems Engineering, Lehigh University(莱斯大学工业与系统工程系)

专题命中 推理评测 :reasoning(title,abstract);verifier(abstract);分类 cs.CL

AI总结 PRIME通过多智能体框架提升大语言模型在算法推理中的性能,显著提高复杂任务的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10357 2026-02-11 cs.AI 83%

Optimus-3: Dual-Router Aligned Mixture-of-Experts Agent with Dual-Granularity Reasoning-Aware Policy Optimization

Optimus-3: 具有双粒度推理感知策略优化的双路由对齐专家混合代理

Zaijing Li, Yuquan Xie, Rui Shao, Gongwei Chen, Weili Guan, Dongmei Jiang, Yaowei Wang, Liqiang Nie

机构 * School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen Campus)(计算机科学与技术学院,哈尔滨工业大学(深圳校区)) Pengcheng Laboratory(鹏城实验室) School of Information Science and Technology, Harbin Institute of Technology (Shenzhen Campus)(信息科学与技术学院,哈尔滨工业大学(深圳校区)) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 推理评测 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 Optimus-3通过双路由对齐专家混合架构和双粒度推理感知策略优化,实现了系统1与系统2的协同,提升了开放性任务的解决能力。

Comments 16 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07625 2026-02-10 cs.CV cs.AI 83%

AD-MIR: Bridging the Gap from Perception to Persuasion in Advertising Video Understanding via Structured Reasoning

AD-MIR:通过结构化推理弥合从感知到说服的广告视频理解鸿沟

Binxiao Xu, Junyu Feng, Xiaopeng Lin, Haodong Li, Zhiyuan Feng, Bohan Zeng, Shaolin Lu, Ming Lu, Qi She, Wentao Zhang

机构 * Peking University, Beijing, China(北京大学) Tsinghua University, Beijing, China(清华大学) Xi'an Jiaotong University, Xi'an, China(西安交通大学) South China University of Technology, Guangzhou, China(华南理工大学)

专题命中 推理评测 :reasoning(title,abstract);self-correction(abstract);分类 cs.AI

AI总结 AD-MIR通过结构化推理框架,结合语义检索与精确关键词匹配,有效解码广告意图,提升广告视频理解的准确性与说服策略分析能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02496 2026-02-04 cs.CL 83%

The Hypocrisy Gap: Quantifying Divergence Between Internal Belief and Chain-of-Thought Explanation via Sparse Autoencoders

虚假差距:通过稀疏自编码器量化内部信念与思维链解释之间的分歧

Shikhar Shiromani, Archie Chaudhury, Sri Pranav Kunda

机构 * Independent(独立研究者)

专题命中 推理评测 :chain-of-thought(title);reasoning(abstract);CoT(abstract);分类 cs.CL

AI总结 通过稀疏自编码器量化模型内部信念与生成回答之间的差异,以检测模型的不忠实行为。

Comments 8 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01246 2026-02-03 cs.CL cs.IR 83%

PARSE: An Open-Domain Reasoning Question Answering Benchmark for Persian

PARSE:一种面向开放领域的推理问答基准,用于波斯语

Jamshid Mozafari, Seyed Parsa Mousavinasab, Adam Jatowt

机构 * University of Innsbruck(因斯布鲁克大学)

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract);分类 cs.CL

AI总结 PARSE是一个面向开放领域的波斯语推理问答基准,通过多阶段过滤和人工评估确保质量,展示了波斯语提示和结构化提示对性能的提升,为低资源环境下开发和评估推理能力的LLM提供了基础。

Comments Submitted to SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22790 2026-02-02 cs.AI math.ST stat.TH 83%

Conditional Performance Guarantee for Large Reasoning Models

基于条件的大型推理模型性能保证

Jianguo Huang, Hao Zeng, Bingyi Jing, Hongxin Wei, Bo An

机构 * Nanyang Technological University, Singapore(南洋理工大学) Southern University of Science(南方科技大学) The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳))

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出G-PAC和C-PAC推理框架,通过分组策略实现组条件风险控制,提升异质环境下推理效率并降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13742 2026-01-27 cs.CL 83%

Hearing Between the Lines: Unlocking the Reasoning Power of LLMs for Speech Evaluation

在行之间倾听:解锁LLMs对语音评估的推理能力

Arjun Chandra, Kevin Miller, Venkatesh Ravichandran, Constantinos Papayiannis, Venkatesh Saligrama

机构 * Boston University(波士顿大学) Amazon AGI(亚马逊人工智能研究院)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 TRACE框架通过文本推理音频线索,实现低成本且与人类一致的语音评估。

Comments EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16964 2026-01-26 cs.AI 83%

AgentDrive: An Open Benchmark Dataset for Agentic AI Reasoning with LLM-Generated Scenarios in Autonomous Systems

AgentDrive: 一个用于自主系统中基于LLM生成场景的代理AI推理开放基准数据集

Mohamed Amine Ferrag, Abderrahmane Lakas, Merouane Debbah

机构 * Department of Computer and Network Engineering, College of Information Technology, United Arab Emirates University(计算机与网络工程系,信息科技学院,阿联酋大学) Khalifa University of Science and Technology(科技大学)

专题命中 推理评测 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 AgentDrive是一个用于自主系统中基于LLM生成场景的代理AI推理开放基准数据集,包含300,000个驾驶场景和100,000个问题的多项选择基准,用于评估和训练自主代理。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏