arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-20 至 2026-04-20 共收录 116 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 12 篇

2604.16158 2026-04-20 cs.CL cs.AI cs.LG 88%

AtManRL: Towards Faithful Reasoning via Differentiable Attention Saliency

AtManRL:通过可微注意力显著性实现更忠实的推理

Max Henning Höth, Kristian Kersting, Björn Deiseroth, Letitia Parcalabescu

机构 * Aleph Alpha Research Lab(Aleph Alpha研究实验室) TU Darmstadt(图林根大学) Hessian.AI Lab(黑森AI实验室)

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出AtManRL方法,通过可微注意力操控学习更忠实的推理过程,结合GRPO框架优化正确性与可解释性,实验证明能识别关键推理token并提升模型透明度。

Comments 14 pages, 8 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15847 2026-04-20 cs.CL 87%

CiPO: Counterfactual Unlearning for Large Reasoning Models through Iterative Preference Optimization

CiPO:通过迭代偏好优化实现大型推理模型的反事实去学习

Junyi Li, Yongqiang Chen, Ningning Ding

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Chinese University of Hong Kong(香港中文大学)

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL

AI总结 针对大型推理模型去学习难题,CiPO通过迭代偏好优化重新定义去学习为对推理过程的针对性干预,有效去除中间推理步骤和最终答案的知识,同时保持推理能力。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13792 2026-04-20 cs.CL cs.AI 82%

Interpretable Traces, Unexpected Outcomes: Investigating the Disconnect in Trace-Based Knowledge Distillation

可解释的轨迹,意外的结果:探讨基于轨迹的知识蒸馏中的断层

Siddhant Bhambri, Upasana Biswas, Subbarao Kambhampati

机构 * School of Computing & AI, Arizona State University(计算与人工智能学院,亚利桑那州立大学)

专题命中 复杂问题求解 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文通过规则问题分解设计实验,探讨基于轨迹的知识蒸馏中轨迹语义正确性与可解释性之间的断层,发现轨迹正确性并不能保证最终答案正确,且可解释的分解轨迹在准确性上不具优势。

Comments Accepted at The 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09953 2026-04-20 cs.CL 79%

ATTNPO: Attention-Guided Process Supervision for Efficient Reasoning

ATTNPO:基于注意力的高效推理过程监督

Shuaiyi Nie, Siyu Ding, Wenyuan Zhang, Linhao Yu, Tianmeng Yang, Yao Chen, Weichong Yin, Yu Sun, Hua Wu, Tingwen Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Baidu Inc.(百度公司) Tianjin University(天津大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出ATTNPO,通过利用模型内在注意力信号进行步骤级信用分配,有效减少推理长度并提升性能,适用于9个基准测试。

Comments Accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15648 2026-04-20 cs.CL cs.CV 79%

HyperGVL: Benchmarking and Improving Large Vision-Language Models in Hypergraph Understanding and Reasoning

HyperGVL:超图理解与推理中大视觉-语言模型的基准测试与改进

Yanbin Wei, Chun Kang, Siwei Li, Haoxuan Che, Yang Chen, Hua Liu, Jian Liu, Zhuang Liu, Can Ouyang, Fei Xing, Lei Sha, Rui Liu, Yu Zhang, James Kwok

机构 * Southern University of Science and Technology(南方科技大学) Hong Kong University of Science and Technology(香港科技大学) Huawei Research(华为研究) Beihang University(北航)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出HyperGVL基准,评估12种先进LVLM在超图理解与推理中的能力,通过84,000个样本覆盖12种任务,引入可泛化的WiseHyGR路由器提升模型性能。

Comments Under Review; Opensource after accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16024 2026-04-20 cs.MA cs.CV 71%

AstroVLM: Expert Multi-agent Collaborative Reasoning for Astronomical Imaging Quality Diagnosis

AstroVLM:专家多智能体协作推理用于天体成像质量诊断

Yaohui Han, Tianshuo Wang, Zixi Zhao, Zhengchun Zhu, Shuo Ren, Yiru Wang, Rongliang Fu, Tinghuan Chen, Tsung-Yi Ho

机构 * The Chinese University of Hong Kong(香港中文大学) Central South University(中南大学) Huawei Technologies Co., Ltd(华为技术有限公司) The Chinese University of Hong Kong, Shenzhen(香港中文大学深圳校区)

专题命中 复杂问题求解 :reasoning(title)

AI总结 本文提出AstroVLM,通过多智能体协作推理解决复杂天体成像质量诊断问题,实验表明其在实际任务中优于所有基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13920 2026-04-20 cs.CL 70%

FACTS: Table Summarization via Offline Template Generation with Agentic Workflows

FACTS: 通过离线模板生成实现基于表格的摘要的代理工作流

Ye Yuan, Mohammad Amin Shabani, Siqi Liu

机构 * McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克人工智能研究所) RBC Borealis

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 FACTS通过离线模板生成实现高效、准确且隐私合规的表格摘要,优于现有方法,适用于实际查询需求。

Comments Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21623 2026-04-20 cs.CL cs.AI cs.LG 67%

OjaKV: Context-Aware Online Low-Rank KV Cache Compression

OjaKV: 基于上下文的在线低秩KV缓存压缩

Yuxuan Zhu, David H. Yang, Mohammad Mohammadi Amiri, Keerthiram Murugesan, Tejaswini Pedapati, Pin-Yu Chen

机构 * Rensselaer Polytechnic Institute(拉特格斯理工学院) IBM Research(IBM研究院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 OjaKV通过结合战略混合存储策略与在线子空间适应,实现KV缓存压缩,提升长上下文推理效率,无需微调模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15687 2026-04-20 cs.CL 57%

Preference Estimation via Opponent Modeling in Multi-Agent Negotiation

通过对手建模进行多智能体谈判中的偏好估计

Yuta Konishi, Kento Yamamoto, Eisuke Sonomoto, Rikuho Takeda, Ryo Furukawa, Yusuke Muraki, Takafumi Shimizu, Kazuma Fukumura, Yuya Kanemoto, Takayuki Ito, Shiyao Ding

机构 * Graduate School of Informatics, Kyoto University(京都大学信息学研究生院) Accenture Japan Ltd(Accenture日本公司)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一种整合自然语言信息的结构化贝叶斯对手建模框架,提升多智能体谈判中的偏好估计准确性与一致性。

Comments This paper is accepted as a Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23304 2026-04-20 cs.CV cs.AI 57%

MedGemma vs GPT-4: Open-Source and Proprietary Zero-shot Medical Disease Classification from Images

MedGemma vs GPT-4:开源与专有零样本医学疾病图像分类

Md. Sazzadul Islam Prottasha, Nabil Walid Rafi

机构 * Department of Information and Communication Technology, Bangladesh University of Professionals(信息与通信技术系,孟加拉国专业大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文比较了开源MedGemma与专有GPT-4在医学图像零样本疾病分类中的性能,MedGemma通过LoRA微调在准确率和敏感性上均表现更优,凸显了领域特定微调对临床应用的重要性。

Comments Accepted for publication in the Journal of Machine Learning and Deep Learning (JMLDL). 9 pages, 9 figures, 10 tables

Journal ref Journal of Machine Learning and Deep Learning, Vol. 2, No. 2, pp. 1-9, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15020 2026-04-20 cs.SE cs.HC 50%

Applying SHAPR in AI-Assisted Research Software Development: Lessons Learnt from Building a Share Trading System

在AI辅助研究软件开发中应用SHAPR:从构建股票交易系统中获得的经验

Ka Ching Chan

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文通过构建模块化股票交易系统案例,展示了SHAPR框架在AI辅助软件开发中的应用,强调持续文档更新、合同稳定编码、源码层提升连贯性等核心方法与贡献。

Comments 6 pages, 2 figures, conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08480 2026-04-20 cs.CV 50%

Video-STAR: Reinforcing Open-Vocabulary Action Recognition with Tools

Video-STAR: 通过工具强化开放词汇动作识别

Zhenlong Yuan, Xiangyan Qu, Chengxuan Qian, Rui Chen, Jing Tang, Lei Sun, Xiangxiang Chu, Dapeng Zhang, Yiwei Wang, Yujun Cai, Shuo Li

机构 * AMAP, Alibaba Group(阿里集团AMAP) University of California at Merced(加州大学默塞德分校) University of Queensland(昆士兰大学) Case Western Reserve University(凯斯西储大学)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 Video-STAR通过结合上下文子动作分解与工具增强强化学习,提升开放词汇动作识别的细粒度匹配与跨模态推理能力,有效减少跨模态幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理评测 33 篇

2510.24328 2026-04-20 cs.CL cs.AI 87%

Beyond MCQ: An Open-Ended Arabic Cultural QA Benchmark with Dialect Variants

超越多项选择题:一个包含方言变体的开放性阿拉伯文化问答基准测试

Hunzalah Hassan Bhatti, Firoj Alam

机构 * Qatar Computing Research Institute, Qatar(卡塔尔计算研究所)

专题命中 推理评测 :CoT(summary_cn,abstract);chain-of-thought(abstract,comments);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种方法,将现代标准阿拉伯语的多项选择题翻译成英文和阿拉伯方言,并转换为开放性问题,评估不同模型在不同设置下的表现,发现模型在阿拉伯方言上表现欠佳,CoT方法提高了正确性但指标混杂。

Comments Cultural Knowledge, Everyday Knowledge, Open-Ended Question, Chain-of-Thought, Large Language Models, Native, Multilingual, Language Diversity

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07160 2026-04-20 cs.AI cs.LG 87%

AscendKernelGen: A Systematic Study of LLM-Based Kernel Generation for Neural Processing Units

AscendKernelGen: 一种针对神经处理单元的LLM基内核生成系统研究

Xinzi Cao, Jianyang Zhai, Pengfei Li, Zhiheng Hu, Cen Yan, Bingxu Mu, Guanghuan Fang, Bin She, Jiayu Li, Yihan Su, Dongyang Tao, Xiansong Huang, Fan Xu, Feidiao Yang, Yao Lu, Chang-Dong Wang, Yutong Lu, Weicheng Xue, Bin Zhou, Yonghong Tian

机构 * Pengcheng Laboratory(鹏城实验室) Huawei(华为) Sun Yat-sen University(中山大学) Peking University(北京大学)

专题命中 推理评测 :CoT(summary_cn,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AscendKernelGen框架,通过引入Ascend-CoT数据集和KernelGen-LM模型,提升NPU内核生成效率与正确性,实验显示复杂内核编译成功率从0%提升至95.5%。

Comments 33 pages,7 figures,16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15994 2026-04-20 cs.AI 86%

ReactBench: A Benchmark for Topological Reasoning in MLLMs on Chemical Reaction Diagrams

ReactBench: 一种用于在化学反应图上进行拓扑推理的MLLMs基准测试

Qiang Xu, Shengyuan Bai, Yu Wang, He Cao, Leqing Chen, Yuanyuan Liu, Bin Feng, Zijing Liu, Yu Li

机构 * International Digital Economy Academy(国际数字经济学院) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 推理评测 :reasoning(title,abstract);logical reasoning(title);分类 cs.AI

AI总结 ReactBench通过化学反应图揭示MLLMs在拓扑推理中的局限性,包含1618个专家标注的问答对,评估17种MLLMs显示锚定任务与整体结构推理任务存在超过30%的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15808 2026-04-20 cs.CV cs.AI 83%

Beyond a Single Frame: Multi-Frame Spatially Grounded Reasoning Across Volumetric MRI

超越单帧:跨体积MRI的多帧空间接地推理

Lama Moukheiber, Caleb M. Yeung, Haotian Xue, Alec Helbling, Zelin Zhao, Yongxin Chen

机构 * Georgia Institute of Technology(佐治亚理工学院) Harvard University(哈佛大学) Georgetown University(乔治城大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出SGMRI-VQA基准,通过多帧空间接地推理提升医学VLMs性能,展示监督微调提升接地能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02626 2026-04-20 cs.CL 81%

Understanding New-Knowledge-Induced Factual Hallucinations in LLMs: Analysis and Interpretation

理解大语言模型中新知识诱导的事实幻觉:分析与解释

Renfei Dang, Peng Hu, Zhejian Lai, Changjiang Gao, Min Zhang, Shujian Huang

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) Huawei Translation Services Center(华为翻译服务中心)

专题命中 推理评测 :reasoning(summary_cn,abstract);分类 cs.CL

AI总结 研究探讨了新知识微调导致的大语言模型事实幻觉现象,通过设计Biography-Reasoning数据集,分析不同知识类型和任务类型中的幻觉表现,发现知识类型中不熟悉程度是幻觉的主要驱动因素。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16270 2026-04-20 cs.CL cs.AI 81%

From Benchmarking to Reasoning: A Dual-Aspect, Large-Scale Evaluation of LLMs on Vietnamese Legal Text

从基准测试到推理:一个双视角、大规模评估LLMs在越南法律文本上的表现

Van-Truong Le

机构 * University of Science, VNUHCM(越南国家大学科学大学) Vietnam National University(越南国家大学) Hanoi Open University(河内开放大学) Ho Chi Minh, Vietnam(胡志明市,越南)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出双视角评估框架,评估四种LLM在越南法律文本的准确性、可读性和一致性,发现Grok-1在可读性和一致性上表现优异但法律准确性不足,而Claude 3 Opus高准确性掩盖了推理错误,揭示当前LLM在法律推理上的核心挑战。

Comments 7 pages, 2 figures. Accepted at the FISU Joint Conference on Artificial Intelligence (FJCAI 2026), Vietnam

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22977 2026-04-20 cs.LG cs.AI 81%

The Reasoning Trap: How Enhancing LLM Reasoning Amplifies Tool Hallucination

推理陷阱:增强大语言模型推理能力如何放大工具幻觉

Chenlong Yin, Zeyang Sha, Shiwen Cui, Changhua Meng, Zechao Li

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Nanjing University of Science and Technology(南京理工大学) Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 研究探讨增强LLM推理能力是否导致工具幻觉增加,通过SimpleToolHalluBench验证因果关系,发现推理增强与幻觉成正比,且不受过拟合影响,揭示需新的训练目标平衡能力和可靠性。

Comments Accepted to ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14554 2026-04-20 cs.CL cs.AI 81%

VLegal-Bench: Cognitively Grounded Benchmark for Vietnamese Legal Reasoning of Large Language Models

VLegal-Bench: 用于大型语言模型越南法律推理的认知导向基准

Nguyen Tien Dong, Minh-Anh Nguyen, Thanh Dat Hoang, Nguyen Tuan Ngoc, Dao Xuan Quang Minh, Phan Phi Hai, Nguyen Thi Ngoc Anh, Dang Van Tu, Binh Vu

机构 * CMC OpenAI VinUniversity HUST SRH University Heidelberg

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 VLegal-Bench是首个系统评估大型语言模型在越南法律任务上的基准,包含10450个样本,通过严格标注流程确保样本基于权威法律文件,涵盖法律问题解答、检索增强生成、多步推理等任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06953 2026-04-20 cs.AI cs.CL 81%

Revisiting the Uniform Information Density Hypothesis in LLM Reasoning

重新审视大语言模型推理中的均匀信息密度假说

Minju Gwak, Guijin Son, Jaehyung Kim

机构 * Yonsei University(延世大学) OneLine AI

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究大语言模型推理中均匀信息密度假说的有效性,提出新框架量化局部和全局信息流均匀性,发现高质量推理在局部均匀但全局非均匀,证明均匀性优于其他内部信号预测推理质量。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13660 2026-04-20 cs.CV 80%

VRAG-DFD: Verifiable Retrieval-Augmentation for MLLM-based Deepfake Detection

VRAG-DFD: 可验证检索增强的基于大语言模型的深度伪造检测

Hui Han, Shunli Wang, Yandan Zhao, Taiping Yao, Shouhong Ding

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent Youtu Lab(腾讯优图实验室)

专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出VRAG-DFD框架,通过结合检索增强生成和强化学习,解决深度伪造检测中专业伪造知识不足的问题,提升大语言模型的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16256 2026-04-20 cs.CV cs.CL 79%

Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap

视觉-语言模型真的能进行视觉推理吗?一种对模态差距的严格研究

Yige Xu, Yongjie Wang, Zizhuo Wu, Kaisong Song, Jun Lin, Zhiqi Shen

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算机与数据科学学院,新加坡) Alibaba-NTU Global e-Sustainability CorpLab (ANGEL)(阿里巴巴-国立大学全球可持续发展公司实验室(ANGEL)) Tongyi Lab, Alibaba Group, China(阿里云实验室,阿里巴巴集团,中国)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文通过CrossMath基准测试,发现视觉-语言模型在文本输入时表现优异,但加入图像信息后推理性能下降,表明其推理主要依赖文本空间,而非真实视觉证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13091 2026-04-20 cs.CV 78%

Reasoning over Video: Evaluating How MLLMs Extract, Integrate, and Reconstruct Spatiotemporal Evidence

视频推理:评估大语言模型如何提取、整合和重构时空证据

Seunghwan Bang, Hwanjun Song

机构 * UNIST(全南大学) KAIST(韩国科学技术院)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文评估大语言模型在视频中的时空推理能力,提出VAEX-BENCH基准,通过合成数据测试抽象推理任务,揭示模型在抽象任务中的局限性。

Comments Project page: https://disl-lab.github.io/VAEX-Bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15385 2026-04-20 cs.SE cs.LG 70%

Prompt-Driven Code Summarization: A Systematic Literature Review

基于提示的代码摘要:系统文献综述

Afia Farjana, Zaiyu Cheng, Antonio Mastropaolo

机构 * William & Mary(威廉玛丽学院)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 本文综述了基于提示的代码摘要方法,分析了不同提示策略的有效性及评估挑战,旨在为未来研究和实际应用提供指导。

Comments 42 pages, 9 figures, 10 tables. Systematic Literature Review. This work is currently under review at ACM TOSEM

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10916 2026-04-20 cs.CV cs.AI 70%

ReXSonoVQA: A Video QA Benchmark for Procedure-Centric Ultrasound Understanding

ReXSonoVQA:面向以过程为中心的超声理解的视频问答基准

Xucheng Wang, Xiaoman Zhang, Sung Eun Kim, Ankit Pal, Pranav Rajpurkar

机构 * Harvard Medical School(哈佛医学院)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 ReXSonoVQA是一个包含514个视频片段和514个问题的视频问答基准,旨在评估动作-目标推理、artifact解决与优化及过程上下文与规划能力,测试VLMs在动态过程理解中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09836 2026-04-20 cs.AI cs.CL cs.LG 67%

COMPOSITE-Stem

COMPOSITE-STEM基准:通过70个专家编写的任务评估AI代理的科学推理能力

Kyle Waters, Lucas Nuzzi, Tadhg Looram, Alessandro Tomasiello, Ariel Ghislain Kemogne Kamdoum, Bikun Li, Damien Sileo, Egor Kretov, Francesco Fournier-Facio, Georgios Soloupis, Haile Kassahun, Hew Wolff, Jiaqi Cai, Lianghui Li, Marc Roth, Mohinder Naiya, Naixu Guo, Qicheng Tang, Richard Wheeler, Samuele Sala, Serguei Popov, Steven Dillmann, Yuqi Li

机构 * PortexAI University of Milano-Bicocca(米兰-比科卡大学) University of Calgary(卡尔加里大学) University of Chicago(芝加哥大学) Inria(法国国家信息与自动化技术研究院) Fraunhofer Institute for Individualized Medical Technology IMTE(弗劳恩霍夫个性化医疗技术研究所) University of Cambridge(剑桥大学) Independent(独立) McGill University(麦吉尔大学) Massachusetts Institute of Technology(麻省理工学院) École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院) Queen Mary University of London(伦敦大学玛丽女王学院) Dot Ingredients National University of Singapore(新加坡国立大学) Georgia Institute of Technology(佐治亚理工学院) University of Edinburgh(爱丁堡大学) Murdoch University(墨尔本大学) University of Porto(波尔图大学) Stanford University(斯坦福大学) Stony Brook University(史泰津布鲁克大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出COMPOSITE-STEM基准,通过70个专家编写任务评估AI代理的科学推理能力,结合精确匹配评分和LLM作为评委的协议,展示AI在科学领域的能力突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16241 2026-04-20 cs.CL cs.AI 62%

BAGEL: Benchmarking Animal Knowledge Expertise in Language Models

BAGEL:语言模型中动物知识专精的基准测试

Jiacheng Shen, Masato Hagiwara, Milad Alizadeh, Ellen Gilsenan-McMahon, Marius Miron, David Robinson, Emmanuel Chemla, Sara Keen, Gagan Narula, Mathieu Laurière, Matthieu Geist, Olivier Pietquin

机构 * Earth Species Project(地球物种项目) NYU Center for Data Science(纽约大学数据科学中心;纽约大学上海) NYU Shanghai(纽约大学上海数据科学中心;纽约大学-复旦大学数学科学研究所) NYU Shanghai Center for Data Science NYU-ECNU Institute of Mathematical Sciences at NYU Shanghai

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 BAGEL基准测试评估语言模型在动物知识方面的专精能力,结合多个来源生成封闭式问题对,涵盖分类学、形态学、栖息地等多个方面,旨在提升语言模型在生物多样性应用中的可靠性。

Comments 28 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15859 2026-04-20 cs.LG cs.AI 62%

QuantSightBench: Evaluating LLM Quantitative Forecasting with Prediction Intervals

QuantSightBench:评估LLM定量预测的预测区间

Jeremy Qin, Maksym Andriushchenko

机构 * ELLIS Institute Tübingen(图宾根ELLIS研究所) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Tübingen AI Center(图宾根人工智能中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出QuantSightBench基准,评估LLM在连续量数值预测中的表现,发现现有模型在90%覆盖率目标上普遍不足,且置信度校准随极端值恶化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15607 2026-04-20 cs.CL cs.AI cs.CY cs.HC 62%

Imperfectly Cooperative Human-AI Interactions: Comparing the Impacts of Human and AI Attributes in Simulated and User Studies

不完全合作的人机交互:在模拟和用户研究中比较人类和AI属性的影响

Myke C. Cohen, Mingqian Zheng, Neel Bhandari, Hsien-Te Kao, Xuhui Zhou, Daniel Nguyen, Laura Cassani, Maarten Sap, Svitlana Volkova

机构 * Aptima, Inc.(Aptima公司) Arizona State University(亚利桑那州立大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 研究通过模拟和用户实验比较人类和AI属性在不完全合作场景中的影响,发现AI属性,尤其是透明度,在真实用户研究中更具影响力。

Comments Will be presented at ACL 2026 and published in the Findings of the Association for Computational Linguistics: ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏