arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 548 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 548 篇

2604.22328 2026-07-21 cs.LG cs.AI cs.CE 版本更新 62%

FETS Benchmark: Foundation Models Enable Scalable and Generalizable Energy Time Series Forecasting

FETS基准:基础模型在能源时间序列预测中优于数据集特定的机器学习

Marco Obermeier, Marco Pruckner, Florian Haselbeck, Andreas Zeiselmair

机构 * Julius-Maximilians-Universität Würzburg, Modeling and Simulation Lab(乌尔姆-马克斯·普朗克大学,建模与仿真实验室) Weihenstephan-Triesdorf University of Applied Sciences, Smart Farming(魏因施泰因-特里尔夫应用科学大学,智能农业) Weihenstephan-Triesdorf University of Applied Sciences, Digital Energy Transition(魏因施泰因-特里尔夫应用科学大学,数字能源转型)

专题命中 推理评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文通过FETS基准展示了基础模型在能源时间序列预测中优于传统机器学习方法,揭示了基础模型在不同数据集和场景下的优越性能及应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22228 2026-07-21 cs.LG cs.AI 版本更新 62%

When Fewer Layers Break More Chains: Layer Pruning Harms Test-Time Scaling in LLMs

当更少的层打破更多的链条:层剪枝损害大语言模型的测试时扩展性

Keyu Wang, Tian Lyu, Guinan Su, Lu Yin, Marco Canini, Jonas Geiping, Shiwei Liu

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究层剪枝对大语言模型长链推理中测试时扩展性的影响,经大量实验发现剪枝会严重损害其扩展性,标准微调补救无效,确定了扩展性脆弱机制及应用层剪枝的风险,呼吁重新思考策略并为保推理鲁棒性方法提供见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11889 2026-07-20 cs.CL cs.AI 版本更新 62%

Scaling Point-in-Time Language Models

扩展即时语言模型

Bryan Kelly, Semyon Malamud, Johannes Schwab, Teng Andrea Xu

机构 * Yale School of Management(耶鲁大学管理学院) AQR Capital Management(AQR资产管理公司) NBER(美国国家经济研究局) Swiss Finance Institute(瑞士金融研究所) EPFL(洛桑联邦理工学院) CEPR(经济政策研究中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究旨在解决大型语言模型的前瞻性偏差问题,通过在大量按时间顺序过滤的令牌上训练仅解码器变压器构建即时语言模型,缩小了与无约束模型的性能差距,经LoRA微调提升可用性,并发布完整管道支持相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10024 2026-07-20 cs.CV cs.AI cs.LG 版本更新 62%

LVSum: A Benchmark for Timestamp-Aware Long Video Summarization

LVSum:一个用于时间感知长视频摘要的基准测试

Alkesh Patel, Melis Ozyildirim, Ying-Chang Cheng, Ganesh Nagarajan

机构 * Apple(苹果公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LVSum基准测试,用于评估长视频摘要中时间对齐的性能,通过引入新的评估指标揭示现有MLLM在时间理解上的系统性差距。

Comments 25 pages, 5 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09142 2026-07-17 cs.AI cs.CL cs.CV 版本更新 62%

MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation

MedRealMM:用于中国在线医疗咨询的真实世界多模态基准测试

Runhan Shi, Quan Zhou, Yuqian Xu, Shuai Yang, Xin Wu, Zitong Zhou, Hui Liu, Bin Zha, Zheming Wang, Liya Li, Wei Wei, Jinru Ding, Wenrao Pang, Mouxiao Bian, Haoyuan Hu, Jun Xu, Jie Xu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究针对现有在线医疗咨询基准与实际临床实践契合度差的问题,构建MedRealMM基准测试,用多模态临床挑战点提取框架转化任务并设评分标准,评估多个大语言模型,指出图像信息重要,前沿模型有不足,为多模态医学推理评估提供现实可重复基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12477 2026-07-17 cs.AI cs.LG 版本更新 62%

DualHNIE: Dual-Channel Hypergraph Learning for Node Importance Estimation in Heterogeneous Knowledge Graphs

MetaHGNIE:异构知识图谱中的元路径诱导超图对比学习

Jiawen Chen, Yanyan He, Qi Shao, Mengli Wei, Duxin Chen, Wenwu Yu, Yanlong Zhao

机构 * Jiangsu Key Laboratory of Networked Collective Intelligence, School of Mathematics, Southeast University(江苏网络集体智能重点实验室,数学学院,东南大学) Jiangsu Key Laboratory of Networked Collective Intelligence, School of Cyber Science and Engineering, Southeast University(江苏网络集体智能重点实验室,网络科学与工程学院,东南大学) State Key Laboratory of Mathematical Sciences, Academy of Mathematics and Systems Science, University of Chinese Academy of Sciences(数学科学国家重点实验室,数学与系统科学研究院,中国科学院大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究异构知识图谱中节点重要性估计问题,提出DualHNIE框架,通过构建高阶知识图谱、引入互补编码器及对比对齐机制进行显式高阶建模和解缠双通道表示学习,实验验证其优于现有方法。

Comments Accepted by IEEE Transactions on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11263 2026-07-16 cs.AI cs.LG 版本更新 62%

Bringing Back Rule Induction to Fluid Intelligence Research? An Initial Validation of the ARC-AGI Benchmark in Humans

将规则归纳带回流体智力研究?人类中ARC-AGI基准的初步验证

Jasmin Thelen, Oliver Wilhelm

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究围绕流体智力测量的两种观点,以含100名参与者的研究初步验证ARC-AGI基准用于人类流体智力测量的有效性,发现其与图形流体智力显著相关,为相关研究提供支持并建议嵌入人工智能基准以促进评估与合作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04115 2026-07-15 cs.LG cs.AI 版本更新 62%

dMX: Differentiable Mixed-Precision Assignment for Low-Precision Floating-Point Formats

dMX: 低精度浮点格式的可微分混合精度分配

Giuseppe Franco, Ian Colbert, Pablo Monteagudo-Lago, Felix Marty, Nicholas Fraser

机构 * AMD

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出可微分混合精度量化框架 dMX,通过连续优化每层浮点格式参数并配合退火调度和正则化项,实现硬件兼容的 MXFP 格式分配,在 LLM 上取得帕累托最优效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26102 2026-07-14 cs.CL cs.AI cs.CY 版本更新 62%

Helpfulness Hurts: Domain-Dependent Degradation of Mid-Trained Compassion Values Under Post-Training

帮助有害:后训练中领域依赖的中期训练同情价值观退化

Jasmine Brazilek, Juliana Seawell

机构 * Compassion Aligned Machine Learning (CaML)(同情心对齐机器学习实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究后训练数据领域对中期训练同情价值观的影响,发现帮助性训练比编程训练更显著降低动物同情和道德推理能力,但跨语言迁移存在差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09904 2026-07-14 cs.LG cs.AI 版本更新 62%

Beyond Naïve Prompting: Strategies for Improved Context-aided Forecasting with LLMs

超越简单提示:改进LLMs上下文辅助预测的策略

Arjun Ashok, Andrew Robert Williams, Vincent Zhihao Zheng, Irina Rish, Nicolas Chapados, Étienne Marcotte, Valentina Zantedeschi, Alexandre Drouin

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出四种策略,从模型诊断、准确性和效率三个正交维度改进LLMs的上下文辅助预测,通过广泛实验揭示执行差距、性能提升和成本降低的解决方案。

Comments Published at TMLR - OpenReview link: https://openreview.net/forum?id=dkjHHFJkVI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08884 2026-07-14 cs.CV cs.CL cs.LG 版本更新 62%

SpurLens: Automatic Detection of Spurious Cues in Multimodal LLMs

SpurLens:多模态大语言模型中虚假线索的自动检测

Parsa Hosseini, Sumit Nawathe, Mazda Moayeri, Sriram Balasubramanian, Soheil Feizi

机构 * Department of Computer Science University of Maryland(计算机科学系大学马里兰大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究多模态大语言模型中虚假偏差,介绍SpurLens管道,利用GPT-4和开放集目标检测器自动识别虚假视觉线索,揭示虚假关联导致的两种失败模式,验证发现并探索缓解策略,呼吁提高评估方法和策略以增强MLLMs可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01042 2026-07-14 cs.IR cs.AI cs.CL 版本更新 62%

Can Argus Judge Them All? Comparing VLMs Across Domains

阿格斯能评判一切吗?跨领域比较视觉语言模型

Harsh Joshi, Gautam Siddharth Kashyap, Rafiq Ali, Ebad Shabbir, Niharika Jain, Sarthak Jain, Jiechao Gao, Usman Naseem

机构 * Bharati Vidyapeeth(巴哈提大学) Macquarie University(麦考瑞大学) DSEU-Okhla Vivekananda Institute of Professional Studies(维维kananda专业研究学院) IIIT-Delhi(德里印度理工学院) Center for SDGC(SDGC中心) Stanford University(斯坦福大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究跨领域视觉语言模型,提出ARGUS-EVAL评估框架,通过多种指标刻画模型行为,评估多个模型在下游任务表现,发现能力与可靠性导向排名有显著差异,如Qwen-2.5VL-3B-Instruct能力强,CLIP延迟和内存占用低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03238 2026-07-13 cs.CR cs.AI cs.LG stat.ML 版本更新 62%

How to DP-fy Your Data: A Practical Guide to Generating Synthetic Data With Differential Privacy

如何让你的数据实现差分隐私:使用差分隐私生成合成数据的实用指南

Natalia Ponomareva, Zheng Xu, H. Brendan McMahan, Peter Kairouz, Lucas Rosenblatt, Vincent Cohen-Addad, Cristóbal Guzmán, Ryan McKenna, Galen Andrew, Alex Bie, Da Yu, Alex Kurakin, Morteza Zadimoghaddam, Sergei Vassilvitskii, Andreas Terzis

机构 * Google Research USA(谷歌DeepMind) NYU Work done at Google as part of student researcher engagement New York NY USA Google Research New York NY USA Institute for Mathematical Computational Engineering, Faculty of Mathematics School of Engineering, Pontificia Universidad Cat\'olica de Chile Santiago Chile Google DeepMind Mountain View CA USA Google Research School of Engineering, Pontificia Universidad Cat\'olica de Chile Google DeepMind

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究如何利用差分隐私生成合成数据,探讨相关技术、保护类型及不同模态进展,概述系统组件,旨在推动差分隐私合成数据应用,促进研究并增强信任。

Journal ref JAIR 2026, vol. 86 JAIR, Vol. 86

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26962 2026-07-10 cs.CY cs.AI cs.CL 版本更新 62%

DeepTutor: Towards Agentic Personalized Tutoring

DeepTutor:迈向代理式个性化辅导

Bingxi Zhao, Jiahao Zhang, Xubin Ren, Zirui Guo, Tianzhe Chu, Yi Ma, Chao Huang

机构 * The University of Hong Kong(香港大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 DeepTutor通过结合引用基础问题辅导与难度校准的问题生成,提出一个统一的开放源码框架,利用静态知识和动态学习者记忆实现个性化适应,并在五个领域大学课程中评估个性化教学效果。

Comments Tech Report, work in progress. Code available at https://github.com/HKUDS/DeepTutor

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03800 2026-07-09 cs.LG cs.AI 版本更新 62%

Trading Human Curation for Synthetic Augmentation in RLVR

在RLVR中用合成增强替代人工策展

Akshansh, Leonardo Rosa Rodrigues, Michael Korostelev, Youssef Hassan, Mark E. Whiting

机构 * Pareto AI

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究通过预指定、门控过滤的增强任务替代人工策展任务,在RLVR中实现成本效益权衡,并保持泛化性能。

Comments 21 pages, 5 main-text figures, 4 appendix figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24827 2026-07-07 cs.LG cs.AI 版本更新 62%

Incompressible Knowledge Probes: Estimating Black-Box LLM Parameter Counts via Factual Capacity

不可压缩的知识探针:通过事实容量估计黑盒大语言模型参数数量

Bojie Li

机构 * Pine AI

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出不可压缩知识探针,通过事实容量估计大语言模型参数数量,验证了参数数量与知识容量的对数线性关系,展示了模型在不同厂商和不同世代中的持续扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02923 2026-07-07 cs.CL cs.AI 版本更新 62%

Council Mode: A Heterogeneous Multi-Agent Consensus Framework for Reducing LLM Hallucination and Bias

理事会模式:一种异质多智能体共识框架,用于减少大语言模型的幻觉和偏见

Shuai Wu, Xue Li, Yanna Feng, Yufang Li, Zhijun Wang, Ran Wang

机构 * Lead Researcher(研究员) Research Assistant(研究员) Academic Advisor(学术顾问) Research Consultant(研究顾问)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出理事会模式,通过多智能体共识框架减少LLM的幻觉和偏见,实验显示在HaluEval和TruthfulQA上 hallucination率降低35.9%,质量得分提升10.2个百分点,且在偏见方面表现更优。

Comments 24 pages, 8 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04387 2026-07-07 cs.AI cs.CL cs.GT 版本更新 62%

The Language of Bargaining: Linguistic Effects in LLM Negotiations

谈判语言:大语言模型谈判中的语言效应

Stuti Sinha, Himanshu Kumar, Aryan Raju Mandapati, Rakshit Sakhuja, Dhruv Kumar

机构 * BITS Pilani(BITS 普利尼)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究通过多智能体模拟,在保持游戏规则等不变的情况下,系统分离英语和四种印度语言框架在不同游戏中的语言效应,发现语言选择对结果影响大,且因任务而异,强调仅用英语评估LLM谈判有局限。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16674 2026-07-03 cs.CV cs.AI cs.CL 版本更新 62%

MedRepBench: A Comprehensive Benchmark for Medical Report Interpretation

MedRepBench:医学报告解读的综合基准

Fangxin Shang, Yuan Xia, Dalu Yang, Yahui Wang, Binglin Yang

机构 * Baidu Inc.(百度公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出MedRepBench基准,包含1925张去标识中文医学报告图像,评估端到端视觉语言模型在报告字段结构化提取和患者友好解释上的性能,并提供GRPO对齐基线提升字段召回率6%。

Comments ECCV 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26874 2026-07-01 cs.DB cs.AI cs.LG 版本更新 62%

Knowledge Graphs as the Missing Data Layer for LLM-Based Industrial Asset Operations

知识图谱:基于LLM的工业资产运营中缺失的数据层

Madhulatha Mandarapu, Sandeep Kunkunuru

机构 * VaidhyaMegha Private Limited, India(印度VaidhyaMegha私人有限公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究通过类型化知识图谱作为数据层,将GPT-4在工业维护场景中的准确率从65%提升至99%,并引入生成增强知识(GAK)处理缺失数据,实现81.8%的场景可回答性。

Comments v4: Accepted at Agents+Graph (AG2026) @ VLDB 2026. Corrects claims to reproduced ground truth: base graph 9 labels/5 edge types/12,647 nodes (extended schema 14/21); GAK materializes 106 failure-mode nodes; FailureSensorIQ noted as a separate IBM benchmark; 467 FMSR overlap with GAK disclosed. 20 pages, 4 figures. Code: github.com/samyama-ai/assetops-kg

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19600 2026-07-01 cs.SE cs.AI cs.CL 版本更新 62%

Human-Agent Collaborative Paper-to-Page Crafting

人机协作的论文到网页制作

Qianli Ma, Siyu Wang, Yilin Chen, Yinhao Tang, Yixiang Yang, Chang Guo, Bingjie Gao, Zhening Xing, Yanan Sun, Zhipeng Zhang

机构 * AutoLab, SAI, Shanghai Jiao Tong University(上海交通大学人工智能学院AutoLab实验室) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 推理评测 :planning(abstract);分类 cs.CL、cs.AI

AI总结 提出AutoPage多智能体系统,通过粗到细的流水线将论文转化为交互式网页,并引入Checker智能体验证和人工检查点,在15分钟内以低于0.1美元的成本生成高质量网页。

Comments Accepted by ACL2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28118 2026-06-26 cs.SE cs.AI cs.LG 版本更新 62%

Hierarchical Fault Detection and Diagnosis for Transformer Architectures

DEFault++: 用于变压器架构的自动故障检测、分类和诊断

Sigma Jahan, Saurabh Singh Rajput, Tushar Sharma, Mohammad Masudur Rahman

机构 * Faculty of Computer Science(计算机科学系) Dalhousie University(达尔豪斯大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 DEFault++通过三级抽象检测、分类和诊断变压器故障,利用原型匹配与监督对比学习在DEFault-bench上实现高检测准确率和分类性能。

Comments Submitted in the ACM Transactions on Software Engineering and Methodology as Journal-First

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18446 2026-06-26 cs.CL cs.AI 版本更新 62%

ReportLogic: Evaluating Logical Quality in Deep Research Reports

ReportLogic: 评估深度研究报告的逻辑质量

Jujia Zhao, Zhaoxin Huan, Zihan Wang, Xiaolu Zhang, Jun Zhou, Suzan Verberne, Zhaochun Ren

机构 * Leiden Institute of Advanced Computer Science, Leiden University(莱顿先进计算机科学研究所,莱顿大学) Ant Group(蚂蚁集团) CISPA Helmholtz Center for Information Security(信息安全霍普夫中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出ReportLogic基准,通过可审计性视角量化报告逻辑质量,包含宏观逻辑、阐述逻辑和结构逻辑三层评估,并训练开源LogicJudge进行可扩展评估。

Comments Accepted by ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00012 2026-06-23 cs.LG cs.AI cs.CY cs.IR 版本更新 62%

OGD4All: A Framework for Accessible Interaction with Geospatial Open Government Data Based on Large Language Models

OGD4All: 基于大语言模型的可访问地理空间开放政府数据交互框架

Michael Siebenmann, Javier Argota Sánchez-Vaquerizo, Stefan Arisona, Krystian Samp, Luis Gisler, Dirk Helbing

机构 * Professorship of Computational Social Science, ETH Zurich(计算社会科学教授职位,苏黎世联邦理工学院) Esri R&D Center Zurich(埃斯里苏黎世研发中心) Complexity Science Hub(复杂性科学中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出OGD4All框架,结合语义检索、智能体推理和沙盒执行,实现基于大语言模型的地理空间开放政府数据交互,在430个数据集上达到98%分析正确率和94%召回率,有效减少幻觉风险。

Comments Author Accepted Manuscript (AAM). Proceedings of 2026 IEEE CAI (Granada, Spain). Update manuscript with final DOI. Code & data available at: https://github.com/ethz-coss/ogd4all

Journal ref 2026 IEEE Conference on Artificial Intelligence (CAI), pp. 882-888

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07528 2026-06-23 cs.CL cs.AI 版本更新 62%

From RAG to Agentic RAG for Faithful Islamic Question Answering

从RAG到智能体RAG:面向可靠的伊斯兰问答

Gagan Bhatia, Hamdy Mubarak, Mustafa Jarrar, George Mikros, Fadi Zaraket, Mahmoud Alhirthani, Mutaz Al-Khatib, Logan Cochrane, Kareem Darwish, Rashid Yahiaoui, Firoj Alam

机构 * Qatar Computing Research Institute, HBKU, Qatar(卡塔尔计算研究中心,HBKU,卡塔尔) College of Humanities and Social Sciences, HBKU, Qatar(人文与社会科学学院,HBKU,卡塔尔) Arab Center for Research and Policy Studies, Qatar(阿拉伯研究中心与政策研究所,卡塔尔) College of Islamic Studies, HBKU, Qatar(伊斯兰研究学院,HBKU,卡塔尔) College of Public Policy, HBKU, Qatar(公共政策学院,HBKU,卡塔尔)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对LLM在伊斯兰问答中的幻觉与弃权问题,构建双语基准IslamicFaithQA,并提出基于结构化工具调用的智能体RAG框架,显著提升正确性与鲁棒性。

Comments Islamic Question Answering; Faithful Question Answering; Retrieval-Augmented Generation; Agentic RAG; Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06676 2026-06-23 cs.CL cs.AI cs.HC 版本更新 62%

One Interaction Is Worth a Thousand Guesses: Benchmarking the Interactive Capabilities of Deep Research Agents

一次交互胜过千次猜测:深度研究代理的交互能力基准测试

Yingchaojie Feng, Qiang Huang, Xiaoya Xie, Zhaorui Yang, Jun Yu, Wei Chen, Anthony K. H. Tung

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) School of Intelligence Science and Engineering, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)智能科学与工程学院) Zhejiang University(浙江大学) State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出IDRBench基准,通过交互式框架和用户模拟器评估深度研究代理的交互能力,实验表明交互能提升研究质量和鲁棒性。

Comments 17 pages, 9 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22411 2026-06-23 cs.CL cs.AI 版本更新 62%

NeedleChain: Measuring Intact Context Comprehension Capability of Large Language Models

NeedleChain: 测量大型语言模型的完整上下文理解能力

Hyeonseok Moon, Heuiseok Lim

机构 * Department of Computer Science and Engineering, Korea University(韩国大学计算机科学与工程系)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对现有基准高估LLM上下文理解能力的问题,提出NeedleChain基准,通过全相关上下文测试模型整合所有证据的能力,并引入ROPE收缩策略提升全上下文整合。

Comments ACL2026 - findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13550 2026-06-23 cs.CL cs.AI 版本更新 62%

Are LLMs Effective Negotiators? Systematic Evaluation of the Multifaceted Capabilities of LLMs in Negotiation Dialogues

LLMs 是有效的谈判者吗?LLMs 在谈判对话中多方面能力的系统评估

Deuksin Kwon, Emily Weiss, Tara Kulshrestha, Kushal Chawla, Gale M. Lucas, Jonathan Gratch

机构 * University of Southern California(南加州大学) University of California, Berkeley(加州大学伯克利分校) Capital One

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 系统评估大型语言模型在谈判中的多方面能力,发现 GPT-4 表现优异,但在主观评估和生成策略性响应方面存在挑战。

Comments Accepted to Findings of EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12805 2026-06-18 q-bio.GN cs.AI cs.CL 版本更新 62%

SciHorizon-GENE: Benchmarking LLM for Life Sciences Inference from Gene Knowledge to Functional Understanding

SciHorizon-GENE:从基因知识到功能理解的生命科学推理基准测试

Xiaohan Huang, Meng Xiao, Chuan Qin, Qingqing Long, Jinmiao Chen, Yuanchun Zhou, Hengshu Zhu

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) University of the Chinese Academy of Sciences(中国科学院大学) DUKE-NUS Medical School, National University of Singapore(新加坡国立大学杜克-新加坡医学学校) Singapore Immunology Network, Agency for Science, Technology and Research(新加坡免疫网络,科技研究局)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型在基因级推理能力上的不足,构建了包含超过19万个人类基因和54万问题的基准SciHorizon-GENE,从研究关注敏感性、幻觉倾向、答案完整性和文献影响力四个生物学关键维度评估模型,揭示了模型在生成忠实、完整且基于文献的功能解释方面的持续挑战。

Comments Accepted by SIGKDD 2026. 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23851 2026-06-18 cs.CL cs.AI cs.SC 版本更新 62%

ASyMOB: Algebraic Symbolic Mathematical Operations Benchmark

ASyMOB:代数符号数学运算基准

Michael Shalyt, Rotem Elimelech, Ido Kaminer

机构 * MIT(麻省理工学院) Technion - Israel Institute of Technology(技术学院-以色列理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出ASyMOB基准,包含35,368个符号数学问题,通过扰动测试揭示大模型在符号数学推理中的鲁棒性不足,并发现LLM与CAS的互补潜力。

Comments Published in ICML2026: https://icml.cc/virtual/2026/poster/63549 Code repository: https://github.com/RamanujanMachine/ASyMOB Complete benchmark dataset: https://huggingface.co/datasets/Shalyt/ASyMOB-Algebraic_Symbolic_Mathematical_Operations_Benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏