arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 969 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 969 篇

2608.07762 2026-08-11 cs.AI cs.CR 新提交 70%

Who Verifies the Benchmark? Decentralizing Trust in Large Language Model Evaluation

谁来验证基准?去中心化大语言模型评估中的信任问题

Sahil Pardasani, Madhusudan Singh

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 推理评测 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 针对LLM基准测试的信任问题,该研究分析7种验证模型的身份感知偏差,提出基于区块链的提交-披露协议以实现去中心化、可验证的LLM评估。

Comments Accepted to International Conference on Quantum Enhanced AI and Secure Computing (QASC2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06108 2026-08-07 cs.AI 新提交 70%

Evaluating Investment Logic in Large Language Models: A Real-World Benchmark Towards Personalzied Financial Agents

评估大语言模型的投资逻辑:面向个性化金融智能体的真实世界基准

Yuanhong Jiang, Jingjie Zou, Zhenghong Lin, Xusheng Yu, Qiqi Huang, Shuai Jia, Shijie Dai

专题命中 推理评测 :reasoning(abstract,abstract_cn);分类 cs.AI

AI总结 该研究推出原生过程基准InvestLogicBench,含151位真实投资者的201247项决策,评估发现金融LLMs逻辑合理性高但事件接地性低,指出需以P→E→R→D→O轨迹评估个性化决策智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04311 2026-08-06 cs.CL 新提交 70%

Pun Intended: Multi-Agent Translation of Wordplay with Contrastive Learning and Phonetic-Semantic Embeddings

并非双关:基于对比学习与音义嵌入的多智能体文字游戏翻译

Russell Taylor, Benjamin Herbert, Michael Sana

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本研究结合大型语言模型与语言约束,提出三种双关语翻译方法,其多智能体系统在CLEF JOKER 2025竞赛中获专家评估第一,可改善文字游戏翻译效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00018 2026-08-04 cs.DB cs.AI 新提交 70%

CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs

CITBench:面向大语言模型的交互式表格数据处理综合基准

Zihan Nan, Yang Gu, Wei Liu, Xi Yan, Zhou Liu, Hao Liang, Wentao Zhang

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出 CITBench 交互式表格数据处理基准,评估发现现有 LLM 在简单表格任务表现良好,但在复杂多轮交互场景下的理解、规划与表格结构感知仍存在显著挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27798 2026-07-31 cs.AI 新提交 70%

MemeBench: What LVLMs Miss When Interpreting Culture-Dependent Memes

MemeBench:大型视觉语言模型在解读依赖文化的梗图时所缺失的内容

Weihang Wang, Kainan Tu, Jielei Zhang, Run Yang, Boheng Sheng, Yuchen He, Yu Xie, Pengyu Chen, Peiyi Li, Huyang Sun, Longwen Gao, Zhouhui Lian

专题命中 推理评测 :reasoning(abstract,abstract_cn);分类 cs.AI

AI总结 研究针对LVLMs解读文化类梗图的知识缺口问题,推出诊断基准MemeBench及实体引导检索基线KAR,验证了检索手段可提升梗图解读的VIKR成功率。

Comments 17 pages, 5 figures, and 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25415 2026-07-29 cs.AI 新提交 70%

A Control System, a Dataset, and a Recipe for Making Frozen LLM Agents Learn a Domain

一种用于使冻结的语言模型智能体学习领域的控制系统、数据集和方法

Debjyoti Paul

机构 * Meta AI

专题命中 推理评测 :planning(abstract);verifier(abstract);分类 cs.AI

AI总结 研究如何让冻结的语言模型智能体学习领域,核心方法是将框架视为特定动作空间,用经典强化学习在线学习策略并以多目标奖励评分,贡献包括用DSPy实例化系统并评估,还发布相关代码、任务套件、训练日志及部署方法。

Comments 8 pages, 1 figure, 3 tables. Code and dataset: https://github.com/dpaul0501/context-optimization-rl

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21632 2026-07-27 cs.CL 新提交 70%

A Consensus-Based Framework for Relative Preference Evaluation of Large Language Models

一种基于共识的大语言模型相对偏好评估框架

Mohtashim Khan

专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL

AI总结 针对大语言模型传统评估基准不足,本文提出基于共识的评估框架,通过不同模型对候选响应排序,以模型间一致性衡量质量,经多模型跨领域研究揭示偏好模式,提供了可扩展的比较评估方法。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21424 2026-07-24 cs.CL cs.SD 新提交 70%

An Evaluation Framework for Structured Audio Captions Validated by Controlled Perturbations

一种通过受控扰动验证的结构化音频字幕评估框架

Liang-Yuan Wu, Sripathi Sridhar, Mark Cartwright, Magdalena Fuentes

专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL

AI总结 研究针对结构化音频字幕评估难的问题,提出多轴评估框架,结合大语言模型判断与计算指标,在五个正交轴上评估,通过受控扰动测试协议验证可靠性,能区分释义与损坏。

Comments submitted to DCASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20498 2026-07-24 cs.AI 新提交 70%

AISE-Bench: A Full-Cycle Curated Benchmark for Information Seeking on Academic Knowledge Graphs

AISE-Bench:用于学术知识图谱信息检索的全周期精选基准测试

Fanjin Zhang, Zhengyang Wang, Ruixuan Huang, Kefan Zhang, Amy Xin, Yuanchun Wang, Shu Zhao, Evgeny Kharlamov, Jie Tang, Juanzi Li

机构 * Renmin University of China(中国人民大学) Anhui University(安徽大学) Z-Lab Z.ai Tsinghua University(清华大学) Bosch Center for AI(博世人工智能中心) University of Oslo(奥斯陆大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 研究针对学术知识图谱信息检索基准测试不足的问题,引入AISE-Bench,通过定制工作流程和综合评估协议构建基准测试,为多步API使用的大语言模型智能体提供新测试平台,助力评估与改进。

Comments 9 pages, accepted by KDD 2026

Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD '26), August 09-13, 2026, Jeju Island, Republic of Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17902 2026-07-21 cs.DL cs.CL 新提交 70%

Benchmarking Resource-Efficient LLMs for Research Topic Ontology Generation in the Biomedical Field

用于生物医学领域研究主题本体生成的资源高效语言模型基准测试

Tanay Aggarwal, Angelo Salatino, Francesco Osborne, Enrico Motta

机构 * Knowledge Media Institute, The Open University, Milton Keynes, UK(开放大学知识媒体研究所) Department of Business and Law, University of Milano-Bicocca, Milan, IT(米兰-比科卡大学商业与法律系)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文评估五个小型开源LLMs识别生物医学概念语义关系的性能,引入MeSH-Rel-4K数据集并分析三种策略,发现针对性微调使平均F1分数显著提高,突破推理瓶颈,为构建生物医学本体提供准确自动化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14543 2026-07-17 cs.RO cs.AI 新提交 70%

SafeRelBench: A Spatial-Relation-Aware Benchmark for Process-Level Safety in VLM-Driven Embodied Agents

SafeRelBench:用于VLM驱动的具身智能体过程级安全的空间关系感知基准测试

Huaigang Yang, Ya Li, Min Ren, Bo Dai, Zhenliang Zhang, Zhaofeng He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,字节跳动公司)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 研究VLM驱动具身智能体的过程级安全问题,引入SAFERELBENCH基准测试,含507个样本。评估七个智能体发现任务成功与安全合规有差距,该基准明确测试行动前安全条件,凸显空间关系在安全评估中的核心地位。

Comments Preprint. 10 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12058 2026-07-15 cs.SE cs.AI cs.CR 新提交 70%

AutoTrace: From Patches to Triggers via Agentic Interprocedural Exploration

AutoTrace:通过智能过程间探索从补丁到触发器

Arastoo Zibaeirad, Marco Vieira, Thomas Zimmermann

专题命中 推理评测 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 研究针对修复漏洞提交的触发器定位难题,提出AutoTrace智能管道逐层探索代码属性图定位漏洞触发器,并构建SinkTrace - Bench数据集。AutoTrace在基准测试中表现出色,还揭示了前沿语言模型在因果推理上的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03704 2026-07-07 cs.CL 新提交 70%

Optimizing Large Language Models for Causality Assessment in Pharmacovigilance: Developing a Performance Metric as Objective for Bayesian Hyperparameter Optimization

优化用于药物警戒中因果关系评估的大语言模型:开发一种性能指标作为贝叶斯超参数优化的目标

Nicole Sonne Heckmann, Arnault-Quentin Vermillet, Søren Norlin Mølgaard, Manuela Del Castillo Suero, Lars Melskens, Gerard Ompad, Maurizio Sessa

机构 * Department of Drug Design and Pharmacology, University of Copenhagen(哥本哈根大学药物设计与药理学系) Safety Operations, Novo Nordisk(诺和制药安全运营部) Clinical Development Centre Denmark, Novo Nordisk(丹麦临床开发中心,诺和制药) Statistical Data Science Lead, Pfizer(辉瑞统计数据科学负责人)

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 研究针对药物警戒中因果关系评估优化大语言模型,开发高斯过程兼容的优化目标,用链思维提示评估GPT-5.2,通过贝叶斯优化研究温度优化效果,EWACS指标优化提升了因果关系分类一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02680 2026-07-07 cs.CV cs.AI 新提交 70%

K9-Bench: Evaluating Multimodal LLMs on Canine-Centric Videos

K9-Bench:在以犬类为中心的视频上评估多模态大语言模型

Khush Attarde, Yusuf Ali, Megha Thukral, Divye Bhutani, Thomas Ploetz, Zsolt Kira

机构 * Ogmen Robotics Inc.(Ogmen机器人公司) Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 介绍K9-Bench基准,通过约5000个问答对测试多模态大语言模型对犬类动作和互动理解。提出数据生成管道创建数据集,发现前沿模型在犬类任务上零样本性能有限,还提供通用数据集构建管道。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24155 2026-07-07 cs.CL 新提交 70%

MedBench v5: A Dynamic, Process-Oriented, and Hallucination-Aware Benchmark for Clinical Multimodal Models

MedBench v5:面向临床多模态模型的动态、过程导向且幻觉感知的基准

Jinru Ding, Chuchu Jiang, Lu Lu, Wenrao Pang, Mouxiao Bian, Zhuangzhi Gao, Jiangyuan Chen, Xinwei Peng, Ruiyao Chen, Sijie Ren, Renjie Lu, Yun Zhong, Bin Han, Meiling Liu, Jie Xu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 推理评测 :reasoning(abstract);self-correction(abstract);分类 cs.CL

AI总结 提出MedBench v5,通过双维框架、可切换信息流压力源、动态过程审计协议和幻觉传播监控,实现临床多模态模型的动态过程评估与幻觉检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31308 2026-07-01 cs.AI 新提交 70%

Benchmarking Large Language Models on Floating-Point Error Classification

大型语言模型在浮点错误分类上的基准测试

Lisa Taldir, Muhammad Ahmad Saeed, David Defour, Pablo de Oliveira Castro, Eric Petit

专题命中 推理评测 :reasoning(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出InterFLOPBench基准,评估14个LLM在六类浮点错误上的静态检测性能,最新模型整体F1超过0.88。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27608 2026-06-29 cs.CV cs.LG 新提交 70%

Qwen-Image-2.0-RL Technical Report

Qwen-Image-2.0-RL 技术报告

Yixian Xu, Kaiyuan Gao, Yuxiang Chen, Yilei Chen, Zecheng Tang, Zihao Liu, Zikai Zhou, Deqing Li, Hao Meng, Kuan Cao, Jiahao Li, Jie Zhang, Liang Peng, Lihan Jiang, Ningyuan Tang, Shengming Yin, Tianhe Wu, Xiaoyue Chen, Yan Shu, Yanran Zhang, Yi Wang, Yu Wu, Yujia Wu, Zekai Zhang, Zhendong Wang, Xiao Xu, Kun Yan, Chenfei Wu

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 提出基于强化学习与在线蒸馏的后训练流程,通过复合奖励模型和GRPO框架提升扩散模型的视觉质量与指令遵循能力,在多个基准上取得显著提升。

Comments 16 pages, 6 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27397 2026-06-29 cs.MA cs.AI cs.GT 新提交 70%

SidConArena: An Environment Evaluating Agents in Open-Ended,Positive-Sum Bargaining Game

SidConArena:一个在开放、正和博弈中评估智能体的环境

Yeqi Feng, Yuxin Chen, Tianxing He

机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 提出SidConArena基准框架,通过三阶段部分可观测随机博弈评估LLM智能体在开放、正和谈判中的经济决策能力,发现前沿模型虽表现更好但仍存在资源误估、谈判被动和长期规划不足。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24747 2026-06-24 cs.AI cs.CE 新提交 70%

Scaling Laws for Task-Specific LLM Distillation

任务特定LLM蒸馏的缩放定律

Lavinia Ghita, Dhruv Desai, Ioana Boier

机构 * NVIDIA(英伟达)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文推导了领域特定LLM压缩的经验缩放定律,通过定量金融领域的实验,比较了基于logit和LoRA的蒸馏方法,并引入混合思维链监督损失,揭示了监督格式对领域知识与通用知识权衡的关键作用。

Comments 24 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24370 2026-06-24 cs.AI cs.CY 新提交 70%

When Helpfulness Overrides Causal Caution: Context-Dependent Suppression and Recovery in LLMs

当有用性凌驾于因果谨慎之上:LLM中的上下文依赖抑制与恢复

Hiroshi Okumura

机构 * Mitsubishi Research Institute, Inc.(三菱电机研究所) Kobe University(北九州市立大学)

专题命中 推理评测 :reasoning(abstract);self-correction(abstract);分类 cs.AI

AI总结 研究LLM从学术到实践咨询语境中因果谨慎的系统性抑制,发现有用性导向响应模式导致因果谨慎表达大幅下降,而自纠正提示可有效恢复。

Comments 43 pages, 3 figures, 5 tables. SSRN Abstract ID: 6965680

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12657 2026-06-12 cs.AI cs.DB cs.RO 新提交 70%

TrajGenAgent: A Hierarchical LLM Agent for Human Mobility Trajectory Generation

TrajGenAgent: 一种用于人类移动轨迹生成的分层LLM智能体

Siyu Li, Toan Tran, Lingyi Zhao, Khurram Shafique, Li Xiong

机构 * Emory University(埃默里大学) University of Florida(佛罗里达大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 提出TrajGenAgent,一种无需微调的分层LLM智能体框架,通过编排器-工作者两阶段设计生成真实轨迹,在时空保真度、语义一致性和个体行为真实性上优于现有方法。

Comments 14 pages, 2 figures, 8 tables. Accepted by the 27th IEEE International Conference on Mobile Data Management (MDM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12160 2026-06-12 cs.CL 新提交 70%

A Controlled Study of Decoding-Time Truthfulness Methods on Instruction-Tuned LLMs

指令调优大语言模型解码时真实性方法的受控研究

Ao Sun

机构 * Independent Researcher(独立研究员)

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 本研究通过分析每层令牌logits特征,提出CHAIR框架检测幻觉,在TruthfulQA和MMLU上显著提升零样本检测准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11909 2026-06-11 cs.AI 新提交 70%

Embodied-BenchClaw: An Autonomous Multi-Agent System for Embodied Spatial Intelligence Benchmark Construction

Embodied-BenchClaw:用于具身空间智能基准构建的自主多智能体系统

Baoyang Jiang, Fengchun Zhang, Leyuan Wang, Haotian Li, Yida Wang, Zhe Ji, Jinshan Lai, Xi Ren, Jianwei Hu, Qiang Ma

机构 * QiYuan Lab(启元实验室) School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院) Beijing University of Posts and Telecommunications(北京邮电大学) School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 提出Embodied-BenchClaw,一个通过五阶段流水线和三个智能体协调的自主系统,自动构建可验证、可执行、可维护且诊断有用的具身空间智能基准,减少人工工作量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07682 2026-06-09 cs.SE cs.AI 新提交 70%

SWE-Marathon: Can Agents Autonomously Complete Ultra-Long-Horizon Software Work?

SWE-Marathon: 智能体能否自主完成超长时程软件工作?

Rishi Desai, Jesse Hu, Joan Cabezas, Neel Harsola, Pratyush Shukla, Roey Ben Chaim, Adnan El Assadi, Omkaar Mukund Kamath, Fenil Faldu, Prannay Hebbar, Jiankai Sun, Yiyuan Li, Pramod Srinivasan, Ishan Gupta, Christopher Settles, Daniel Wang, Derek Chen, Pranav Raja, Albert Liu, Marek Šuppa, Nevasini Sasikumar, Luyang Kong, Erik Quintanilla, Xiangyi Li, Ivan Bercovich, Steven Dillmann

机构 * Abundant Zenity Harvard University(哈佛大学) University of Waterloo(滑铁卢大学) Gujarat Technological University(古吉拉特技术大学) Warping Stanford University(斯坦福大学) UNC-Chapel Hill(北卡罗来纳大学教堂山分校) Independent(独立) Refresh Soleda AI Near AI Georgia Tech(佐治亚理工学院) Comenius University in Bratislava(布拉迪斯拉发Comenius大学) UC San Diego(圣地亚哥大学) BenchFlow UC Santa Barbara(圣巴巴拉大学)

专题命中 推理评测 :planning(abstract);verifier(abstract);分类 cs.AI

AI总结 提出SWE-Marathon基准,包含20个超长时程任务,平均消耗2720万token,评估智能体在规划、长上下文理解和记忆方面的能力,当前前沿编码智能体解决率低于30%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13606 2026-08-17 cs.AI cs.CL cs.LG cs.MA cs.MM 新提交 67%

MobileMem: Learning from a Year of Mobile Experiences

MobileMem:从一年的移动体验中学习

Xinle Deng, Yida Xue, Xiangyuan Ru, Haoming Xu, Shuofei Qiao, Mengru Wang, Yijun Chen, Buqiang Xu, Chen Jiang, Yuchen Eleanor Jiang, Lizhong Wang, Jianfeng Wang, Li Zeng, Haofen Wang, Guilin Qi, Huajun Chen, Ningyu Zhang

机构 * OPPO OpenKG

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究推出MobileMem基准与框架,基于一年移动体验构建,用于设备端长期记忆研究,支持多类推理,推动智能体从信息检索向体验智能发展。

Comments Technical Report; Project Page: this http URL (http://mobilemem.openkg.cn/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13463 2026-08-14 cs.CV cs.AI cs.CL cs.LG 新提交 67%

MLLM-Routed Heterogeneous Ensembles for Robust Cross-Dataset Image Classification

用于鲁棒跨数据集图像分类的MLLM路由异质集成模型

Daniel Perkins, John Squires, Janou Milligan, Chandra Raskoti, Linda Ungerboeck

机构 * The Bredesen Center for Interdisciplinary Research and Graduate Education(布雷德森跨学科研究与研究生教育中心) University of Tennessee Knoxville(田纳西大学诺克斯维尔分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究针对跨数据集图像分类泛化难题,提出ARMDIL模型,通过MLLM智能体动态路由图像到适配的视觉骨干,兼具竞争力、高适应性与可解释性,为通用视觉系统奠定基础。

Comments 8 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13267 2026-08-14 cs.CL cs.AI cs.CV cs.LG 新提交 67%

How Do VLMs Behave When Blind or Misled? Behavioral Evaluation of VLMs on Scientific Figures

视觉语言模型(VLMs)在失明或被误导时的表现如何?针对科学图表的VLMs行为评估

Paul Osemudiame Oamen, Owusu-Banahene Osei, Ananya Mukherjee, Christian Greisinger, Steffen Eger, Pius Onobhayedo, Wei Zhao

机构 * University of Aberdeen(阿伯丁大学) International Institute of Information Technology Hyderabad(海德拉巴国际信息技术学院) University of Technology Nuremberg(纽伦堡工业大学) University of Southern California(南加利福尼亚大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究构建科学图表理解基准SciFigBench,提出A-R-I框架评估VLMs在视觉证据缺失或误导时的行为可靠性,发现高感知与推理准确性不代表行为可靠,不同模型表现存在显著差异。

Comments 25 pages including appendix. Project website: https://scifigbench.nlp4sci.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12781 2026-08-14 cs.CV 新提交 67%

Beyond Correctness: Benchmarking and Aligning Response Behaviors in Hybrid-Thinking MLLMs

超越正确性:混合思维多模态大语言模型(MLLM)的响应行为基准测试与对齐

Xinming Wang, Weinong Wang, Hongming Yang, Yansong Lin, Zheng Ruan, Shangpin Peng, Qiming Peng, Nan Qiao, Fengyuan Lu, Guoqing Ma, Marito Li, Songyang Zhang, Saiyong Yang, Han Hu, Yonglong Tian, Xu-Yao Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Large Language Model Department, Tencent(腾讯大语言模型部) University of Electronic Science and Technology of China(电子科技大学) Hong Kong University of Science and Technology(香港科技大学) Zhongguancun Academy(中关村学院)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

AI总结 该研究针对混合思维 MLLM 的思维与非思维模式响应错位问题,构建 PatternEval 基准并开发 PatternRL 方法,可减轻跨模式错位且任务性能损失极小。

Comments 8 tables and 6figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12654 2026-08-14 cs.AI cs.CL cs.LG 新提交 67%

SteerBench-Work: A Benchmark for Agent Steering at Action Boundaries

SteerBench-Work:动作边界处智能体决策的基准测试

Oguz Serdar, Cuneyt Mertayak

机构 * AgentDock

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究推出职场智能体动作边界决策基准SteerBench-Work,发现模型在该任务中存在过度拒绝的显著偏差,且通用能力与引导校准并不等同。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11787 2026-08-13 cs.CL cs.AI cs.LG 新提交 67%

GRPO for Financial Advice Generation: Outperforming Commercial LLMs under CATE Evaluation

用于金融建议生成的GRPO:在CATE评估下优于商用大语言模型

Ofir Ben Shoham, Shrutendra Harsola, Vignesh Subrahmaniam, Shravan Mohan, Yakov Gazman, Oded Vainas

机构 * Intuit(英图易(金融科技公司))

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究将金融建议生成建模为强化学习问题,用GRPO微调开放权重大语言模型,经独立于评判者的CATE审计,其毛利润提升约为最强商用基线的两倍,表现优于商用大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏