arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-30 至 2026-06-30 共收录 223 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 51 篇

2606.29278 2026-06-30 cs.AI cs.CL 81%

The Complexity Ceiling Benchmark: A Multi-Domain Evaluation of Sequential Reasoning Under Depth Scaling

复杂性天花板基准:深度缩放下顺序推理的多领域评估

Shubh Chapra, Dhruv Kumar, Murari Mandal, Yash Sinha

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出复杂性天花板基准(CCB),通过控制任务语义内容、仅改变推理深度N,评估语言模型在三个结构不同领域中的顺序推理衰减,发现几何级数衰减和领域天花板差异,并引入跟踪级指标TFBC。

Comments 12 pages, 6 figures. Accepted to the 1st Workshop on Combining Theory and Benchmarks (CTB), CTB@ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29254 2026-06-30 cs.CL cs.NE 80%

Travel-Oriented Reasoning Large Language Model via Domain-Specific Knowledge Graphs

面向旅游的推理大语言模型:基于领域特定知识图谱

Vignesh Ram Nithin Kappagantula, Shayan Hassantabar, Samuel Simpson, Golnaz Moallem

机构 * Expedia Group(Expedia集团)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 提出一种模块化流水线,利用专家构建的知识图谱生成多跳问答对,微调大语言模型以提升旅游领域推理的准确性和校准能力,在基准上达到82.4%精确匹配。

Comments Accepted to the Uncertainty Reasoning and Quantification in Decision Making (UDM) Workshop, KDD 2026 (To be presented in August 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29067 2026-06-30 cs.CL 79%

ThinkProbe: Beyond Accuracy -- Structural Profiling of Open-Ended LLM Reasoning Traces via Non-Generative Thought Graphs

ThinkProbe:超越准确性——通过非生成式思维图对开放式LLM推理轨迹进行结构分析

Mohamed Amine Kerkouri, Simon D. Hernandez, Marouane Tliba, Yann Dauxais, Maha Ben-Fares, Pierre Holat

机构 * F-Initiatives Université sorbonne Paris Nord(巴黎-索邦大学 Nord)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 提出ThinkProbe框架,将LLM推理轨迹转化为思维图,通过非生成式管道提取五维认知特征,发现推理结构是模型级稳定属性,且结构维度对问题领域敏感。

Comments Under Review for EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28349 2026-06-30 cs.IR cs.AI 79%

HMARS: A Hierarchical Multi-Agent Memory System for Long-Context Reasoning

HMARS:用于长上下文推理的分层多智能体记忆系统

Zeju Li, Ziyang Zheng, Yizhou Zhou, Qiang Xu

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 提出HMARS分层多智能体记忆系统,通过子智能体、中层智能体和前沿模型的分层结构管理长上下文,在长文档和多轮记忆任务中优于检索、重排序、全上下文、基于图和智能体基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09305 2026-06-30 cs.LG 79%

Reward Modeling for Reinforcement Learning-Based LLM Reasoning: Design, Challenges, and Evaluation

基于强化学习的LLM推理中的奖励建模:设计、挑战与评估

Pei-Chi Pan, Yingbin Liang, Sen Lin

机构 * University of Houston(得克萨斯大学) The Ohio State University(俄亥俄州立大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 本文探讨了奖励建模在提升LLM推理性能中的关键作用,提出了一种以推理为中心的分类视角,分析了奖励机制、奖励黑客问题及评估挑战,旨在构建更稳健、可验证的推理模型。

Comments Accepted at Transactions on Machine Learning Research (TMLR), 2026. https://openreview.net/forum?id=TDfrN1TbGH

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21526 2026-06-30 cs.CV 78%

VIGIL: Part-Grounded Structured Reasoning for Generalizable Deepfake Detection

VIGIL:基于部分的结构化推理用于通用深度伪造检测

Xinghan Li, Junhao Xu, Jingjing Chen

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所) Shanghai Key Laboratory of Multimodal Embodied AI(上海市多模态具身人工智能重点实验室)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 VIGIL通过计划-检验流程,结合部分级证据和结构化推理,提升深度伪造检测的可解释性和泛化能力。

Comments Project Page: https://vigil.best

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29689 2026-06-30 cs.CL 74%

Can MLLMs Critique Like Humans? Evaluating Open-Ended Aesthetic Reasoning in Multimodal Large Language Models

MLLM 能否像人类一样进行批评?评估多模态大语言模型中的开放式审美推理

Sajjad Ghiasvand, Maryam Amirizaniani, Haniyeh Ehsani Oskouie, Mahnoosh Alizadeh, Ramtin Pedarsani

机构 * UCSB(加州大学圣塔芭芭拉分校) University of Washington(华盛顿大学) UCLA(加州大学洛杉矶分校)

专题命中 推理评测 :reasoning(title);分类 cs.CL

AI总结 本文评估多模态大语言模型在开放式审美批评中的表现,发现基于参考的相似度指标存在误导,模型在选择性、特异性和多样性方面与人类批评存在系统性差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29130 2026-06-30 cs.CL 70%

DistilledGemma: Balanced Efficiency-Accuracy for Person-Place Relation Extraction from Multilingual Historical Articles

DistilledGemma:面向多语言历史文章的人物-地点关系提取的平衡效率与准确性

Youssef Aboelwafa, Ahmed Samir, Nagwa Elmakky, Marwan Torki

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 提出DistilledGemma系统,采用三阶段知识蒸馏管道,从26B教师模型蒸馏到2.3B学生模型,在HIPE-2026共享任务中实现高效准确的人物-地点关系提取,标准测试集排名第三,二进制测试集排名第二。

Comments The Conference and Labs of the Evaluation Forum (CLEF) 2026 - HIPE Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28385 2026-06-30 cs.RO cs.AI 70%

RoboGaze: Evaluating Robot World Models via Structured Vision-Language Analysis

RoboGaze: 通过结构化视觉-语言分析评估机器人世界模型

Minh-Loi Nguyen, Nghiem Tuong Diep, Hung Khang Nguyen, Minh Le, Doanh Le Thien, Hoang H. Tran, Dung D. Le, Vu N. Duong, Daniel Sonntag, An Thai Le, Duy Minh Ho Nguyen, Vien Anh Ngo, Tran Van Nhiem

机构 * Ho Chi Minh City University of Science, Vietnam National University(越南国家科学大学胡志明市大学) VinRobotics VinUniversity German Research Center for AI (DFKI)(人工智能研究中心(DFKI)) University of Stuttgart(斯图加特大学) Max Planck Research School for Intelligent Systems(智能系统马克斯·普朗克研究学校) Technische Universität Darmstadt(达姆施塔特技术大学)

专题命中 推理评测 :planning(abstract);verifier(abstract);分类 cs.AI

AI总结 提出RoboGaze,一种无需训练的多智能体VLM框架,通过任务-场景对齐、维度专家路由和批评验证三阶段流水线,对机器人操作视频进行结构化可解释评估,显著提升描述F1和时序对齐性能。

Comments First version 29 pages, 7 figures. Project webpage: https://robogaze-eval.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00616 2026-06-30 cs.CV cs.AI 70%

Pause and Think: A Dataset and Benchmark for Video-Grounded Assistive Action Suggestion

暂停与思考:面向视频基础辅助动作建议的数据集与基准

Shivam Singh, Saptarshi Majumder, Pratik Prabhanjan Brahma, Zicheng Liu, Emad Barsoum

机构 * Advanced Micro Devices, Inc.(先进微器件公司)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 提出 pause-and-think-T 数据集和 pause-and-think-B 基准,通过推理监督训练紧凑模型,在视频场景理解与目标规划任务中达到与大型模型相当的性能。

Comments Accepted in IROS 2026 (IEEE/RSJ International Conference on Intelligent Robots and Systems)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28615 2026-06-30 cs.LG cs.AI cs.CL stat.ML 67%

What LLMs explain is not what they believe: Evaluating explanation sufficiency under models' own input beliefs

LLM 解释的内容并非其信念:基于模型自身输入信念评估解释充分性

Nhi Nguyen, Shauli Ravfogel, Rajesh Ranganath

机构 * New York University(纽约大学)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出自洽充分性(SCSuff)指标,利用 LLM 自身生成替代输入来评估自由文本解释的充分性,发现 LLM 解释通常不充分且与模型大小、准确率等弱相关。

Comments 23 pages, 9 figures, 13 tables, Forty-Third International Conference on Machine Learning (ICML 2026)

Journal ref Forty-Third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28467 2026-06-30 cs.LG cs.AI cs.CL 67%

An Agentic AI Pipeline for Appliance-Level Energy Anomaly Detection and LLM-Driven Recommendations

一种用于设备级能源异常检测和基于LLM的推荐建议的智能体AI流水线

Dihia Falouz, Aida Douaibia, Amine Bechar, Youssef Elmir, Abbes Amira, Adel Oulefki

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出一种端到端智能体流水线,结合深度时间序列预测、变分异常检测和LLM推理,为办公建筑设备级能耗生成优先级排序的可操作维护建议。

Comments 07 pages, 01 figure, accepted for presentation at the IEEE International Conference on Communication, Computing, Networking, and Control in Cyber-Physical Systems (CCNCPS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00539 2026-06-30 cs.LG cs.AI cs.CL 67%

Distributionally Robust Reinforcement Learning with Human Feedback

具有人类反馈的分布鲁棒强化学习

Debmalya Mandal, Paulius Sasnauskas, Goran Radanovic

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种分布鲁棒的强化学习方法,通过改进奖励基强化学习和直接偏好优化,提升模型在分布变化时的鲁棒性,实验显示在非分布任务中性能显著提升。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28358 2026-06-30 cs.IR cs.AI cs.CL 62%

How Do LLMs Cite? A Mechanistic Interpretation of Attribution in Retrieval-Augmented Generation

LLM如何引用?检索增强生成中归因的机制解释

Ian van Dort, Maria Heuss

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 通过激活修补方法,发现LLM的引用机制并非单一组件,而是由注意力头和MLP层组成的分布式“归因集成”,调控这些组件可修复大部分错误引用。

Comments This preprint has not undergone peer review or any post-submission improvements or corrections. The Version of Record of this contribution is published in Advances in Information Retrieval, ECIR 2026, Lecture Notes in Computer Science, vol. 16485, pp. 458-473, and is available online at https://doi.org/10.1007/978-3-032-21324-2_35

Journal ref Advances in Information Retrieval, ECIR 2026. Lecture Notes in Computer Science, vol. 16485, pp. 458-473. Springer, Cham (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28345 2026-06-30 cs.RO cs.AI cs.CL cs.CY 62%

Auditing LLM-Governed Social Robots with Culture-Specific Moral Gradients

审计具有文化特定道德梯度的LLM驱动社交机器人

Carmen Ng, Gjergji Kasneci

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对LLM驱动社交机器人在跨文化场景中优先分配资源时的道德偏差,提出基于梯度的多语言审计框架,通过对称控制场景测试模型对文化偏好梯度的区分能力,发现提示工程无法可靠纠正的持续性不对称问题。

Comments Accepted for publication in Proceedings of the 2026 ACM Conference on Fairness, Accountability, and Transparency (FAccT '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09066 2026-06-30 cs.SD cs.AI cs.CL 62%

ORCA: Open-ended Response Correctness Assessment for Audio Question Answering

ORCA:面向音频问答的开放性回答正确性评估

Šimon Sedláček, Sara Barahona, Bolaji Yusuf, Laura Herrera-Alarcón, Santosh Kesiraju, Cecilia Bolaños, Alicia Lozano-Diez, Sathvik Udupa, Fernando López, Allison Ferner, Ramani Duraiswami, Jan Černocký

机构 * Brno University of Technology(布尔诺科技大学) Universidad Autónoma de Madrid(马德里自治大学) University of Buenos Aires(布宜诺斯艾利斯大学) Tufts University(塔夫茨大学) University of Maryland(马里兰大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ORCA模型,通过三阶段标注流程实现轻量级回答正确性与分歧建模,实验显示其在已见和未见基准上均优于基线模型,且能有效识别问题项。

Comments Accepted to TACL; pre-MIT Press publication version

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14900 2026-06-30 cs.CV cs.AI cs.CL 62%

Skin-R1: Clinical Knowledge-Guided Dermatological Diagnosis Using Vision-Language Models

Skin-R1: 基于视觉-语言模型的临床知识引导的皮肤病诊断

Zehao Liu, Weijieying Ren, Jipeng Zhang, Tianxiang Zhao, Jingxi Zhu, Xiaoting Li, Vasant G Honavar

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 Skin-R1结合教材引导的临床推理监督与强化学习,提升皮肤病诊断的准确性和鲁棒性,通过构建基于教材的推理生成器和强化学习框架,改进模型在异构数据集和稀疏标注下的表现。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17117 2026-06-30 cs.CV cs.AI cs.LG 62%

PlantExpertVQA: A Visual Question Answering Dataset for Benchmarking Vision-Language Models in Plant Science

PlantExpertVQA: 一个用于植物科学中视觉语言模型基准测试的视觉问答数据集

Syed Nazmus Sakib, Nafiul Haque, Mohammad Zabed Hossain, Shifat E. Arman

机构 * Department of Robotics and Mechatronics Engineering, University of Dhaka(达卡大学机器人与机电工程系) Department of Botany, University of Dhaka(达卡大学植物学系)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 PlantExpertVQA数据集旨在提升视觉语言模型在农业决策中的应用,包含765,186个高质量问答对,涵盖38种作物和89种病害,通过多阶段流程生成并经专家审核,验证了参数高效微调的有效性。

Comments 36 pages, 9 figures, 14 tables and Submitted to Nature Scientific Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30185 2026-06-30 cs.AI 57%

Dynamo: Dynamic Skill-Tool Evolution for Vision-Language Agents

Dynamo: 视觉-语言代理的动态技能-工具演化

Yutao Sun, Yanting Miao, Hao-Xuan Ma, Mengyu Zhou, Mingshuai Chen, Tiancheng Zhao, Dexin Wang, Lei Lv, Li Xu, Xiaoxi Jiang, Guanjun Jiang

机构 * Qwen Large Model Application Team, Alibaba(阿里云大模型应用团队) Alibaba Zhejiang University(阿里巴巴浙江大学) University of Waterloo(多伦多大学) Vector Institute(向量研究所) Nanjing University(南京大学) Binjiang Institute of Zhejiang University(浙江大学滨江学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出Dynamo,一种无需训练、无需权重更新的框架,通过让冻结的VLM在少量标注数据上自我检查并演化可复用的推理技能和可执行的视觉工具,提升视觉推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30175 2026-06-30 cs.CL 57%

CORTEX: High-Quality Cross-Domain Organization of Web-Scale Corpora through Ontological Corpus Graph

CORTEX:通过本体语料图实现网络规模语料库的高质量跨领域组织

Chengtao Gan, Xiaoke Guo, Yushan Zhu, Zhaoyan Gong, Zhiqiang Liu, Songze Li, Huajun Chen, Wen Zhang

机构 * Zhejiang University(浙江大学) JIUTIAN Research(JIUTIAN研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出CORTEX框架,利用本体语料图(OCG)将网络规模语料构建从扁平文档筛选提升为结构化知识组织,实现质量精炼、层次化本体和跨领域对齐,并构建CortexBench基准验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30026 2026-06-30 cs.CV cs.AI 57%

MuseBench: Benchmarking Intent-Level Audiovisual Arts Understanding in MLLMs

MuseBench: 多模态大语言模型中意图级视听艺术理解的基准测试

Yuxuan Fan, Gyusik Seo, Jing Hao, Jaemin Cho, Mohit Bansal, Jaehong Yoon

机构 * NTU Singapore(南洋理工大学) The University of Hong Kong(香港大学) Johns Hopkins University(约翰霍普金斯大学) AI2(人工智能研究所) UNC-Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出MuseBench基准,通过4016道涵盖电影、视觉艺术、舞台表演和游戏艺术的选择题,评估多模态大模型对艺术创作意图的理解,发现最佳模型准确率仅48.29%,远低于人类专家的87.18%。

Comments Project page: https://musebench.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29984 2026-06-30 cs.AI 57%

Be Faithful When Response: Returning Fluent and Grounded Answers for Vision-Language Models Reinforcement Learning

回答时保持忠实:为视觉语言模型强化学习返回流畅且基于视觉依据的答案

Peng, Lee, Yin Zhang, Yanglin Zhang, Haonan Wu, Zishan Liu, Ruoxi Zang, Xin Zhu, Jiayin Zheng, Jian Yao, Zefeng Ji, Fei Ma

机构 * GMLab Hong Kong Polytechnic University(香港理工大学) XPENG Robotics(XPENG机器人)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出Faithful Warm-Start (FWS)策略,通过构建具有明确视觉-语言因果关系的FaithfulQA数据集并利用VLM裁判净化,在强化学习前预热模型,提升答案准确性、稳定训练并减少无视觉依据的推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29887 2026-06-30 cs.AI 57%

SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing

SafePyramid: 一种用于上下文策略护栏的分层基准

Jiacheng Zhang, Haoyu He, Sen Zhang, Shen Wang, Xiaolei Xu, Yuhao Sun, Meng Shen, Feng Liu

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出SafePyramid基准,包含1000轮多领域对话和3000条应用特定策略,通过三级难度评估LLM在上下文中执行策略护栏的能力,发现当前模型表现有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29763 2026-06-30 cs.CV cs.AI 57%

TopoAgent: An Agentic Framework for Automated Topology Learning in Medical Imaging

TopoAgent: 医学影像中自动拓扑学习的智能体框架

Guangyu Meng, Pengfei Gu, Xueyang Li, Yiyu Shi, Erin Wolf Chambers, Danny Z. Chen

机构 * Dept. of Computer Science and Engineering, University of Notre Dame(内布拉斯加大学达灵顿分校计算机科学与工程系) Dept. of Computer Science, The University of Texas Rio Grande Valley(德克萨斯大学里奥格兰德谷分校计算机科学系)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出基于大语言模型的智能体框架TopoAgent,通过感知-推理-行动-反思循环和21个领域工具,自动为医学图像选择最优拓扑描述符并生成特征向量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29630 2026-06-30 cs.AI 57%

SFBench: The SciFy Scientific Feasibility Benchmark

SFBench:SciFy科学可行性基准

Cash Costello, James Mayfield, Elsbeth Turcan, Christine Piatko, Christina K. Pikas, Justin Rokisky, Sam Scheck, Chris Ribaudo, Ritwik Bose, Alex Memory

机构 * Johns Hopkins Applied Physics Laboratory(约翰霍普金斯应用物理实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出SFBench基准数据集,用于评估系统判断科学声明可行性的能力,包含197条材料科学声明及专家标注的可行性评分与解释,具有任务复杂、声明全新、专家标注和开放式解释等特点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29545 2026-06-30 cs.CL 57%

AURORA: Asymmetry and Update-Induced Rotation for Robust Hallucination Detection in Large Language Models

AURORA:用于大型语言模型中鲁棒幻觉检测的不对称性与更新诱导旋转

Zishuai Zhang, Hainan Zhang, Zhiming Zheng

机构 * School of Artificial Intelligence, Beihang University, China(北京航空航天大学人工智能学院) Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, Beihang University, China(北京航空航天大学未来区块链与隐私计算先进创新中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出AURORA框架,利用权重梯度动态(不对称性和旋转比)检测LLM幻觉,跨模型和数据集表现鲁棒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29520 2026-06-30 cs.SE cs.AI cs.DB 57%

SAKE: Software Architectural Knowledge Evaluation Benchmark for Large Language Models

SAKE:大型语言模型的软件架构知识评估基准

Tiziano Santilli, Francesco Daghero, Mayhar Tourchi Moghaddam

机构 * University of Southern Denmark(丹麦南方大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出SAKE基准,包含2154道专家策划的多选题,评估LLM在八个架构类别和四种上下文长度下的架构知识,揭示专业实践中的能力差距。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29193 2026-06-30 cs.SE cs.AI 57%

A Multi-Dataset Benchmark for Evaluating LLM Agents in Microservice Failure Diagnosis

用于评估微服务故障诊断中LLM智能体的多数据集基准

Yuanhong Cai, Xiaohui Nie, Kanglin Yin, Changhua Pei, Yongqian Sun, Shenglin Zhang, Haibin Liu, Guiyang Liu, Xidao Wen, Fang Situ, Dan Pei

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出基于推理过程评估的基准,包含两个大规模数据集(AIOps2025和RCA100),从定位、识别和原因三个维度评估智能体诊断能力,覆盖500多个专家标注的故障案例。

Comments 10 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28707 2026-06-30 cs.AI 57%

BV-Blend: Uncertainty-Weighted Historical Baselines for Stable Critic-Free RL with Verifiable Rewards

BV-Blend: 不确定性加权历史基线用于稳定无评论家可验证奖励强化学习

Yupeng Chang, Yuan Wu, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE, China(知识驱动人机智能工程研究中心,教育部,中国) International Center of Future Science, Jilin University(未来科学国际中心,吉林大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 针对GRPO在零方差组中学习停滞的问题,提出BV-Blend框架,通过语义聚类历史时刻与置信权重混合基线,稳定优势估计,提升训练稳定性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28556 2026-06-30 cs.AI 57%

IMCBench: A benchmark for multimodal LLMs in Image-grounded Medical Conversations

IMCBench:面向多模态大语言模型在图像基础医疗对话中的基准测试

Maria Xenochristou, Ashutosh Joshi, Korosh Vatanparvar, Mohammad Abuzar Hashemi, Prasad Kasu, Deepak Bansal, Anchal Nema, Nivedita Wadhwa, Prashams S Jain, Rebecca Abraham, Will Kimbrough, Dilek Hakkani-Tur, Wilko Schulz-Mahlendorf

机构 * Amazon Health AI(亚马逊健康AI)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出IMCBench基准,结合临床图像与合成患者档案模拟多轮医疗对话,从安全性、准确性和不确定性使用三个维度评估模型,发现准确描述不等于安全指导。

Comments Accepted at ECML PKDD 2026. 22 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏