arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-22 至 2026-05-22 共收录 145 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 45 篇

2605.22734 2026-05-22 cs.CL 79%

ChronoMedKG: A Temporally-Grounded Biomedical Knowledge Graph and Benchmark for Clinical Reasoning

ChronoMedKG:一个具有时间基础的生物医学知识图谱和用于临床推理的基准

Md Shamim Ahmed, Farzaneh Firoozbakht, Lukas Galke Poech, Jan Baumbach, Richard Röttger

机构 * University of Southern Denmark(丹麦南部大学) University of Hamburg(汉堡大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出ChronoMedKG,一个包含460,497个证据链接三元组的生物医学知识图谱,覆盖13,431种疾病,通过时间组件如发病窗口或进展阶段,为临床推理提供时间基础,并引入ChronoTQA基准测试,验证了其在时间推理任务中的有效性。

Comments 9 pages main text plus appendices, 8 figures. Dataset and benchmark paper. ChronoMedKG released under CC BY 4.0 and ChronoTQA/code under MIT (Zenodo: 10.5281/zenodo.19697542). Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22602 2026-05-22 cs.AI 79%

Think Thrice Before You Speak: Dual knowledge-enhanced Theory-of-Mind Reasoning for Persuasive Agents

三思而后言:基于双重知识增强的理论思维推理用于说服代理

Minghui Ma, Bin Guo, Runze Yang, Mengqi Chen, Yan Liu, Jingqi Liu, Yahan Pei, Xuehao Ma, Qiuyun Zhang, Zhiwen Yu

机构 * Northwestern Polytechnical University(西北工业大学) Peking University(北京大学) Harbin Engineering University(哈尔滨工程大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于双重知识增强的理论思维推理方法,用于提升说服代理的对话能力,通过构建大规模标注数据集和提出TTBYS框架,提高了LLM在推理欲望、信念和说服策略方面的性能。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22570 2026-05-22 cs.CV cs.AI 79%

VGenST-Bench: A Benchmark for Spatio-Temporal Reasoning via Active Video Synthesis

VGenST-Bench: 一个通过主动视频合成进行时空推理的基准

Jinho Park, Youbin Kim, Hogun Park, Eunbyung Park

机构 * Department of Artificial Intelligence, Sungkyunkwan University(全北大学人工智能系) Department of Artificial Intelligence, Yonsei University(延世大学人工智能系)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出VGenST-Bench,一个通过生成模型主动合成多样化评估场景的视频基准,旨在评估多模态大语言模型的时空推理能力,通过引入多代理流程和3x2x2视频分类体系,实现对细粒度时空理解的精准诊断。

Comments 82 pages, 91 figures (7 in main paper, 84 in appendix). Project page: https://zinosii.github.io/VGenST-Bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20665 2026-05-22 cs.CV cs.AI 79%

The Expense of Seeing: Attaining Trustworthy Multimodal Reasoning Within the Monolithic Paradigm

视见之代价:在单体范式内实现可信的多模态推理

Karan Goyal

机构 * IIIT Delhi, India(德里印度理工学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出了一种新的多模态评估方法,通过信息论视角揭示了多模态推理中的视见代价问题,提出了三个新指标并提出了语义充分性准则,挑战了传统多模态评估方法。

Comments Addresses practical viability of Vlabel construction. Writing is grounded. Acknowledgement is duly added

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17123 2026-05-22 cs.CL 79%

MTR-Bench: A Comprehensive Benchmark for Multi-Turn Reasoning Evaluation

MTR-Bench:多轮推理评估的综合性基准

Xiaoyuan Li, Keqin Bao, Yubo Ma, Moxin Li, Wenjie Wang, Rui Men, Yichang Zhang, Fuli Feng, Dayiheng Liu

机构 * University of Science and Technology of China(中国科学技术大学) Alibaba Group(阿里巴巴集团) National University of Singapore(新加坡国立大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出MTR-Bench,一个包含4类、40个任务和3600个实例的综合性基准,用于评估大型语言模型的多轮推理能力,通过自动化框架实现大规模评估,并揭示了当前先进推理模型在多轮交互任务中的不足。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21975 2026-05-22 cs.LG 79%

Reasoning through Verifiable Forecast Actions: Consistency-Grounded RL for Financial LLMs

通过可验证的预测动作进行推理:面向金融大语言模型的一致性导向强化学习

Jialin Chen, Aosong Feng, Harshit Verma, Siyi Gu, Haiwen Wang, Ali Maatouk, Yixuan He, Yifeng Gao, Leandros Tassiulas, Rex Ying

机构 * Yale University(耶鲁大学) University of Texas Rio Grande Valley(德克萨斯理工大学) Arizona State University(亚利桑那州立大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出StockR1,一种结合时间序列的LLM,通过可验证的预测动作统一股票预测与金融推理,利用强化学习优化整个流程,提升金融问答和股票预测的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13294 2026-05-22 cs.CV cs.AI 79%

VisPhyWorld: Probing Physical Reasoning via Code-Driven Video Reconstruction

VisPhyWorld: 通过代码驱动的视频重建探测物理推理

Jiarong Liang, Max Ku, Ka-Hei Hui, Ping Nie, Wenhu Chen

机构 * University of Waterloo(滑铁卢大学) Autodesk AI Lab(Autodesk人工智能实验室) Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出VisPhyWorld框架,通过要求模型从视觉观察生成可执行的模拟器代码来评估物理推理能力,引入VisPhyBench基准测试集,验证模型在重建外观和模拟物理运动方面的能力,发现最先进的MLLM在准确推断物理参数和模拟一致的物理动态方面存在困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20912 2026-05-22 cs.AI 79%

DeFacto: Counterfactual Thinking with Images for Enforcing Evidence-Grounded and Faithful Reasoning

DeFacto: 通过图像进行反事实推理以强制证据支持和忠实推理

Tianrun Xu, Haoda Jing, Ye Li, Yuquan Wei, Jun Feng, Guanyu Chen, Haichuan Gao, Tianren Zhang, Feng Chen

机构 * Department of Automation, Tsinghua University, Beijing, China(清华大学自动化系) Zhongguancun Academy, Beijing, China(中关村学院) School of Software, Xinjiang University, Urumqi, China(新疆大学软件学院) College of Materials Science and Engineering, Fuzhou University, Fuzhou, China(福州大学材料科学与工程学院) Institute of Automation, Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学人工智能学院) Beijing Qianjue Technology Co., Ltd., Beijing, China(北京千 jue 技术有限公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出DeFacto框架,通过整合正例、反事实和随机遮蔽三种训练范式,提升多模态语言模型在证据一致性方面的表现,并引入DeFacto-1.5K基准进行系统评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22413 2026-05-22 cs.CV 78%

From Recognition to Reasoning: Benchmarking and Enhancing MLLMs on Real-World Receipt Document Understanding

从识别到推理:在现实世界收据文档理解上对齐和增强MLLMs

Yandi Wang, Libin Zhan, Ziwei Huang, Tiancheng Luo, Yuxuan Jiang, Wang Dong, Leilei Gan, Jun Chen

机构 * Zhejiang University(浙江大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出ReceiptBench基准,通过四个层次化子任务提升收据信息提取的结构一致性,并提出两阶段训练框架GRPO,通过强化学习信号提升模型性能,实验证明其在复杂推理任务上的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22047 2026-05-22 cs.AI 74%

Active Evidence-Seeking and Diagnostic Reasoning in Large Language Models for Clinical Decision Support

大语言模型在临床决策支持中的主动证据获取与诊断推理

Chen Zhan, Xihe Qiu, Xiaoyu Tan, Xibing Zhuang, Gengchen Ma, Yue Zhang, Shuo Li, Peifeng Liu, Xiaoxiao Ge, Liang Liu, Lu Gan

机构 * Tencent Youtu Lab(腾讯优图实验室) Case Western Reserve University(凯斯西储大学)

专题命中 推理评测 :reasoning(title);分类 cs.AI

AI总结 研究探讨了大语言模型在临床决策支持中的主动证据获取与诊断推理问题,提出了一种基于OSCE的标准化患者模拟器和可控可复现的基准测试,发现多轮证据获取会降低诊断准确性并降低支持证据质量,表明静态全上下文基准可能高估交互证据获取场景中的性能,需引入互补的交互评估以提高临床决策安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16077 2026-05-22 cs.LG 70%

MDM-Prime-v2: Binary Encoding and Index Shuffling Enable Scaling of Diffusion Language Models

MDM-Prime-v2:二进制编码和索引洗牌使扩散语言模型能够扩展

Chen-Hao Chao, Wei-Fang Sun, Junwei Quan, Chun-Yi Lee, Rahul G. Krishnan

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) NVIDIA AI Technology Center(NVIDIA AI技术中心) National Taiwan University(国立台湾大学)

专题命中 推理评测 :reasoning(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出MDM-Prime-v2,通过二进制编码和索引洗牌技术改进扩散语言模型,解决了子分词器功能形式与BPE分词器结合导致的交叉熵损失增加以及子分词器粒度超参数选择缺乏工具的问题,从而提升了模型在常识推理基准上的零样本准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22355 2026-05-22 cs.CL cs.AI cs.LG 67%

TransitLM: A Large-Scale Dataset and Benchmark for Map-Free Transit Route Generation

TransitLM: 一个大规模数据集和基准,用于无地图的公共交通路线生成

Hanyu Guo, Jiedong Yang, Chao Chen, Longfei Xu, Kaikui Liu, Xiangxiang Chu

机构 * Alibaba Group(阿里巴巴集团) AMAP

专题命中 推理评测 :planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出TransitLM,一个包含1300万条公共交通路线规划记录的数据集,用于无地图的公共交通路线生成,展示了通过数据训练模型生成有效路线的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22655 2026-05-22 cs.CR cs.SE 67%

Do Fine-Tuned LLMs Understand Vulnerabilities? An Investigation into the Semantic Trap

细调的大语言模型理解漏洞吗?对语义陷阱的调查

Feiyang Huang, Yuqiang Sun, Fan Zhang, Ziqi Yang, Han Liu, Yang Liu

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文研究了细调的大语言模型是否真正理解漏洞的根本原因,发现了一种称为语义陷阱的现象,并提出了一种评估框架来检测这种现象。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21491 2026-05-22 cs.LG cs.AI cs.CL 67%

Teaching Language Models to Forecast Research Success Through Comparative Idea Evaluation

通过比较想法评估教授语言模型预测研究成功的技巧

Srujan P Mule, Aniketh Garikaparthi, Manasi Patwardhan

机构 * IISER Pune(印度理工学院帕内尔)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究探讨了语言模型能否在无需实验的情况下预测研究想法的实证成功,通过构建基于PapersWithCode客观结果的11488对想法数据集,发现通过强化学习可提升模型性能至71.35%,证明小型语言模型可以作为有效的客观验证器,为自主科学发现提供可扩展路径。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10348 2026-05-22 cs.CL cs.AI cs.LG 67%

Training-Trajectory-Aware Token Selection

基于训练轨迹的token选择

Zhanming Shen, Jiaqi Hu, Zeyu Qin, Hao Chen, Wentao Ye, Zenan Huang, Yihong Zhuang, Guoshan Lu, Junlin Zhou, Junbo Zhao

机构 * Zhejiang University(浙江大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出T3S方法,通过在token层面重构训练目标,清除未学习token的优化路径,从而在连续蒸馏中提升性能,实验表明在AR和dLLM设置中均取得显著效果。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22168 2026-05-22 cs.AI cs.LG 62%

Measuring Cross-Modal Synergy: A Benchmark for VLM Explainability

衡量跨模态协同:VLM可解释性的一个基准

Joël Roman Ky, Salah Ghamizi, Maxime Cordy

机构 * University of Luxembourg(卢森堡大学) Luxembourg Institute of Health (LIH)(卢森堡健康研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Synergistic Faithfulness作为衡量VLM跨模态协同的指标,解决了传统单模态评估方法在评估VLM可解释性时的不足,通过引入Shapley交互指数,实现了对多模态协同的准确评估,同时提升了计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12456 2026-05-22 cs.CR cs.CL cs.LG 62%

TextSeal: A Localized LLM Watermark for Provenance & Distillation Protection

TextSeal: 一种用于溯源与蒸馏保护的本地化大语言模型水印

Tom Sander, Hongyan Chang, Tomáš Souček, Tuan Tran, Valeriu Lacatusu, Sylvestre-Alvise Rebuffi, Alexandre Mourachko, Surya Parimi, Christophe Ropers, Rashel Moritz, Vanessa Stark, Hady Elsahar, Pierre Fernandez

机构 * FAIR, Meta Superintelligence Labs(FAIR,Meta超智能实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出TextSeal,一种先进的大语言模型水印技术,通过Gumbel-max采样引入双密钥生成以恢复输出多样性,并结合熵加权评分和多区域定位提升检测性能。该方法支持推测解码和多令牌预测等服务优化,不增加推理开销。在检测强度上严格优于基线方法SynthID-text,并对稀释具有鲁棒性,即使在混合的人类/AI文档中也能保持自信的本地化检测。理论上该方案无失真,经推理基准评估证实其保持下游性能;同时通过多语言人工评估(6000次A/B对比,5种语言)显示无明显质量差异。除了用于溯源检测外,TextSeal还具有'放射性'特性:其水印信号通过模型蒸馏传递,可检测未经授权的使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13372 2026-05-22 cs.AI cs.LG 62%

MoralityGym: A Benchmark for Evaluating Hierarchical Moral Alignment in Sequential Decision-Making Agents

MoralityGym:用于评估序列决策代理中分层道德对齐的基准

Simon Rosen, Siddarth Singh, Ebenezer Gelo, Helen Sarah Robertson, Ibrahim Suder, Victoria Williams, Benjamin Rosman, Geraud Nangue Tasse, Steven James

机构 * University of the Witwatersrand(威特沃特斯兰大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MoralityGym基准,通过将道德规范表示为有序的规范约束,评估序列决策代理中分层道德对齐的挑战,展示了98个伦理困境问题,并通过心理学和哲学的见解改进了伦理决策方法。

Comments Accepted at AAMAS 2026

Journal ref Proc of the 25th International Conference on Autonomous Agents and Multiagent Systems AAMAS 2026, Paphos, Cyprus, May 25 to 29, 2026, IFAAMAS

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17602 2026-05-22 cs.AI cs.CV cs.LG 62%

AutoRubric-T2I: Robust Rule-Based Reward Model for Text-to-Image Alignment

AutoRubric-T2I: 一种用于文本到图像对齐的鲁棒基于规则的奖励模型

Kuei-Chun Kao, Daixuan Huo, Yuanhao Ban, Cho-Jui Hsieh

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AutoRubric-T2I,一种首个用于文本到图像生成的规则学习框架,通过自动合成和选择显式规则来指导视觉语言模型(VLM)法官。该方法通过合成偏好对的推理轨迹生成候选规则,并利用VLM法官在每种规则下对配对图像进行评分,产生配对规则评分差异用于偏好学习。通过ℓ1正则化逻辑回归精简器去除噪声和冗余规则,从而在少量标注偏好数据下生成高质量、可解释的奖励信号,并在多个图像奖励基准测试中优于现有奖励模型基线。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15588 2026-05-22 cs.CL cs.LG 62%

Calibrating LLMs with Semantic-level Reward

通过语义层面奖励校准大型语言模型

Fengfei Yu, Ruijia Niu, Dongxia Wu, Yian Ma, Rose Yu

机构 * Department of Computer Science and Engineering, University of California San Diego, La Jolla, California, USA(加州大学圣地亚哥分校计算机科学与工程系,拉贾尔,加利福尼亚州,美国) Halıcıoğlu Data Science Institute, University of California San Diego, La Jolla, California, USA(加州大学圣地亚哥分校Halıcıoğlu数据科学研究所,拉贾尔,加利福尼亚州,美国) Department of Statistics, Stanford University, Stanford, California, USA(斯坦福大学统计学系,斯坦福,加利福尼亚州,美国)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种新的校准框架CSR,通过在语义空间中直接校准语言模型,避免了传统方法中因词汇化置信度导致的不一致问题,实验显示CSR在多个数据集上均能有效降低ECE并提高AUROC。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22414 2026-05-22 cs.CV cs.AI 57%

Towards Clinically Interpretable Ophthalmic VQA via Spatially-Grounded Lesion Evidence

迈向具有空间定位病变证据的临床可解释性眼科VQA

Xingyue Wang, Bo Liu, Meng Wang, Zhixuan Zhang, Chengcheng Zhu, Huazhu Fu, Jiang Liu

机构 * Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学计算机科学与工程系) The Hong Kong Polytechnic University(香港理工大学) National University of Singapore(新加坡国立大学) University of Washington(华盛顿大学) Institute of High Performance Computing, Agency for Science, Technology and Research(科技研究局高性能计算研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出FundusGround基准,通过空间定位病变证据提升眼科VQA的临床可解释性,通过三阶段流程收集标注病变的视网膜影像,并评估多种视觉语言模型在答案准确性和病变层面推理上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04111 2026-05-22 cs.SE cs.AI cs.HC 57%

CentaurEval: Benchmarking Human-in-the-Loop Value in Agentic Coding

CentaurEval: 评估人机协同在编程中的价值

Hanjun Luo, Chiming Ni, Jiaheng Wen, Zhimu Huang, Yiran Wang, Bingduo Liao, Sylvia Chung, Yingbin Jin, Xinfeng Li, Wenyuan Xu, XiaoFeng Wang, Hanan Salam

机构 * New York University Abu Dhabi(纽约大学阿布扎克校区) Nanyang Technological University(南洋理工大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Harvard University(哈佛大学) Zhejiang University(浙江大学) University of Electronic Science and Technology of China(电子科技大学) Beijing University of Technology(北京理工大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出CentaurEval基准测试,用于评估人机协同在编程中的价值。该基准测试通过协作必要问题模板,结合人类推理和AI效率,展示了人机协作在编程任务中的显著优势。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13910 2026-05-22 cs.CL 57%

RAGCap-Bench: Benchmarking Capabilities of LLMs in Agentic Retrieval Augmented Generation Systems

RAGCap-Bench: 评估代理检索增强生成系统中LLM能力的基准测试

Jingru Lin, Chen Zhang, Stephen Y. Liu, Haizhou Li

机构 * National University of Singapore(新加坡国立大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出RAGCap-Bench,用于评估代理检索增强生成系统中中间任务的细粒度能力,通过分析现有系统输出识别常见任务和核心能力,设计针对性评估问题,实验表明增强中间能力的模型能获得更好的整体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21807 2026-05-22 cs.CL 57%

When Cases Get Rare: A Retrieval Benchmark for Off-Guideline Clinical Question Answering

当案例变得稀少时:一个用于偏离指南临床问答的检索基准

Doeun Lee, Muge Zhang, Yi Yu, Ashish Manne, Stephen Koesters, Frank Wen, Brady Buchanan, Lynda Villagomez, Oluwatoba Moninuola, James Lim, Kathryn Tobin, Andrew Srisuwananukorn, Ping Zhang, Sachin Kumar

机构 * The Ohio State University(俄亥俄州立大学) The Ohio State University Wexner Medical Center(俄亥俄州立大学韦克斯纳医学中心) University of Chicago Medical Center(芝加哥大学医学中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出OGCaReBench基准,用于评估医疗问答中超越常规指南的开放性推理能力,通过检索医学文献提升模型在真实世界医疗场景中的表现。

Comments 34 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21773 2026-05-22 cs.CR cs.LG 57%

HIDBench: Benchmarking Large Language Models for Host-Based Intrusion Detection

HIDBench: 用于基于主机入侵检测的大型语言模型评估

Danyu Sun, Jinghuai Zhang, Yuan Tian, Zhou Li

机构 * University of California, Irvine(加州大学洛杉矶分校) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出HIDBench基准测试,用于评估大型语言模型在支持基于主机的入侵检测系统(HIDS)中的能力,揭示了LLM在复杂系统日志数据中的性能差异和敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21758 2026-05-22 cs.AI 57%

A Causal Argumentation Method for Explainability of Machine Learning Models

一种用于机器学习模型可解释性的因果论辩方法

Henry Salgado, Meagan R. Kendall, Martine Ceberio

机构 * Department of Computer Science, The University of Texas at El Paso, El Paso, TX, USA(计算机科学系,德克萨斯理工大学埃尔帕索分校) Department of Engineering Education and Leadership, The University of Texas at El Paso, El Paso, TX, USA(工程教育与领导力系,德克萨斯理工大学埃尔帕索分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种结合因果推理和论辩推理的方法,用于解释机器学习模型为何做出特定预测,通过因果发现方法识别变量间的因果关系,并将其转化为双极论辩框架来表示特征间的支持与反对交互,最终通过半稳定语义确定解释性特征扩展。

Comments To be published in The 4th World Conference on eXplainable Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21545 2026-05-22 cs.SE cs.AI 57%

RefusalBench: Why Refusal Rate Misranks Frontier LLMs on Biological Research Prompts

RefusalBench: 为什么拒绝率错误排名前沿大语言模型在生物研究提示中的表现

Lukas Weidener, Marko Brkić, Mihailo Jovanović, Emre Ulgac, Aakaash Meduri

机构 * Applied Scientific Intelligence, Inc.(应用科学智能公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出RefusalBench,通过141个提示的47组匹配三元组,评估前沿大语言模型在生物研究提示中的拒绝行为,发现拒绝率错误排名安全校准,揭示了模型在不同风险层级下的表现差异。

Comments 34 pages, 4 figures, 12 tables (10 in main text, 2 in supplementary). Code and data: https://github.com/AppliedScientific/refusalbench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17998 2026-05-22 cs.SE cs.AI 57%

Verify-Gated Completion as Admission Control in a Governed Multi-Agent Runtime: A Bounded Architecture Case Study

验证门控完成作为受控多智能体运行时的准入控制:一个有界架构案例研究

Hai-Duong Nguyen, Xuan-The Tran

机构 * Vietnam Maritime University(越南海防大学)

专题命中 推理评测 :verifier(abstract);分类 cs.AI

AI总结 本文研究了验证门控完成作为受控多智能体运行时的准入控制机制,通过一个有界参考实现,探讨了可审计的验证门控完成所能支持的信息,并分析了其在不同场景下的表现和限制。

Comments 39 pages, 2 figures, 17 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02604 2026-05-22 cs.LG 57%

Heterogeneous Agent Collaborative Reinforcement Learning

异质智能体协作强化学习

Zhixia Zhang, Zixuan Huang, Gongxun Li, Huaiyang Wang, Chengyi Yuan, Xin Xia, Deqing Wang, Fuzhen Zhuang, Shuai Ma, Ning Ding, Yaodong Yang, Jianxin Li, Yikun Ban

机构 * Beihang University(北航) Bytedance China(字节跳动中国) Tsinghua University(清华大学) Peking University(北京大学) Apple(苹果公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出了一种新的强化学习从可验证奖励(RLVR)问题HACRL,通过异质智能体共享验证的轨迹实现协同优化,解决了孤立多智能体在线优化的效率问题,并提出HACPO算法以最大化样本利用率和跨智能体知识转移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15671 2026-05-22 cs.HC cs.AI 57%

StreetDesignAI: Broadening Designer Perspectives Through Multi-Persona Evaluation of Cycling Infrastructure

StreetDesignAI: 通过多角色评估拓宽设计师视角

Ziyi Wang, Yilong Dai, Duanya Lyu, Mateo Nader, Sihan Chen, Wanghao Ye, Zijian Ding, Xiang Yan

机构 * University of Maryland, College Park(马里兰大学 College Park 分校) University of Alabama(阿拉巴马大学) University of Florida(佛罗里达大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出StreetDesignAI,通过多角色评估方法帮助设计师更全面地理解骑行者需求,提升设计决策能力。

详情

展开后加载摘要…

URL PDF HTML 收藏