arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-26 至 2026-05-26 共收录 267 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 71 篇

2604.11632 2026-05-26 cs.CL 57%

CArtBench: Evaluating Vision-Language Models on Chinese Art Understanding, Interpretation, and Authenticity

CArtBench: 评估视觉语言模型在中国艺术理解、解读与真实性方面的能力

Xuefeng Wei, Zhixuan Wang, Xuan Zhou, Zhi Qu, Hongyao Li, Yusuke Sakai, Hidetaka Kamigaito, Taro Watanabe

机构 * Nara Institute of Science and Technology(奈良科学技術大學) Liaoning Normal University(遼寧師範大學)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出CARTBENCH基准,通过四个子任务评估视觉语言模型在中国艺术作品上的识别、推理、鉴赏和真伪鉴别能力,发现现有模型在复杂证据链接、风格断代和真伪诊断方面表现不足。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11557 2026-05-26 cs.AI 57%

UniToolCall: Unifying Tool-Use Representation, Data, and Evaluation for LLM Agents

UniToolCall: 统一LLM智能体的工具使用表示、数据与评估

Yijuan Liang, Xinghao Chen, Yifan Ge, Ziyi Wu, Hao Wu, Changyu Zeng, Wei Xing, Xiaoyu Shen

机构 * University of Science and Technology of China(中国科学技术大学) Ningbo Institute of Digital Twin(宁波数字孪生研究所) Eastern Institute of Technology(东部技术研究所) Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出UniToolCall框架,通过标准化工具集构建、数据集生成和评估流程,结合22k+工具和390k+训练实例,引入锚点链接机制,在混合设置下使Qwen3-8B单轮严格精度达93.0%,超越GPT、Gemini和Claude。

Comments 21 pages, 10 figures, 9 tables. Code and datasets are publicly available at: https://github.com/EIT-NLP/UniToolCall

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22143 2026-05-26 cs.CL 57%

Benchmarking and Learning Real-World Customer Service Dialogue

基准测试与学习真实世界客服对话

Tianhong Gao, Jundong Shen, Jiapeng Wang, Bei Shi, Ying Ju, Junfeng Yao, Huiyu Yu

机构 * ByteDance, Beijing, China(字节跳动,北京,中国)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 针对工业智能客服与真实对话需求脱节的问题,提出OlaBench基准和OlaMind模型,通过蒸馏专家推理模式与分阶段强化学习,在OlaBench上超越GPT-5.2和Gemini 3 Pro,在线A/B测试中问题解决率提升23.67%,人工转接率降低6.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25188 2026-05-26 cs.AI 57%

DarkForest: Less Talk, Higher Accuracy for Multi-Agent LLMs

DarkForest: 少说话,多智能体LLM更高精度

Yi Li, Songtao Wei, Dongming Jiang, Zhichun Guo, Qiannan Li, Bingzhe Li

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) Independent Researcher(独立研究者) University of California, Davis(加州大学戴维斯分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出DarkForest框架,通过保持智能体独立、结构化解析响应并基于信念分布协调,减少通信开销和错误传播,在六个推理基准上实现领先质量并大幅降低令牌消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24941 2026-05-26 cs.CR cs.LG 57%

Memory-Induced Tool-Drift in LLM Agents

LLM代理中的记忆诱导工具漂移

Mahavir Dabas, Jihyun Jeong, Ming Jin, Ruoxi Jia

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 研究LLM代理中长期记忆存储的个性偏见(如成本意识、不耐烦等)在不适用情境下静默影响工具调用的问题,提出MEMDRIFT基准测试,发现偏置记忆导致工具参数偏离基线,且现有防御措施无法消除该现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24823 2026-05-26 cs.AI 57%

Agent Manufacturing: Foundation-Model Agents as First-Class Industrial Entities

Agent制造:基础模型Agent作为一级工业实体

Yilei Zhang

机构 * University of Canterbury(坎特伯雷大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Agent制造范式,即基础模型Agent通过解释开放目标、长程规划、调用工具和机器、与其他Agent及人类协商来协调生产,从而将工业中的人类协调认知工作自动化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24806 2026-05-26 cs.SD cs.AI eess.AS 57%

Zero-Shot Parkinson's Disease Detection from Speech: Comparing Large Audio and Language Models

零样本帕金森病语音检测:比较大型音频和语言模型

Muhammad Ashad Kabir, Sirajam Munira

机构 * School of Computing, Mathematics and Engineering, Charles Sturt University(计算机科学与工程学院,查尔斯·斯图尔特大学) Department of Computer Science, Rensselaer Polytechnic Institute(计算机科学系,伦塞拉尔理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 通过比较手工声学特征和原始音频波形两种输入模态,研究零样本帕金森病检测在不同语言中的性能差异,发现手工特征在低资源语言中更稳定,而音频输入带来数据集依赖的增益。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24765 2026-05-26 cs.CR cs.LG 57%

CyberMaskQA: A Privacy-Aware Benchmark for Evaluating Large Language Models in Cybersecurity Question Answering

CyberMaskQA: 一个用于评估大语言模型在网络安全问答中隐私意识的基准

Matilda Gaddi, Jin Noh, Onat Gungor, Tajana Rosing

机构 * Department of Computer Science and Engineering(计算机科学与工程系) University of California, San Diego (UCSD)(加州大学圣地亚哥分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 针对现有基准缺乏隐私保护评估的问题,提出CyberMaskQA基准,通过结合人工场景与LLM语义扩展生成带隐私标签的数据集,以评估模型在网络安全问答中的推理与隐私保护能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24686 2026-05-26 cs.AI 57%

Emotional intelligence in large language models is fragmented across perception, cognition, and interaction

大型语言模型中的情商在感知、认知和交互上存在碎片化

Minghao Lv, Lu Chen, Enchang Zhang, Anji Zhou, Xiaoran Xue, Hanyi Zhang, Fenghua Tang, Zhuo Rachel Han, Mengyue Wu

机构 * X-LANCE Lab(X-LANCE实验室) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) MoE Key Lab of Artificial Intelligence(人工智能MOE重点实验室) Jiangsu Key Lab of Language Computing(江苏省语言计算重点实验室) Beijing Key Laboratory of Applied Experimental Psychology(北京应用实验心理学重点实验室) National Demonstration Center for Experimental Psychology Education, Faculty of Psychology, Beijing Normal University(北京师范大学实验心理学教育国家级示范中心,心理学学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出FACET框架,基于Mayer-Salovey-Caruso四分支能力模型评估大型语言模型的情商,发现其并非单一能力,而是在认知和交互维度上碎片化,且隐藏情绪识别是普遍瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24562 2026-05-26 cs.CV cs.AI 57%

PEDESTRIANQA: A Benchmark for Vision-Language Models on Pedestrian Intention and Trajectory Prediction

PEDESTRIANQA: 面向行人意图与轨迹预测的视觉-语言模型基准

Naman Mishra, Shankar Gangisetty, C. V. Jawahar

机构 * CVIT, IIIT-Hyderabad, India(IIIT-海得拉巴计算机视觉与智能技术研究所,印度)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出大规模视频数据集PedestrianQA,将行人意图和轨迹预测转化为带结构化理由的问答任务,通过微调视觉-语言模型显著提升预测准确性与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28128 2026-05-26 cs.LG cs.CR 57%

ORACAL: A Robust and Explainable Multimodal Framework for Smart Contract Vulnerability Detection with Causal Graph Enrichment

ORACAL: 一种基于因果图增强的鲁棒且可解释的智能合约漏洞检测多模态框架

Tran Duong Minh Dai, Triet Huynh Minh Le, M. Ali Babar, Van-Hau Pham, Phan The Duy

机构 * Information Security Lab, University of Information Technology(信息安全部,信息科技大学) Vietnam National University(越南国家大学) School of Computer Science and Information Technology, Adelaide University(计算机科学与信息技术学院,阿德莱德大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 提出ORACAL异构多模态图学习框架,集成控制流图、数据流图和调用图,通过RAG和LLM增强关键子图,并采用因果注意力机制和PGExplainer实现鲁棒且可解释的智能合约漏洞检测。

Comments 21 pages, version 2

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20334 2026-05-26 cs.SE cs.AI 57%

Procedural Refinement by LLM-driven Algorithmic Debugging for ARC-AGI-2

基于LLM驱动的算法调试的程序化精炼用于ARC-AGI-2

Yu-Ning Qiu, Lin-Feng Zou, Jiong-Da Wang, Xue-Rong Yuan, Wang-Zhou Dai

机构 * Nanjing University(南京大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出一种神经符号精炼方法ABPR,结合LLM与Prolog元解释器,通过证明树推导进行语义重检,在ARC-AGI-2上实现高通过率,并扩展到RAVEN风格推理任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09130 2026-05-26 cs.LG 57%

UniComp: A Unified Evaluation of Large Language Model Compression via Pruning, Quantization and Distillation

UniComp: 通过剪枝、量化和蒸馏对大型语言模型压缩的统一评估

Jonathan von Rad, Yong Cao, Andreas Geiger

机构 * University College London(伦敦大学学院) University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 提出UniComp框架,统一评估剪枝、量化和知识蒸馏三种压缩方法,从性能、可靠性和效率三个维度在40个数据集上分析,发现知识偏差、性能与可靠性解耦以及任务特定校准可提升推理性能。

Comments 18 pages, 5 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21463 2026-05-26 cs.SD cs.AI 57%

Unifying Speech Editing Detection and Content Localization via Prior-Enhanced Audio LLMs

通过先验增强的音频大语言模型统一语音编辑检测与内容定位

Jun Xue, Yi Chai, Yanzhen Ren, Jinshen He, Zhiqiang Tang, Zhuolin Yi, Yihuan Huang, Yuankun Xie, Yujie Chen

机构 * Key Laboratory of Aerospace Information Security(航空信息安全与可信计算重点实验室) School of Cyber Science and Engineering(网络安全工程学院) Wuhan University(武汉大学) Independent Researcher(独立研究员) School of Computer Science and Technology(计算机科学与技术学院) Anhui University(安徽大学) Communication University of China(中国通信大学) Beihang University(北京航空航天大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出基于音频大语言模型的统一框架,通过生成式方法联合处理语音编辑检测和内容定位,并引入先验增强策略和声学一致性损失以提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12194 2026-05-26 cs.AI cs.CV 57%

Teaching large language models to reason like expert diagnosticians

教会大型语言模型像专家诊断医生一样推理

Thomas A. Buckley, Riccardo Conci, Peter G. Brodeur, Jason Gusdorf, Sourik Beltrán, Bita Behrouzi, Byron Crowe, Jacob Dockterman, Muzzammil Muhammad, Sarah Ohnigian, Andrew Sanchez, James A. Diao, Aashna P. Shah, Daniel Restrepo, Eric S. Rosenberg, Andrew S. Lea, Emily Glanton, Kimberly LeBlanc, Undiagnosed Diseases Network, Marinka Zitnik, Scott H. Podolsky, Zahir Kanjee, Raja-Elie E. Abdulnour, Jacob M. Koshy, Adam Rodman, Arjun K. Manrai

机构 * Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系) Department of Medicine, Beth Israel Deaconess Medical Center(贝塞斯达医院内科部) The Mongan Institute, Massachusetts General Hospital(麻省总医院蒙根研究所) Division of Gastroenterology, Brigham and Women’s Hospital(布里洛妇女医院胃肠病科) Department of Medicine, Brigham and Women’s Hospital(布里洛妇女医院内科部) Department of Medicine, Massachusetts General Hospital(麻省总医院内科部) Department of Pathology, Massachusetts General Hospital(麻省总医院病理学部) Department of Health Humanities and Bioethics, University of Rochester School of Medicine and Dentistry(罗切斯特大学医学院和牙科学院健康人文与生物伦理学部) Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学凯普纳人工智能研究所) Center for the History of Medicine, Countway Library of Medicine, Harvard Medical School(哈佛医学院医学史中心,考特维图书馆) Department of Global Health and Social Medicine, Harvard Medical School(哈佛医学院全球健康与社会医学部) Division of Pulmonary and Critical Care Medicine, Brigham and Women’s Hospital(布里洛妇女医院呼吸科和重症医学科)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出 Dr. CaBot 代理 AI 系统,通过生成基于初始病例描述的幻灯片演示来模拟专家诊断推理,并在 NEJM CPC 和 NIH 未诊断疾病网络病例上取得优于前沿模型的表现,同时发布 CPC-Bench 基准以促进临床 AI 发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08652 2026-05-26 cs.AI 57%

Prompt-and-Check: Using Large Language Models to Evaluate Communication Protocol Compliance in Simulation-Based Training

Prompt-and-Check:使用大型语言模型评估基于模拟训练中的通信协议合规性

Vishakha Lall, Yisi Liu

机构 * Centre of Excellence in Maritime Safety(海上安全卓越中心) Singapore Polytechnic(新加坡理工学院) Singapore(新加坡)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出Prompt-and-Check方法,利用开源大语言模型通过上下文丰富的提示评估模拟训练中通信协议的合规性,并在海事领域案例中验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08047 2026-05-26 cs.AI cs.MA 57%

WorldGUI: An Interactive Benchmark for Desktop GUI Automation from Any Starting Point

WorldGUI: 一个从任意起点进行桌面GUI自动化的交互式基准测试

Henry Hengyuan Zhao, Kaiming Yang, Wendi Yu, Difei Gao, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 提出WorldGUI基准测试,覆盖10个桌面和Web应用,在多种系统构建的初始状态下评估GUI代理的规划鲁棒性,并引入WorldGUI-Agent框架通过三阶段批评提升动态环境下的可靠性。

Comments Technique Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24267 2026-05-26 cs.CL 57%

DRInQ: Evaluating Conversational Implicature with Controlled Context Variation

DRInQ: 通过受控上下文变化评估会话含义

Hirona Jacqueline Arai, Xiang Ren

机构 * University of Southern California(南加州大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出DRInQ基准,通过半自动化管道生成系统变化的问答上下文实例,评估大语言模型在会话含义中的语用推理能力,发现模型在生成与推理之间存在不对称性。

Comments To be presented at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24117 2026-05-26 cs.AI 57%

SkillEvolBench: Benchmarking the Evolution from Episodic Experience to Procedural Skills

SkillEvolBench:从情景经验到程序性技能的演化基准测试

Yingtie Lei, Zhongwei Wan, Jiankun Zhang, Samiul Alam, Zixuan Zhong, Peizhou Huang, Xin Wang, Jingxuan Zhang, Donghao Zhou, Yunta Hsieh, Zhihao Dou, Hui Shen, Yan Xu, Dimitrios Dimitriadis, Tuo Zhang, Mi Zhang

机构 * The Ohio State University(俄亥俄州立大学) The University of Chicago(芝加哥大学) University College London(伦敦大学学院) University of Michigan(密歇根大学) The Chinese University of Hong Kong(香港中文大学) Case Western Reserve University(凯斯西储大学) Amazon(亚马逊)

专题命中 推理评测 :verifier(abstract);分类 cs.AI

AI总结 提出SkillEvolBench基准,通过六个真实环境中的180个任务,评估大语言模型代理能否将情景经验提炼为可复用的程序性技能,发现当前代理难以形成稳健的技能,且原始轨迹复用优于蒸馏技能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24006 2026-05-26 cs.DC cs.LG 57%

A Tabular Schedule Abstraction for Communication-Aware Evaluation of Pipeline-Parallel LLM Training

一种用于通信感知评估流水线并行LLM训练的表格调度抽象

Daniel Barley, Jonathan Leis, Benjamin Klenk, Holger Fröning

机构 * Hardware and Artificial Intelligence (HAWAII) Lab, Heidelberg University, Heidelberg, Germany(海德堡大学硬件与人工智能实验室) NVIDIA Corporation, Santa Clara, CA, USA(英伟达公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出一种表格调度抽象和统一的多抽象方法,通过公式推理、理想化调度表和通信感知执行模拟,比较了GPipe、1F1B、Chimera和Hanayo等流水线调度方案,发现通信会抵消气泡分析的结构优势,调度排名依赖于执行环境。

Comments Accepted at the 25th IEEE International Symposium on Parallel and Distributed Computing (ISPDC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23970 2026-05-26 cs.CL 57%

Faithful or Fabricated? A Causal Framework for Rationalization Bias in LLM Judges

忠实还是捏造?LLM 评判中合理化偏差的因果框架

Riya Tapwal, Abhishek Kumar, Carsten Maple

机构 * School of Computing and Electrical Engineering(计算与电子工程学院) Indian Institute of Technology (IIT) Mandi(印度理工学院(IIT)曼迪) London U.K.(伦敦英国) Warwick Manufacturing Group U.K.(沃里克制造集团英国)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL

AI总结 提出因果框架研究 LLM 评判者对非证据线索的依赖,通过线索干预和锚定度量揭示其合理化偏差,并验证证据锁定策略的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23949 2026-05-26 cs.MA cs.AI 57%

SODE: Analyzing Social Dynamics in LLM Agents

SODE:分析LLM智能体中的社会动态

Inseo Jung, Yoonseok Oh, Kyungryul Back, Jinkyu Kim, Jungbeom Lee

机构 * Department of Computer Science, Korea University(韩国大学计算机科学系)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出SODE框架,通过直接互惠、间接互惠和群体动态三个进化维度评估LLM智能体的社会行为,发现指令调优模型存在被动顺从问题,推理模型则因短视优化破坏长期合作,并展示长期框架可激发推理模型的互惠能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23917 2026-05-26 cs.CL 57%

Multi-Persona Debate System for Automated Scientific Hypothesis Generation

用于自动科学假设生成的多角色辩论系统

Jaeha Oh, Byungchan Kim, Ju Li, Yang Jeong Park, Jin-Sung Park

机构 * Department of Materials Science & Engineering, Ajou University(材料科学与工程系,阿乔大学) Department of Energy Systems Research, Ajou University(能源系统研究系,阿乔大学) Department of Nuclear Science and Engineering, Massachusetts Institute of Technology(核科学与工程系,麻省理工学院) Department of Materials Science and Engineering, Massachusetts Institute of Technology(材料科学与工程系,麻省理工学院) Department of Materials Science and Engineering, Ulsan National Institute of Science and Technology(材料科学与工程系,乌山国家科学与技术研究院) Graduate School of Artificial Intelligence, Ulsan National Institute of Science and Technology(人工智能研究生院,乌山国家科学与技术研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出多角色辩论系统(MPDS),结合文献检索、长上下文大语言模型推理、语料驱动角色归纳和结构化多智能体辩论,自动生成科学假设,在电池材料研究中验证其有效性。

Comments 31 pages with 7 main figures, 4 supplementary figures and 1 supplementary table

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13608 2026-05-26 cs.LG 57%

Is GPT-4o mini Blinded by its Own Safety Filters? Exposing the Multimodal-to-Unimodal Bottleneck in Hate Speech Detection

GPT-4o mini 是否被自身的安全过滤器蒙蔽?揭示多模态到单模态瓶颈在仇恨言论检测中的作用

Niruthiha Selvanayagam, Ted Kurti

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文通过 Hateful Memes Challenge 数据集系统分析 GPT-4o mini 在多模态仇恨言论检测中的安全架构,发现并实验验证了“单模态瓶颈”缺陷,即上下文无关的安全过滤器会优先阻断多模态推理,导致误报。

Comments This paper reports preliminary findings from a small-scale study whose sample size is insufficient to support the stated conclusions. The authors are withdrawing it to conduct a more comprehensive evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05682 2026-05-26 cs.CL 57%

Retrieved In-Context Principles from Previous Mistakes

从先前错误中检索的上下文原则

Hao Sun, Yong Jiang, Bo Wang, Yingyan Hou, Yan Zhang, Pengjun Xie, Fei Huang

机构 * Peking University(北京大学) Beijing Institute of Technology(北京理工大学) Alibaba Group(阿里巴巴集团) Chinese Academy of Sciences(中国科学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出检索式上下文原则(RICP)框架,通过教师模型分析学生模型错误生成原则,聚类错误以增强覆盖,检索相关错误生成问题级原则,提升定制化,无需推理时干预,在七个推理基准上提升多种提示策略性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25357 2026-05-26 cs.CV cs.MA 50%

Towards Reliable Fetal Ultrasound Interpretation with Multi-Agent Collaboration

面向可靠胎儿超声解读的多智能体协作

Xiaotian Hu, Mingxuan Liu, Junwei Huang, Kasidit Anmahapong, Yifei Chen, Yiming Huang, Xuguang Bai, Zihan Li, Hongjia Yang, Yingqi Hao, Hong Xu, Yu Jiang, Tian Tian, Yi Liao, Haibo Qu, Qiyuan Tian

机构 * Tsinghua University(清华大学) University of California San Diego(加州大学圣地亚哥分校) West China Second University Hospital, Sichuan University(四川大学西昌医学院)

专题命中 推理评测 :reasoning(abstract)

AI总结 提出FetUSAgents多智能体系统,通过协作LLM代理和双路径证据仲裁(DPEA)整合视觉工具与临床推理,在胎儿超声VQA、报告生成等任务上超越最强基线25%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25343 2026-05-26 cs.CV 50%

Toward Native Multimodal Modeling: A Roadmap

迈向原生多模态建模:路线图

Siyu An, Junru Lu, Junnan Dong, Qiufeng Wang, Yinghui Li, Weizhi Fei, Zichao Yu, Zheng Yuan, Biao Liu, Haopeng Wang, Renzhao Liang, Yixuan Yang, Yunhang Shen, Bo Ke, Keyu Chen, Linhao Luo, Difan Zou, Xiao Huang, Di Yin, Ruizhi Qiao, Xing Sun

机构 * Tencent Youtu Lab(腾讯优图实验室) Tsinghua University(清华大学) The University of Hong Kong(香港大学) University of Warwick(沃林汉大学) Monash University(墨尔本大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出从非原生多模态范式向原生多模态建模(NMM)过渡的正式路线图,通过输入-输出二元性分类现有模型,并系统探讨架构协调、数据整理、训练推理及评估的全栈工业级方案。

Comments 52 pages, 5 figures, 3 tables, ~300 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25296 2026-05-26 cs.HC 50%

Subjective Code Preferences in Experts and Large Language Models

专家与大型语言模型中的主观代码偏好

Anna Mokhova, Subhabrata Dutta, Iryna Gurevych, Simone Balloccu

专题命中 推理评测 :reasoning(abstract)

AI总结 通过收集约3000对Python代码片段并由73位专家评分,研究LLM在四个主观偏好轴(复杂度、注释、模块化、可读性)上的表现,发现模型在自然语言与代码评估中存在不一致,且表现出位置偏差和极化评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25273 2026-05-26 cs.CY 50%

LLM-as-a-Judge in Healthcare: A Scoping Analysis of Applications, Methods, and Human Alignment

LLM-as-a-Judge 在医疗保健中的应用:应用、方法和人类一致性的范围分析

Lingyao Li, Deyi Li, Chen Chen, Renkai Ma, Runlong Yu, Mingquan Lin, Rui Yin, Lizhou Fan, Cathy Shyr, Siyuan Ma, Mei Liu, Steven Bethard

专题命中 推理评测 :reasoning(abstract)

AI总结 本研究通过PRISMA指导的系统综述,分析了LLM-as-a-Judge在医疗保健中的应用场景、技术配置和与人类专家判断的一致性,发现其在临床决策支持、自然语言处理等领域有广泛应用,但可靠性因任务而异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09658 2026-05-26 cs.CV 50%

Measuring Epistemic Humility in Multimodal Large Language Models

测量多模态大语言模型中的认知谦逊

Bingkui Tong, Jiaer Xia, Sifeng Shang, Kaiyang Zhou

机构 * Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed人工智能大学) Hong Kong Baptist University(香港 Baptist大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 提出HumbleBench基准,通过强制选择多项选择中引入“以上皆非”选项,评估多模态大语言模型拒绝错误选项的谦逊行为。

详情

展开后加载摘要…

URL PDF HTML 收藏