arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 548 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 548 篇

2607.10202 2026-08-11 cs.LG 版本更新 57%

When Counterbalancing Hides the Bias: Access-Conditioned Position Lock in Forced-Choice LLM Evaluation

跨模型价值比较中的两个混淆因素:响应确定性和访问约束

Hong-In Won, Jinseok Jang, Hyoseop Kim

机构 * KITECH(韩国产业技术评价院) National Research Council of Science and Technology (NST)(韩国国家科学技术研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 研究跨模型价值比较中的两个混淆因素,提出无规则价值困境等方法分离并校正响应确定性,还发现访问约束影响模型价值概况,贡献了确定性校正分解,识别出部署约束是独特价值混淆因素。

Comments 16 pages, 3 figures, 7 tables. Substantially revised: reframed around an identifiability result for the counterbalanced concentration index, with access configuration presented as one generator of the failure rather than a separate confound. Code and data are included as ancillary files

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11949 2026-08-11 cs.LG cs.CR stat.ML 版本更新 57%

Online Shift Detection and Conformal Adaptation for Deployed Safety Classifiers

已部署安全分类器的在线漂移检测与共形自适应

Jun Wen Leong

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 提出在线监测系统,使用校准序列统计检测分布漂移,并通过共形弃权层自适应阈值恢复目标错误率,在800个实验单元中实现86.6%有效检测。

Comments 38 pages, 8 figures, 18 tables. Code and pre-registration at https://github.com/junwenleong/safety-classifier-shift-monitor

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08251 2026-08-11 cs.CY cs.AI 版本更新 57%

Contemporary AI lacks the imagination to diverge or negate in science

当代人工智能缺乏在科学中发散或否定的想象力

Honglin Bao, Siyang Wu, Xiao Liu, Sida Li, Shiyun Cao, James A. Evans

机构 * Data Science Institute, University of Chicago(芝加哥大学数据科学研究所) Knowledge Lab, University of Chicago(芝加哥大学知识实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 通过大规模科学家评估,发现当前AI在科学假设生成中缺乏多样性,无法自发提出零假设,且自动评估与专家判断一致性低,但微调奖励模型可缩小差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27887 2026-08-11 cs.AI q-fin.PM 版本更新 57%

PortBench: A Correlation-Aware, Full-Pipeline Benchmark for LLM-Driven Portfolio Management

PortBench: 一种相关性感知的、全流水线的LLM驱动投资组合管理基准

Yuxuan Zhao, Sijia Chen, Ningxin Su

机构 * Yantai Research Institute of Harbin Engineering University(哈尔滨工程大学烟台研究院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出PortBench基准,通过静态QA和动态五阶段分配流水线评估LLM在投资组合管理中的表现,发现多数模型无法超越等权重分配,且存在推理错误累积和压力下大幅回撤的问题。

Comments Project page: https://portbench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21916 2026-08-11 cs.CL cs.SE 版本更新 57%

MathDuels: A Self-Play Benchmark That Grows

MathDuels:评估大语言模型作为问题提出者和解决者

Zhiqiu Xu, Shibo Jin, Shreya Arya, Mayur Naik

机构 * Department of Computer and Information Science, University of Pennsylvania(宾夕法尼亚大学计算机与信息科学系) Department of Mathematics, University of Pennsylvania(宾夕法尼亚大学数学系)

专题命中 推理评测 :verifier(abstract);分类 cs.CL

AI总结 MathDuels通过让模型同时扮演问题提出者和解决者角色,揭示了模型在两者能力上的差异,展示了评估方法在区分模型能力上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20004 2026-08-11 cs.DB cs.CL 版本更新 57%

Human-Level Text-to-SQL via Reinforcement Learning on Verified Data, Without Pipeline Engineering

ReViSQL:实现人水平的文本到SQL

Yuxuan Zhu, Tengjun Jin, Yoojin Choi, Daniel Kang

机构 * UIUC(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出ReViSQL框架,通过高质量训练数据提升SQL推理能力,首次在BIRD基准上达到人水平准确率,且在不同模型规模下均表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05825 2026-08-10 cs.CL 版本更新 57%

MoCA: Implicit Social Context Analysis

MoCA:隐式社会语境分析

Wenhao Xu, Kaiwen Zhang, Hao Li, Maowei You, Yongzheng Ji, Siyuan Zuo, Jingxuan Yu, Sina A, Xinyao Tan, Bobo Li, Hao Fei, Mong-Li Lee, Wynne Hsu

机构 * National University of Singapore(新加坡国立大学) University of Oxford(牛津大学) Wuhan University(武汉大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出隐式社会语境分析(MoCA)新任务,构建含3108个实例的基准数据集,提出CoDAR框架提升模型性能,但模型与人类推理仍存差距,凸显隐式社会理解难度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09885 2026-08-10 cs.CL 版本更新 57%

Index SLM Technical Report

索引SLM技术报告

Tianjiao Li, Lusheng Zhang, Shien He, Xiaojing Liu, Tianxing Yan, Mengran Yu, Ziang Cui, Kai Zhao, Yang Liu, Yuxin Li

机构 * Bilibili(哔哩哔哩)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 哔哩哔哩开发Index-1.9B系列小语言模型,包括基础模型等四个模型。预训练采用特定方法,Index-1.9B-Base在标准基准测试表现出色,还进行了多项控制研究,所有模型及评估代码已公开。

Comments 16 pages, 9 figures. v2: updated author list (added Yang Liu and Yuxin Li; marked core contributors and project lead) and added a release-date note on the first page

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16009 2026-08-10 cs.AI 版本更新 57%

MEDLEY-BENCH: Benchmarking Behavioural Metacognition and Belief Revision Under Social Pressure in Large Language Models

MEDLEY-BENCH:在AI元认知中规模购买评估但不控制

Farhad Abtahi, Abdolamir Karbalaie, Eduardo Illueca-Fernandez, Fernando Seoane

机构 * Department of Clinical Science, Intervention and Technology (CLINTEC), Karolinska Institutet(临床科学、干预与技术部门(CLINTEC),Karolinska研究所) Department of Clinical Physiology, Karolinska University Hospital(临床生理学部门,Karolinska大学医院) Department of Biomedical Engineering and Health Systems, KTH Royal Institute of Technology(生物医学工程与健康系统部门,KTH皇家理工学院) Department of Textile Technology, University of Borås(纺织技术部门,Borås大学) Department of Medical Technologies, Karolinska University Hospital(医学技术部门,Karolinska大学医院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 MEDLEY-BENCH评估了12种模型家族中35个模型在五个领域130个模糊实例上的行为元认知能力,发现评估能力随模型规模增加而增强,但控制能力不增加,揭示了元认知能力与规模无关的结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03238 2026-08-10 cs.AI 版本更新 57%

"LLM Agent Performance" Is Not a Single Evaluation Target

基于LLM的智能体评估统一框架的必要性

Pengyu Zhu, Li Sun, Philip S. Yu, Sen Su

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Chongqing University of Posts and Telecommunications(重庆邮电大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 针对当前LLM智能体评估受系统提示、工具集和环境动态等混杂因素影响的问题,提出标准化统一评估框架以提升公平性和可复现性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00559 2026-08-10 cs.AI 版本更新 57%

Social World Models

社交世界模型

Xuhui Zhou, Jiarui Liu, Akhila Yerukola, Hyunwoo Kim, Maarten Sap

机构 * Language Technologies Institute, Carnegie Mellon University, Pittsburgh, PA, USA(卡内基梅隆大学语言技术研究所) NVIDIA, Santa Clara, CA, USA(英伟达)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出社交世界模型(SWMs)及结构化社交世界表示形式(S3AP),通过显式建模隐藏心理状态提升AI在社交推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01347 2026-08-07 cs.CL 版本更新 57%

Same Task, Different Work: Prompt-Induced Waste in Coding Agents

提示词诱导的大推理模型浪费:一项预注册的双框架编码智能体基准测试

Sarel Weinberger, Amir Hozez

机构 * PointFive

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 该研究通过预注册基准测试发现,提示词措辞和智能体框架会大幅影响大推理编码智能体的成本,部分提示指令可成倍增加推理成本却不提升任务成功率,框架选择的成本差异更显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01263 2026-08-07 cs.LG 版本更新 57%

Distill What the Student Can See: Fisher-Projected On-Policy Distillation for Vision-Language Models

提炼学生可见内容:面向视觉语言模型的Fisher投影在线策略蒸馏

Leyan Xue, Feng Xiong, Mingjun Ma, Changqing Zhang

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 针对视觉语言模型在线策略蒸馏中教师修正与学生能力不匹配的问题,提出FP-OPD方法,在8B到2B的蒸馏中使7个多模态基准平均得分分别提升2.77和1.60个点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27594 2026-08-07 cs.LG 版本更新 57%

Compliance2LoRA: Personalizable On-Demand Safety Alignment on Arbitrary Policy Subsets via Hypernetwork-Generated LoRA Adapters

Compliance2LoRA:通过超网络生成的LoRA适配器对任意策略子集进行按需安全对齐

Pankayaraj Pathmanathan, Furong Huang

机构 * University of Maryland College Park(马里兰大学帕克分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 Compliance2LoRA是一种自适应超网络框架,可通过生成LoRA适配器,在单个大型推理模型上实现对任意安全策略子集的按需对齐,且不牺牲任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21800 2026-08-07 cs.AI 版本更新 57%

BioAgent Bench: An AI Agent Evaluation Suite for Bioinformatics

BioAgent Bench: 一个用于生物信息学的AI代理评估套件

Dionizije Fa, Marko Culjak, Bruno Pandza, Mateo Cupic

机构 * Entropic

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出BioAgent Bench,用于评估AI代理在常见生物信息学任务中的性能和鲁棒性。通过定制端到端任务和压力测试,发现前沿代理可完成多步骤流程,但鲁棒性测试揭示了在受控扰动下的失败模式,表明高阶流程构建不保证可靠步骤推理。

Comments ICML 2026 camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15604 2026-08-07 cs.CL 版本更新 57%

Text Generation: A Systematic Literature Review of Tasks, Evaluation, and Challenges

文本生成:关于任务、评估与挑战的系统文献综述

Jonas Becker, Jan Philip Wahle, Bela Gipp, Terry Ruas

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 该系统综述梳理2017-2025年257篇论文,划分文本生成五大任务,评估三类方法,指出任务特有与共有的9项挑战,为NLP领域不同阶段研究者提供领域概览与研究方向参考。

Comments Published in the Journal of Artificial Intelligence Research (JAIR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21597 2026-08-06 cs.AI 版本更新 57%

Risk Is Not the Target: A Monotonic Framework for Evaluating Wildfire Operational Risk Signals

风险不是目标:评估野火运行风险信号的单调框架

Nicolas Caron, Christophe Guyeux, Hassan Noura, Maxime Coulmeau, Benjamin Aynes

机构 * Météo-France(法国气象局) INRAE(法国国家农业、食品与环境研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究提出用单调评估框架衡量野火风险系统预测分数与运行负荷关系,比较DFE、GRU模型及FARS三种方法,发现DFE单调性最佳,GRU局部强但风险水平分布不佳,FARS有局限性,好风险模型应能解释运行动态。

Comments Accepted in 2026 IEEE 50th Annual Computers, Software, and Applications Conference (COMPSAC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20690 2026-08-06 cs.CL 版本更新 57%

Learning to Detect UI Principle Violations via Reinforcement Learning

通过强化学习学习检测用户界面原则违规

Nishi Mehta, Swathi Alse, Himani Kumawat, Yue Yu, Pratik Jayarao

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 研究小型语言模型和编码代理生成的网页前端代码违反界面质量原则的问题,通过统一多来源的界面质量原则,构建数据集并利用强化学习训练轻量级视觉语言模型作为评判器,提升检测效果并发布相关方法支持评估和后续工作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17188 2026-08-06 cs.CV cs.CL 版本更新 57%

Not Truly Multilingual: Script Consistency as a Missing Dimension in VLM Evaluation

并非真正的多语言:脚本一致性作为VLM评估中缺失的维度

Prabhjot Singh, Bhushan Pawar, Madhu Reddiboina, Rajvee Sheth

机构 * RediMinds Inc.(RediMinds公司) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Independent Researcher(独立研究员)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出PuMVR基准,评估10个VLM在旁遮普语三种文字上的表现,发现显著的脚本差距,并提出脚本一致性率(SCR)作为必要评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15314 2026-08-05 cs.AI 版本更新 57%

Cura 1T: Specialized Model for Agentic Healthcare

Cura 1T:用于智能医疗保健的专用模型

actAVA AI, :, Haolin Chen, Leon Qi, Steve Brown, Deon Metelski, Tao Xia, Joonyul Lee, Qixuan Wang, Kevin Riley, Frank Wang, Weiran Yao

机构 * actAVA AI(actAVA人工智能公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究针对医疗保健中多任务需求及能力失效问题,提出通过人工门控自我进化循环训练的Cura 1T模型,以数据为中心改进模型,该模型在医疗评估套件中表现优异,在相关基准测试中保持竞争力。

Comments Model: https://actava.ai/cura; Docs: https://actava.ai/cura/docs; Github: https://github.com/actava-ai/Cura

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12953 2026-08-05 cs.CV cs.AI cs.IR cs.MM 版本更新 57%

Epistemic-aware Vision-Language Foundation Model for Fetal Ultrasound Interpretation

具备知识意识的视觉-语言基础模型用于胎儿超声解读

Xiao He, Huangxuan Zhao, Guojia Wan, Jiancheng Pan, Yanxing Liu, Yong Luo, Juhua Liu, Yongchao Xu, Wei Zhou, Dacheng Tao, Bo Du

机构 * National Engineering Research Center for Multimedia Software, School of Computer Science, Wuhan University(国家多媒体软件工程技术研究中心,武汉大学计算机学院) College of Computing and Data Science, Nanyang Technological University(computing and Data Science学院,南洋理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 FetalMind通过Salient Epistemic Disentanglement方法,提升胎儿超声解读的准确性和效率,实现多视图图像推理和疾病诊断的高效处理。

Comments KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13502 2026-08-05 cs.CL 版本更新 57%

BOW: Training Language Models to Reason Over Plausible Next Words

BOW:训练语言模型对合理的下一个单词进行推理

Ming Shen, Zhikun Xu, Jacob Dineen, Xiao Ye, Ben Zhou

机构 * Arizona State University(亚利桑那州立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 BOW是一种RL框架,通过训练语言模型生成合理下一个单词空间的全面描述,在10个推理基准上表现优于部分基线,BOW-Reg还能提升SharedRef正确率并降低单义崩溃。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11421 2026-08-05 cs.CL 版本更新 57%

States Hidden in Hidden States: Implicit Discrete State Representations Emerge in LLMs' Hidden States

隐藏状态中隐藏的状态:大型语言模型的隐藏状态中出现隐式离散状态表示

Junhao Chen, Shengding Hu, Zhiyuan Liu, Maosong Sun

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL

AI总结 本研究探索LLMs的符号计算能力,发现其隐藏状态中存在隐式离散状态表示(IDSRs),最强模型可直接计算最多15个加数的求和,但当前开源模型的IDSRs存在损耗会导致输出错误。

Comments 12 pages, 12 figures. Revised manuscript with public code and reproducibility artifacts; clarified the evaluation protocol; corrected figure labels and chance baselines, the attention-bridge description, cross-references, and probe notation. No new experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04227 2026-08-04 cs.AI cs.HC 版本更新 57%

Pro$^2$Assist: Continuous Step-aware Proactive Assistance with Multi-modal Egocentric Perception for Long-horizon Procedural Tasks

Pro²Assist:面向长程流程任务的、基于多模态自我中心感知的步骤感知主动式辅助系统

Lilin Xu, Bufang Yang, Siyang Jiang, Kaiwei Liu, Kaiyuan Hou, Yuang Fan, Hongkai Chen, Zhenyu Yan, Xiaofan Jiang

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出Pro²Assist,一种基于多模态自我中心感知的步骤感知主动式辅助系统,通过AR眼镜感知与持续推理提升长程流程任务辅助效果,在动作理解与主动时机准确率上优于基线,获多数用户认可。

Comments To appear in IMWUT'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09757 2026-08-04 cs.CL cs.AI 版本更新 57%

RSRA: Training-Free Probing of Representation Sensitivity for Efficient LoRA Rank Allocation

RSLoRA:通过表示敏感性探测实现LoRA的无训练秩分配

Jiaqi Liu, Haidong Kang, Qihui Zhao, Guo Yu, Jingchao Wang

机构 * Dalian University of Technology(大连理工大学) Northeastern University(东北大学) Hebei Key Laboratory of Marine Perception Network and Data Processing(河北省海洋感知网络与数据处理重点实验室) Nanjing Tech University(南京工业大学) Institute of Intelligent Manufacturing(智能制造研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究针对LoRA传统秩分配问题,提出RSLoRA,通过激活空间几何及虚拟表示探测机制确定高敏感性模块,无需训练调整和反向梯度,在主流基准测试中优于现有方法,为模型自适应提供高效方案。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23488 2026-08-04 cs.LG 版本更新 57%

Do Prompt-Elicited Trajectories Reflect Training-Time Reward Hacking? A Systematic Study on Monitoring Training-Time Reward Hacking in Code Generation

合成轨迹反映真实的奖励黑客行为吗?对监控真实世界代码生成中黑客行为的系统研究

Lichen Li, Hengguang Zhou, Yijun Liang, Tianyi Zhou, Cho-Jui Hsieh

机构 * Peking University(北京大学) University of California, Los Angeles(加州大学洛杉矶分校) Arena University of Maryland(马里兰大学) Mohamed bin Zayed University of Artificial Intelligence(莫莫迪 bin Zayed 人工智能大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文研究合成轨迹与真实世界中代码生成奖励黑客行为的差异,通过对比监控器在合成与真实数据上的表现,发现合成数据训练的监控器无法泛化到真实黑客行为,而真实数据训练的监控器对未见过的黑客类型更具泛化能力。

Comments Corrected a typo in the title; no other changes

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08262 2026-08-04 cs.AI 版本更新 57%

FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use

FinToolBench:评估LLM代理在真实金融工具使用中的表现

Jiaxuan Lu, Kong Wang, Yemin Wang, Qingmei Tang, Hongwei Zeng, Xiang Chen, Jiahao Pi, Shujian Deng, Lingzhi Chen, Yi Fu, Kehua Yang, Xiao Sun

机构 * Shanghai AI Laboratory(上海人工智能实验室) Hunan University(湖南大学) Xiamen University(厦门大学) Tencent(腾讯) UCAS(中国科学技术大学) Tongji University(同济大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 FinToolBench是首个评估金融工具学习代理真实世界表现的基准,通过760个可执行金融工具和295个严格查询,评估时效性、意图类型和合规性等关键维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21079 2026-08-04 cs.CL 版本更新 57%

SoM-1K: A Thousand-Problem Benchmark Dataset for Strength of Materials

SoM-1K:用于材料力学能力的千题基准数据集

Qixin Wan, Zilong Wang, Jingwen Zhou, Wanting Wang, Ziheng Geng, Jiachen Liu, Ran Cao, Lu Cheng

机构 * College of Civil Engineering, Hunan University(湖南大学土木工程学院) Department of Civil & Architectural Engineering, University of Miami(迈阿密大学土木与建筑工程系) Department of Electrical and Computer Engineering, University of Miami(迈阿密大学电气与计算机工程系) School of Architecture, University of Miami(迈阿密大学建筑学院) Department of Computer Science, University of Illinois Chicago(伊利诺伊大学芝加哥分校计算机科学系)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 该研究推出含1065道题的SoM-1K多模态基准,评估8种基础模型的材料力学能力,提出DoI提示策略,发现当前模型表现差,LLMs配DoI优于VLMs配图像,为工程AI提供基准并强调多模态推理需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19063 2026-08-03 cs.AI 版本更新 57%

Quality Action Assurance: Multimodal Verification of Examiner Claims in VR OSCEs

质量行动保证:虚拟现实客观结构化临床考试中考官声明的多模态验证

Harry Rogers, Sally Shiels, Ashley Tomlinson, James Thomas, James Aylward, Nathan Gauge, Helen Higham, Alison Noble

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究针对VR儿科OSCEs中考官评分受主观因素影响问题,提出多模态框架QAA,结合约束时间动作对齐模型与大语言模型,通过对比动作与真实事件序列验证考官声明,提升了评估的公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02854 2026-08-03 cs.AI 版本更新 57%

M3MAD-Bench: Multi-Dimensional Evaluation of Multi-Agent Debate Across Domains and Modalities

M3MAD-Bench: 多智能体辩论在不同领域和模态中真的有效吗?

Ao Li, Jinghui Zhang, Luyu Li, Yuxiang Duan, Lang Gao, Mingcai Chen, Weijun Qin, Shaopeng Li, Fengxian Ji, Ning Liu, Lizhen Cui, Xiuying Chen, Yuntao Du

机构 * Shandong University(山东大学) MBZUAI Nanjing University of Posts and Telecommunications(南京邮电大学) BOB Cloud(BOB云)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 M3MAD-Bench通过多领域、多模态和多维指标评估多智能体辩论方法的有效性,提供全面的性能-成本分析。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏