Dean of LLM Tutors: A Framework for Automated Quality Review of AI-generated Feedback
LLM导师院长:AI生成反馈的自动质量审查框架
专题命中 推理评测 :reasoning(abstract)
AI总结 提出DeanLLM框架,通过16维度评估LLM导师反馈的内容、教育效果和幻觉风险,并利用微调GPT-4.1实现与人类专家高度一致的自动审查。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
LLM导师院长:AI生成反馈的自动质量审查框架
专题命中 推理评测 :reasoning(abstract)
AI总结 提出DeanLLM框架,通过16维度评估LLM导师反馈的内容、教育效果和幻觉风险,并利用微调GPT-4.1实现与人类专家高度一致的自动审查。
工业检测场景安全评估的多模态基准
机构 * Department of Automation, Tsinghua University(清华大学自动化系) ; Institute for Embodied Intelligence and Robotics, Tsinghua University(清华大学具身智能与机器人研究所) ; TetraBOT Intelligence Co., Ltd.(天博智能科技有限公司) ; DAMO Academy, Alibaba Group(阿里巴巴达摩院) ; School of Automation, Southeast University(东南大学自动化学院)
专题命中 推理评测 :reasoning(abstract)
AI总结 针对工业现场多模态安全评估缺乏真实数据的问题,构建了首个包含真实机器人巡检数据、像素级标注和七种同步模态的基准数据集InspecSafe-V1,覆盖五个典型场景,支持多模态异常识别与安全评估。
Comments 14 pages, 6 figures, Accepted by Scientific Data
MIRAGE:微服务依赖测试的在线LLM模拟
专题命中 推理评测 :reasoning(abstract)
AI总结 MIRAGE通过在线LLM模拟动态响应微服务依赖请求,提升测试场景的覆盖率和准确性,尤其在错误处理和代码推理方面表现更优。
SurgXBench: 可解释的视觉-语言模型手术基准
机构 * Arizona State University(亚利桑那州立大学) ; Intel Labs(英特尔实验室) ; Duke University(杜克大学) ; University of Miami(迈阿密大学) ; University of California, Merced(加州大学默塞德分校)
专题命中 推理评测 :reasoning(abstract)
AI总结 针对手术视觉-语言模型(VLM)泛化能力不足的问题,提出SurgXBench基准,在零样本设置下评估多个先进VLM在器械与动作分类任务上的表现,并集成可解释AI分析模型注意力与因果解释,揭示模型依赖弱上下文线索而非临床相关证据的局限性。
Qwen-Image-Bench:从生成到创造——文本到图像评估
机构 * Alibaba(阿里巴巴)
专题命中 推理评测 :reasoning(abstract)
AI总结 针对现有文本到图像评估基准缺乏对真实世界保真度和创造性生成能力的考量,本文提出Qwen-Image-Bench,一个与专业艺术家共同设计的创作者中心基准,通过分层分类体系、1000个分层提示和基于Qwen3.6-27B的统一评判模型Q-Judger,实现细粒度、可归因的诊断,有效区分领先的T2I模型。
6根手指,1个肾脏:自然对抗性医学图像揭示视觉语言模型的关键弱点
机构 * German Cancer Research Center (DKFZ) Heidelberg, Division of Intelligent Medical Systems(德国癌症研究中心(DKFZ)海德堡,智能医学系统部门) ; Medical Faculty, Heidelberg University(海德堡大学医学院) ; Faculty of Mathematics and Computer Science, Heidelberg University(海德堡大学数学与计算机科学学院) ; HIDSS4Health - Helmholtz Information and Data Science School for Health, Karlsruhe/Heidelberg(HIDSS4Health - 哈勃-马克斯信息与数据科学健康学院,卡尔斯鲁厄/海德堡) ; Helmholtz Imaging, German Cancer Research Center (DKFZ)(哈勃-马克斯成像,德国癌症研究中心(DKFZ)) ; Engineering Faculty, Heidelberg University(海德堡大学工程学院) ; School of Computation, Information and Technology, TUM(技术大学(TUM)计算、信息与技术学院) ; Weldon School of Biomedical Engineering, Purdue University(普渡大学韦尔登生物医学工程学院) ; Department of Visceral, Thoracic and Vascular Surgery, University Hospital and Faculty of Medicine Carl Gustav Carus, TUD Dresden University of Technology(visceral、胸腔和血管外科部门,技术大学(TUD)德累斯顿大学医院和医学院) ; National Center for Tumor Diseases (NCT), NCT Heidelberg, a partnership between DKFZ and University Hospital Heidelberg(肿瘤疾病国家中心(NCT),海德堡NCT,DKFZ与海德堡大学医院之间的合作) ; Heidelberg University Hospital, Surgical Clinic, Surgical AI Research Group(海德堡大学医院,外科诊所,外科人工智能研究组) ; Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI), Abu Dhabi, UAE(Mohamed Bin Zayed人工智能大学(MBZUAI),阿布扎赫,阿拉伯联合酋长国)
专题命中 推理评测 :reasoning(abstract)
AI总结 提出AdversarialAnatomyBench基准,测试25个视觉语言模型在罕见解剖变异上的表现,发现准确率从71%降至28%,且模型缩放和干预无法解决。
MalSkillBench: 一个运行时验证的恶意智能体技能基准
专题命中 推理评测 :reasoning(abstract)
AI总结 提出MalSkillBench,首个运行时验证的恶意智能体技能基准,包含3944个恶意技能,通过闭环生成-验证-反馈流水线构建,揭示代码注入与提示注入检测的不对称性,并指出联合推理任务意图、代码和指令的必要性。
现代视频大语言模型需要听觉吗?基准审计与可扩展补救措施
机构 * NAVER Cloud AI(NAVER云AI) ; KAIST AI(韩国国立庆北大学AI)
专题命中 推理评测 :reasoning(abstract)
AI总结 通过审计10个视频基准发现多数任务仅凭视觉即可解决,音频未被充分利用;提出在LLaVA-OneVision上附加语音/音频编码器,采用25倍令牌压缩,实验证明音频在需要语音理解或跨模态对齐的任务上带来显著提升。
Comments Accepted to Interspeech 2026
探索ChatGPT在实验物理反馈与评估中的潜力
专题命中 推理评测 :reasoning(abstract)
AI总结 本研究探索ChatGPT在实验物理实验报告评估中的应用,通过API评估和定制化ChatGPT两种模式,发现其在形式结构反馈上表现一致,但在技术推理和实验数据解释方面可靠性较低,强调了教师监督的重要性。
Comments 11 pages, 1 fig
CodePercept: 基于代码的MLLM视觉STEM感知
机构 * MoE Key Lab of Artificial Intelligence, AI Institute, School of Computer Science, Shanghai Jiao Tong University(人工智能大模型重点实验室,人工智能学院,计算机科学学院,上海交通大学) ; Qwen Team(通义实验室) ; Beijing Institute of Technology(北京理工大学) ; Tsinghua University(清华大学) ; Zhejiang University(浙江大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文发现多模态大模型在STEM视觉推理中感知能力是瓶颈,提出通过代码作为感知媒介,构建ICC-1M数据集和STEM2Code-Eval基准来增强和评估感知能力。
Comments Accepted by CVPR2026
E-VAds:面向多模态大语言模型的电商短视频理解基准
机构 * Alimama Tech, Taobao \& Tmail Group of Alibaba ; Huazhong University of Science ; Vin University
专题命中 推理评测 :reasoning(abstract)
AI总结 提出电商短视频理解基准E-VAds,通过多模态信息密度评估框架量化领域复杂性,并构建多智能体生成的问答数据集,最后开发基于强化学习的推理模型E-VAds-R1,在商业意图推理上实现109.2%的性能提升。
Comments Accepted by ICML2026
TWICE:通过事件驱动代理建模个性化用户行为的时间演化
专题命中 推理评测 :planning(abstract)
AI总结 提出TWICE框架,结合结构化用户画像、事件驱动记忆模块和两阶段工作流,利用LLM模拟用户行为的时间演化,在Twitter数据集上优于基线。
DRIVESPATIAL:自动驾驶中视觉语言模型时空智能的基准
机构 * University of Arkansas, USA(美国阿肯色大学) ; Google Research, Google(谷歌研究院) ; University of Liverpool, UK(英国利物浦大学) ; Max Planck Research School for Intelligent Systems(马克斯·普朗克智能系统研究学校)
专题命中 推理评测 :reasoning(abstract)
AI总结 提出DriveSpatial基准,通过多视角、时空推理任务评估视觉语言模型在自动驾驶中的场景构建、关系理解、时序推理和泛化能力,发现人类与模型间存在显著差距。
GroupToM-Bench: 多模态大语言模型中群体心智理论和非线性社会涌现的基准测试
机构 * Xidian University(西安电子科技大学) ; National University of Singapore(新加坡国立大学) ; University of Electronic Science and Technology of China(电子科技大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 针对多模态大语言模型在群体心智理论推理上的不足,提出GroupToM-Bench基准,通过七级认知审计框架评估模型从微观BDI状态到宏观结果预测的因果链,揭示模型在处理社会结构和非线性集体动态上的缺陷。
Comments ACL 2026 (Main Conference)
HanDyVQA:面向细粒度手-物交互动态的视频问答基准
机构 * Institute of Industrial Science, The University of Tokyo(东京大学工业科学研究所) ; National Institute of Advanced Industrial Science and Technology (AIST)(国家先进工业科学与技术研究院) ; Waseda University(早稻田大学) ; Visual Geometry Group, University of Oxford(牛津大学视觉几何组)
专题命中 推理评测 :reasoning(abstract)
AI总结 提出HanDyVQA基准,通过六类问题(11.1K QA对)和10.3K分割掩码,全面评估视频模型对手-物交互中操作与效果的细粒度时空推理能力,发现最佳模型Gemini-2.5-Pro仅73%准确率(人类97%)。
Comments CVPR 2026, Project page: https://masatate.github.io/HanDyVQA-project-page/
DuplexSLA: 一种具备同步语音、语言和动作的全双工语音语言模型
专题命中 推理评测 :planning(abstract)
AI总结 本研究提出DuplexSLA,一种全双工语音语言模型,通过共享160ms时间线解码助理音频和结构化动作流,实现了同步语音、语言和动作的处理,解决了现有全双工模型在对话中规划和工具调用方面的不足。
利用大型多模态模型导航千兆像素病理图像
机构 * Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系) ; Department of Pathology, Massachusetts General Hospital(麻省总医院病理学系) ; Department of Pathology and Laboratory Medicine, Brown University(布朗大学病理学与实验室医学系)
专题命中 推理评测 :reasoning(abstract)
AI总结 提出GIANT方法,无需训练即可让通用多模态模型自主导航WSI,通过迭代选择多放大倍数裁剪并聚合证据,在MultiPathQA基准上实现SOTA。
面向部署的可解释AI辅助eBPF/XDP缓解框架在物联网边缘的应用
专题命中 推理评测 :reasoning(abstract)
AI总结 提出一种基于Linux的物联网边缘网关框架,结合资源感知的AI风险评分、事件级可解释性和eBPF/XDP限界缓解,实现可部署的异常流量管控。
Comments 59 pages, 2 figures, 12 tables. Conceptual framework and research agenda for explainable AI-assisted eBPF/XDP mitigation at the IoT edge. Corrected truncated abstract metadata
什么语义能经受住连接器的考验?视频编辑中VLM到DiT对齐的诊断
机构 * HKUST(香港理工大学) ; FDU(福建大学) ; ZJU(浙江大学) ; NUS(新加坡国立大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 本研究探讨了视频生成模型中VLM与DiT对齐过程中的语义瓶颈问题,通过提出TRACE-Edit数据集和诊断协议,发现连接器模块会导致细粒度结构语义的严重退化,挑战了原有假设。
ReMoT: 基于运动对比三元组的强化学习
机构 * Xi’an Jiaotong University(西安交通大学) ; Shenzhen University of Advanced Technology(深圳先进技术大学) ; DAMO Academy, Alibaba Group(阿里巴巴集团 DAMO 院)
专题命中 推理评测 :reasoning(abstract)
AI总结 提出ReMoT统一训练范式,通过规则生成大规模运动对比数据集和组相对策略优化,解决VLM时空一致性问题,在时空推理任务上提升25.1%。
Comments CVPR 2026 Highlight
CORRECT: 多智能体系统中基于知识迁移的浓缩错误识别
专题命中 推理评测 :reasoning(abstract)
AI总结 提出CORRECT框架,利用在线缓存蒸馏错误模式,实现轻量级、免训练的错误定位,在多智能体系统中提升错误识别效率,并在七个应用上取得最高19.8%的步骤级错误定位提升。
忠实、丰富且精确:T2I模型在自然科学插图生成中的基准测试
机构 * Shanghai Innovation Institute(上海创新研究院) ; Shanghai AI Laboratory(上海人工智能实验室) ; University of Science and Technology of China(中国科学技术大学) ; Wuhan University(武汉大学) ; Nankai University(南开大学) ; Shanghai Jiao Tong University(上海交通大学) ; Fudan University(复旦大学) ; ZODA ; Alaya Studio(Alaya工作室)
专题命中 推理评测 :reasoning(abstract)
AI总结 提出FEPBench基准,通过细粒度原子集标注和三维评估(指令忠实性、推理丰富性、语义精确性)系统评估T2I模型在自然科学插图生成中的表现,发现即使最先进的闭源模型仍存在文本渲染瓶颈、推理丰富性有限以及生成丰富性与精确性难以平衡的问题。
基于代理AI的语义通信:基础、架构与应用
专题命中 推理评测 :reasoning(abstract)
AI总结 本文探讨代理AI如何赋能语义通信,提出统一框架并展示多场景应用,通过案例研究验证其有效性。
Comments This version is being withdrawn because we need to further reevaluate the attribution of contributions among the authors
Vis-CoT:一种用于LLM思维链推理中交互式可视化和干预的人机协同框架
专题命中 其他推理 :CoT(title,title_cn);reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.CL
AI总结 提出Vis-CoT框架,将线性思维链文本转换为交互式推理图,允许用户可视化逻辑流程、识别错误步骤并通过剪枝和嫁接进行干预,显著提升推理准确性和用户信任。
Comments arXiv admin note: This paper has been withdrawn by arXiv due to unverifiable authorship and affiliation
推理动态与监控模态依赖性的局限性
机构 * University of Copenhagen, Department of Computer Science(哥本哈根大学计算机科学系) ; University of Sheffield, School of Computer Science(谢菲尔德大学计算机科学学院)
专题命中 其他推理 :CoT(summary_cn,abstract);reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究分析18种VLM的推理动态,发现模型易受早期预测影响,推理训练模型在模态条件下表现出更强的纠正行为,但其效果依赖于模态条件,且CoT的可检测性因模型而异。
Comments Accepted for publication in COLM 2026
诊断推理模型中的病理链式思维
机构 * Department of Epidemiology, CAUSALab, Harvard University, Boston, USA(流行病学系、CAUSALab、哈佛大学) ; Imperial College London, London, UK(伦敦帝国学院) ; McGill University, Montreal, Canada(麦吉尔大学) ; Geodesic Research, Cambridge, UK(Geodesic研究)
专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.AI
AI总结 本文提出了一种评估链式思维推理模型中病态的实用工具,通过定义具体度量标准和训练特定模型生物来识别和区分三种不同的病态现象。
推理的成本:链式推理诱导视觉-语言模型的过度自信
机构 * KTH Royal Institute of Technology, Stockholm, Sweden(皇家理工学院) ; Science for Life Laboratory, Stockholm, Sweden(生命科学实验室)
专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.LG
AI总结 研究发现链式推理会降低视觉-语言模型的不确定性估计质量,主要机制是隐式答案条件化,导致模型过度自信。
变压器通用推理的障碍(以及如何克服它们)
机构 * Saarland University(萨尔兰大学) ; Ohio State University(俄亥俄州立大学)
专题命中 其他推理 :CoT(summary_cn,abstract);reasoning(title);chain-of-thought(abstract);分类 cs.CL、cs.LG
AI总结 研究探讨了Transformer在长CoT轨迹上的泛化能力限制,并提出通过动态词汇增长和符号标记实现长度可扩展性。
Comments Accepted at COLM 2026
后训练中的分布偏差:推理轨迹的马尔可夫分析
机构 * City University of Hong Kong(香港城市大学) ; Center for Advanced Intelligence Project, RIKEN(RIKEN高级智能研究中心) ; The Institute of Statistical Mathematics(统计数学研究所) ; University of Sydney(悉尼大学) ; CFAR and IHPC, Agency for Science, Technology and Research (A*STAR)(A*STAR的CFAR和IHPC) ; Nanyang Technological University(南洋理工大学) ; The University of Tokyo(东京大学)
专题命中 其他推理 :CoT(summary_cn,abstract);reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 通过马尔可夫链模型分析后训练策略(如RLVR和ORM/PRM)如何强化高概率路径而遗忘稀有但关键的推理步骤,并证明探索策略(如拒绝简单实例和KL正则化)有助于保留稀有CoT。
低精度softmax变换器的表达能力(摘要)链式思维
机构 * Department of Mathematics, University of Tübingen, Germany(图宾根大学数学系)
专题命中 其他推理 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.LG
AI总结 本文研究了低精度softmax变换器在链式思维中的表达能力,通过构造三元激活和分离注意力分数的硬max变换器来模拟图灵机,从而将构造转换为等效的softmax变换器,并分析了最近提出的总结链式思维范式在模拟图灵机时的效率。
Comments Accepted to ICML 2026