SkillGuard: A Permission-Centric Framework for Agent Skill Security
SkillGuard:一种面向智能体技能的权限框架
专题命中 推理评测 :reasoning(abstract)
AI总结 提出SkillGuard权限框架,通过双平面治理模型联合管控上下文影响和动作副作用,以缩小技能声明意图与运行时行为之间的安全差距。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
SkillGuard:一种面向智能体技能的权限框架
专题命中 推理评测 :reasoning(abstract)
AI总结 提出SkillGuard权限框架,通过双平面治理模型联合管控上下文影响和动作副作用,以缩小技能声明意图与运行时行为之间的安全差距。
OpenEarthAgent:一个用于工具增强地理空间代理的统一框架
机构 * Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed人工智能大学) ; IBM Research(IBM研究院) ; Linköping University(林霍姆斯大学) ; Technical University Munich(慕尼黑技术大学) ; Australian National University(澳大利亚国立大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出OpenEarthAgent框架,通过整合卫星影像、自然语言查询和结构化推理轨迹,实现多模态地理空间推理,提升遥感任务的执行能力与空间逻辑一致性。
Comments Accepted at the European Conference on Computer Vision (ECCV 2026)
基于大语言模型的分布式多智能体系统中长期记忆的成本与准确性
专题命中 推理评测 :reasoning(abstract)
AI总结 针对分布式多智能体系统中长期记忆的成本与准确性评估空白,构建独立可复现测试平台,比较多种架构并发现检索不完整是准确率差距主因,RAG基线以更低总拥有成本达到高准确率。
Comments Copyright IEEE 2026. Manuscript accepted at IEEE COMPSAC 2026. Not for redistribution. Published version: https://doi.org/10.1109/XXXXXX
TIIF-Bench:你的文本到图像模型如何遵循指令?
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Tsinghua University(清华大学) ; OPPO Research Institute(OPPO研究院)
专题命中 推理评测 :reasoning(abstract)
AI总结 研究旨在评估T2I模型遵循指令能力,提出TIIF-Bench基准,含多维度、多难度提示及新评估指标,利用大语言模型知识开发可重现评估器,通过对主流模型测试分析其优缺点及现有基准局限性。
Comments 35 pages, 14 figures, 9 tables
视频扩散模型在手部运动重建中的惊人有效性
机构 * Nanyang Technological University(南洋理工大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 提出ViDiHand,利用预训练视频扩散模型重建4D双手姿态,无需检测器或优化,在多个基准上显著超越现有方法。
诊断视觉语言模型中由损坏引起的可靠性故障
机构 * City University of Macau(澳门城市大学) ; Nanyang Technological University(南洋理工大学) ; Jiangxi University of Finance and Economics(江西财经大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 研究视觉损坏对视觉语言模型行为的影响,引入Bench-C测试平台及稳健对齐分数(RAS),通过对13个VLM实验发现轻度损坏会提高top-1准确率却降低预测结构,支持超越最终答案的稳健性评估。
Comments 14 pages
从我的视角到你的视角:利用特权自我中心监督从外中心视频中学习自我中心线索
机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) ; Elorian AI
专题命中 推理评测 :reasoning(abstract)
AI总结 研究针对视觉语言模型难以从外中心视频推断自我中心属性的问题,提出Ego2ExoVLM框架,利用时间同步视频对及特权监督,通过两个组件实现此能力,在多任务评估中取得领先性能。
Comments ECCV 2026
基于混合评估的软件需求到架构生成基准测试
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出R2ABench基准,包含真实软件项目及PRD和PlantUML图,通过多维混合评估框架评估生成架构,发现LLM在关系推理上存在不足,代码专用模型和代理框架各有优劣。
SWE-Manager:编码前选择并合成黄金方案
专题命中 推理评测 :reasoning(abstract)
AI总结 研究软件工程中提案选择问题,引入SWE-Manager方法,通过强化学习训练8B模型进行提案比较、选择及合成黄金方案,在基准测试中表现优异,并设计框架评估其在实际问题解决中的有效性。
IRG-MotionLLM:用于文本到运动生成的交织运动生成、评估和细化
机构 * Sun Yat-sen University(中山大学) ; Tongyi Lab, Alibaba Group(阿里云实验室) ; Shenzhen Loop Area Institute(深圳河套学院) ; Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education, China(教育部人工智能与先进计算重点实验室)
专题命中 推理评测 :reasoning(abstract)
AI总结 研究揭示运动评估和细化任务可促进知识流动,提出通过迭代文本-运动对话将运动生成与评估、细化紧密结合的新范式,介绍IRG-MotionLLM及训练方案,构建数据引擎,实验证明其性能。
Comments Accepted by ECCV 2026
VKnowU:评估多模态语言模型中的视觉知识理解
机构 * University of Science and Technology of China(中国科学技术大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Nanjing University(南京大学) ; Shanghai Innovation Institute(上海创新研究院) ; City University of Hong Kong(香港城市大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 研究多模态大语言模型视觉知识理解能力,提出VKnowU基准测试。评估28个模型,发现与人类表现有差距。引入新数据集和VideoKnow+基线模型,采用结构化范式和强化学习,提升模型表现。
Comments Accepted by ECCV 2026. https://github.com/OpenGVLab/VKnowU
Omni-DuplexEval: 评估实时双工全模交互
机构 * Tsinghua University(清华大学) ; Tongji University(同济大学) ; ModelBest Inc.(ModelBest公司)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出Omni-DuplexEval基准,用于系统评估实时双工交互能力,通过两个互补场景评估模型生成连续响应和主动提醒的能力,并揭示现有模型在平衡响应及时性和内容连贯性方面的局限性。
Comments 21 pages, 6 figures
VERITAS:通过智能系统进行图像派生假设检验的可验证认知推理
专题命中 推理评测 :reasoning(abstract)
AI总结 VERITAS通过多智能体系统自主测试自然语言假设,生成可审计的证据链,通过四阶段工作流和认知证据标签框架提升医学影像研究的可验证性,达到81.4%的准确率。
Comments 43 pages, 5 figures. Code available at https://github.com/LucZot/veritas
Video-Oasis:重新审视视频理解的评估
机构 * Sejong University(世宗大学) ; NAVER Cloud
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出Video-Oasis,通过系统评估现有评估方法,揭示视频理解中的时空挑战,发现54%的基准样本无需视觉输入即可解决,先进模型表现仅略超随机猜测。
Comments Accepted at ECCV2026; Project page: https://limgeuntaekk.github.io/Video-Oasis/
评估数百个LLM代理的集体行为
专题命中 推理评测 :reasoning(abstract)
AI总结 提出框架评估LLM代理在社会困境中的涌现行为,通过自然语言策略生成与代码翻译,分析行为指纹、自博弈福利及文化演化,发现大群体中文化演化收敛至低福利自私均衡。
Comments 18 pages, 5 figures
LLM导师院长:AI生成反馈的自动质量审查框架
专题命中 推理评测 :reasoning(abstract)
AI总结 提出DeanLLM框架,通过16维度评估LLM导师反馈的内容、教育效果和幻觉风险,并利用微调GPT-4.1实现与人类专家高度一致的自动审查。
工业检测场景安全评估的多模态基准
机构 * Department of Automation, Tsinghua University(清华大学自动化系) ; Institute for Embodied Intelligence and Robotics, Tsinghua University(清华大学具身智能与机器人研究所) ; TetraBOT Intelligence Co., Ltd.(天博智能科技有限公司) ; DAMO Academy, Alibaba Group(阿里巴巴达摩院) ; School of Automation, Southeast University(东南大学自动化学院)
专题命中 推理评测 :reasoning(abstract)
AI总结 针对工业现场多模态安全评估缺乏真实数据的问题,构建了首个包含真实机器人巡检数据、像素级标注和七种同步模态的基准数据集InspecSafe-V1,覆盖五个典型场景,支持多模态异常识别与安全评估。
Comments 14 pages, 6 figures, Accepted by Scientific Data
MIRAGE:微服务依赖测试的在线LLM模拟
专题命中 推理评测 :reasoning(abstract)
AI总结 MIRAGE通过在线LLM模拟动态响应微服务依赖请求,提升测试场景的覆盖率和准确性,尤其在错误处理和代码推理方面表现更优。
SurgXBench: 可解释的视觉-语言模型手术基准
机构 * Arizona State University(亚利桑那州立大学) ; Intel Labs(英特尔实验室) ; Duke University(杜克大学) ; University of Miami(迈阿密大学) ; University of California, Merced(加州大学默塞德分校)
专题命中 推理评测 :reasoning(abstract)
AI总结 针对手术视觉-语言模型(VLM)泛化能力不足的问题,提出SurgXBench基准,在零样本设置下评估多个先进VLM在器械与动作分类任务上的表现,并集成可解释AI分析模型注意力与因果解释,揭示模型依赖弱上下文线索而非临床相关证据的局限性。
Qwen-Image-Bench:从生成到创造——文本到图像评估
机构 * Alibaba(阿里巴巴)
专题命中 推理评测 :reasoning(abstract)
AI总结 针对现有文本到图像评估基准缺乏对真实世界保真度和创造性生成能力的考量,本文提出Qwen-Image-Bench,一个与专业艺术家共同设计的创作者中心基准,通过分层分类体系、1000个分层提示和基于Qwen3.6-27B的统一评判模型Q-Judger,实现细粒度、可归因的诊断,有效区分领先的T2I模型。
6根手指,1个肾脏:自然对抗性医学图像揭示视觉语言模型的关键弱点
机构 * German Cancer Research Center (DKFZ) Heidelberg, Division of Intelligent Medical Systems(德国癌症研究中心(DKFZ)海德堡,智能医学系统部门) ; Medical Faculty, Heidelberg University(海德堡大学医学院) ; Faculty of Mathematics and Computer Science, Heidelberg University(海德堡大学数学与计算机科学学院) ; HIDSS4Health - Helmholtz Information and Data Science School for Health, Karlsruhe/Heidelberg(HIDSS4Health - 哈勃-马克斯信息与数据科学健康学院,卡尔斯鲁厄/海德堡) ; Helmholtz Imaging, German Cancer Research Center (DKFZ)(哈勃-马克斯成像,德国癌症研究中心(DKFZ)) ; Engineering Faculty, Heidelberg University(海德堡大学工程学院) ; School of Computation, Information and Technology, TUM(技术大学(TUM)计算、信息与技术学院) ; Weldon School of Biomedical Engineering, Purdue University(普渡大学韦尔登生物医学工程学院) ; Department of Visceral, Thoracic and Vascular Surgery, University Hospital and Faculty of Medicine Carl Gustav Carus, TUD Dresden University of Technology(visceral、胸腔和血管外科部门,技术大学(TUD)德累斯顿大学医院和医学院) ; National Center for Tumor Diseases (NCT), NCT Heidelberg, a partnership between DKFZ and University Hospital Heidelberg(肿瘤疾病国家中心(NCT),海德堡NCT,DKFZ与海德堡大学医院之间的合作) ; Heidelberg University Hospital, Surgical Clinic, Surgical AI Research Group(海德堡大学医院,外科诊所,外科人工智能研究组) ; Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI), Abu Dhabi, UAE(Mohamed Bin Zayed人工智能大学(MBZUAI),阿布扎赫,阿拉伯联合酋长国)
专题命中 推理评测 :reasoning(abstract)
AI总结 提出AdversarialAnatomyBench基准,测试25个视觉语言模型在罕见解剖变异上的表现,发现准确率从71%降至28%,且模型缩放和干预无法解决。
MalSkillBench: 一个运行时验证的恶意智能体技能基准
专题命中 推理评测 :reasoning(abstract)
AI总结 提出MalSkillBench,首个运行时验证的恶意智能体技能基准,包含3944个恶意技能,通过闭环生成-验证-反馈流水线构建,揭示代码注入与提示注入检测的不对称性,并指出联合推理任务意图、代码和指令的必要性。
现代视频大语言模型需要听觉吗?基准审计与可扩展补救措施
机构 * NAVER Cloud AI(NAVER云AI) ; KAIST AI(韩国国立庆北大学AI)
专题命中 推理评测 :reasoning(abstract)
AI总结 通过审计10个视频基准发现多数任务仅凭视觉即可解决,音频未被充分利用;提出在LLaVA-OneVision上附加语音/音频编码器,采用25倍令牌压缩,实验证明音频在需要语音理解或跨模态对齐的任务上带来显著提升。
Comments Accepted to Interspeech 2026
探索ChatGPT在实验物理反馈与评估中的潜力
专题命中 推理评测 :reasoning(abstract)
AI总结 本研究探索ChatGPT在实验物理实验报告评估中的应用,通过API评估和定制化ChatGPT两种模式,发现其在形式结构反馈上表现一致,但在技术推理和实验数据解释方面可靠性较低,强调了教师监督的重要性。
Comments 11 pages, 1 fig
CodePercept: 基于代码的MLLM视觉STEM感知
机构 * MoE Key Lab of Artificial Intelligence, AI Institute, School of Computer Science, Shanghai Jiao Tong University(人工智能大模型重点实验室,人工智能学院,计算机科学学院,上海交通大学) ; Qwen Team(通义实验室) ; Beijing Institute of Technology(北京理工大学) ; Tsinghua University(清华大学) ; Zhejiang University(浙江大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文发现多模态大模型在STEM视觉推理中感知能力是瓶颈,提出通过代码作为感知媒介,构建ICC-1M数据集和STEM2Code-Eval基准来增强和评估感知能力。
Comments Accepted by CVPR2026
E-VAds:面向多模态大语言模型的电商短视频理解基准
机构 * Alimama Tech, Taobao \& Tmail Group of Alibaba ; Huazhong University of Science ; Vin University
专题命中 推理评测 :reasoning(abstract)
AI总结 提出电商短视频理解基准E-VAds,通过多模态信息密度评估框架量化领域复杂性,并构建多智能体生成的问答数据集,最后开发基于强化学习的推理模型E-VAds-R1,在商业意图推理上实现109.2%的性能提升。
Comments Accepted by ICML2026
TWICE:通过事件驱动代理建模个性化用户行为的时间演化
专题命中 推理评测 :planning(abstract)
AI总结 提出TWICE框架,结合结构化用户画像、事件驱动记忆模块和两阶段工作流,利用LLM模拟用户行为的时间演化,在Twitter数据集上优于基线。
DRIVESPATIAL:自动驾驶中视觉语言模型时空智能的基准
机构 * University of Arkansas, USA(美国阿肯色大学) ; Google Research, Google(谷歌研究院) ; University of Liverpool, UK(英国利物浦大学) ; Max Planck Research School for Intelligent Systems(马克斯·普朗克智能系统研究学校)
专题命中 推理评测 :reasoning(abstract)
AI总结 提出DriveSpatial基准,通过多视角、时空推理任务评估视觉语言模型在自动驾驶中的场景构建、关系理解、时序推理和泛化能力,发现人类与模型间存在显著差距。
GroupToM-Bench: 多模态大语言模型中群体心智理论和非线性社会涌现的基准测试
机构 * Xidian University(西安电子科技大学) ; National University of Singapore(新加坡国立大学) ; University of Electronic Science and Technology of China(电子科技大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 针对多模态大语言模型在群体心智理论推理上的不足,提出GroupToM-Bench基准,通过七级认知审计框架评估模型从微观BDI状态到宏观结果预测的因果链,揭示模型在处理社会结构和非线性集体动态上的缺陷。
Comments ACL 2026 (Main Conference)
HanDyVQA:面向细粒度手-物交互动态的视频问答基准
机构 * Institute of Industrial Science, The University of Tokyo(东京大学工业科学研究所) ; National Institute of Advanced Industrial Science and Technology (AIST)(国家先进工业科学与技术研究院) ; Waseda University(早稻田大学) ; Visual Geometry Group, University of Oxford(牛津大学视觉几何组)
专题命中 推理评测 :reasoning(abstract)
AI总结 提出HanDyVQA基准,通过六类问题(11.1K QA对)和10.3K分割掩码,全面评估视频模型对手-物交互中操作与效果的细粒度时空推理能力,发现最佳模型Gemini-2.5-Pro仅73%准确率(人类97%)。
Comments CVPR 2026, Project page: https://masatate.github.io/HanDyVQA-project-page/