How Far Can Root Cause Analysis Go on Real-World Telemetry Data?
根因分析在实际遥测数据上能走多远?
专题命中 多模态评测 :multimodal(abstract);分类 cs.AI
AI总结 研究生产微服务故障根因分析难题,提出结构化多智能体RCA管道,性能超现有方法。引入反向推理智能体和自动规则挖掘管道,发现故障证据多,瓶颈在智能体推理能力,模型推理和领域知识是主要限制,进步需模型改进。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
根因分析在实际遥测数据上能走多远?
专题命中 多模态评测 :multimodal(abstract);分类 cs.AI
AI总结 研究生产微服务故障根因分析难题,提出结构化多智能体RCA管道,性能超现有方法。引入反向推理智能体和自动规则挖掘管道,发现故障证据多,瓶颈在智能体推理能力,模型推理和领域知识是主要限制,进步需模型改进。
TerraLogic:地球观测中分层地理空间推理的基准
机构 * The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)) ; Technical University of Munich(慕尼黑工业大学)
专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV
AI总结 针对遥感中认知地理空间推理研究不足的问题,引入TerraLogic基准及HieraPlan工具增强智能体,通过545个任务推动评估向认知级发展,实验显示HieraPlan在分层地理空间推理上表现出色,为相关研究提供强大基线。
Comments 8 pages, 3 figures, and 7 tables. Dataset and agent code are available at https://github.com/Ireliya/TerraLogic
Claude Fable 5在生物医学挑战问题上的能力
机构 * School of Computing, University of Georgia(佐治亚大学计算学院) ; Department of Chemistry, University of Illinois(伊利诺伊大学化学系) ; Institute of Bioinformatics, University of Georgia(佐治亚大学生物信息学研究所)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CL
AI总结 研究评估Claude Fable 5在八个生物医学基准上的能力,以确定性评分针对固定答案键评估,含两个Claude前身和GPT-5作基线。发现Fable 5拒绝率因基准而异,排除拒绝项后准确率超其他模型,还识别出两种拒绝模式,其生物医学应用主要受限在参与意愿。
Comments 15 pages, 6 tables, 4 figures, appendix with qualitative examples
通过虚拟模态合成将大型多模态模型推广到通用视觉模态
机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算学部)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 研究大型多模态模型推广到未见视觉模态的挑战,提出VVM-Tuning训练框架,通过模态合成和上下文让模型具备相关能力,引入VVM-Bench基准,实验证明经合成模态训练的模型在多模态上有改进且无需模态内训练。
Comments Accepted by the European Conference on Computer Vision (ECCV) 2026
迈向现实世界的可穿戴运动重建
机构 * Max Planck Institute for Informatics(马克斯·普朗克信息研究所) ; Saarbrücken Research Center for Visual Computing, Interaction and AI(萨尔布吕肯视觉计算、交互与人工智能研究中心) ; Google(谷歌)
专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV
AI总结 研究可穿戴设备运动捕捉问题,提出优先考虑轻便设备。贡献包括提供多模态数据集,提出WHIP模型,研究传感器互补性,以实现从任意传感器子集重建运动,处理缺失模态并生成合理运动。
Comments Accepted at ECCV 2026
UniClawBench:面向实际任务中主动智能体的通用基准测试
机构 * HKU MMLab(香港大学多媒体实验室) ; Meituan(美团)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CL
AI总结 针对现有基准测试难以评估主动智能体的问题,提出UniClawBench,基于五项基础模型能力设计400个双语现实任务,采用实时评估和闭环评估策略,通过多模型框架对比展示基础模型能力和框架设计对性能的影响,还公开了基准测试和代码。
Comments Project Page: https://uniclawbench.github.io | GitHub Repo: https://github.com/HKU-MMLab/UniClawBench
LTM:适用于易发生野火地区的大规模地形模型
专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV
AI总结 针对易发生野火地区传统地形重建方法不足,提出利用过时DEM的多模态重建框架,通过物理像素对齐降低计算复杂度,经大型地形模拟器验证,相比现有技术显著提升了重建精度与计算效率,为野火应对提供可扩展方案。
人工智能理解成像吗?计算成像任务中智能体人工智能的系统基准测试
机构 * University of Hawaii at Manoa(夏威夷大学马诺阿分校) ; Glass Imaging(玻璃成像公司)
专题命中 多模态评测 :multimodal(abstract);分类 cs.AI
AI总结 研究人工智能在计算成像任务中的表现,提出ImagingBench基准测试,涵盖五类20个任务及三种评估设置,对多模态系统测试发现智能体模型比专门方法弱,该基准可测差距与跟踪进展。
Comments 14 pages, 11 figures. Preprint / work in progress. Paper Webpage: https://cirp-lab.github.io/imagingbench
用于通用文档视觉问答的领域适应视觉语言模型的比较研究
机构 * Universidad Autónoma de Madrid (UAM)(马德里自治大学) ; BiometricsAI(生物识别人工智能)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 研究对8个开源预训练VLMs在三种文档领域的DocVQA进行全面评估,通过多种评估方式发现其在不同布局性能有差异,参数缩放影响性能,视觉理解是瓶颈,还表明少样本微调能让模型快速适应目标域文档。
Comments 17 pages, 4 figures, accepted at the Automatically Domain-Adapted and Personalized Document Analysis workshop of the ICDAR 2026
MADB:一个具有专业和多维度注释的大规模音乐美学数据集
机构 * Central Conservatory of Music, China(中央音乐学院) ; Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院) ; Tianjin Conservatory of Music(天津音乐学院) ; Beijing Electronic Science and Technology Institute(北京电子科技研究所) ; Peking University(北京大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.AI
AI总结 研究音乐美学评估问题,引入含9999首曲目、由30名注释者标注的MADB数据集,通过多预训练模型建立统一评估框架,揭示模型与人类判断差距,为音乐理解提供新基准。
WildCity:用于渲染、模拟和空间智能的真实世界城市规模测试平台
机构 * May Mobility(五月出行公司) ; New York University(纽约大学) ; NVIDIA(英伟达公司) ; Stanford University(斯坦福大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 针对人工智能在构建城市规模空间表征方面的挑战,引入WildCity真实世界多模态数据集,建立重建基线并转化为模拟器,分析关键挑战,推动城市规模渲染及相关人工智能发展。
Comments ECCV 2026; Project Page: https://han-xiangyu.github.io/Wild-City/
CoMind:从多视角理解人类协作活动
机构 * ETH Zurich(苏黎世联邦理工学院) ; MPI for Informatics(马克斯·普朗克信息研究所) ; Microsoft Switzerland(微软瑞士公司) ; TU Munich(慕尼黑工业大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 研究旨在填补人类协作认知过程研究空白,引入CoMind数据集,整合多模态数据并标注,建立相关基准,有助于开发和评估能建模复杂社会互动及推理人类行为的AI系统。
Comments Accepted to ECCV 2026
从车道感知角度评估自动驾驶对环境错觉的鲁棒性:基准测试
机构 * SKLCCSE, the School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院软件安全技术与工程北京市重点实验室) ; the School of Cyber Science and Technology, Sun Yat-sen University(中山大学网络空间科学与技术学院) ; Henan University of Science and Technology(河南科技大学) ; the School of Computing, National University of Singapore(新加坡国立大学计算学院) ; College of Computing & Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 研究自动驾驶对环境错觉的鲁棒性,聚焦传统车道检测和视觉语言模型系统。引入基准LanEvil++并评估,发现错觉严重影响性能,阴影干扰最大。提出多模态错觉防御方法MIDA,有效提升了模型在挑战性条件下的鲁棒性。
Comments Accepted by IEEE TPAMI 2026
Ground3D-LMM:基于LMM的细粒度3D点接地与空间推理
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; The Hong Kong Polytechnic University(香港理工大学) ; Linköping University(林雪平大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 研究3D环境自然语言查询的可操作性问题,提出Ground3D-LMM统一模型,以点云等为输入,支持3D空间对话,能给出基于点的响应和度量数值输出,通过定义新任务、引入数据集验证,为3D对话理解提供强大基线。
Comments ECCV 2026
CaReCoS:基于频谱图的心脏、呼吸和咳嗽声音视觉基准
专题命中 多模态评测 :multimodal(abstract);分类 eess.AS
AI总结 研究针对医学声学信号频谱图缺乏多模态推理基准的问题,创建CaReCoS基准,将临床问题与频谱图配对,评估模型发现其难以处理频谱图中细粒度声学特征,强调医学声音可视化训练的必要性。
TacReasoner:面向真实场景交互推理的动态触觉-语言框架
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Beijing Zhongguancun Academy(北京中关村科学城) ; Nanyang Technological University(南洋理工大学) ; Guangdong Institute of Artificial Intelligence and Advanced Computing(广东省人工智能与先进计算研究院)
专题命中 多模态评测 :multimodal(abstract);分类 cs.AI
AI总结 针对动态触觉信号建模不足、触觉基础模型易幻觉的问题,提出含动态触觉编码器的TacReasoner框架,配套构建TouchCoT-10k数据集与DynTac-Bench基准,推理性能优于主流大模型。
Comments 8 pages, 7 figures. Accepted at IROS 2026
自主信息寻求:智能推荐系统路线图
机构 * National University of Singapore(新加坡国立大学) ; Polytechnic University of Bari(巴里理工大学) ; Renmin University of China(中国人民大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CL
AI总结 综述基于大语言模型的智能体融入推荐系统带来的转变,介绍基于自主性水平的分类法及三种核心范式,分析各范式采用的架构和智能体对关键组件的增强,探讨评估方法及未解决问题,指出开放挑战。
G$^2$TAM:几何基础的轨迹任意模型
机构 * HKU(香港大学) ; Shanghai AI Lab(上海人工智能实验室) ; BUAA(北京航空航天大学) ; SJTU(上海交通大学) ; UCLA(加州大学洛杉矶分校) ; ZJU(浙江大学)
专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV
AI总结 研究利用现代前馈3D重建模型的空间一致性,提出G$^2$TAM框架,用无序RGB图像或视频进行3D实例跟踪。核心是跨模态空间编码器,还构建数据集,实验表明该模型有多种优势,为交互式空间推理奠定基础。
Comments Accepted by ICML 2026. Project Page:https://zcmax.github.io/projects/G2TAM/
用于开源情报和网络调查的智能与生成式人工智能:分类法、评估、挑战及未来方向
机构 * School of Computer Science and Mathematics, Keele University(基尔大学计算机科学与数学学院) ; Cybersecurity Institute, University of Liverpool(利物浦大学网络安全研究所) ; Department of Applied Computing IICL, University of Wales Trinity Saint David(威尔士特里尼达大学应用计算系) ; Deakin Cyber Research and Innovation Hub, Deakin University(德金大学网络安全研究与创新中心) ; Department of Information Systems and Cyber Security, The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校信息系与网络安全系)
专题命中 多模态评测 :multimodal(abstract);分类 cs.AI
AI总结 研究指出公开数字信息增长使人工开源情报分析不足,大语言模型等成解决方案但评估框架滞后。通过综述74项研究,明确智能人工智能类别,找出幻觉验证差距,映射研究到情报生命周期并给出研究议程。
Comments 36 Pages
可解释机器学习利用运动校正QSM MRI和多波段多回波fMRI特征预测帕金森病严重程度
机构 * Lyda Hill Department of Bioinformatics(Lyda Hill 生物信息学系) ; Department of Biomedical Engineering(生物医学工程系) ; University of Texas Southwestern Medical Center, Dallas, Texas, USA(德克萨斯西南医学中心,德克萨斯州达拉斯)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 利用可解释机器学习,从QSM和多波段多回波静息态fMRI衍生的ReHo特征预测帕金森病运动严重程度。提取特征进行多模型实验,结果显示不同模型表现及特征贡献,表明结构和功能成像依临床预测目标作用不同。
Comments 16 pages from main manuscript and 17 pages from supplementary information
学习在杂乱收纳中进行刀片插入的3D可用空间
机构 * Amazon Robotics(亚马逊机器人公司)
专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV
AI总结 研究杂乱收纳中刀片插入的3D可用空间问题,利用VulcanVoxel方法,通过基于3D占用场的掩码自动编码器,从单峰数据恢复多模态预测,提升了性能。
用于地球系统基础模型的统一数据集
机构 * Politecnico di Milano, Department of Management, Economics and Industrial Engineering(米兰理工大学管理、经济与工业工程系) ; RFF-CMCC European Institute on Economics and the Environment(资源未来研究所-欧洲经济与环境CMCC研究所) ; CMCC Foundation - Euro-Mediterranean Center on Climate Change(CMCC基金会-欧洲地中海气候变化中心)
专题命中 多模态评测 :multimodal(abstract);分类 cs.AI
AI总结 研究针对地球系统基础模型训练数据缺乏统一资源的问题,构建WorldTensor数据集,整合多类数据到标准网格,为训练和评估模型提供资源,推动多模态地球系统基础模型发展。
Comments Under review
医学视觉语言模型 HuluMed 和 MedGemma 以及通用聊天机器人 Gemma 3、ChatGPT Plus 和 Claude Pro 在真实未见伤口图像上的评估
机构 * Department of Computer Science, New Jersey Institute of Technology(新泽西理工学院计算机科学系) ; Vascular and Endovascular Surgery, Robert Wood Johnson Hospital(罗伯特·伍德·约翰逊医院血管外科) ; Department of Data Science, New Jersey Institute of Technology(新泽西理工学院数据科学系)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 本研究评估了六种视觉语言模型在慢性伤口分析任务上的表现,发现通用模型 ChatGPT 和 Claude 显著优于医学专用模型,表明广泛的多模态推理能力比领域知识更重要。
自信地扩展:校准LLM的置信度以实现自适应测试时扩展
机构 * Shanghai Jiao Tong University(上海交通大学) ; Southeast University(东南大学) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 多模态评测 :multimodal(abstract);分类 cs.AI
AI总结 提出C3RL算法,通过结合正确性、校准和数据集参考准确率奖励来校准LLM的置信度,并基于此引入CAS策略,根据置信度自适应分配推理计算资源,在提升校准性的同时降低推理成本。
从伪造到基础模型:身份证件攻击与检测的系统性综述
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 本文系统综述了身份证件伪造攻击(物理呈现、数字注入、生成式合成)及检测方法,揭示了基准与现实间的差距,并发现最强模型在零样本场景下APCER超25%。
ClawArena-Team: 语言模型智能体中子智能体编排与动态工作流的基准测试
机构 * UNC-Chapel Hill(北卡罗来纳大学教堂山分校) ; University of California, Berkeley(加州大学伯克利分校) ; University of California, Santa Cruz(加州大学圣克鲁兹分校)
专题命中 多模态评测 :multimodal(abstract);分类 cs.AI
AI总结 提出ClawArena-Team基准,通过41个多轮多模态多目录场景,评估单个LLM作为管理者编排子智能体的能力,发现管理瓶颈在于权限授予而非感知,且成本与质量解耦。
Comments 24 pages, 10 figures, website: https://www.clawarena.cc/
DroneIQA-VLE:基于视觉-语言集成的多任务无人机图像质量评估
机构 * East China Normal University(华东师范大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 提出DroneIQA-VLE框架,通过集成SigLIP2视觉编码器与多任务回归头以及LoRA微调的Qwen3.5-9B多模态大模型,联合预测全局、目标和背景质量分数,在ICME 2026无人机图像质量评估挑战赛中获得第二名。
Comments The model achieves 2nd place in ICME 2026 Drone-IQA Grand Challenge on Target-aware Image Quality Assessment for Low-altitude UAV Images
PixelEyes: 解耦感知与推理以实现精准视觉证据查找
机构 * Wuhan University(武汉大学) ; UC Merced(加州大学默塞德分校) ; UTS(UTS大学) ; NUS(新加坡国立大学) ; NTU(南洋理工大学) ; CASIA(中国科学院自动化所)
专题命中 多模态评测 :MLLM(abstract);分类 cs.CV
AI总结 针对多轮视觉推理中目标定位失败导致轨迹冗余的问题,提出PixelEyes,通过解耦推理与感知(推理器决定查找目标,专用感知工具定位),引入掩码引导视觉搜索和语义区域广度优先搜索,构建PixelEyes-6K数据集和Pinpoint-Bench基准,显著提升定位准确性。
Comments 22pages, 10 figures
CryoACE: 面向冷冻电镜中精确自动模型构建的原子中心框架
专题命中 多模态评测 :multimodal(abstract);分类 cs.AI
AI总结 提出CryoACE框架,通过原子中心重建范式和无需训练的引导机制,实现冷冻电镜密度图中均质与异质结构的精确原子模型构建,显著优于现有方法。
Journal ref ICML2026
超越单字符:评估多模态大语言模型在句子级甲骨文理解中的表现
机构 * Shanghai Jiao Tong University(上海交通大学) ; Nanjing University of Science and Technology(南京理工大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 提出S-OBI基准,通过字形替换与组合合成清晰标准的句子级甲骨文实例,设计语义匹配、语义槽提取和上下文推理任务,评估多模态大语言模型在句子级甲骨文理解中的表现,发现当前模型仍依赖字符级识别。
Comments 13 pages, 4 figures