OSGuard: A Benchmark for Safety in Computer-Use Agents
OSGuard:计算机使用智能体安全基准
机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校)
专题命中 多模态评测 :multimodal(abstract);分类 cs.AI
AI总结 提出OSGuard双粒度基准,通过动作级安全判断和风险增强执行评估智能体在良性指令下的安全性,揭示局部监督与端到端安全的差距。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
OSGuard:计算机使用智能体安全基准
机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校)
专题命中 多模态评测 :multimodal(abstract);分类 cs.AI
AI总结 提出OSGuard双粒度基准,通过动作级安全判断和风险增强执行评估智能体在良性指令下的安全性,揭示局部监督与端到端安全的差距。
DriveReward:面向自动驾驶的综合数据集与生成式视觉语言奖励模型
机构 * Tsinghua University(清华大学) ; Xiaomi EV(小米汽车)
专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV
AI总结 提出DriveReward数据集和专用视觉语言奖励模型,通过反事实标注和时序视觉引导,解决自动驾驶中奖励获取的泛化问题,在强化学习和轨迹选择中取得与基于规则方法相当的性能。
CisTransCell:通过基因功能、调控控制和细胞上下文进行单细胞扰动预测
机构 * [q-bio.GN]
专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI
AI总结 提出CisTransCell框架,结合调控序列和编码序列先验与细胞表达状态,建模扰动响应级联,实现零样本单细胞扰动预测。
基于层级肿瘤结构比较的统一MRI脑图像翻译
机构 * South China University of Technology(华南理工大学) ; UTS Data Science Institute, University of Technology Sydney(悉尼科技大学UTS数据科学研究所)
专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV
AI总结 提出HTSCGAN模型,通过层级肿瘤结构比较和多种损失函数,提高多模态MRI脑图像翻译质量,在BraTS2020/2021上表现优异。
具身基准构建的智能自动化:流程、具身、模拟器与趋势
机构 * University of Electronic Science and Technology of China(电子科技大学) ; Qiyuan Lab(启元实验室) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Tsinghua University(清华大学) ; Beihang University(北京航空航天大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.AI
AI总结 本文综述具身智能基准构建的五阶段流程,分析从人工到自动化再到智能体闭环的转变,指出自动化将成本转向验证与治理。
理解跨传感器特征变化以实现可泛化的3D感知
机构 * Zhejiang University(浙江大学)
专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV
AI总结 针对雷达-相机BEV感知跨数据集性能下降问题,提出频域场景变化建模框架,通过合成多样源域视图并正则化融合表示,提升3D检测器鲁棒性,无需目标域样本。
RAIL: 基于CHC框架重新思考大型音频语言模型中的听觉智能
机构 * School of Computing and Information Systems, The University of Melbourne(墨尔本大学计算与信息系统学院) ; Faculty of Psychology and Educational Sciences, Alexandru Ioan Cuza University of Iași(亚历山德鲁伊万库扎大学心理学与教育科学学院) ; School of Electronic Information, Wuhan University(武汉大学电子信息学院) ; School of Public Health, The University of Hong Kong(香港大学公共卫生学院) ; School of Computer Science, The University of Auckland(奥克兰大学计算机科学学院) ; Department of Data Science and Artificial Intelligence, Monash University(莫纳什大学数据科学与人工智能系)
专题命中 多模态评测 :multimodal(abstract);分类 cs.AI
AI总结 提出RAIL基准,基于CHC认知框架将听觉智能分解为五种核心能力,构建结构化评估任务,系统评测大型音频语言模型的认知行为。
大型语言模型在安全数据提取中的基准测试
机构 * SAP SE(SAP公司) ; Institute for Digital Transformation, Ravensburg-Weingarten University(拉文斯堡-魏恩加滕大学数字化转型研究所)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CL
AI总结 针对安全数据表(SDS)的异构格式,本研究基准测试了四种大型语言模型(LLM)在文本与多模态处理下的提取性能,发现文本结合思维链提示的Gemini 1.5 Pro准确率最高(84%),但均未达到90%的可靠部署阈值。
Comments 18 pages, 8 figures, submitted to Applied Intelligence
视觉语言模型像工程师一样推理吗?一个基准测试与分阶段评估
机构 * Indian Institute of Technology Kharagpur(印度理工学院卡哈拉格普尔分校)
专题命中 多模态评测 :multimodal(abstract);分类 cs.AI
AI总结 提出工程视觉问答基准EngVQA和8阶段自动评估框架,揭示当前视觉语言模型在工程推理中的显著局限,并验证了自动化评估与人工评分的高度一致性。
Comments 9 pages (main text), 4 figures, 2 tables; 50 pages total including appendix. The first two authors contributed equally
Sigma-Branch: 用于动态推理的分层单路径网络重构,减少活跃参数
机构 * Graduate School of Science and Technology, Keio University(Keio大学理工学院)
专题命中 多模态评测 :cross-modal(abstract);分类 cs.AI
AI总结 提出Sigma-Branch框架,通过分层二叉树结构将预训练密集网络重构为共享主干、分层路由器和专用叶子,利用激活聚类初始化并微调,推理时仅执行单一路径,在CIFAR-100/ResNet-50等任务上减少58-60%活跃参数,性能损失小于1.72个百分点。
POTATR: 一种用于页面级表格提取的轻量级图像到图模型
机构 * Kensho Technologies
专题命中 多模态评测 :MLLM(abstract_cn);分类 cs.CV
AI总结 提出轻量级图像到图模型POTATR(29M参数),在页面级表格提取任务上以130倍速度和300倍低成本超越前沿模型,GriTS_Con达0.964,输出空间可解释。
Comments 16 pages, split from PubTables-v2 paper
基于转换的阿尔茨海默病数字孪生建模在稀疏纵向数据下的应用
机构 * University of Southampton(南安普顿大学) ; University Hospital Southampton NHS Foundation Trust(南安普顿大学医院NHS基金会信托) ; Faculty of Medicine, University of Southampton(南安普顿大学医学院)
专题命中 多模态评测 :multimodal(abstract);分类 cs.AI
AI总结 针对阿尔茨海默病进展异质性和数据稀疏问题,提出结合局部转换建模与序列建模的数字孪生框架,利用多模态纵向数据预测认知状态并量化不确定性,在ADNI数据上表现优异。
Comments 13 pages, 5 figures, 3 tables. Accepted as a full-length paper at the International Conference on AI in Healthcare (AIiH) 2026
LargeMonitor: 通过大型预训练模型监控在线无任务持续学习
机构 * HKU(香港大学) ; Qicore Tech(启科科技)
专题命中 多模态评测 :multimodal(abstract);分类 cs.AI
AI总结 提出LargeMonitor框架,利用大型预训练模型(LVM和LMM)解耦检测与诊断,实现无任务持续学习中的零样本漂移检测和语义病因诊断,提升现有算法性能。
上下文感知深度学习用于原子分辨率扫描透射电镜中的缺陷分类
机构 * cond-mat.mtrl-sci(材料科学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.AI
AI总结 提出上下文感知学习框架,融合图像对比度与元数据(成分、束能、探测器几何),解决仅凭图像对比度进行缺陷分类的歧义性,在模拟数据上准确率超98%,实验数据接近人类水平。
Comments 6 figures
复杂视觉查询的符号与抽象推理
机构 * Zhejiang University(浙江大学) ; Nanjing University(南京大学) ; Ant Group(蚂蚁集团)
专题命中 多模态评测 :multi-modal(abstract);分类 cs.CL
AI总结 提出复杂视觉查询(CVQ)概念,通过多模态知识图谱合成数据集,并设计两阶段训练框架,提升多模态大语言模型的符号与抽象推理能力。
Comments Work in progress
面向城市交通系统协同中断响应的弹性即服务评估框架
机构 * Univ. Gustave Eiffel, COSYS, GRETTIA, Paris, France(古斯塔夫·埃菲尔大学,交通系统、网络与安全实验室,交通工程与智能交通系统研究组,法国巴黎) ; VEDECOM, mobiLAB, Department of Human factors and Economics of Sustainable Mobility, Versailles, France(VEDECOM研究所,移动出行实验室,可持续出行人因与经济系,法国凡尔赛)
专题命中 多模态评测 :multimodal(abstract);分类 cs.AI
AI总结 提出一个基于KPI的时间索引框架,结合优化模型与智能体仿真,从脆弱性、适应性、鲁棒性等多维度评估城市交通中断响应方案的弹性,并通过巴黎RER B线案例验证了协同策略的优越性。
集成深度学习需求预测与多目标优化的循环咖啡供应链:面向成本、排放和新鲜度管理的数据驱动框架
机构 * Ankara Yıldırım Beyazıt University(安卡拉耶尔德勒姆贝亚泽特大学) ; Texas Tech University(德克萨斯理工大学) ; University of Alabama(阿拉巴马大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.AI
AI总结 提出两阶段框架,先用CNN-LSTM模型预测需求(MAE=22.87,R²=0.90),再通过三目标MILP模型优化成本、碳排放和新鲜度,在循环供应链中获得25个Pareto解,平衡政策可减排22.4%仅增成本9.9%。
工业场景中的零样本学习:新的大规模基准、挑战与基线
机构 * Zhejiang University(浙江大学) ; Alibaba Group(阿里巴巴集团) ; Huawei Technologies(华为技术有限公司) ; Tsinghua University(清华大学) ; Microsoft Research(微软研究院)
专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI
AI总结 针对工业场景中视觉语言模型应用难、数据稀缺的问题,提出大规模多模态工业开放数据集MMIO和精炼文本-视觉提示RTVP,实现零样本工业缺陷检测,在MMIO上达到SOTA。
DIYHealth Suite:家庭健康管理的数据集、模型与基准
机构 * National University of Singapore(新加坡国立大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.AI
AI总结 针对家庭健康管理中的数据异构、任务多变和缺乏统一基准等问题,提出包含大规模多模态数据集DIYHealth-900K、自适应基础模型DIYHealthGPT(采用混合超低秩适应技术)和首个家庭护理基准DIYHealthBench的综合框架,在11项任务上达到最优性能。
Comments Accepted by ICML 2026
多任务模型融合的闭式谱正则化
机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) ; Sun Yat-sen University(中山大学) ; Nanyang Technological University(南洋理工大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 针对多任务模型融合中的干扰最小化问题,发现迭代求解器实际充当隐式谱正则化器,据此提出基于谱滤波的闭式方法SWUDI及其自适应变体SWUDI-A,显著提升效率并匹配或超越现有方法。
外观有帮助吗?在线3D多行人追踪中基于图像的重识别系统研究
机构 * Institute of Systems and Robotics, Department of Electrical and Computer Engineering, University of Coimbra(系统与机器人研究所,电气与计算机工程系,科英布拉大学)
专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV
AI总结 系统研究轻量级投影框架下图像重识别在在线3D多目标追踪中的作用,提出级联匹配策略以在低延迟下恢复遮挡轨迹并防止身份切换。
Comments Accepted for publication at the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026)
你的帖子揭示了什么:社交媒体用户级隐私泄露的基准与智能体框架
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) ; Wuhan University(武汉大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.AI
AI总结 针对社交媒体用户级多模态隐私泄露缺乏统一基准和评估指标的问题,提出SopriBench基准和隐私暴露分数(PES),并开发了无需训练的智能体框架Argus,通过跨帖子线索累积推理实现隐私推断,PES达0.55,较最强基线提升25%。
Scalix:感知不确定性的尺度一致单目SLAM
机构 * University of Technology, Sydney(悉尼科技大学) ; Centre for Autonomous Systems(自主系统中心)
专题命中 多模态评测 :multi-modal(abstract)
AI总结 本文提出实时单目SLAM框架Scalix,通过整合带不确定性的学习深度线索到概率因子图,实现度量尺度估计,在多环境基准上性能领先且实时泛化。
Comments 8 pages, 5 figures and 3 tables
面向含分块缺失的垂直分布式数据的高维辅助学习
专题命中 多模态评测 :multimodal(abstract)
AI总结 针对含分块缺失的垂直分布式数据,提出 ALB 算法,无需合并记录即可实现高维线性估计与推理,性能优于完整样本 Lasso,可近似集中式基准。
FlatLab:面向扁平物体机器人操作的统一方法论框架及基于仿真的基准测试
机构 * Jilin University(吉林大学) ; Peking University(北京大学) ; Chinese Academy of Sciences(中国科学院) ; University of Birmingham(伯明翰大学)
专题命中 多模态评测 :multi-modal(abstract)
AI总结 该研究针对扁平物体机器人操作泛化能力有限的问题,提出含策略生成器与执行模块的统一框架,并构建FlatLab仿真基准,方法泛化效果优于现有基线。
Comments This paper is accepted to ICML 2026
基于深度学习的药物-靶点结合亲和力预测的最新进展
机构 * Prairie View A&M University(普雷里维尤农工大学)
专题命中 多模态评测 :multimodal(abstract)
AI总结 本文综述近期基于深度学习的药物-靶点结合亲和力预测方法,分析其优势、局限与研究缺口,指出当前方法存在数据集偏差等问题,探讨未来研究方向。
探究人工智能生成的物理解答并培养学生对其进行评判的能力
专题命中 多模态评测 :multimodal(abstract)
AI总结 本研究通过调整框架评估OpenAI的o4-mini生成的物理解答,发现明确提示可提升解答完整性,MAPS指导能让学生更精准评判AI解答,为物理教育研究提供了新视角。
Comments 6 pages, 1 figure, Physics Education Research Conference 2026
面向随机预测函数的聚类随机平滑方法
机构 * Delft University of Technology(代尔夫特理工大学) ; University of Stuttgart(斯图加特大学) ; AI4I
专题命中 多模态评测 :multi-modal(abstract)
AI总结 本文针对随机多模态回归中随机平滑的模式崩溃问题,提出聚类α-平滑框架,在两个基准实验中较现有方法显著降低了Wasserstein距离与碰撞率。
日常训练中下肢肌肉活动的同步AMG与EMG数据集
专题命中 多模态评测 :multimodal(abstract)
AI总结 该研究构建了健康成人下肢活动的同步AMG与EMG多模态数据集,通过基准测试评估其用于关节角估计的性能,为下肢肌肉协调相关研究提供了可重复的资源。
切换时机的判定:生成对抗网络自适应极小极大训练的E-过程
专题命中 多模态评测 :multimodal(abstract)
AI总结 本研究将GAN训练的切换时机判定转化为序列假设检验问题,提出基于E-过程的自适应训练流程,在多模态合成分布与图像数据集上表现优于或匹配最优固定比例基线。