arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 600 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 600 篇

2606.15617 2026-06-17 cs.CV 新提交 57%

NeRD: Neuro-Symbolic Rule Distillation for Efficient Ontology-Grounded Chain-of-Thought in Medical Image Diagnosis

NeRD:面向医学图像诊断的高效本体接地思维链的神经符号规则蒸馏

Hongxi Yang, Yiwen Jiang, Siyuan Yan, Jamie Chow, Eunis Li, Charlotte Poon, Stephanie Fong, Xiangyu Zhao, Deval Mehta, Yasmeen George, Zongyuan Ge

机构 * Department of Data Science & AI, Faculty of Information Technology, Monash University(莫纳什大学信息技术学院数据科学与人工智能系) AIM for Health Lab, Faculty of Information Technology, Monash University(莫纳什大学信息技术学院AIM健康实验室) Faculty of Engineering, Monash University(莫纳什大学工程学院) Faculty of Medicine, The Chinese University of Hong Kong(香港中文大学医学院) School of Computing Technologies, RMIT University(皇家墨尔本理工大学计算技术学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出NeRD框架,通过神经符号规则蒸馏生成高效、本体接地且非冗余的推理链,避免人工规则,在皮肤数据集上实现强诊断性能和可解释性,并首次实现专家介入的多模态思维链诊断。

Comments Accepted at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14383 2026-06-17 cs.CV 新提交 57%

IndustryBench-MIPU: Benchmarking Multi-Image Attribute Value Extraction for Industrial Products

IndustryBench-MIPU:面向工业产品的多图像属性值提取基准

Haonan Qi, Jin Cao, Yongqi Zhang, Xintong Wang, Weidong Tang, Bin Chen, Chengfu Huo, Haojun Pan, Hengyu You, Jing Li, Yingde Wang, Liang Ding

机构 * Multimodal and Industrial AI Team(多模态与工业AI团队) Taobao&Tmall, Alibaba Group(淘宝&天猫,阿里巴巴集团)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出首个多图像工业产品理解基准IndustryBench-MIPU,通过结构化属性提取任务评估多模态大模型在规格表、铭牌、技术图纸上的文本识别、视觉推理、领域知识和跨图像证据整合能力,发现多图像完整性是核心瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16991 2026-06-16 cs.CV cs.LG 新提交 57%

A Multi-Center Benchmark for Abdominal Disease Diagnosis and Report Generation from Non-Contrast CT

基于非增强CT的腹部疾病诊断与报告生成的多中心基准

Mariam Elbakry, Aliaa Sayed Sheha, Salma Hassan Tantawy, Aya Yassin, Concetto Spampinato, Karim Lekadir, Xiaomeng Li, Marawan Elbatel

机构 * Ain Shams University(艾因夏姆斯大学) The Hong Kong University of Science and Technology(香港科技大学) University of Catania(卡塔尼亚大学) Universitat de Barcelona(巴塞罗那大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出一个多中心基准,利用非增强CT合成增强CT发现,用于多器官腹部疾病诊断和自动报告生成,实验表明非增强CT保留诊断信号,平均AUC达69.1%(内部)和63.1%(外部)。

Comments Early Accept (top ~9%), MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16175 2026-06-16 cs.AI 新提交 57%

PAL-Bench: Evidence-Grounded Profile Reconstruction from Longitudinal Personal Albums

PAL-Bench: 基于纵向个人相册的证据驱动画像重建

Qiwei Yan, Zhiqiang Yuan, Zexi Jia, Nanxing Hu, Kailin Lyu, Jie Zhou, Jinchao Zhang

机构 * Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) University of Chinese Academy of Sciences(中国科学院大学) Zhejiang University(浙江大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 提出PAL-Bench基准,通过合成用户和隐私保护审计,评估从纵向个人相册中重建用户画像、社交关系和身份映射的能力,发现现有系统在身份解析和证据引用方面存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15779 2026-06-16 cs.CV cs.LG 新提交 57%

Faithful Action-unit Causal Reasoning for Counterfactually Faithful Emotion Explanations

面向反事实忠实情感解释的忠实动作单元因果推理

Van Thong Huynh, Hong Hai Nguyen, Thuy Pham, Trong Nghia Nguyen, Soo-Hyung Kim

机构 * Faculty of CSE, Ho Chi Minh City University of Technology (HCMUT), VNUHCM(胡志明市理工大学计算机科学与工程学院,越南国家大学胡志明市分校) Dept. of AI, FPT University(FPT大学人工智能系) Faculty of DSAI, College of Technology, National Economic University(国民经济大学技术学院数据科学与人工智能系) Dept. of AI Convergence, Chonnam National University(全南大学人工智能融合系)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出FACR方法,通过反事实一致性目标和极性感知因果图,训练模型在动作单元与情感之间实现可测量的因果忠实性,在UNBC-PAIN数据集上将忠实度从0.08提升至0.57。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15034 2026-06-16 cs.AI 新提交 57%

OSGuard: A Benchmark for Safety in Computer-Use Agents

OSGuard:计算机使用智能体安全基准

Mina Mohammadmirzaei, Jeffrey Flanigan

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 提出OSGuard双粒度基准,通过动作级安全判断和风险增强执行评估智能体在良性指令下的安全性,揭示局部监督与端到端安全的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08525 2026-06-16 cs.CV 新提交 57%

DriveReward: A Comprehensive Dataset and Generative Vision-Language Reward Model for Autonomous Driving

DriveReward:面向自动驾驶的综合数据集与生成式视觉语言奖励模型

Qimao Chen, Fang Li, Yuechen Luo, Zehan Zhang, Haiyang Sun, Fangzhen Li, Bing Wang, Guang Chen, Yang Ji, Jiong Deng, Hongwei Xie, Hangjun Ye, Long Chen, Yi Zhang

机构 * Tsinghua University(清华大学) Xiaomi EV(小米汽车)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 提出DriveReward数据集和专用视觉语言奖励模型,通过反事实标注和时序视觉引导,解决自动驾驶中奖励获取的泛化问题,在强化学习和轨迹选择中取得与基于规则方法相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13713 2026-06-15 q-bio.GN cs.AI 新提交 57%

CisTransCell: Single-Cell Perturbation Prediction via Gene Function, Regulatory Control, and Cellular Context

CisTransCell:通过基因功能、调控控制和细胞上下文进行单细胞扰动预测

Wei Zhang, Xun Jiang, Yuesi Xi, Ming Tang

机构 * [q-bio.GN]

专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI

AI总结 提出CisTransCell框架,结合调控序列和编码序列先验与细胞表达状态,建模扰动响应级联,实现零样本单细胞扰动预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13096 2026-06-12 cs.CV 新提交 57%

Unified MRI Brain Image Translation via Hierarchical Tumor Structure Comparison

基于层级肿瘤结构比较的统一MRI脑图像翻译

Yupeng Cai, Jia Wei, Jianlong Zhou

机构 * South China University of Technology(华南理工大学) UTS Data Science Institute, University of Technology Sydney(悉尼科技大学UTS数据科学研究所)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 提出HTSCGAN模型,通过层级肿瘤结构比较和多种损失函数,提高多模态MRI脑图像翻译质量,在BraTS2020/2021上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12207 2026-06-11 cs.RO cs.AI 新提交 57%

Intelligent Automation for Embodied Benchmark Construction: Pipelines, Embodiments, Simulators, and Trends

具身基准构建的智能自动化:流程、具身、模拟器与趋势

Jinshan Lai, Jianwei Hu, Baoyang Jiang, Fengchun Zhang, Leyuan Wang, Haotian Li, Yida Wang, Tingxuan Huang, Xi Ren, Qiang Ma

机构 * University of Electronic Science and Technology of China(电子科技大学) Qiyuan Lab(启元实验室) Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学) Beihang University(北京航空航天大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文综述具身智能基准构建的五阶段流程,分析从人工到自动化再到智能体闭环的转变,指出自动化将成本转向验证与治理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11573 2026-06-11 cs.CV 新提交 57%

Understanding Cross-Sensor Feature Variations for Generalizable 3D Perception

理解跨传感器特征变化以实现可泛化的3D感知

Xin Qiu, Wenjie Liu, Fuyuan Ai, YuChen Tan, Zhiwei Xu, Chunyi Song

机构 * Zhejiang University(浙江大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 针对雷达-相机BEV感知跨数据集性能下降问题,提出频域场景变化建模框架,通过合成多样源域视图并正则化融合表示,提升3D检测器鲁棒性,无需目标域样本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11260 2026-06-11 cs.SD cs.AI 新提交 57%

RAIL: Rethinking Auditory Intelligence in Large Audio-Language Models with a CHC-Grounded Benchmark

RAIL: 基于CHC框架重新思考大型音频语言模型中的听觉智能

Hongyu Jin, Siyi Wang, Yang Xiao, Jiaheng Dong, Shihong Tan, Kaiyuan peng, Georgiana Juravle, Shanquan Chen, Gongping Huang, Hong Jia, Eun-Jung Holden, James Bailey, Ting Dang

机构 * School of Computing and Information Systems, The University of Melbourne(墨尔本大学计算与信息系统学院) Faculty of Psychology and Educational Sciences, Alexandru Ioan Cuza University of Iași(亚历山德鲁伊万库扎大学心理学与教育科学学院) School of Electronic Information, Wuhan University(武汉大学电子信息学院) School of Public Health, The University of Hong Kong(香港大学公共卫生学院) School of Computer Science, The University of Auckland(奥克兰大学计算机科学学院) Department of Data Science and Artificial Intelligence, Monash University(莫纳什大学数据科学与人工智能系)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 提出RAIL基准,基于CHC认知框架将听觉智能分解为五种核心能力,构建结构化评估任务,系统评测大型音频语言模型的认知行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11204 2026-06-11 cs.CL cs.IR 新提交 57%

Benchmarking Large Language Models for Safety Data Extraction

大型语言模型在安全数据提取中的基准测试

Jonas Grill, Thomas Bayer, Sören Berlinger

机构 * SAP SE(SAP公司) Institute for Digital Transformation, Ravensburg-Weingarten University(拉文斯堡-魏恩加滕大学数字化转型研究所)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 针对安全数据表(SDS)的异构格式,本研究基准测试了四种大型语言模型(LLM)在文本与多模态处理下的提取性能,发现文本结合思维链提示的Gemini 1.5 Pro准确率最高(84%),但均未达到90%的可靠部署阈值。

Comments 18 pages, 8 figures, submitted to Applied Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10833 2026-06-10 cs.AI 新提交 57%

Do VLMs Reason Like Engineers? A Benchmark and a Stage-wise Evaluation

视觉语言模型像工程师一样推理吗?一个基准测试与分阶段评估

Syed Wasiq, Syed Mohamad Tawseeq, Yashwant Pravinrao Bangde, Debaditya Roy

机构 * Indian Institute of Technology Kharagpur(印度理工学院卡哈拉格普尔分校)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 提出工程视觉问答基准EngVQA和8阶段自动评估框架,揭示当前视觉语言模型在工程推理中的显著局限,并验证了自动化评估与人工评分的高度一致性。

Comments 9 pages (main text), 4 figures, 2 tables; 50 pages total including appendix. The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09924 2026-06-10 cs.LG cs.AI 新提交 57%

Sigma-Branch: Hierarchical Single-Path Network Reconstruction for Dynamic Inference with Reduced Active Parameters

Sigma-Branch: 用于动态推理的分层单路径网络重构,减少活跃参数

Kohga Tanaka, Hiroaki Nishi

机构 * Graduate School of Science and Technology, Keio University(Keio大学理工学院)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.AI

AI总结 提出Sigma-Branch框架,通过分层二叉树结构将预训练密集网络重构为共享主干、分层路由器和专用叶子,利用激活聚类初始化并微调,推理时仅执行单一路径,在CIFAR-100/ResNet-50等任务上减少58-60%活跃参数,性能损失小于1.72个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09788 2026-06-09 cs.CV 新提交 57%

POTATR: A Lightweight Image-to-Graph Model for Page-Level Table Extraction

POTATR: 一种用于页面级表格提取的轻量级图像到图模型

Brandon Smock, Libin Liang, Max Sokolov, Amrit Ramesh, Valerie Faucon-Morin, Tayyibah Khanam, Maury Courtland

机构 * Kensho Technologies

专题命中 多模态评测 :MLLM(abstract_cn);分类 cs.CV

AI总结 提出轻量级图像到图模型POTATR(29M参数),在页面级表格提取任务上以130倍速度和300倍低成本超越前沿模型,GriTS_Con达0.964,输出空间可解释。

Comments 16 pages, split from PubTables-v2 paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09671 2026-06-09 cs.LG cs.AI 新提交 57%

Transition-Based Digital Twin Modelling for Alzheimer's Disease under Sparse Longitudinal Data

基于转换的阿尔茨海默病数字孪生建模在稀疏纵向数据下的应用

Yinyu Huang, Yilin Zhang, Sofia Michopoulou, Christopher Kipps, Rahman Attar

机构 * University of Southampton(南安普顿大学) University Hospital Southampton NHS Foundation Trust(南安普顿大学医院NHS基金会信托) Faculty of Medicine, University of Southampton(南安普顿大学医学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 针对阿尔茨海默病进展异质性和数据稀疏问题,提出结合局部转换建模与序列建模的数字孪生框架,利用多模态纵向数据预测认知状态并量化不确定性,在ADNI数据上表现优异。

Comments 13 pages, 5 figures, 3 tables. Accepted as a full-length paper at the International Conference on AI in Healthcare (AIiH) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09430 2026-06-09 cs.LG cs.AI 新提交 57%

LargeMonitor: Monitoring Online Task-Free Continual Learning via Large Pretrained Models

LargeMonitor: 通过大型预训练模型监控在线无任务持续学习

Mingqi Yuan, Xiaoquan Sun, Shihao Luo, Jiayu Chen

机构 * HKU(香港大学) Qicore Tech(启科科技)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 提出LargeMonitor框架,利用大型预训练模型(LVM和LMM)解耦检测与诊断,实现无任务持续学习中的零样本漂移检测和语义病因诊断,提升现有算法性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09419 2026-06-09 cond-mat.mtrl-sci cs.AI 新提交 57%

Context-Aware Deep Learning for Defect Classification in Atomic-Resolution STEM

上下文感知深度学习用于原子分辨率扫描透射电镜中的缺陷分类

Jiadong Dan, Cheng Zhang, Leyi Loh, Ivan Verzhbitskiy, Yuan Chen, Goki Eda, Michel Bosman, N. Duane Loh

机构 * cond-mat.mtrl-sci(材料科学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 提出上下文感知学习框架,融合图像对比度与元数据(成分、束能、探测器几何),解决仅凭图像对比度进行缺陷分类的歧义性,在模拟数据上准确率超98%,实验数据接近人类水平。

Comments 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09195 2026-06-09 cs.CL 新提交 57%

Symbolic and Abstractive Reasoning with Complex Visual Queries

复杂视觉查询的符号与抽象推理

Yichi Zhang, Jingdian Lu, Zhuo Chen, Lingbing Guo, Jun Xu, Wen Zhang, Huajun Chen

机构 * Zhejiang University(浙江大学) Nanjing University(南京大学) Ant Group(蚂蚁集团)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CL

AI总结 提出复杂视觉查询(CVQ)概念,通过多模态知识图谱合成数据集,并设计两阶段训练框架,提升多模态大语言模型的符号与抽象推理能力。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08849 2026-06-09 cs.AI 新提交 57%

A Resilience-as-a-Service assessment framework for coordinated disruption response in interdependent urban transit systems

面向城市交通系统协同中断响应的弹性即服务评估框架

Sara Jaber, S. M. Hassan Mahdavi, Neila Bhouri, Mostafa Ameli

机构 * Univ. Gustave Eiffel, COSYS, GRETTIA, Paris, France(古斯塔夫·埃菲尔大学,交通系统、网络与安全实验室,交通工程与智能交通系统研究组,法国巴黎) VEDECOM, mobiLAB, Department of Human factors and Economics of Sustainable Mobility, Versailles, France(VEDECOM研究所,移动出行实验室,可持续出行人因与经济系,法国凡尔赛)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 提出一个基于KPI的时间索引框架,结合优化模型与智能体仿真,从脆弱性、适应性、鲁棒性等多维度评估城市交通中断响应方案的弹性,并通过巴黎RER B线案例验证了协同策略的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08314 2026-06-09 cs.AI 新提交 57%

Integrating Deep Learning Demand Forecasting with Multi-Objective Optimization for Circular Coffee Supply Chains: A Data-Driven Framework for Cost, Emissions, and Freshness Management

集成深度学习需求预测与多目标优化的循环咖啡供应链:面向成本、排放和新鲜度管理的数据驱动框架

Gerçek Budak, Faraz Gholamzadeh Gharehgheshlaghi, Melika Barjesteh Vaezi, Ahmad Gholizadeh Lonbar

机构 * Ankara Yıldırım Beyazıt University(安卡拉耶尔德勒姆贝亚泽特大学) Texas Tech University(德克萨斯理工大学) University of Alabama(阿拉巴马大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 提出两阶段框架,先用CNN-LSTM模型预测需求(MAE=22.87,R²=0.90),再通过三目标MILP模型优化成本、碳排放和新鲜度,在循环供应链中获得25个Pareto解,平衡政策可减排22.4%仅增成本9.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07965 2026-06-09 cs.AI 新提交 57%

Zero-Shot Learning in Industrial Scenarios: New Large-Scale Benchmark, Challenges and Baseline

工业场景中的零样本学习:新的大规模基准、挑战与基线

Zekai Zhang, Qinghui Chen, Maomao Xiong, Shijiao Ding, Zhanzhi Su, Xinjie Yao, Yiming Sun, Cong Bai, Jinglin Zhang

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Huawei Technologies(华为技术有限公司) Tsinghua University(清华大学) Microsoft Research(微软研究院)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI

AI总结 针对工业场景中视觉语言模型应用难、数据稀缺的问题,提出大规模多模态工业开放数据集MMIO和精炼文本-视觉提示RTVP,实现零样本工业缺陷检测,在MMIO上达到SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07542 2026-06-09 cs.CY cs.AI 新提交 57%

DIYHealth Suite: Dataset, Model, and Benchmark for Health Management at Home

DIYHealth Suite:家庭健康管理的数据集、模型与基准

Changshuo Liu, Junran Wu, Zhongle Xie, Wenqiao Zhang, Kaiping Zheng, Jiaqi Zhu, Qingpeng Cai, Ooi Gene Anne, Marcus Chun Jin Tan, Jianwei Yin, James Wei Luen Yip, Beng Chin Ooi

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 针对家庭健康管理中的数据异构、任务多变和缺乏统一基准等问题,提出包含大规模多模态数据集DIYHealth-900K、自适应基础模型DIYHealthGPT(采用混合超低秩适应技术)和首个家庭护理基准DIYHealthBench的综合框架,在11项任务上达到最优性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07289 2026-06-08 cs.LG cs.CV 新提交 57%

Closed-Form Spectral Regularization for Multi-Task Model Merging

多任务模型融合的闭式谱正则化

Yongxian Wei, Runxi Cheng, Xingxuan Zhang, Li Shen, Chun Yuan, Peng Cui, Dacheng Tao

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Sun Yat-sen University(中山大学) Nanyang Technological University(南洋理工大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 针对多任务模型融合中的干扰最小化问题,发现迭代求解器实际充当隐式谱正则化器,据此提出基于谱滤波的闭式方法SWUDI及其自适应变体SWUDI-A,显著提升效率并匹配或超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07233 2026-06-08 cs.CV cs.LG cs.RO 新提交 57%

Does Appearance Help? A Systematic Study of Image-Based Re-Identification in Online 3D Multi-Pedestrian Tracking

外观有帮助吗?在线3D多行人追踪中基于图像的重识别系统研究

Eduardo Borges, Luís Garrote, Urbano J. Nunes

机构 * Institute of Systems and Robotics, Department of Electrical and Computer Engineering, University of Coimbra(系统与机器人研究所,电气与计算机工程系,科英布拉大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 系统研究轻量级投影框架下图像重识别在在线3D多目标追踪中的作用,提出级联匹配策略以在低延迟下恢复遮挡轨迹并防止身份切换。

Comments Accepted for publication at the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06784 2026-06-08 cs.CR cs.AI cs.CY 新提交 57%

What Your Posts Reveal: A Benchmark and Agentic Framework for User-Level Privacy Leakage on Social Media

你的帖子揭示了什么:社交媒体用户级隐私泄露的基准与智能体框架

Zifan Peng, Yini Huang, Aiwen Lu, Qiming Ye, Peixian Zhang, Jingyi Zheng, Yule Liu, Xuechao Wang, Xinlei He, Jiaheng Wei

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Wuhan University(武汉大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 针对社交媒体用户级多模态隐私泄露缺乏统一基准和评估指标的问题,提出SopriBench基准和隐私暴露分数(PES),并开发了无需训练的智能体框架Argus,通过跨帖子线索累积推理实现隐私推断,PES达0.55,较最强基线提升25%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14049 2026-08-17 cs.RO 新提交 50%

FlatLab: A Unified Methodology Framework and Simulation-Based Benchmark for Robotic Manipulation of Flat Objects

FlatLab:面向扁平物体机器人操作的统一方法论框架及基于仿真的基准测试

Xingyu Zhu, Wenshuo Han, Zhouyu Wang, Yuran Wang, Ruihai Wu, Hao Dong, Fan Tang, Hechang Chen, Hyung Jin Chang, Yixing Gao

机构 * Jilin University(吉林大学) Peking University(北京大学) Chinese Academy of Sciences(中国科学院) University of Birmingham(伯明翰大学)

专题命中 多模态评测 :multi-modal(abstract)

AI总结 该研究针对扁平物体机器人操作泛化能力有限的问题,提出含策略生成器与执行模块的统一框架,并构建FlatLab仿真基准,方法泛化效果优于现有基线。

Comments This paper is accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13797 2026-08-17 cs.LG 新提交 50%

Recent Advances in Deep Learning-Based Drug-Target Binding Affinity Prediction

基于深度学习的药物-靶点结合亲和力预测的最新进展

Jafin Khan, Md Hossain Shuvo

机构 * Prairie View A&M University(普雷里维尤农工大学)

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文综述近期基于深度学习的药物-靶点结合亲和力预测方法,分析其优势、局限与研究缺口,指出当前方法存在数据集偏差等问题,探讨未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12533 2026-08-14 physics.ed-ph 新提交 50%

Probing AI-generated physics solutions and preparing students to critique them

探究人工智能生成的物理解答并培养学生对其进行评判的能力

Nikhil Sanjay Borse, Amir Bralin, Sean Savage, N. Sanjay Rebello

专题命中 多模态评测 :multimodal(abstract)

AI总结 本研究通过调整框架评估OpenAI的o4-mini生成的物理解答,发现明确提示可提升解答完整性,MAPS指导能让学生更精准评判AI解答,为物理教育研究提供了新视角。

Comments 6 pages, 1 figure, Physics Education Research Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏