arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-05-05 至 2026-05-05 共收录 35 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人学习 2 篇

2510.03599 2026-05-05 cs.RO 85%

Learning to Act Through Contact: A Unified View of Multi-Task Robot Learning

通过接触学习行动:多任务机器人学习的统一视角

Shafeef Omar, Majid Khadiv

机构 * Munich Institute of Robotics and Machine Intelligence, Germany(德国慕尼黑机器人与机器智能研究所) Technical University of Munich, Germany(德国慕尼黑技术大学)

专题命中 机器人学习 :robot learning(title);manipulation(abstract,abstract_cn);robotic(abstract);分类 cs.RO

AI总结 本文提出基于接触显式表示的多任务运动与操作策略学习框架,通过接触目标序列统一定义任务,实现单一策略执行多种任务,提升泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01234 2026-05-05 cs.CV 57%

TT4D: A Pipeline and Dataset for Table Tennis 4D Reconstruction From Monocular Videos

TT4D:一个用于从单目视频中进行乒乓球4D重建的流水线和数据集

Nima Rahmanian, Daniel Kienzle, Thomas Gossard, Dvij Kalaria, Rainer Lienhart, Shankar Sastry

机构 * University of California, Berkeley(加州大学伯克利分校) University of Augsburg(奥格斯堡大学) University of Tübingen(图宾根大学)

专题命中 机器人学习 :robot learning(abstract);分类 cs.CV

AI总结 本文提出TT4D数据集,通过创新的重建流水线实现大规模高精度乒乓球比赛重建,解决单目视频中遮挡和视角变化带来的重建难题,支持虚拟回放和机器人学习。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人操作 12 篇

2605.01448 2026-05-05 cs.RO cs.CV 88%

Decompose and Recompose: Reasoning New Skills from Existing Abilities for Cross-Task Robotic Manipulation

分解与重组:从已有能力中推导新技能以实现跨任务机械操作

Xitie Zhang, Aming Wu, Yahong Han

机构 * School of Artificial Intelligence, College of Intelligence and Computing, Tianjin University, China(人工智能学院,智能与计算学院,天津大学,中国) School of Computer Science and Information Engineering, Hefei University of Technology, China(计算机科学与信息工程学院,合肥工业大学,中国)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出Decompose and Recompose框架,通过分解现有任务演示为可解释的技能-动作对,实现跨任务机械操作的零样本泛化。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10101 2026-05-05 cs.RO 88%

Robo3R: Enhancing Robotic Manipulation with Accurate Feed-Forward 3D Reconstruction

Robo3R:通过精确的前馈3D重建增强机器人操作

Sizhe Yang, Linning Xu, Hao Li, Juncheng Mu, Jia Zeng, Dahua Lin, Jiangmiao Pang

机构 * Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO;robotics(comments)

AI总结 Robo3R通过前馈3D重建模型,直接从RGB图像和机器人状态实时预测高精度场景几何,提升机器人操作的精度与一致性。

Comments Published at Robotics: Science and Systems (RSS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01434 2026-05-05 cs.RO 83%

High-Speed, Scalable Sensor Readout for Dexterous Robotic Hands via Shift-Register Multiplexing

通过移位寄存器多路复用实现高吞吐量的可扩展传感器读取用于灵巧机械手

Jaehoon Kim, Lazaros Christoforidis, Michalis Papadakis, Victor Kartsch, Robert K. Katzschmann

机构 * Soft Robotics Lab, IRIS, D-MAVT, ETH Zurich(软机器人实验室,IRIS,D-MAVT,苏黎世联邦理工学院) Integrated Systems Laboratory, ETH Zurich(集成系统实验室,苏黎世联邦理工学院)

专题命中 机器人操作 :robotic(title,abstract);manipulation(abstract);分类 cs.RO

AI总结 本文提出一种基于串入并出移位寄存器原理的可扩展模拟传感器读取架构,支持异构模拟输出传感器的集成与扩展,实现高吞吐量的传感器数据采集,验证了其在机械手上的应用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01069 2026-05-05 cs.RO 83%

Online Safety Filter for Deformable Object Manipulation with Horizon Agnostic Neural Operators

面向可变形物体操作的在线安全过滤器:无时间 horizon 神经算子

Jiaxing Li, Hanjiang Hu, Zhuoyuan Wang, Yorie Nakahira, Changliu Liu

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出一种基于约束的在线安全过滤器,通过最小修改控制策略,实时强制任务级安全约束,结合无时间 horizon 神经算子和边界控制屏障函数,提升柔体操作的安全性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08245 2026-05-05 cs.RO cs.AI 73%

STEP: Warm-Started Visuomotor Policies with Spatiotemporal Consistency Prediction

STEP: 带时空一致性的预热视觉运动策略

Jinhao Li, Yuxuan Cong, Yingqiao Wang, Hao Xia, Shan Huang, Yijia Zhang, Ningyi Xu, Guohao Dai

机构 * Shanghai Jiao Tong University, Shanghai, China.(上海交通大学,上海,中国。) Shanghai Innovation Institute, Shanghai, China.(上海创新研究院,上海,中国。)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出STEP策略,通过轻量级时空一致性预测机制生成高质量预热动作,同时保持生成能力。引入速度感知扰动注入机制,防止执行停滞,提升实时任务性能。

Comments Accept by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01033 2026-05-05 cond-mat.str-el cond-mat.stat-mech 71%

Manipulation of electromagnetic wave propagation in quantum-spin-chain medium

在量子自旋链介质中操控电磁波传播

Taras Krokhmalskii, Taras Verkholyak, Ostap Baran, Dmytro Yaremchuk, Taras Hutak, Oleg Derzhko

专题命中 机器人操作 :manipulation(title)

AI总结 研究一维磁性晶体中电磁波传播机制,通过计算色散关系k(ω)展示外部磁场对电磁波传播的调控,为更真实的磁性介质模型提供理论支持。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01480 2026-05-05 cs.CV 57%

AttnRouter: Per-Category Attention Routing for Training-Free Image Editing on MMDiT

AttnRouter:基于MMDiT的无训练图像编辑的类别级注意力路由

Guandong Li, Mengxia Ye

机构 * iFLYTEK Aegon THTF

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 本文提出AttnRouter,通过类别级路由表优化MMDiT的无训练图像编辑,实验显示其在CLIP-T+DINO-I复合指标上提升6.4%,且自动分类器在仅55%类别准确率下关闭98%的差距。

Comments 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01217 2026-05-05 cs.CV 57%

Asymmetric Invertible Threat: Learning Reversible Privacy Defense for Face Recognition

非对称可逆威胁:学习可逆隐私保护用于人脸识别

Jiabei Zhang, Ziyuan Yang, Andrew Beng Jin Teoh, Yi Zhang

机构 * School of Cyber Science and Engineering, Sichuan University(四川大学计算机科学与工程学院) Lee Kong Chian School of Medicine, Nanyang Technological University(南洋理工大学李科钦医学院) School of Electrical and Electronic Engineering, Yonsei University(延世大学电子与电气工程学院)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 本文提出ARFP,通过整合隐私保护、密钥恢复和篡改指示,提升人脸识别系统对逆向净化攻击的防御能力,同时保持授权恢复的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00930 2026-05-05 q-bio.GN cs.AI 57%

CellxPert: Inference-Time MCMC Steering of a Multi-Omics Single-Cell Foundation Model for In-Silico Perturbation

CellxPert:一种多组学单细胞基础模型的推理时间MCMC引导方法用于计算机模拟扰动

Andac Demir, Erik W. Anderson, Jeremy L. Jenkins, Srayanta Mukherjee

机构 * Novartis Biomedical Research(诺华生物医学研究)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 CellxPert通过整合多组学数据,实现了对单细胞和空间多组学的统一表示,支持细胞类型注释、扰动响应预测和多组学整合,采用MCMC方法提升生物可解释性。

Journal ref ICLR Machine Learning for Genomics Explorations Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25859 2026-05-05 cs.RO 57%

Privileged Foresight Distillation: Zero-Cost Future Correction for World Action Models

特权预见蒸馏:世界动作模型的零成本未来修正

Pengcheng Fang, Hongli Chen, Xiaohao Cai

机构 * The University of Southampton(南安普顿大学) The University of Queensland(昆士兰大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 本文提出特权预见蒸馏,通过将未来信息作为可压缩的修正项进行蒸馏,提升世界动作模型在无未来信息下的表现,实验证明其在LIBERO和RoboTwin任务中有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01225 2026-05-05 cond-mat.mes-hall 50%

Vector Magnonics: Electrical Injection and Control of Spin Flow in Altermagnets

矢量磁学:在交替磁体中电注入和控制自旋流

Yanmeng Lei, Rui-Chun Xiao, Weiwei Lin, Tao Yu

专题命中 机器人操作 :manipulation(abstract)

AI总结 研究通过电注入矢量磁自旋流实现交替磁体中自旋流的控制,揭示了其独特的传输特征及Néel矢量方向的实验区分方法。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01025 2026-05-05 cs.GT 50%

Your Loss is My Gain: Low Stake Attacks on Liquid Staking Pools

你的损失是我的收益:针对流动性质押池的低 stakes 攻击

Sen Yang, Aviv Yaish, Arthur Gervais, Fan Zhang

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文研究了流动性质押池中因低 stakes 攻击导致的经济安全漏洞,通过深度强化学习框架发现攻击策略,并分析了应用层的盈利渠道。

Comments 47 pages, 15 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身导航 7 篇

2508.02046 2026-05-05 cs.RO cs.LG 81%

NaviMaster: Learning a Unified Policy for GUI and Embodied Navigation Tasks

NaviMaster: 学习GUI和具身导航任务的统一策略

Zhihao Luo, Wentao Yan, Jingyu Gong, Min Wang, Zhizhong Zhang, Xuhong Wang, Yuan Xie, Xin Tan

机构 * East China Normal University(东华大学) Shanghai AI Laboratory(上海人工智能实验室) SenseTime Research(商汤科技研究院)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.LG

AI总结 本文提出NaviMaster,通过统一框架整合GUI导航和具身导航,采用视觉目标轨迹收集管道、统一强化学习框架和距离感知奖励,提升泛化能力。

Comments ACL 2026 Main Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07557 2026-05-05 cs.RO 79%

AutoSpatial: Visual-Language Reasoning for Social Robot Navigation through Efficient Spatial Reasoning Learning

AutoSpatial: 通过高效空间推理学习实现社交机器人导航的视觉-语言推理

Yangzhe Kong, Daeun Song, Jing Liang, Dinesh Manocha, Ziyu Yao, Xuesu Xiao

机构 * George Mason University(乔治·马歇尔大学) University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 本文提出AutoSpatial方法,通过结构化空间接地和大规模VQA对自动生成标签,提升VLMs在社交导航中的空间推理能力,实现更准确的空间感知、运动预测、推理、行动和解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00879 2026-05-05 cs.RO cs.SY eess.SY 70%

LiDAR for Rehabilitation: A Comprehensive Survey of Applications, AI Techniques, and Future Directions

激光雷达在康复中的应用:应用、人工智能技术及未来方向的综合调研

Soumia Siyoucef, Najmeddine Dhieb, Hakim Ghazzai, Eleonora Guanziroli, Franco Molteni, Gianluca Setti

专题命中 具身导航 :navigation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文综述了激光雷达在康复、术后护理和医院环境中的应用,分析了基于学习的方法及统计趋势,揭示了当前方法、AI处理技术和开放挑战。

Comments This paper is accepted for publication in IEEE Sensors Reviews, April, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01562 2026-05-05 cs.SE cs.AI 57%

Neuro-Symbolic Agents for Hallucination-Free Requirements Reuse

神经符号代理用于无幻觉要求重用

Ahmed Ibrahim

机构 * Western University(西部大学)

专题命中 具身导航 :navigation(abstract);分类 cs.AI

AI总结 本文提出神经符号多代理系统,通过模型驱动 elicitation 过程实现无幻觉的要求重用,结合 LLM 和符号验证器确保结构有效性,实验显示 100% 覆盖率和 0.2% 违规率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01477 2026-05-05 cs.RO 57%

Action Agent: Agentic Video Generation Meets Flow-Constrained Diffusion

动作代理:代理视频生成与流约束扩散的结合

Jeffrin Sam, Nguyen Khang, Yara Mahmoud, Miguel Altamirano Cabrera, Dzmitry Tsetserukou

机构 * Intelligent Space Robotics Laboratory, Skoltech(斯克里普切尔技术大学智能空间机器人实验室)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 本文提出Action Agent框架,结合代理导航视频生成与流约束扩散控制,通过两阶段方法提升多体机器人导航性能,实现从语言和图像输入生成物理合理的第一人称导航视频,并在真实和仿真环境中取得高成功率。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00861 2026-05-05 eess.AS cs.AI eess.SP 57%

Voice Mapping of Text-to-Speech Systems: A Metric-Based Approach for Voice Quality Assessment

语音映射在文本到语音系统中的应用:基于指标的语音质量评估方法

Huanchen Cai, Sten Ternström

机构 * Division of Speech, Music and Hearing, School of Electrical Engineering and Computer Science, KTH Royal Institute of Technology(语音、音乐和听觉系,电气工程与计算机科学学院,皇家理工学院)

专题命中 具身导航 :robotic(abstract);分类 cs.AI

AI总结 本文基于指标分析六种TTS模型,发现语音范围是评估模型能力的主要指标,VITS表现最佳,Glow-TTS在软发音方面表现优异,CPPs值在7-8dB时语音自然,超过10dB则显得机械。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01540 2026-05-05 eess.SP 50%

A Time-Synchronized Video Reference System for Data Analysis of Body-Attached Sensor Nodes in Outdoor Scenarios

一种用于户外场景中身体附加传感器节点数据分析的时间同步视频参考系统

Lukas Schulthess, Fabian Pleisch, Matheo Käch, Björn P. Bruhin, Michele Magno, Luca Benini, Christoph Leitner

专题命中 具身导航 :navigation(abstract)

AI总结 本文提出了一种轻量级时间码生成器,通过将GNSS时间转换为线性时间码信号,实现视频录制中与传感器数据的同步,减少功耗并支持更小的电池和无感硬件设计。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 具身推理 2 篇

2604.18058 2026-05-05 cs.LG 79%

Sonata: A Hybrid World Model for Inertial Kinematics under Clinical Data Scarcity

Sonata:一种用于临床数据稀缺情况下的六轴躯干IMU表示学习的混合世界模型

Blaise Delaney, Salil Patel, Yuji Xing, Dominic Dootson, Karin Sevegnani, Chrystalina Antoniades

机构 * TimeTrace Labs(TimeTrace实验室) NVIDIA University of Oxford(牛津大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.LG

AI总结 Sonata在临床数据稀缺情况下,通过混合世界模型实现了六轴躯干IMU的高效表示学习,具有更强的临床判别能力、前瞻性跌倒风险预测和跨群体迁移能力。

Comments 18 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00943 2026-05-05 cs.RO 70%

ARIS: Agentic and Relationship Intelligence System for Social Robots

ARIS:面向社交机器人的代理与关系智能系统

Stavya Datta, Fucai Ke, Leimin Tian, Hamid Rezatofighi

机构 * Monash University(墨尔本大学)

专题命中 具身推理 :robotics(abstract);world model(abstract);分类 cs.RO

AI总结 ARIS通过整合多模态推理、图基社会世界模型和检索增强生成技术,提升社交机器人在多轮交互和社会关系推理中的能力,实验显示其在智能感知和用户亲和力方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 模仿学习与强化学习 3 篇

2605.01352 2026-05-05 cs.OS cs.AI cs.DC 57%

VUDA: Breaking CUDA-Vulkan Isolation for Spatial Sharing of Compute and Graphics on the Same GPU

VUDA: 打破CUDA-Vulkan隔离以实现同一GPU上的计算与图形空间共享

Bin Xu, Pengfei Hu, Wenxin Zheng, Jinyu Gu, Haibo Chen

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 模仿学习与强化学习 :embodied AI(abstract);分类 cs.AI

AI总结 VUDA通过打破CUDA与Vulkan的执行隔离,实现计算与图形任务的空间并行,提升GPU利用率并减少端到端延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01232 2026-05-05 cs.RO 57%

A Principled Approach for Creating High-fidelity Synthetic Demonstrations for Imitation Learning

为模仿学习创建高保真合成演示的原理性方法

Moniruzzaman Akash, Momotaz Begum

机构 * Spot mobile manipulator(Spot移动机械臂)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 本文提出基于动态运动基元的框架,通过保留专家轨迹结构生成多样化演示,实现高保真渲染与几何推理的统一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01201 2026-05-05 cs.RO 57%

To Do or Not to Do: Ensuring the Safety of Visuomotor Policies Learned from Demonstrations

做或不做:确保从示范中学习的视觉-运动策略的安全性

Riad Ahmed, Moniruzzaman Akash, Momotaz Begum

机构 * Department of Computer Science(计算机科学系)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO

AI总结 本文提出了一种政策无关的安全度量,确保视觉-运动策略在状态空间特定区域内的最大任务成功率,通过视图合成和Nagumo子切线条件分析,验证了策略安全性和性能的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 人机交互与遥操作 1 篇

2605.01483 2026-05-05 cs.CV cs.AI 62%

Research on Vision-Language Question Answering Models for Industrial Robots

工业机器人中视觉-语言问答模型的研究

Ping Li, Bartlomiej Brzozka

机构 * Shandong Management University(山东管理大学) Maria Curie-Sklodowska University(玛丽·居里-斯洛多夫斯卡大学)

专题命中 人机交互与遥操作 :robotics(abstract);分类 cs.AI、cs.CV

AI总结 本文提出一种层次交叉模态融合模型,解决工业机器人中语义模糊、复杂环境布局和领域术语的问题,通过多级特征融合提升问答可靠性。

Comments 8 Pages, 5 figures

Journal ref Brzozka,B.Machine Learning Algorithms in Predicting College Students' Grades:A Review.Journal of Applied Automation Technologies,2025,3,1-12

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 机器人数据与评测 6 篇

2602.07264 2026-05-05 cs.RO cs.AI cs.SE 62%

aerial-autonomy-stack -- a Faster-than-real-time, Autopilot-agnostic, ROS2 Framework to Simulate and Deploy Perception-based Drones

空域自主栈 -- 一个优于实时的、与自动驾驶无关的ROS2框架,用于模拟和部署基于感知的无人机

Jacopo Panerati, Sina Sajjadi, Sina Soleymanpour, Varunkumar Mehta, Iraj Mantegh

机构 * National Research Council Canada(加拿大国家研究理事会)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI

AI总结 本文提出空域自主栈,一个基于ROS2的开源框架,支持快速模拟和部署基于感知的无人机系统,通过统一接口支持PX4和ArduPilot,实现20倍于实时的仿真速度,缩短开发测试周期。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01501 2026-05-05 cs.RO cs.MA 61%

Distributed Algorithm with Emergent Area Partitioning and Base Station's Situation Awareness for Multi-Robot Patrolling

多机器人巡逻的分布式算法与自适应区域划分及基站态势感知

Kazuho Kobayashi, Shohei Kobayashi, Seiya Ueno, Takehiro Higuchi

机构 * Department of Mechanical Engineering, Materials Science, and Ocean Engineering, Graduate School of Engineering Science, Yokohama National University(机械工程、材料科学与海洋工程系,工程科学研究生院, Yokohama国立大学) Faculty of Environment and Information Sciences, Yokohama National University(环境与信息科学系,Yokohama国立大学)

专题命中 机器人数据与评测 :robotics(abstract,journal_ref);分类 cs.RO

AI总结 本文提出LR-PT算法,通过自适应区域划分和基站态势感知提升多机器人巡逻效率,实现全面覆盖和态势感知增强。

Journal ref Journal of Robotics and Mechatronics, vol.37, no.4, pp.927-944, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12539 2026-05-05 cs.AI cs.CL 57%

MemeLens: Multilingual Multitask VLMs for Memes

MemeLens:多语言多任务VLMs用于表情包

Ali Ezzat Shahroor, Mohamed Bayan Kmainasi, Abul Hasnat, Dimitar Dimitrov, Giovanni Da San Martino, Preslav Nakov, Firoj Alam

机构 * Qatar Computing Research Institute(卡塔尔计算研究所) Sofia University "St. Kliment Ohridski"(索菲亚大学"圣克莱孟·奥赫里迪斯") University of Padova(帕多瓦大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 本文提出MemeLens,一种统一的多语言多任务解释增强视觉语言模型,用于表情包理解。通过整合38个公开数据集,建立20个任务的共享分类体系,并分析不同模型范式和数据集的表现,发现多模态训练和统一训练对表情包理解至关重要。

Comments disinformation, misinformation, factuality, harmfulness, fake news, propaganda, hateful meme, multimodality, text, images

详情

展开后加载摘要…

URL PDF HTML 收藏