arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-05-08 至 2026-05-08 共收录 59 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 19 篇

2605.05344 2026-05-08 cs.CV cs.AI cs.IR 62%

Open-SAT: LLM-Guided Query Embedding Refinement for Open-Vocabulary Object Retrieval in Satellite Imagery

Open-SAT: 一种基于LLM的查询嵌入细化方法用于卫星影像开放词汇物体检索

Md Adnan Arefeen, Biplob Debnath, Ravi K. Rajendran, Murugan Sankaradas, Srimat T. Chakradhar

机构 * North South University(北南大学) NEC Laboratories America(NEC实验室)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 Open-SAT通过LLM引导在推理阶段优化查询与卫星影像内容的对齐,提升开放词汇检索性能,实验表明其F1分数提升达16.04%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06434 2026-05-08 cs.AI 57%

Knowledge Graphs, the Missing Link in Agentic AI-based Formal Verification

知识图谱:代理AI形式验证中的缺失链接

Vaisakh Naduvodi Viswambharan, Keerthan Kopparam Radhakrishna, Deepak Narayan Gadde, Aman Kumar

机构 * 1 Infineon Technologies Dresden AG \& Co. KG, Germany 2 Infineon Technologies Semiconductor India Private Limited, India

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出基于知识图谱的验证方法,通过结构化中间表示提取规范、RTL和工具反馈,提升形式验证中规范到RTL的关联性,并通过多代理工作流生成SVAs及三种修正循环。

Comments To appear at the IEEE International Conference on IC Design and Technology 2026 (ICICDT), June 22 - 24, 2026, Dresden, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05807 2026-05-08 cs.CR cs.AI 57%

LCC-LLM: Leveraging Code-Centric Large Language Models for Malware Attribution

LCC-LLM:利用代码导向的大语言模型进行恶意软件归因

Christopher G. Pedraza Pohlenz, Hassan Jalil Hadi, Ali Hassan, Ali Shoker

机构 * CyberSaR, King Abdullah University of Science and Technology(CyberSaR,国王阿卜杜勒·阿齐兹大学科学与技术学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出LCC-LLM,一种代码导向的恶意软件归因和多任务静态恶意软件分析框架,通过构建包含34000个PE样本的LCCD数据集,结合静态分析与多源安全知识,提升恶意软件归因的可靠性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05643 2026-05-08 cs.AI cs.IR 57%

Text-Graph Synergy: A Bidirectional Verification and Completion Framework for RAG

文本-图协同:一种双向验证与完成框架用于RAG

Jiarui Zhong, Hong Cai Chen

机构 * School of Automation, Southeast University(自动化学院,东南大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出TGS-RAG框架,通过双向机制融合文本与图结构,解决传统RAG中信息孤岛问题,提升多跳推理性能。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05626 2026-05-08 cs.CL cs.AI 57%

When2Speak: A Dataset for Temporal Participation and Turn-Taking in Multi-Party Conversations for Large Language Models

When2Speak: 一个多党对话中大型语言模型的时间参与和发言时机的数据集

Vihaan Nama, Shreya Mendi, Zian Ye, Brinnae Bent

机构 * Pratt School of Engineering(普拉特工程学院) Duke University(杜克大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出When2Speak数据集,通过四阶段生成流程学习群体互动中的发言时机,通过强化学习优化模型,提升多党对话中的发言准确性与自然度。

Comments Currently under review. Dataset can be found: https://huggingface.co/datasets/duke-trust-lab/When2Speak

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05538 2026-05-08 cs.AI cs.IR 57%

AgenticRAG: Agentic Retrieval for Enterprise Knowledge Bases

AgenticRAG:企业知识库中的代理检索

Susheel Suresh, Hazel Mak, Shangpo Chou, Fred Kroon, Sahil Bhatnagar

机构 * Microsoft Corporation(微软公司)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 AgenticRAG通过在现有企业检索基础设施上叠加轻量级代理框架,使语言模型能够自主迭代检索信息、导航文档并分析证据,提升了检索准确率和事实性。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20616 2026-05-08 cs.CV 57%

Shape2Animal: Creative Animal Generation from Natural Silhouettes

Shape2Animal: 从自然剪影生成创意动物

Quoc-Duy Tran, Anh-Tuan Vo, Dinh-Khoi Vo, Tam V. Nguyen, Minh-Triet Tran, Trung-Nghia Le

机构 * University of Science, Ho Chi Minh City, Vietnam(胡志明市科学技术大学) Vietnam National University, Ho Chi Minh City, Vietnam(越南国家大学) University of Dayton, Ohio, US(Dayton 大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出Shape2Animal框架,通过将自然物体剪影转化为 plausible 动物形式,展现人类对模糊刺激的感知能力。利用 vision-language 模型和扩散模型生成视觉连贯的动物图像,适用于视觉叙事、教育内容等领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06311 2026-05-08 cs.RO 50%

Toward Visually Realistic Simulation: A Benchmark for Evaluating Robot Manipulation in Simulation

迈向视觉逼真模拟:评估机器人操作的基准测试

Yixin Zhu, Zixiong Wang, Jian Yang, Jin Xie, Jingyi Yu, Jiayuan Gu, Beibei Wang

机构 * Nanjing University(南京大学) Nankai University(南开大学) ShanghaiTech University(上海科技大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出VISER基准,通过高保真3D资产和物理渲染材料,评估机器人操作的视觉逼真度,提升仿真与现实性能的关联性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11409 2026-05-08 quant-ph 50%

When T-Depth Misleads: Predicting Fault-Tolerant Quantum Execution Slowdown under Magic-State Delivery Constraints

当T深度误导:在魔态交付限制下预测容错量子执行延迟

Boshuai Ye, Arif Ali Khan, Peng Liang

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出通过slack ratio和Delta_max预测量子执行延迟,揭示静态T深度无法准确预测执行性能,实验证明Delta_max是预测延迟的最强指标。

Comments 10 pages, 10 figures. Code available at https://github.com/C2-Q/BARC/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 文档图表理解 2 篇

2605.05820 2026-05-08 cs.CV 84%

ChartZero: Synthetic Priors Enable Zero Shot Chart Data Extraction

ChartZero:合成先验使零样本图表数据提取成为可能

Md Touhidul Islam, Yasir Mahmud, Sujan Kumar Saha, Mark Tehranipoor, Farimah Farahmandi

机构 * University of Florida(佛罗里达大学)

专题命中 文档图表理解 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV

AI总结 本文提出ChartZero框架,通过合成先验实现鲁棒的零样本图表数据提取,克服了传统方法在曲线碎片化和语义关联上的缺陷,引入GOI损失和VLM引导的图例匹配策略,提升整体数据重建能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06021 2026-05-08 cs.CV cs.DL 57%

PlotPick: AI-powered batch extraction of numerical data from scientific figures

PlotPick: 基于AI的科学图表中数值数据批量提取工具

Tommy Carstensen

机构 * Copenhagen Research Centre for Biological and Precision Psychiatry(哥本哈根生物与精准精神病学研究中心) Mental Health Centre Copenhagen(哥本哈根心理健康中心) Copenhagen University Hospital(哥本哈根大学医院)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 PlotPick利用视觉语言模型批量提取科学图表中的结构化表格数据,六个VLMs在ChartX和PlotQA基准测试中均优于专用模型DePlot,尤其在未包含在训练数据中的图表类型上表现更佳。

Comments 7 pages, 2 figures, 2 tables. Software available at https://plotpick.streamlit.app and https://github.com/tommycarstensen/plotpick

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与屏幕智能体 2 篇

2605.06664 2026-05-08 cs.CV cs.AI 81%

BAMI: Training-Free Bias Mitigation in GUI Grounding

BAMI:无需训练的GUI定位偏差缓解

Borui Zhang, Bo Zhang, Bo Wang, Wenzhao Zheng, Yuhao Cheng, Liang Tang, Yiqiang Yan, Jie Zhou, Jiwen Lu

机构 * Tsinghua University, China(清华大学,中国) Lenovo Research, China(联想研究院,中国)

专题命中 GUI与屏幕智能体 :grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出BAMI方法,通过粗到细聚焦和候选选择缓解GUI定位中的精度偏差和歧义偏差,提升模型在无训练设置下的准确性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06339 2026-05-08 cs.AI 57%

A Regime Theory of Controller Class Selection for LLM Action Decisions

控制器类别选择的制度理论:用于LLM行动决策

Zhaoyang Jiang, Zhizhong Fu, Yunsoo Kim, Jiacong Mi, Zicheng Li, Xuanqi Peng, Honghan Wu

机构 * University of Glasgow(格拉斯哥大学) University College London(伦敦大学学院) UESTC(电子科技大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI

AI总结 本文提出一种制度理论,通过分析有限样本下的实例不确定性信号,指导LLM在不同输入下选择合适的控制器类别,从而在有限样本中实现最优决策。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与鲁棒性 4 篇

2605.05594 2026-05-08 cs.CL cs.CV cs.LG 73%

The Cost of Context: Mitigating Textual Bias in Multimodal Retrieval-Augmented Generation

上下文的成本:减轻多模态检索增强生成中的文本偏差

Hoin Jung, Xiaoqian Wang

机构 * Elmore Family School of Electrical and Computer Engineering(埃尔莫夫家族电气与计算机工程学院)

专题命中 幻觉与鲁棒性 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 本文探讨了多模态大语言模型在整合检索增强生成时出现的文本偏差问题,提出BAIR方法通过恢复视觉显著性并施加位置感知惩罚来提升多模态接地和诊断可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05709 2026-05-08 cs.AI 70%

Conceal, Reconstruct, Jailbreak: Exploiting the Reconstruction-Concealment Tradeoff in MLLMs

隐藏、重建、突破:在大规模语言模型中利用重建-隐藏权衡

Md Farhamdur Reza, Richeng Jin, Tianfu Wu, Huaiyu Dai

机构 * NC State University(北卡罗来纳州立大学) Zhejiang University(浙江大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.AI

AI总结 本文探讨了在多模态大语言模型中利用重建与隐藏的权衡进行意图混淆攻击,提出了一种基于字符移除的变体构造方法,并引入关键词相关的干扰图像以提高攻击效果。

Comments 39 pages, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06096 2026-05-08 cs.CL cs.CV 57%

Uncovering Entity Identity Confusion in Multimodal Knowledge Editing

揭示多模态知识编辑中的实体身份混淆

Shu Wu, Xiaotian Ye, Xinyu Mou, Dongsheng Liu, Xiaohan Wang, Mengqi Zhang

机构 * New Laboratory of Pattern Recognition (NLPR)(模式识别新实验室) State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS)(多模态人工智能系统国家重点实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing University of Posts and Telecommunications(北京邮电大学) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) Huazhong University of Science and Technology(华中科技大学) Shandong University(山东大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 本文研究多模态知识编辑中实体身份混淆问题,发现现有方法无法区分图像-实体绑定与实体-实体关系,导致模型错误关联。通过构建EC-Bench基准测试,提出约束编辑阶段以提升绑定准确性,从而减少混淆。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05810 2026-05-08 cs.CV 57%

CXR-ContraBench: Benchmarking Negated-Option Attraction in Medical VLMs

CXR-ContraBench:医疗视觉语言模型中否定选项吸引力的基准测试

Zhengru Fang, Yanan Ma, Yu Guo, Senkang Hu, Yixian Zhang, Hangcheng Cao, Wenbo Ding, Yuguang Fang

机构 * City University of Hong Kong(香港城市大学) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 研究医疗视觉语言模型在否定选项吸引力问题上的表现,通过CXR-ContraBench基准测试发现模型在面对矛盾图像和问题时易产生极性反转,提出QCCV-Neg方法有效修复极性混淆问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. VLM训练与架构 8 篇

2605.05909 2026-05-08 cs.AI 91%

Null Space Constrained Contrastive Visual Forgetting for MLLM Unlearning

空域约束对比遗忘用于MLLM反学习

Yuhang Wang, Zhenxing Niu, Haoxuan Ji, Guangyu He, Linlin Zhang, Haichang Gao

机构 * School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) Xi’an Jiaotong University(西安交通大学)

专题命中 VLM训练与架构 :MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出一种MLLM反学习方法,通过冻结LLM主干并微调视觉模块,在保留非目标视觉知识和全部文本知识的同时,有效遗忘目标视觉知识。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05421 2026-05-08 cs.CV cs.AI cs.LG 82%

DARK: Diagonal-Anchored Repulsive Knowledge Distillation for Vision-Language Models under Extreme Compression

DARK:针对极端压缩下视觉-语言模型的对角锚定排斥知识蒸馏

Numan Saeed, Asif Hanif, Fadillah Adamsyah Maani, Hussain Alasmawi, Mohammad Yaqub

机构 * Mohamed Bin Zayed University of Artificial Intelligence(Mohamed Bin Zayed人工智能大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出DARK,一种对比知识蒸馏框架,通过分解损失函数为对角项和非对角项,使学生模型在极端压缩下更高效地排斥教师模型的非目标相似结构,实验证明其在零样本基准上表现优异。

Comments Project website: www.numansaeed.com/mobilefetalclip

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00699 2026-05-08 cs.CR 80%

STARE: Step-wise Temporal Alignment and Red-teaming Engine for Multi-modal Toxicity Attack

STARE:分步时间对齐与红队引擎用于多模态毒性攻击

Xutao Mao, Liangjie Zhao, Tao Liu, Xiang Zheng, Hongying Zan, Cong Wang

专题命中 VLM训练与架构 :vision-language model(abstract,abstract_cn);VLM(abstract,abstract_cn)

AI总结 STARE通过分步时间对齐和红队引擎,提升多模态毒性攻击的成功率,揭示优化诱导的相位对齐现象,为安全机制提供理论基础。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05668 2026-05-08 cs.AI cs.CV 76%

Large Vision-Language Models Get Lost in Attention

大视觉-语言模型在注意力中迷失

Gongli Xi, Ye Tian, Mengyu Yang, Huahui Yi, Liang Lin, Xiaoshuai Hao, Kun Wang, Wendong Wang

机构 * School of Cyberspace Security, Beijing University of Posts(信息安全学院,北京邮电大学) State Key Laboratory of Networking and Switching Technology, Beijing University of Posts(网络与交换技术国家重点实验室,北京邮电大学) School of Computer Science (National Pilot Software Engineering School), Beijing University of Posts(计算机科学学院(国家试点软件工程学院),北京邮电大学) Nanyang Technological University, Singapore(新加坡南洋理工大学) Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China(信息工程研究所,中国科学院北京研究院)

专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV、cs.AI

AI总结 研究揭示大视觉-语言模型中注意力与前馈网络的作用差异,提出基于信息论和几何的统一框架,发现注意力模块存在冗余问题。

Comments 25 pages, 10 figures. Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14724 2026-05-08 cs.CV cs.AI cs.CL 62%

HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding

HERMES: KV缓存作为分层内存用于高效视频流理解

Haowei Zhang, Shudong Yang, Jinlan Fu, See-Kiong Ng, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) National University of Singapore(新加坡国立大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 HERMES提出一种无需训练的架构,通过将KV缓存视为分层内存框架,实现视频流的实时准确理解,提升处理速度并降低内存消耗。

Comments Accepted to ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06477 2026-05-08 cs.CV 57%

GeoStack: A Framework for Quasi-Abelian Knowledge Composition in VLMs

GeoStack: 一种用于视觉语言模型中近阿贝尔知识组合的框架

Pranav Mantini, Shishir K. Shah

机构 * The University of Oklahoma School of Computer Science(俄克拉荷马大学计算机科学学院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 GeoStack通过几何约束和结构约束确保基础模型知识保留,实现常数时间推理,有效缓解灾难性遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06049 2026-05-08 cs.CV 57%

Fusion in Your Way: Aligning Image Fusion with Heterogeneous Demands via Direct Preference Optimization

融合你的方式:通过直接偏好优化对齐图像融合与异质需求

Weijian Su, Songqian Zhang, Yuqi Han, Jian Zhuang, Yongdong Huang, Qiang Zhang

机构 * School of Computer Science and Technology, Dalian University of Technology(大连理工大学计算机科学与技术学院) Key Laboratory of Social Computing and Cognitive Intelligence (Dalian University of Technology), Ministry of Education(社会计算与认知智能重点实验室(大连理工大学),教育部) Institute of Image Processing and Understanding, North Minzu University(北华大学图像处理与理解研究所)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出DPOFusion框架,通过整合PALDM和PCLDM实现任务引导和偏好适应的图像融合,解决人类和机器视觉的异质需求问题,提升融合质量和任务导向的迁移能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19316 2026-05-08 cs.CL 50%

KORE: Enhancing Knowledge Injection for Large Multimodal Models via Knowledge-Oriented Controls

KORE:通过知识导向控制增强大型多模态模型的知识注入

Kailin Jiang, Hongbo Jiang, Ning Jiang, Zhi Gao, Jinhe Bi, Yuchen Ren, Bin Li, Yuntao Du, Lei Liu, Qing Li

机构 * University of Science State Key Laboratory of General Artificial Intelligence, BIGAI Xiamen University Northeast Forestry University Beijing Institute of Technology Ludwig Maximilian University of Munich The University of Sydney C-FAIR\&school of software, Shandong University State Key Lab. for Novel Software Technology, Nanjing University, P.R. China

专题命中 VLM训练与架构 :LLaVA(abstract)

AI总结 KORE通过知识导向的增强和约束,提升大型多模态模型的知识注入能力,同时保留旧知识。方法利用协方差矩阵和投影初始化,有效减少灾难性遗忘。

Comments ICML 2026, Project Page: https://kore-lmm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 其他VLM 4 篇

2411.19182 2026-05-08 cs.CV cs.AI 62%

SOWing Information: Cultivating Contextual Coherence with MLLMs in Image Generation

信息播种:利用大规模语言模型在图像生成中培养上下文一致性

Yuhan Pei, Ruoyu Wang, Yongqi Yang, Ye Zhu, Olga Russakovsky, Yu Wu

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Department of Computer Science, Princeton University(普林斯顿大学计算机科学系)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SOW方法,通过多模态大语言模型实现文本-视觉到图像生成,提升图像像素级条件保真度和视觉语义一致性。

Comments Project page: https://pyh-129.github.io/SOW/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05910 2026-05-08 cs.CV 57%

Plug-and-play Class-aware Knowledge Injection for Prompt Learning with Visual-Language Model

即插即用的类感知知识注入用于具有视觉-语言模型的提示学习

Junhui Yin, Nan Pu, Xinyu Zhang, Lingfeng Yang, Lin Wu, Xiaojie Wang, Zhun Zhong

机构 * University of Science and Technology Beijing(北京科技大学) Hefei University of Technology(合肥工业大学) University of Auckland(奥克兰大学) Nanjing University of Science and Technology(南京理工大学) Swansea University(斯旺西大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 本文提出CAKI框架,通过类特定提示生成和查询-键提示匹配,补充现有方法中的类特定知识,提升基类和新类的性能。

Comments Accepted by International Journal of Computer Vision

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05241 2026-05-08 cs.RO cs.LG 57%

DexSim2Real: Foundation Model-Guided Sim-to-Real Transfer for Generalizable Dexterous Manipulation

DexSim2Real: 基于基础模型的仿真到现实迁移用于通用的灵巧操作

Zijian Zeng, Fei Ding, Huiming Yang, Xianwei Li, Yuhao Liao

机构 * Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团) Bengbu University(Bengbu大学) UCSI University(UCSI大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.LG

AI总结 本文提出DexSim2Real框架,结合基础模型引导的域随机化、触觉视觉交叉注意力策略和渐进技能课程,提升灵巧操作的仿真到现实迁移性能,实验表明其在现实世界中的成功率达到78.2%。

Comments 13 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19417 2026-05-08 cs.HC 50%

MER 2026: From Discriminative Emotion Recognition to Generative Emotion Understanding

MER 2026:从判别性情感识别到生成性情感理解

Zheng Lian, Xiaojiang Peng, Kele Xu, Ziyu Jia, Xinyi Che, Zebang Cheng, Fei Ma, Laizhong Cui, Yazhou Zhang, Xin Liu, Liang Yang, Jia Li, Fan Zhang, Liumeng Xue, Erik Cambria, Guoying Zhao, Bjorn W. Schuller, Jianhua Tao

专题命中 其他VLM :multimodal large language model(abstract)

AI总结 MER2026延续系列挑战趋势,包含四个赛道,聚焦双人交互、细粒度识别、偏好预测和生理信号情感识别。

详情

展开后加载摘要…

URL PDF HTML 收藏