arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 363 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 363 篇

2506.11637 2026-08-17 astro-ph.IM 版本更新 50%

Multivariate time series transformer embeddings for light curves of periodic variable stars

用于周期性变星光变曲线的多变量时间序列Transformer嵌入

Gabriel Chiong, Ignacio Becker, Pavlos Protopapas

专题命中 预训练与数据 :pretraining(abstract)

AI总结 该研究扩展了Astromer框架,提出多波段Transformer架构,在周期性变星分类任务中,其F1分数较单波段模型提升10至23个百分点,展现了多波段模型的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08235 2026-08-14 eess.AS 版本更新 50%

SraVaani 1.0: Scaling Inclusive Speech Recognition for Indic Languages

SraVaani 1.0:面向印度语言的包容性自动语音识别规模化模型

Sujith Pulikodan, Agneedh Basu, Pavan Kumar J, Pranav D Bhat, Suryansh Shukla, Nihar Desai, Prasanta Kumar Ghosh

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文提出SraVaani 1.0,一款基于FastConformer架构的多语言ASR模型,覆盖65种印度语言,经三阶段训练后在8个基准上表现优异,是唯一支持多种低资源及部落印度语言转录的开源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21263 2026-08-12 cs.CV 版本更新 50%

Towards Geometry-Grounded Dense Semantic Matching with VGGT Priors

基于VGGT先验的几何基础密集语义匹配研究

Songlin Yang, Tianyi Wei, Yushi Lan, Zeqi Xiao, Anyi Rao, Xingang Pan

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) Visual Geometry Group, University of Oxford(牛津大学视觉几何组)

专题命中 预训练与数据 :foundation model(abstract)

AI总结 本文针对现有语义匹配方法的几何歧义与最近邻规则局限,采用VGGT先验,通过特征调整、循环训练等策略实现适配,在多方面性能优于基线。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14166 2026-08-11 cs.SE cs.CR cs.DC 版本更新 50%

Stop Means Stop: Measuring and Repairing the Enforcement Gap in Agent-Framework Control Primitives

停止即停止:测量和修复智能体框架控制原语中的执行差距

Sajjad Khan

专题命中 预训练与数据 :LLM(abstract)

AI总结 研究生产型大语言模型智能体框架控制原语执行差距,用无模型差分探针发现漏洞及差距,提出SOUNDGATE修复,能强制执行多种属性,端到端阻止违规,释放合法效果。

Comments 32 pages, 3 figures, 11 tables. Code: pip install soundgate (PyPI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24485 2026-08-10 cs.RO 版本更新 50%

τ: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision

τ:从未来视觉监督中学习触觉增强的视觉-语言-动作模型

Ning Cheng, Jinan Xu, Wanlin Li, Yangzhi Chen, Jing Gao, Yiqun Wang, Kelan Peng, Wenjuan Han

专题命中 预训练与数据 :pretraining(abstract)

AI总结 研究旨在解决学习触觉表示并应用于VLA模型的挑战,提出τ框架从未来视觉监督学习动作条件时空触觉表示,结合视觉语言特征用于动作生成,引入TacAura数据集,实验证明其性能优于现有模型且能泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19880 2026-08-07 cs.RO cs.CV 版本更新 50%

EA-Nav: Learning Safe Visual Navigation Policies with Embodiment Awareness

EA-Nav:通过具身感知学习安全的视觉导航策略

Jialu Zhang, Yong Du, Xianda Guo, Shunwang Sun, Xinqi Liu, Yue Sun, Guodong Lu, Wei Sui, Jituo Li

机构 * Zhejiang University(浙江大学) Wuhan University(武汉大学) Hunan University(湖南大学) D-Robotics(D机器人公司)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 针对跨具身导航挑战,提出基于模仿学习的具身感知导航框架,通过模块化多阶段设计,预训练构建数据集并引入具身几何,微调设计多模态信息注入机制,有效提高不同具身设置下的导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01410 2026-08-06 cs.RO cs.CV 版本更新 50%

GenTrack: Physical Alignment for Robot-Native Motion Generation and Zero-Shot Humanoid Tracking

GenTrack:面向机器人原生运动生成与零样本人形机器人跟踪的物理对齐框架

Zeyu Ling, Xinyao Yu, Renye Yan, Jikang Cheng, Zhanke Wang, Qing Shuai, Changqing Zou

专题命中 预训练与数据 :post-training(abstract)

AI总结 GenTrack是一种在线生成器-跟踪器框架,通过协同训练缩小重定向参考与机器人原生运动的可执行性差距,在Unitree G1机器人上实现了零样本人形机器人跟踪性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21611 2026-08-04 cs.CV 版本更新 50%

SARe: Structure-Aware Generative 3D Fragment Reassembly

SARe: 基于结构的大规模3D碎片重组

Hanze Jia, Chunshi Wang, Yuxiao Yang, Zhonghua Jiang, Yawei Luo, Shuainan Ye, Tan Tang

机构 * State Key Lab of CAD\&CG, Zhejiang University(浙江大学CAD与计算机图形学国家重点实验室) School of Software Technology, Zhejiang University(浙江大学软件学院) Laboratory of Art and Archaeology Image, Zhejiang University(浙江大学艺术与考古图像实验室)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文提出SARe框架,通过生成式方法解决大规模3D碎片重组问题,通过显式接触建模提高接触推理的稳定性与一致性,实验证明在碎片数量增加时具有更优的性能。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18164 2026-08-04 cs.CV 版本更新 50%

CDG-MAE: Cross-view Masked Modeling using Diffusion Generated Views

CDG-MAE:基于扩散生成视图的跨视图掩码建模

Varun Belagali, Pierre Marza, Srikar Yellapragada, Zilinghan Li, Tarak Nath Nandi, Ravi K Madduri, Joel Saltz, Stergios Christodoulidis, Maria Vakalopoulou, Dimitris Samaras

机构 * Stony Brook University(石溪大学) MICS, CentraleSupélec, Université Paris-Saclay(MICS,CentraleSupélec,巴黎-萨克雷大学) Argonne National Laboratory(阿贡国家实验室) University of Chicago(芝加哥大学) Archimedes/Athena RC

专题命中 预训练与数据 :pretraining(abstract)

AI总结 CDG-MAE是一种基于MAE的自监督方法,通过图像条件扩散模型生成多样化合成视图并采用多锚掩码策略,缩小了与基于视频的MAE方法的差距,同时保持仅图像MAE的数据优势。

Comments Accepted to TMLR 2026, Github link: https://github.com/cvlab-stonybrook/CDG-MAE

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07861 2026-07-31 cs.CV 版本更新 50%

From Synthetic to Real: Toward Identity-Consistent Makeup Transfer with Synthetic and Real Data

从合成到真实:迈向身份一致的化妆转移的合成与真实数据

Yue Yu, Jiayu Wang, Jiajia Shi, Zhiyu Tan, Hao Li, Jingjing Chen

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院)

专题命中 预训练与数据 :post-training(abstract)

AI总结 本文提出ConsistentBeauty和RealBeauty方法,通过合成数据筛选和强化学习提升化妆转移的逼真度与身份一致性,并建立多样化基准测试以评估模型在复杂真实场景中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09971 2026-07-30 cs.RO 版本更新 50%

TiPToP: A Modular Open-Vocabulary Robot Manipulation System That Plans

TiPToP:一种用于机器人操作的模块化开放式词汇规划系统

William Shen, Nishanth Kumar, Sahit Chintalapudi, Ryan Lindeborg, Jie Wang, Christopher Watson, Edward Hu, Jing Cao, Dinesh Jayaraman, Leslie Pack Kaelbling, Tomás Lozano-Pérez

专题命中 预训练与数据 :foundation model(abstract)

AI总结 TiPToP是一种模块化开放式词汇规划系统,结合预训练视觉模型与任务规划器,通过自然语言指令和RGB图像直接解决多步骤操作任务,实现实时高效的操作规划。

Comments Project website: https://tiptop-robot.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09708 2026-07-28 eess.AS 版本更新 50%

Adapting a Text-to-Audio Model for Room Impulse Response Generation

为房间脉冲响应生成适应文本到音频模型

Kirak Kim, Sungyoung Kim

专题命中 预训练与数据 :language model(abstract)

AI总结 本文提出利用预训练文本到音频模型生成房间脉冲响应,通过视觉语言模型提取声学描述解决数据稀缺问题,验证大规模生成音频先验在该任务中的有效性。

Comments Accepted to IWAENC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06237 2026-07-27 math.NA cs.NA 版本更新 50%

ResiPhy-MDNF: A Residual-Based Physics-Aware Multilevel Discrete Neural Field Framework for PDE-Constrained Inverse Problems

PhyRes-MDNF:用于多级离散神经场反演的物理耦合残差GNN校正

Zheng Lu, Jiwei Jia, Young Ju Lee

专题命中 预训练与数据 :pretraining(abstract)

AI总结 研究针对偏微分方程约束下细网格系数反演病态问题,提出PhyRes-MDNF框架,通过固定物理的多级离散神经场优化,在全空间达西实现中联合优化状态场与系数场,实验表明该方法提升了精度与迭代效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19315 2026-07-24 cs.CV 版本更新 50%

ERank in Latent Space as an Image-Complexity and Richness Measure

潜在空间中的有效秩作为图像复杂度和丰富度度量

Maksim Smirnov, Grigory Kononov, Anastasiia Linich, Egor Surkov, Egor Shvetsov

专题命中 预训练与数据 :pretraining(abstract)

AI总结 研究提出用图像深度特征图通道协方差的ERank衡量视觉丰富度,经单次前向传播计算得出。它能排序图像,与多种指标相关,与人类标注有一定关联。作为数据选择标准,对超分辨率、OCR等任务有不同影响,是受输入丰富度影响时有用的廉价信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13969 2026-07-24 cs.CV 版本更新 50%

SoccerSynth Field: enhancing field detection with synthetic data from virtual soccer simulator

足球合成场地:利用虚拟足球模拟器的合成数据增强场地检测

HaoBin Qin, Jiale Fang, Keisuke Fujii

机构 * Graduate School of Informatics, Nagoya University, Nagoya, Aichi, Japan(名古屋大学信息科学研究生院) RIKEN Center for Advanced Intelligence Project, Tokyo, Tokyo, Japan(理化学研究所先进情报项目中心)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 研究针对团队运动场地检测中真实数据集收集成本高、耗时的问题,提出用合成数据集(足球合成场地)预训练模型,经实验对比,该合成数据集预训练的模型在足球场检测中性能卓越,有效增强了模型鲁棒性与准确性。

Comments Accepted at ACIVS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02402 2026-07-23 cs.CV 版本更新 50%

Show Me Examples: Inferring Visual Concepts from Image Sets

展示示例:从图像集合中推断视觉概念

Nick Stracke, Kolja Bauer, Stefan Andreas Baumann, Miguel Angel Bautista, Josh Susskind, Björn Ommer

机构 * Munich Center for Machine Learning(慕尼黑机器学习中心) Apple(苹果公司)

专题命中 预训练与数据 :language model(abstract)

AI总结 提出VICIS任务评估视觉语言模型从图像集合中推断共享概念的能力,并设计训练框架与架构,使模型能提取概念嵌入并生成与查询一致的新图像。

Comments for code, view https://github.com/CompVis/set-learner

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16290 2026-07-22 cs.CV 版本更新 50%

Strength-Parity Ensembling with Parameter-Isolated Experts for Multi-Task Affect Recognition

基于参数隔离专家的强度-奇偶集成用于多任务情感识别

Tung Hung Bui, Hong Hai Nguyen, Van Thong Huynh

专题命中 预训练与数据 :pretraining(abstract)

AI总结 研究在特定规则下从单张无约束面部进行多任务情感识别问题,基于共享情感潜变量提出强度-奇偶规则,用参数隔离解决成员相关性及多样性问题,提升了系统整体验证分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25746 2026-07-22 cs.RO 版本更新 50%

TacRefineNet: Goal-Conditioned Tactile Grasp Refinement for Edge-Prominent Objects

TacRefineNet:用于边缘突出物体的目标条件触觉抓取优化

Shuaijun Wang, Haoran Zhou, Diyun Xiang, Yangwei You

机构 * Xiaomi Robotics(小米机器人)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 研究针对边缘突出物体抓取对齐难的问题,提出TacRefineNet框架,利用连体策略网络预测手腕姿态增量,经交叉组合训练,在模拟样本上训练后部署到实际五指手,实验表明其在可见物体抓取上有一定成功率及误差控制,还有长期扰动校正等特点。

Comments 9 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10879 2026-07-21 cs.RO cs.CV 版本更新 50%

3D Scene Graph Prediction: Generating Hierarchical Models from Partially Observed Environments

3D场景图预测:从部分观测环境生成层次模型

Siyi Hu, Jared Strader, Hyungtae Lim, Luca Carlone

机构 * Laboratory for Information & Decision Systems (LIDS), Massachusetts Institute of Technology(信息与决策系统实验室(LIDS),麻省理工学院) Department of Electrical and Computer Engineering, Oakland University(奥克兰大学电气与计算机工程系)

专题命中 预训练与数据 :LLM(abstract)

AI总结 针对机器人部分观测环境的场景预测问题,提出自上而下框架合成含房间层和物体层的3D场景图,用混合域图扩散模型等方法,相比其他方法对分布外部分平面图泛化性更好,能在真实场景预测。

Comments Accepted at IROS 2026. Main paper: 8 pages, 3 figures, 3 tables. Includes a supplementary appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13247 2026-07-21 cs.CV 版本更新 50%

STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits

STARCaster:用于身份和视图感知的会说话肖像的时空自回归视频扩散

Foivos Paraperas Papantoniou, Stathis Galanakis, Rolandos Alexandros Potamias, Bernhard Kainz, Stefanos Zafeiriou

机构 * Imperial College London, UK(伦敦帝国理工学院) FAU Erlangen–Nürnberg, Germany(埃朗根-纽伦堡大学)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 研究提出STARCaster模型,通过重新思考参考和几何范式,采用组合方法及解耦学习,解决语音驱动肖像动画和动态视点控制问题,能有效泛化,超越先前方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15038 2026-07-20 cs.CV 版本更新 50%

Video = World + Event Stream

视频 = 世界 + 事件流

Lianghua Huang, Zhi-Fan Wu, Yupeng Shi, Wei Wang, Mengyang Feng, Cheng Yu, Chen Liang, Junjie He, Chen-Wei Xie, Yu Liu, Jingren Zhou, Ang Wang, Bang Zhang, Baole Ai, Chongyang Zhong, Jinwei Qi, Kai Zhu, Pandeng Li, Peng Zhang, Wenyuan Zhang, Xinhua Cheng, Yitong Huang, Yun Zheng, Yuxiang Bao, Yuzheng Wang, Zhiwei Lin, Zoubin Bi

机构 * Alibaba Group(阿里巴巴集团)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 研究提出Wan-Streamer v0.3,将视频视为世界加事件流,据此有通用预训练任务,应用于实时全双工视听交互,保留v0.2运行点,为实时下游任务提供能力。

Comments website: https://wan-streamer.com/v0.3/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16348 2026-07-20 cs.SE 版本更新 50%

Prompts Blend Requirements and Solutions: From Intent to Implementation

提示融合需求与解决方案:从意图到实现

Shalini Chakraborty, Jan-Philipp Steghöfer

专题命中 预训练与数据 :prompting(abstract)

AI总结 本文提出将提示视为轻量级需求 artifacts,通过分析现有提示,提出包含功能质量、通用解决方案和具体解决方案的模型,并提出四个假设以评估提示工程的最佳实践。

Comments 12 pages, 2 figures, 3 tables. Accepted at the 20th International Symposium on Empirical Software Engineering and Measurement(ESEM 2026) Emerging Results, Vision, and Reflection Papers Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15770 2026-07-09 physics.optics cs.AR cs.CV 版本更新 50%

Physically Grounded Monocular Depth via Nanophotonic Wavefront Encoding

通过纳米光子波前编码实现物理基础的单目深度

Bingxuan Li, Jiahao Wu, Yuan Xu, Zezheng Zhu, Yunxiang Zhang, Kenneth Chen, Yanqi Liang, Nanfang Yu, Qi Sun

机构 * New York University(纽约大学) Columbia University(哥伦比亚大学)

专题命中 预训练与数据 :foundation model(abstract)

AI总结 研究旨在解决单目深度感知中度量尺度模糊问题,核心方法是用超透镜通过纳米光子学编码深度线索,结合DFMs与输入自适应策略及模拟管道,实验证明该方法有效提升单目度量深度传感精度。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30611 2026-07-08 cs.CV 版本更新 50%

Reweighting Framewise Attention in Video Transformers for Facial Expression Understanding

视频Transformer中重加权帧级注意力用于面部表情理解

Seongro Yoon, Donghyeon Cho, Jinsun Park, François Brémond

机构 * Inria, Université Côte d’Azur, France(法国国家信息与自动化研究所、法国滨海阿尔卑斯大学) Hanyang University, South Korea(韩国家阳大学) Pusan National University, South Korea(韩国釜山国立大学)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 提出MiRA框架,通过重加权帧级注意力增强ViT对细微面部动态的时空选择性,无需额外参数,在表情识别基准上持续提升性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23683 2026-07-01 cs.CV 版本更新 50%

Learning to Decipher from Pixels: A Case Study of Copiale

从像素中学习 decipher —— Copiale 的案例研究

Lei Kang, Giuseppe De Gregorio, Raphaela Heil, Alicia Fornés, Beáta Megyesi

机构 * Computer Vision Center, Universitat Autònoma de Barcelona(巴塞罗那自治大学计算机视觉中心) Department of Linguistics, Stockholm University(斯德哥尔摩大学语言系)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文提出一种端到端的 transcription-free 方法,直接将手写密码图像映射到明文。通过 Copiale 密码案例研究,首次引入文本行级数据集,结合密码图像与德文明文,展示预训练和特定密码微调提升 deciphering 准确性。

Comments The 9th International Conference on Historical Cryptology (HistoCrypt 2026), Amiens, France, June 22-24, 2026 URN: urn:nbn:se:su:diva-257058 ISBN: 9789908539997 (print) OAI: oai:DiVA.org:su-257058 DiVA, id: diva2:2075848

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09100 2026-07-01 cs.CV cs.RO 版本更新 50%

Physically Grounded 3D Generative Reconstruction under Hand Occlusion using Proprioception and Multi-Contact Touch

基于本体感知和多接触触觉的物理 grounded 的 3D 生成重建在手部遮挡下

Gabriele Mario Caddeo, Pasquale Marra, Lorenzo Natale

机构 * Istituto Italiano di Tecnologia(意大利技术研究院)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文提出了一种多模态、物理 grounded 的方法,用于在严重手部遮挡下进行度量尺度的无遮挡物体重建和姿态估计,通过本体感知和多接触触觉信号提升重建精度和物理一致性。

Comments 29 pages, 10 figures, Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02379 2026-06-29 cs.CV 版本更新 50%

Honey, I Shrunk the Arc de Triomphe!

亲爱的,我把凯旋门缩小了!

Yuanbo Xiangli, Hanyu Chen, Xueqing Tsang, Noah Snavely

机构 * Cornell University(康奈尔大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 预训练与数据 :foundation model(abstract)

AI总结 针对单目度量几何估计中的“尺度坍缩”现象,通过构建新数据集MetricScenes并采用两阶段泊松补全方法提升深度图质量,微调MoGe-2模型显著缓解了尺度低估问题。

Comments Project page: https://metricscenes.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17455 2026-06-29 cs.CV cs.RO 版本更新 50%

VLM-Guided Visual Place Recognition for Planet-Scale Geo-Localization

VLM引导的视觉地点识别用于行星级地理定位

Sania Waheed, Na Min An, Michael Milford, Sarvapali D. Ramchurn, Shoaib Ehsan

机构 * Univ. of Southampton, UK(英国南安普顿大学) KAIST, South Korea(韩国科学技术院) QUT, Australia(昆士兰科技大学) Univ. of Essex, UK(英国埃塞克斯大学)

专题命中 预训练与数据 :language model(abstract)

AI总结 提出VLM与检索式VPR结合的混合框架,利用VLM生成先验约束搜索空间,再通过检索和重排序实现行星级地理定位,在街道和城市级别分别提升4.51%和13.52%。

Journal ref Proceedings of the Australasian Conference on Robotics and Automation (ACRA 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28090 2026-06-25 cs.CV 版本更新 50%

To View Transform or Not to View Transform: NeRF-based Pre-training Perspective

视图变换还是不视图变换:基于NeRF的预训练视角

Hyeonjun Jeong, Juyeb Shin, Dongsuk Kum

机构 * KAIST(韩国科学技术院)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 提出NeRP3D检测器,避免视图变换与NeRF的冲突先验,保留预训练NeRF网络,实现连续3D表示学习,在nuScenes上提升场景重建和检测性能。

Comments The Fourteenth International Conference on Learning Representations (ICLR'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21416 2026-06-25 cs.RO 版本更新 50%

Spotlighting Task-Relevant Features: Object-Centric Representations for Better Generalization in Robotic Manipulation

聚焦任务相关特征:面向机器人操作泛化的对象中心表示

Alexandre Chapin, Bruno Machado, Emmanuel Dellandréa, Liming Chen

专题命中 预训练与数据 :pretraining(abstract)

AI总结 针对机器人操作策略泛化受视觉表示中任务无关信息干扰的问题,提出基于槽的对象中心表示(SBOCR),通过将密集特征分组为对象级实体来减少噪声,在模拟和真实实验中优于全局和密集特征表示。

详情

展开后加载摘要…

URL PDF HTML 收藏