arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 2962 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 2264 篇

2607.03580 2026-07-07 cs.LG cs.CV 新提交 70%

When Geometry Aligns: Dihedral Hidden-State Transformations in UNet, ViT, and DiT Architectures

当几何对齐时:UNet、ViT和DiT架构中的二面体隐藏状态变换

Mojtaba Faramarzi, Alex Lamb, Irina Rish

机构 * University of Montreal(蒙特利尔大学) Mila - Quebec AI Institute(米拉-魁北克人工智能研究所) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 研究通过将二面体群基于反射的元素应用于中间隐藏状态作为受控内部干预,对比几何一致和不一致变体,分析特征稳定性和几何漂移,发现一致变换可提高稳定性,为稳定隐藏状态干预确立关键原则。

Comments Accepted at the Conference on Lifelong Learning Agents (CoLLAs), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03488 2026-07-07 cs.CV 新提交 70%

Learning to Generate Multiple Objects from Dense and Occluded Layouts

从密集和遮挡布局中学习生成多个对象

Bach-Hoang Ngo, Si-Tri Ngo, Hieu Le, Trung-Nghia Le

机构 * University of Science, Ho Chi Minh City(胡志明市科学大学)

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 研究文本到图像扩散模型在密集场景中对象计数错误问题,提出布局感知注意力偏差和无模态平衡损失方法,引入基准测试,提高计数准确性并防止实例合并且保持图像质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03470 2026-07-07 cs.CV 新提交 70%

PhysMirror: Physics-Aware Mirror Object Generation

物理镜像:物理感知镜像对象生成

Xuan-Bach Mai, Duy-Phuc Nguyen, Quoc-Van Le, Tam V. Nguyen, Thanh-Toan Do, Huu Le, Duong-Van Nguyen, Minh-Triet Tran, Trung-Nghia Le

机构 * University of Science, Ho Chi Minh City(胡志明市科学大学) Vietnam National University, Ho Chi Minh City(胡志明市越南国家大学) University of Dayton(代顿大学) Monash University(莫纳什大学) VinFast(VinFast公司) VinUniversity(Vin大学)

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 针对现代文本到图像扩散模型合成物理精确镜像反射的挑战,提出物理感知生成框架PhysMirror,通过3D空间先验执行投影几何,引入评估指标,实验表明其在反射精度等方面优于基线。

Comments IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00832 2026-07-07 cs.CV cs.AI 新提交 70%

Pano2World: End-to-End 3D Generation via Unified Multi-View Sequences

Pano2World: 通过统一多视图序列进行端到端三维生成

Zhenjia Li, Jinrang Jia, Yifeng Shi

机构 * Ke Holdings Inc.(贝壳找房)

专题命中 扩散模型 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 提出Pano2World方法,利用全景扩散模型和视图感知注意力路由,从单张室内全景图直接生成可探索的三维高斯场景,解决多步管道误差累积和视频模型灵活性不足的问题。

Comments 10 pages, 3 figures, 3 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02322 2026-07-03 cs.RO cs.CV 新提交 70%

The Moving Eye: Enhancing VLA Spatial Generalization via Hybrid Dynamic Data Collection

移动之眼:通过混合动态数据收集增强VLA空间泛化能力

Jincheng Tang, Yilong Zhu, Zhengyuan Xie, Jiang-Jiang Liu, Jiaxing Zhang

机构 * Lion Rock AI Lab, China Merchants Research Institute of Advanced Technology(狮岩人工智能实验室,中国商人先进科技研究院) The Hong Kong University of Science and Technology(香港科学与技术大学) Nankai University(南开大学)

专题命中 扩散模型 :diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 针对VLA模型空间泛化脆弱性问题,提出混合动态数据策略,结合连续相机运动与多样静态视角,减少虚假相关性,提升对未见相机位姿和物体配置的泛化能力。

Comments IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02428 2026-07-03 eess.IV cs.CV physics.med-ph 新提交 70%

Self-Auditing Residual Drifting for Pathology-Preserving Accelerated Knee MRI

自审计残差漂移模型用于保留病理特征的加速膝关节MRI

Qing Lyu, Jianxu Wang, Mohammad Kawas, Ge Wang, Christopher T. Whitlow

机构 * Department of Radiology & Biomedical Imaging, Yale School of Medicine(放射学与生物医学成像系,耶鲁医学院) Department of Biomedical Engineering, Rensselaer Polytechnic Institute(生物医学工程系,伦塞拉尔理工学院)

专题命中 扩散模型 :diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 提出SA-RDM-DC模型,通过物理条件残差漂移生成和自审计机制,在加速膝关节MRI中实现高保真重建并保留病理特征,优于多种基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00428 2026-07-02 cs.CV 新提交 70%

HyFL-CLIP: Hyperbolic Fine-Tuning of CLIP for Robust Long-Context Understanding

HyFL-CLIP: 用于鲁棒长上下文理解的CLIP双曲微调

Ji Ha Jang, Hayeon Kim, Chulwon Lee, Junghun James Kim, Se Young Chun

机构 * Dept. of Electrical and Computer Engineering(电气与计算机工程系) IPAI INMC & AIIS(智能计算与人工智能研究所) Seoul National University(首尔国立大学)

专题命中 扩散模型 :diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 提出HyFL-CLIP,通过双曲空间微调CLIP,利用跨流形相似性蒸馏和爱因斯坦中点聚合建模层次蕴含关系,提升长上下文理解鲁棒性,在文本扰动下长文本跨模态检索提升高达19.5%。

Comments Accepted to ECCV 2026. Project page: https://janeyeon.github.io/hyflclip

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31326 2026-07-01 cs.CV 新提交 70%

Bridging Video Understanding and Generation in a Unified Framework

桥接视频理解与生成的统一框架

Yuqi Wang, Runyi Li, Ruoyu Feng, Renjie Chen, Wenfeng Lin, Mingyu Guo

专题命中 扩散模型 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出Vega统一框架,通过共享词汇表联合建模文本与视觉表示,结合自回归预测关键帧语义令牌与扩散模型渲染密集视频帧,在视频生成和理解基准上均取得强性能。

Comments technical blog

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25234 2026-06-25 cs.CV 新提交 70%

Structuring Sparsity: Block-Sparse Featurizers Capture Visual Concept Manifolds

结构化稀疏:块稀疏特征化器捕获视觉概念流形

Thomas Fel, Matthew Kowal, Mozes Jacobs, Dron Hazra, Usha Bhalla, Lee Sharkey, Lucius Bushnaq, Satchel Grant, Tal Haklay, Thomas Icard, Can Rager, Michael Pearce, Daniel Wurgaft, Aiden Swann, Fenil Doshi, Siddharth Boppana, Curt Tigges, Nick Cammarata, Thomas Serre, Vasudev Shyam, Owen Lewis, Thomas McGrath, Jack Merullo, Ekdeep Singh Lubana, Atticus Geiger

机构 * Goodfire Harvard University(哈佛大学) Stanford University(斯坦福大学) Brown University(布朗大学)

专题命中 扩散模型 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出块稀疏特征化器(BSF)来建模视觉概念流形,通过最小描述长度分析证明其比方向基特征化器更紧凑,并应用于解释曲线检测、发现新流形及控制图像生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24206 2026-06-24 cs.CV cs.AI 新提交 70%

Inclusive Interactive Collisions for Multi-View Consistent Compositional 3D Generation

包容性交互碰撞:多视图一致组合式3D生成

Chang Liu, Mingwen Shao, Xiang Lv, Xinyuan Chen, Lingzhuang Meng, Qiao Zhang, Zhengyi Gong, Jinghao Hu

机构 * School of Computer Science and Technology, China University of Petroleum (East China)(中国石油大学(华东)计算机科学与技术学院) Artificial Intelligence Research Institute, Shenzhen University of Advanced Technology(深圳理工大学人工智能研究院) College of Computer Science, Northwest University(西北大学计算机科学学院)

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出I2C-3D方法,通过包容性交互碰撞策略和多视图自适应分数蒸馏采样,实现多视图一致、物理合理的组合式3D场景生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21146 2026-06-23 cs.CV 新提交 70%

ChronoLock: Protecting Videos from Unauthorized Text-to-Video Personalization

ChronoLock: 保护视频免受未经授权的文本到视频个性化

Jiaming He, Jiashu Zhang, Guanyu Hou, Shuhan Ye, Hanwei Zhu, Yi Yu, Xudong Jiang

机构 * Nanyang Technological University(南洋理工大学) Jilin University(吉林大学) The University of Manchester(曼彻斯特大学)

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 针对文本到视频个性化中的未经授权微调风险,提出ChronoLock框架,通过扰动时间去噪轨迹破坏运动学习过程,有效降低运动模仿质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19676 2026-06-19 cs.CV cs.AI 新提交 70%

TeleMorpher: Toward Robust Simultaneous Motion-Location Editing

TeleMorpher: 迈向鲁棒的同步运动-位置编辑

Haengbok Chung

专题命中 扩散模型 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 提出TeleMorpher,一种基于扩散模型的一步式框架,通过运动先验、姿态扭曲和基线运动编辑器注入,实现视频中主角运动与位置的同步编辑,在定量和定性评估中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18765 2026-06-18 cs.CV 新提交 70%

SpectralDiT: Timestep-Conditioned Spectral Residual Correction for Flow-Matching DiTs

SpectralDiT:流匹配DiT的时间步条件谱残差校正

Jiayu Tian

机构 * Peking University(北京大学)

专题命中 扩散模型 :diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 提出SpectralDiT,通过时间步条件谱残差校正模块,在CIFAR-10和ImageNet-100上以极少额外计算和参数提升流匹配DiT的生成质量,FID分别降低5.1%和8.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14700 2026-06-15 cs.CV 新提交 70%

RepFusion: Leveraging Multimodal Priors for Denoising in Representation Space

RepFusion:利用多模态先验在表示空间中进行去噪

Xichen Pan, Aashu Singh, Satya Narayan Shukla, Xiangjun Fan, Shlok Kumar Mishra, Saining Xie

机构 * Meta AI New York University(纽约大学)

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出RepFusion方法,利用多模态大语言模型作为噪声表示编码器,为扩散变压器提供条件信号,在相似推理预算下优于新初始化解码器基线。

Comments Project Page: https://xichenpan.com/repfusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12213 2026-06-11 cs.CV 新提交 70%

SHERPA: Seam-aware Harmonized ERP Adaptation for Open-Domain 360$^\circ$ Panorama Generation

SHERPA: 面向开放域360°全景生成的无缝感知协调ERP适配

Jungwoon Kang, Jaehun Kim, Yiwon Yu, Hyungyum Jang, Sanghoon Lee, Jongyoo Kim

机构 * Yonsei University(延世大学)

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出SHERPA框架,通过频率选择性圆形RoPE、圆形潜编码/解码、图像侧FFN适配器和双路径训练方案,实现从平面扩散模型到360°全景的轻量级适配,支持逼真和风格化全景生成。

Comments 29 pages, 23 figures, 5 tables. Preprint version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10892 2026-06-10 cs.CV cs.AI 新提交 70%

Improving Text-Instance Alignment Of Foreground Conditioned Out-Painting Via Customized Concept Embedding

通过定制化概念嵌入改进前景条件外绘中的文本-实例对齐

Yihao Zhao, Xuan Han, Bin He, Mingyu You

机构 * College of Electronic and Information Engineering, Tongji University, Shanghai, China(电子信息工程学院,同济大学,上海,中国) State Key Laboratory of Autonomous Intelligent Unmanned Systems, Frontiers Science Center for Intelligent Autonomous Systems, Ministry of Education, Shanghai, China(自主智能无人系统国家重点实验室,智能自主系统前沿科学中心,教育部,上海,中国)

专题命中 扩散模型 :diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 针对前景条件外绘中文本驱动方法产生的伪影问题,提出定制化概念嵌入扩散框架,通过实例感知损失和语义保持提示模板定制概念嵌入,显著减少伪影并提升图像质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07145 2026-06-08 cs.CV 新提交 70%

Consistent-Inversion: Reverse Consistency Guidance for Structure-Preserving Visual Editing

Consistent-Inversion: 用于结构保持视觉编辑的反向一致性引导

Xiaocheng Lu, Jingcai Guo, Song Guo

机构 * Hong Kong University of Science and Technology(香港理工大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 扩散模型 :diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 提出Consistent-Inversion,一种无训练的反向一致性引导框架,通过检查中间目标轨迹能否在源提示下反向到源反转轨迹,并利用反向一致性差异校正早期去噪步骤,在保持结构的同时提升编辑效果。

Comments Submitted to IEEE Transactions on Multimedia; 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16143 2026-08-18 cs.GR cs.CV cs.MM cs.SD 新提交 67%

AnyTalk: Speech Animation for Arbitrary Characters Leveraging a Video Generation Model

AnyTalk:利用视频生成模型实现任意角色的语音动画

Kwan Yun, Serin Yoon, Sunjin Jung, Jung Eun Yoo, Inyup Lee, Junyong Noh

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR、cs.MM

AI总结 AnyTalk是一种无需动画数据、利用视频扩散模型的新方法,可生成任意角色的3D语音动画,还能蒸馏出实时版本,降低了人工与数据需求。

Comments accepted to TVCG, Project page at https://serin-yoon.github.io/projects/anytalk/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12416 2026-08-14 cs.RO 新提交 67%

RoboSynChallenge: Mastering Real-World Dexterity via Generalizing Synthesized Manipulation Skills

RoboSynChallenge:通过泛化合成操作技能掌握真实世界灵巧操作

Runyi Zhao, Ruixin Wu, Chengkun Li, Hongrui Zhang, Ang Li, Ruixing Jin, Yueci Deng, Yingying Guo, Lihe Ding, Shaocong Dong, Tianfan Xue, Yanjun Gao, Yudong Luo, Pascal Poupart, Simo Wu, Kui Jia, Wei-shi Zheng, Guiliang Liu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) DexForce(德克斯力公司) The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology(香港科技大学) University of Colorado Anschutz(科罗拉多大学安舒茨医学中心) Mila - Quebec AI Institute(米拉-魁北克人工智能研究所) Vector Institute(向量研究所) University of Waterloo(滑铁卢大学) Fudan University(复旦大学) Sun Yat-sen University(中山大学) Shenzhen Loop Area Institute (SLAI)(深圳环区研究所)

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 RoboSynChallenge竞赛推出统一基准,结合合成数据与真实评估,提供多类基准策略,旨在推动开发泛化性强、数据高效的机器人操作系统,助力通用机器人智能发展。

Comments NeurIPS 2026 Competition Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05970 2026-08-07 cs.RO cs.AI 新提交 67%

SkillMemo: Expert-guided Skill Memory Framework for Compositional Embodied Manipulation

SkillMemo:用于组合式具身操纵的专家引导技能记忆框架

Changyuan Wang, Chubin Zhang, Zhenyu Wu, Runhao Li, Angyuan Ma, Ke Chao, Yinan Liang, Xiuwei Xu, Ziwei Wang, Yansong Tang, Jiwen Lu

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Department of Automation, Tsinghua University(清华大学自动化系) Nanyang Technological University(南洋理工大学) Beijing Normal University(北京师范大学)

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 SkillMemo是一种专家引导的技能记忆框架,通过分解轨迹为技能基元并结合动态记忆库,提升了DP和VLA模型的组合泛化能力,在基准测试中达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03330 2026-08-05 cs.AI 新提交 67%

Long-term Traffic Scene Prediction via Polynomial Representations in Autonomous Driving

自动驾驶中基于多项式表示的长期交通场景预测

Yue Yao

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 本研究提出基于多项式表示的自动驾驶交通场景预测模型,结合理论分析与实证验证,在标准基准上接近最优准确率,提升分布偏移下的泛化能力,生成更合理的多智能体场景,降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01150 2026-08-04 cs.DC 新提交 67%

Zellige: Moldable Sequence Placement for Mixed Image-Video DiT Training

Zellige:用于混合图像-视频DiT训练的可塑序列放置

Guangyu Xiang, Xueze Kang, Minwei Zhao, Yuxin Wang, Shaohuai Shi, Lin Zhang, Xiaowen Chu

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 Zellige是一种可塑序列放置系统,通过硬件分析器、两阶段规划器和合并注意力引擎解决混合图像-视频DiT训练的GPU序列放置问题,在多GPU环境下性能优于KnapFormer。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26055 2026-07-29 cs.RO cs.AI cs.LG 新提交 67%

$π\mathbf{R}^2$: Reactive Real-time Flow Policies

$π\mathbf{R}^2$:反应式实时流策略

Sungjae Park, Shubham Tulsiani

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 扩散模型 :diffusion(abstract);inpainting(abstract)

AI总结 研究通用操作策略反应性和实时性问题,提出$\pi\mathbf{R}^2$方法,将条件分快速和慢速通道,采用延迟自适应流调度,能在保留大型主干等的同时,让策略实时反应并提高成功率。

Comments Preprint(20 pages). Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26047 2026-07-29 cs.RO 新提交 67%

S2A2: Audio-Visual Imitation Learning for Manipulation Tasks Using Acoustic Spatial Information

S2A2:利用声学空间信息进行操作任务的视听模仿学习

Kaneyoshi Hiratsuka, Benjamin Yen, Ryosuke Kojima

机构 * Kyoto University(京都大学) RIKEN(理化学研究所) Institute of Science Tokyo(东京理科大学)

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 研究利用声学信息进行操作任务的模仿学习,提出多模态框架S2A2,集成视觉与声学信息,实现多种策略集成,模拟与真实机器人实验表明其对特定任务有效且适用于现实操作。

Comments Project page: https://azuma413.github.io/projects/s2a2

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14984 2026-07-17 cs.AI 新提交 67%

Demographically-Conditioned Synthetic Medical Images for Bias Mitigation and Bias Detection in Disease Classifiers

用于减轻疾病分类器偏差和检测偏差的人口统计学条件合成医学图像

Mahmoud Ibrahim, Bart Elen, Chang Sun, Gokhan Ertaylan, Michel Dumontier

机构 * Institute of Data Science, Faculty of Science and Engineering, Maastricht University(马斯特里赫特大学科学与工程学院数据科学研究所) Department of Advanced Computing Sciences, Faculty of Science and Engineering, Maastricht University(马斯特里赫特大学科学与工程学院高级计算科学系) VITO(比利时弗拉芒技术研究所)

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 研究医学图像分类器亚组公平性审计的样本量问题,提出用人口统计学条件合成生成器减轻训练偏差、检测评估偏差。以COVID-19胸部CT分类为例,发现其在偏差减轻和检测上的作用,如预训练效果好、能再现亚组排名等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10504 2026-07-14 cs.RO 新提交 67%

SUREFlow: State-space Uncertainty-aware REsidual Flow Matching for Robust Robot Manipulation

SUREFlow:用于鲁棒机器人操作的状态空间不确定性感知残差流匹配

Md Tanvir Islam, Sai Navaneet Peddapalli, Sangmoon Lee, Sangtae Ahn

机构 * School of Electronic and Electrical Engineering, Kyungpook National University(庆尚国立大学电子与电气工程学院)

专题命中 扩散模型 :diffusion(abstract);generative vision(abstract)

AI总结 研究针对机器人操作策略在复杂条件下的不稳定性问题,提出SUREFlow框架,基于Mamba主干联合预测动作速度与残差不确定性,能选择性细化动作维度,在LIBERO等平台实验中取得良好效果,提升了机器人操作的鲁棒性与效率。

Comments Accepted at IEEE/RSJ International Conference on Intelligent Robots & Systems (IROS) 2026, Pittsburgh, PA, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08359 2026-07-10 cs.RO cs.AI 新提交 67%

FSD-VLN: Fast-Slow Dual-System Modeling for Aerial Long-Horizon Vision-Language Navigation

FSD-VLN:用于空中长距离视觉语言导航的快慢双系统建模

Xueke Zhu, Qingyan Meng, Liutao Yu, Wei Zhang, Zhengyu Ma, Huihui Zhou, Yonghong Tian

机构 * Pengcheng Laboratory(鹏城实验室) Shenzhen Institutes of Advanced Technology(中国科学院深圳先进技术研究院) Peking University(北京大学)

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 研究空中长距离视觉语言导航问题,提出FSD-VLN快慢双系统架构,将语义推理与低延迟飞行命令解耦,通过两个异步分支及时间感知自适应优化器实现,实验表明该方法提升导航成功率,减少推理延迟和运行时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07101 2026-07-09 cs.RO cs.AI 新提交 67%

GeoProp: Grounding Robot State in Vision for Generalist Manipulation

GeoProp:将机器人状态在视觉中进行定位以实现通用操作

Guoyang Zhao, Quanhao Qian, Gongjie Zhang, Wenhao Li, Jiuniu Wang, Xiaowei Lu, Deli Zhao, Ran Xu

机构 * Tongji University(同济大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) HuPan Lab(湖畔实验室) Alibaba Group(阿里巴巴集团) Nanyang Technological University(南洋理工大学)

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 研究针对机器人操作中本体感觉与视觉缺乏有效对齐问题,提出轻量级GeoProp适配器,通过几何定位、特征采样及FiLM调制等使两者对齐,在多任务中提升策略性能,是具身策略的简单高效归纳偏差。

Comments 21 pages, 8 figures, 11 tables. Project page: https://alibaba-damo-academy.github.io/GeoProp/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06963 2026-07-09 cs.CR cs.AI cs.CL 新提交 67%

Large Language Models (LLMs) and Generative AI in Cybersecurity and Privacy: A Survey of Dual-Use Risks, AI-Generated Malware, Explainability, and Defensive Strategies

大型语言模型(LLMs)和生成式人工智能在网络安全与隐私中的应用:两用风险、人工智能生成的恶意软件、可解释性及防御策略综述

Kiarash Ahi, Saeed Valizadeh

机构 * Virelya Intelligence Research Labs(Virelya智能研究实验室) Google(谷歌)

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 综述大型语言模型和生成式人工智能在网络安全中的应用,涵盖两用风险等多方面。通过回顾众多资料及实际案例研究,给出负责任部署建议与安全路线图,为应对人工智能驱动的网络安全挑战提供关键参考。

Comments Invited survey paper. 10 pages, 5 figures, 2 tables

Journal ref IEEE 6th Silicon Valley Cybersecurity Conference (SVCC), San Francisco, CA, USA, 2025, pp. 1-10

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07665 2026-07-09 cs.LG cs.NA math.NA 新提交 67%

Guidance Breaks the Fitted Operator: A Terminal-Fitted Repair for Classifier-Free Guidance

引导打破拟合算子:无分类器引导的终端拟合修复

Shiheng Zhang

机构 * University of Washington(华盛顿大学)

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 研究无分类器引导(CFG)在大引导时的问题,通过数值分析发现引导使判别子空间异常硬化致DDIM不再拟合。提出单系数零额外NFE修复方法,经实验验证该方法能稳定高引导,减少残差放大饱和,提升FID并保持精度,但也有其局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏