arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

共收录 2909
2606.05031 2026-06-04 cs.CV

MetaPoint: Unlocking Precise Spatial Control in Agentic Visual Generation

MetaPoint:在智能体视觉生成中实现精确空间控制

Dewei Zhou, Xinyu Huang, Xun Wang, Ji Xie, Yabo Zhang, Liang Li, Kunchang Li, Zongxin Yang, Yi Yang

机构 * Zhejiang University(浙江大学) ByteDance Seed(字节跳动种子) Harvard University(哈佛大学)

AI总结 提出MetaPoint方法,通过将连续2D坐标表示为单个特殊token,利用模型固有的位置编码实现像素级空间控制,无需修改架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04911 2026-06-04 cs.CV cs.CL

BreastGPT: A Multimodal Large Language Model for the Full Spectrum of Breast Cancer Clinical Routine

BreastGPT: 面向乳腺癌临床全流程的多模态大语言模型

Yang Liu, Jiajin Zhang, Danyang Tu, Yaojun Hu, Jiao Qu, Jiuyu Zhang, Yu Shi, Wei Fang, Shi Gu, Ling Zhang, Yingda Xia

机构 * DAMO Academy, Alibaba Group(阿里巴巴集团 DAMO 院) Zhejiang University(浙江大学) Hupan Lab(华潘实验室) West China Hospital(西京医院) China Medical University(中国医科大学)

AI总结 提出BreastGPT多模态大语言模型,通过构建工作流对齐的指令语料库BreastStage和双分支视觉编码器,实现乳腺癌筛查、诊断和治疗规划全流程的多模态推理,在BreastStage-Bench上取得75.66%封闭式准确率和89.92%开放式得分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04797 2026-06-04 cs.CV cs.LG

Crafting Your Evolving Dreams: Concept-Incremental Versatile Customization

打造你不断演变的梦想:概念增量式多功能定制

Jiahua Dong, Wenqi Liang, Hongliu Li, Yang Cong, Duzhen Zhang, Hanbin Zhao, Henghui Ding, Yulun Zhang, Salman Khan, Fahad Shahbaz Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed大学人工智能学院) University of Trento(特伦托大学) Department of Civil and Environmental Engineering, The Hong Kong Polytechnic University(香港理工大学土木与环境工程系) South China University of Technology(华南理工大学) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Institute of Big Data, Fudan University(复旦大学大数据研究院) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出持续可定制扩散模型(CCDM),通过属性解耦LoRA模块和相关性引导聚合策略解决灾难性遗忘,并结合可控区域上下文合成策略处理概念忽视,实现概念增量式多功能定制。

Comments Accepted to Transactions on Pattern Analysis and Machine Intelligence (TPAMI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04516 2026-06-04 cs.LG cs.AI

GeoMin: Data-Efficient Semi-Supervised RLVR via Geometric Distribution Modeling

GeoMin: 基于几何分布建模的数据高效半监督RLVR

Guangcheng Zhu, Shenzhi Yang, Haobo Wang, Xing Zheng, Yingfan MA, Xuening Feng, Zhongqi Chen, Kai Tang, Zhengqing Zang, Bowen Song, Weiqiang Wang, Gang Chen

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

AI总结 提出GeoMin方法,通过建模标注数据的全局特征分布来解码正确与错误展开的结构差异,从而建立稳健先验评估自奖励信号可靠性,以少量标注数据高效利用未标注数据,在仅用10%标注时超越全监督模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04503 2026-06-04 cs.LG cs.AI

Smart Picks in the Dark: Towards Efficient RLVR for Reasoning via Tracing Metacognitive Pivots

暗中选择:通过追踪元认知支点实现高效的推理可验证奖励强化学习

Guangcheng Zhu, Shenzhi Yang, Haobo Wang, Xing Zheng, Yingfan MA, Xuening Feng, Zhongqi Chen, Bowen Song, Weiqiang Wang, Gang Chen

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

AI总结 针对可验证奖励强化学习(RLVR)中数据效率低的问题,提出PivotTrace框架,利用注意力动态追踪推理过程中的元认知支点,通过支点密度量化不确定性实现数据自动分流,在仅使用29.3%标注样本和2.75倍收敛加速下超越全监督模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04457 2026-06-04 cs.CV

Imagine Before You Draw: Visual Prompt Engineering for Image Generation

先构思再绘制:面向图像生成的视觉提示工程

Liyu Jia, Fengda Zhang, Jiachun Pan, Kesen Zhao, Saining Zhang, Wang Lin, Weijia Wu, Yue Liao, Aojun Zhou, Hanwang Zhang

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(国立新加坡大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 提出视觉提示工程(VPE),通过在单一模型内先生成视觉语义令牌作为中间计划,再生成完整图像,从而避免信息瓶颈,提升图像生成质量与编辑保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03784 2026-06-04 cs.RO

Revisiting Embodied Chain-of-Thought for Generalizable Robot Manipulation

重新审视具身思维链以实现可泛化的机器人操作

Nan Sun, Yuan Zhang, Yongkun Yang, Wentao Zhao, Peiyan Li, Jun Guo, Wenxuan Song, Pengxiang Ding, Runze Suo, Yifei Su, Xin Xiao, Xinghang Li, Huaping Liu

机构 * Tsinghua University(清华大学) Xiaomi Robotics(小米机器人) Peking University(北京大学) CASIA HKUST(GZ)(香港科技大学(广州)) Zhejiang University(浙江大学) Fudan University(复旦大学) Wuhan University(武汉大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 本文通过构建最大规模具身思维链语料库,提出ERVLA模型,利用思维链作为表征塑造监督而非测试时推理,显著提升了机器人操作的可泛化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09242 2026-06-04 cs.CV

When Detectors Forget Forensics: Blocking Semantic Shortcuts for Generalizable AI-Generated Image Detection

当检测器遗忘取证:阻断语义捷径以实现可泛化的AI生成图像检测

Chao Shuai, Shaojing Fan, Chenlin Zou, Bin Gong, Weichen Lian, Xiuli Bi, Zhenguang Liu, Zhongjie Ba, Kui Ren

机构 * State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) National University of Singapore(新加坡国立大学) Chongqing University of Posts and Telecommunications(重庆邮电大学)

AI总结 本文提出几何语义解耦(GSD)框架,通过抑制语义主导方向来促进不变取证表征,从而解决预训练视觉基础模型在AI生成图像检测中因语义回退导致的泛化不足问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
1902.09135 2026-06-04 math.NA cs.CV cs.NA eess.IV

A Dual Symmetric Gauss-Seidel Alternating Direction Method of Multipliers for Hyperspectral Sparse Unmixing

一种双对称Gauss-Seidel交替方向乘子法用于超光谱稀疏解混

Longfei Ren, Chengjing Wang, Peipei Tang, Zheng Ma

机构 * School of Information Science and technology, and the Provincial Key Lab of Information Coding and Trans- mission, Southwest Jiaotong University(信息科学与技术学院,信息编码与传输省重点实验室,西南交通大学) School of Mathematics, Southwest Jiaotong University(数学学院,西南交通大学) School of Computer and Computing Science, Zhejiang University City College(计算机与计算科学学院,浙江大学城市学院)

AI总结 本文提出了一种高效的双对称Gauss-Seidel交替方向乘子法(sGS-ADMM)用于带有总变分正则化的超光谱稀疏解混,解决了传统ADMM在计算效率和收敛性方面的不足,并通过实验验证了该方法在解混效率和图像质量上的优越性。

Comments 30 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1903.00182 2026-06-04 eess.SY cs.DC cs.LG cs.SY

Distributed Variational Bayesian Algorithms for Extended Object Tracking

分布式变分贝叶斯算法用于扩展目标跟踪

Junhao Hua, Chunguang Li

机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院)

AI总结 本文研究了分布式扩展目标跟踪问题,提出了一种基于变分贝叶斯方法的集中算法,并扩展到分布式场景,通过交替方向乘子法技术,同时估计扩展目标状态和测量噪声协方差。

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1809.03343 2026-06-04 eess.SY cs.LG cs.SY stat.ML

Distributed dynamic modeling and monitoring for large-scale industrial processes under closed-loop control

分布式动态建模与监控用于闭环控制下的大规模工业过程

Wenqing Li, Chunhui Zhao, Biao Huang

机构 * State Key Laboratory of Industrial Control Technology, College of Control Science and Engineering, Zhejiang University(工业控制技术国家重点实验室,控制科学与工程学院,浙江大学) Hubei Key Laboratory of Advanced Control and Intelligent Automation for Complex Systems(复杂系统先进控制与智能自动化湖北省重点实验室) Department of Chemical and Materials Engineering, University of Alberta(阿尔伯塔大学化学与材料工程系)

AI总结 本文提出一种分布式监控方法,结合静态和动态特性,区分真实故障与操作条件变化,通过稀疏慢特征分析算法分解过程并建立模型,验证方法有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03116 2026-06-03 eess.AS cs.AI cs.SD

AnyAudio-Judge: A Dynamic Rubric-Based Benchmark and Evaluator for Audio Instruction Following

AnyAudio-Judge:基于动态评分标准的音频指令跟随基准与评估器

Haitao Li, Tian Tan, Yuguang Yang, Shan Yang, Xie Chen

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) Tencent Hunyuan(腾讯文脉)

AI总结 针对指令引导音频生成中复杂指令解耦困难、评估缺乏可解释性和细粒度属性匹配的问题,提出基于动态评分标准的评估范式,通过自适应分解音频描述为可验证的二元评分项,并构建包含7920个样本的双语基准和105K训练语料,结合SFT与GRPO训练专用评估器,在零样本对齐检测和下游强化学习指令对齐中取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03906 2026-06-03 cs.AI

scTranslation: A Comprehensive Benchmark for Single-Cell Multi-Omics Modality Translation

scTranslation:单细胞多组学模态翻译的综合基准

Jiabei Cheng, Jingbo Zhou, Jun Xia, Changkai Li, Zhen Lei, Chang Yu, Stan Z. Li

机构 * Westlake University(西湖大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Xidian University(西安电子科技大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 针对单细胞多组学模态翻译任务,提出了包含多样化数据集、先进模型和全面评估指标的综合基准scTranslation,并系统研究了特征选择、特征质量和少样本设置等影响因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03682 2026-06-03 cs.RO

GN0: Toward a Unified Paradigm for Generation, Evaluation, and Policy Learning in Visual-Language Navigation

GN0:迈向视觉语言导航中生成、评估与策略学习的统一范式

Xinhai Li, Xiaotao Zhang, Yuehao Huang, Jiankun Dong, Tianhang Wang, Sunyao Zhou, Yunzi Wu, Chengnuo Sun, Yunfei Ge, Qizhen Weng, Chi Zhang, Chenjia Bai, Xuelong Li

机构 * Institute of Artificial Intelligence, China Telecom(人工智能研究院,中国电信) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Tongji University(同济大学) Fudan University(复旦大学) Jiangsu University(江苏大学)

AI总结 提出GN0统一框架,通过自动生成大规模导航数据集GN-Matrix、基于3DGS的高保真仿真平台和BEV基准GN-Bench,结合RL驱动的导航基础模型BAE,在VLN任务上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03601 2026-06-03 cs.SE cs.AI

DDOR: Delta Debugging for Explainable Overrefusal Testing and Repair

DDOR: 用于可解释过度拒绝测试与修复的Delta调试方法

Qinyan Zhou, Peixin Zhang, Jun Sun, Haonan Zhang, Dongxia Wang

机构 * Southeast University(东南大学) Singapore Management University(新加坡管理学院) Zhejiang University(浙江大学) Huzhou Institute of Industrial Control Technology(湖州工业控制技术研究所)

AI总结 提出DDOR框架,通过delta调试定位最小拒绝触发片段(mRTF),实现黑盒环境下大语言模型过度拒绝行为的自动化测试与修复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03577 2026-06-03 cs.CV

Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching

通过宽基线匹配激发多模态大语言模型中的复杂空间推理

Hao Zhong, Muzhi Zhu, Shenyan Zeng, Anzhou Li, Cong Chen, Hua Geng, Duochao Shi, Wentao Ye, Tao Lin, Hao Chen, Chunhua Shen

机构 * State Key Laboratory of CAD & CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) Ant Group(蚂蚁集团) Westlake University(西湖大学)

AI总结 本文提出ReasonMatch-Bench基准和动态对应强化学习(DCRL)方法,以系统评估和提升多模态大语言模型在宽基线匹配任务中的空间推理能力。

Comments CVPR 2026. Project page: https://aim-uofa.github.io/reasonmatch/ Code: https://github.com/aim-uofa/ReasonMatch

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03418 2026-06-03 cs.CV

IDO: Incongruity-aware Distribution Optimization for Multimodal Fake News Detection

IDO: 面向多模态假新闻检测的不一致性感知分布优化

Hengyang Zhou, Rongman Hong, Yuxuan Zhou, Jing Wang, Zhaoyan Pan

机构 * Nanjing University(南京大学) University of Birmingham(伯明翰大学) East China Normal University(华东师范大学) Zhejiang University(浙江大学)

AI总结 提出不一致性感知分布优化(IDO)方法,通过事实不一致性和模态不一致性建模,提升多模态假新闻检测性能。

Comments Accept by GlobalSouthML@ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03240 2026-06-03 cs.RO

GeoAlign: Beyond Semantics with State-Guided Spatial Alignment in VLA Models

GeoAlign: VLA模型中的状态引导空间对齐超越语义

Yizhi Chen, Zhanxiang Cao, Xinyi Peng, Yixiao Zheng, Xiaxi Si, Yiheng Li, Liyun Yan, Keqi Zhu, Xueyun Chen, Shengcheng Fu, Tianyue Zhan, Yufei Jia, Jinming Yao, Yan Xie, Kun Wang, Cewu Lu, Yue Gao

机构 * Tongji University(同济大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Jingdezhen Ceramic University(景德镇陶瓷大学) Tsinghua University(清华大学) HONOR(HONOR公司) University of Science and Technology of China(中国科学技术大学)

AI总结 提出GeoAlign架构,通过RGB几何分支的后训练和机器人本体状态引导的几何特征查询,实现几何感知的空间对齐和动态可供性选择,在多个基准上取得高性能。

Comments 20 pages, 9 figures, 8 tables, including appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03216 2026-06-03 cs.CV

Follow-Your-Preference++: Rethinking Preference Alignment for Image Inpainting

Follow-Your-Preference++:重新思考图像修复中的偏好对齐

Junkun Yuan, Yutao Shen, Toru Aonishi, Hideki Nakayama, Yue Ma

机构 * Zhejiang University(浙江大学) The University of Tokyo(东京大学) Tsinghua University(清华大学)

AI总结 本文从基本原理出发,通过直接偏好优化框架和公开奖励模型构建偏好数据,系统研究了图像修复中的偏好对齐问题,发现奖励模型存在偏差但可通过集成缓解,并在标准指标、大视觉语言模型评估和人类评估上显著超越先前最先进模型。

Comments 23 pages, 14 figures. arXiv admin note: substantial text overlap with arXiv:2509.23082

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03168 2026-06-03 cs.CV

JAVEDIT: Joint Audio-Visual Instruction-Guided Video Editing with Agentic Data Curation

JAVEDIT: 联合音频-视觉指令引导视频编辑与智能体数据策展

Yinan Chen, Chuming Lin, Zhennan Chen, Yuxiang Zeng, Junwei Zhu, Yali Bi, Xijie Huang, Chengming Xu, Donghao Luo, Zhucun Xue, Xiaobin Hu, Chengjie Wang, Yong Liu, Jiangning Zhang, Shuicheng Yan

机构 * Zhejiang University(浙江大学) Tencent Youtu Lab(腾讯优图实验室) Nanjing University(南京大学) University of Auckland(奥克兰大学) Fudan University(复旦大学) National University of Singapore(新加坡国立大学)

AI总结 针对联合音频-视觉编辑缺乏数据集和基准的问题,提出首个大规模高质量数据集JAVEdit-100k、基准JAVEditBench以及基线模型JAVEdit,在六项指标中五项超越所有基线。

Comments Equal contributions from first two authors. Project page: https://ryanchenyn.github.io/projects/JAVEdit Code: https://github.com/RyanChenYN/JAVEdit Dataset: https://huggingface.co/datasets/Coraxor/JAVEdit-100k

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03127 2026-06-03 cs.RO

TTT-VLA: Test-Time Latent Prompt Optimization for Vision-Language-Action Models

TTT-VLA:面向视觉-语言-动作模型的测试时潜在提示优化

Wenbo Zhang, Jianxiong Li, Shuai Yang, Sijin Chen, Jiajun Liu, Lingqiao Liu, Xiao Ma

机构 * ByteDance Seed(字节跳动种子) The University of Adelaide(阿德莱德大学) Tsinghua University(清华大学) Zhejiang University(浙江大学) The University of Hong Kong(香港大学) CSIRO Data61

AI总结 提出TTT-VLA框架,通过测试时优化潜在提示来适应分布偏移,无需修改策略本身,在SimperEnv上提升单/多实体任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03103 2026-06-03 cs.AI

DeskCraft: Benchmarking Desktop Agents on Professional Workflows and Human-in-the-Loop Collaboration

DeskCraft: 桌面代理在专业工作流与人在环协作中的基准测试

Wenkai Wang, Tao Xiong, Jingchen Ni, Yunpeng Bao, Xiyun Li, Tianqi Liu, Hongcan Guo, Zilong Huang, Shengyu Zhang

机构 * Zhejiang University(浙江大学) Tsinghua University(清华大学) Tencent(腾讯) The University of Hong Kong(香港大学)

AI总结 提出DeskCraft基准,针对专业创意软件中的长周期工作流和主动人机协作,通过多级难度分类和交互协议评估18种代理,发现GPT-5.4在标准任务上达31.6%,交互任务上达27.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03074 2026-06-03 cs.LG cs.SY eess.SY

RMPrior: Bridging Propagation Priors and Diffusion Refinement for Efficient Radio Map Construction

RMPrior: 融合传播先验与扩散精炼的高效无线电地图构建

Zixuan Guo, Xiucheng Wang, Nan Cheng

机构 * Zhejiang University(浙江大学)

AI总结 提出一种中起点采样策略,通过将传播先验扰动至中间扩散时间步,仅执行剩余反向步骤,在加速2.01倍的同时提升重建质量,并理论分析了初始化差距的上界及截断条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02753 2026-06-03 cs.CV cs.AI

MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data

MetaWorld: 从单视角视频数据扩展多智能体视频世界模型

Teng Hu, Mingchun Lu, Yating Wang, Jiangning Zhang, Jinkun Hao, Ye Pan, Ran Yi, Lizhuang Ma, Dacheng Tao

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学)

AI总结 提出MetaWorld框架,通过单目世界状态展开、主体感知世界生成器和世界状态对齐机制,从单视角视频构建多智能体视频世界模型,解决数据稀缺和世界状态对齐问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02132 2026-06-03 cs.AI

Learning When Not to Act: Mitigating Tool Abuse in Agentic Reinforcement Learning

学习何时不行动:缓解智能体强化学习中的工具滥用

Liuji Chen, Dianxing Tang, Xing Shi, Dingshuo Chen, Qiang Liu, Shu Wu, Liang Wang

机构 * NLPR, Institute of Automation, Chinese Academy of Sciences(NLPR,自动化研究所,中国科学院) ByteDance(字节跳动) Zhejiang University(浙江大学)

AI总结 提出EAPO框架,通过引入无工具轨迹、难度感知奖励塑造和置信度感知令牌重加权,在数学和知识密集型推理任务中减少工具滥用,同时提升准确率-效率权衡。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02090 2026-06-03 cs.CV

FocusDiT: Masking Queries in Diffusion Transformers for Fine-grained Image Generation

FocusDiT: 扩散Transformer中的查询掩码用于细粒度图像生成

Xueji Fang, Liyuan Ma, Jianhao Zeng, Jinjin Cao, Mingyuan Zhou, Guo-Jun Qi

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学)

AI总结 提出FocusDiT方法,通过掩码关键查询令牌仅输入FFN层,增强细粒度视觉生成,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01767 2026-06-03 cs.AI

EvoBrain: Continual Learning of EEG Foundation Models Across Heterogeneous BCI Tasks

EvoBrain: 面向异构BCI任务的EEG基础模型的持续学习

Yangxuan Zhou, Sha Zhao, Jiquan Wang, Shijian Li, Gang Pan

机构 * State Key Laboratory of Brain-machine Intelligence and College of Computer Science and Technology, Zhejiang University(脑机智能国家重点实验室和浙江大学计算机科学与技术学院) MOE Frontier Science Center for Brain Science and Brain-Machine Integration, Zhejiang University(教育部脑科学与脑机集成前沿科学中心,浙江大学)

AI总结 提出EvoBrain框架,通过神经频谱任务归一化和响应亲和蒸馏,解决EEG基础模型在异构BCI任务中的持续学习问题,实现跨任务知识迁移和遗忘缓解。

Comments 18 pages,12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00542 2026-06-03 cs.LG

Rethinking Bregman Divergences in Kronecker-Factored Optimizers

重新思考Kronecker因子优化器中的Bregman散度

Bing Liu, Wenjie Zhou, Chengcheng Zhao

机构 * College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全国家重点实验室,计算技术研究所)

AI总结 本文通过协方差矩阵谱分析,研究了不同Bregman散度(Frobenius、von Neumann、LogDet)在Kronecker近似误差分配中的角色,并提出一种子空间感知的Kronecker优化器,在顶部子空间应用基于特征值的预处理,在底部子空间使用自适应各向同性加速常数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29663 2026-06-03 cs.RO

EXACT-MPPI: Exact Signed-Distance Navigation for Arbitrary-Footprint Robots from Point Clouds via Path Integral Control

EXACT-MPPI:通过路径积分控制实现点云中任意足迹机器人的精确有符号距离导航

Chen Peng, Zhikang Ge, Wenwu Lu, Haiming Gao, Stavros Vougioukas, Peng Wei

机构 * ZJU-Hangzhou Global Scientific and Technological Innovation Center, Zhejiang University, Hangzhou, China(浙江大学杭州全球科技创新中心) College of Biosystems Engineering and Food Science, Zhejiang University, Hangzhou, China(浙江大学生物系统工程与食品科学学院) Department of Biological and Agricultural Engineering, University of California, Davis, Davis, California, USA(加州大学戴维斯分校生物与农业工程系)

AI总结 提出EXACT-MPPI框架,将解析精确有符号距离评估器嵌入模型预测路径积分控制器,无需中间地图表示,直接处理点云实现任意形状足迹机器人的安全导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29661 2026-06-03 cs.CV

Geometry-Guided Modeling of Foundation Features Enables Generalizable Object Shape Deformation Learning

几何引导的基础特征建模实现可泛化的物体形状变形学习

Yiyao Ma, Kai Chen, Zhongxiang Zhou, Zhuheng Song, Dongsheng Xie, Zelong Tan, Rong Xiong, Qi Dou

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong, Hong Kong SAR, China(香港中文大学计算机科学与工程系) Zhejiang Innovation Center for Humanoid Robotics, Ningbo, China(浙江省人形机器人创新中心) State Key Laboratory of Industrial Control and Technology, Zhejiang University, Hangzhou, China(浙江省工业控制技术重点实验室)

AI总结 提出一种几何引导的特征建模机制和视图自适应特征聚合模块,通过变形类别级形状模板实现单目3D形状恢复,在形状变化和视角多样性上显著优于现有方法。

Comments 20 pages, 12 figures, accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏