arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

共收录 3015
2608.06768 2026-08-10 cs.CV 新提交

Explore or Converge? Stage-Guided Per-Step Optimization for Diffusion Models

探索还是收敛?面向扩散模型的阶段引导式逐步优化方法

Renye Yan, Jikang Cheng, You Wu, Wei Peng, Zongwei Wang, Ling Liang, Yimao Cai

机构 * Peking University(北京大学) Nanjing University(南京大学) Stanford University(斯坦福大学)

AI总结 针对扩散模型RL偏好对齐的奖励不匹配问题,提出SGPO方法,通过分阶段分配目标,使生成质量提升26.7%、收敛速度提高36.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06745 2026-08-10 cs.AI 新提交

MemPrism: Task-Conditioned Relational Memory Views for Long-Horizon Agents

MemPrism:面向长程智能体的任务条件关系记忆视图

Zhisheng Chen, Bingfan Zeng, Bangde Cao, Zhengwei Xie, Yuxuan Li, Jinhan Li, Zheng Lu, Xiangchen Guan, Zikai Xiao, Rui Qian, Jingwei Song

机构 * Nanyang Technological University(南洋理工大学) South China University of Technology(华南理工大学) Beijing University of Posts and Telecommunications(北京邮电大学) University of Science and Technology of China(中国科学技术大学) Peking University(北京大学) Zhejiang University(浙江大学) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 该研究针对长程智能体记忆系统的表示不匹配问题,提出MemPrism任务条件关系记忆框架,经实验验证可提升长程任务性能、减少记忆消耗且视图策略可跨VLM迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06404 2026-08-10 cs.CV cs.LG 新提交

UAV3DCrop: Benchmarking 3D Reconstruction in Repeated Multi-Angle UAV Crop Surveys

UAV3DCrop:面向重复多视角无人机作物调查的三维重建基准测试

Junxiong Zhou, Xuechen Li, Chonghao Qiu, Lang Qiao, Xiaowei Jia, Qi Yang, Chishan Zhang, Leikun Yin, Nanshan You, Vipin Kumar, David Mulla, Ce Yang, Zhenong Jin, Licheng Liu

机构 * University of Minnesota, Twin Cities(明尼苏达大学双城校区) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of Pittsburgh(匹兹堡大学) Max Planck Institute for Biogeochemistry(马克斯·普朗克生物地球化学研究所) Boston University(波士顿大学) Peking University(北京大学)

AI总结 本文提出UAV3DCrop基准,评估NeRF、3DGS等场景优化方法及预训练前馈模型在作物三维重建任务的表现,发现无单一方法适配所有农艺需求,仅一种前馈模型可恢复可用度量尺度。

Comments 22 pages, 7 figures. Dataset and project page: https://link-dev.github.io/UAV3DCrop/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04111 2026-08-10 cs.CV cs.CL cs.LO 版本更新

GEB-Bench: Abstract Structures Told in Many Voices

GEB-Bench:多视角呈现的抽象结构

Tong Zhang, Zhiyuan Shi, Yun Peng, Tao Xie

机构 * Fudan University(复旦大学) Peking University(北京大学)

AI总结 本研究推出GEB-Bench基准,评估12种模型发现其在结构识别与跨视角映射间存在差距,仅前沿模型能缩小该差距,且表面复杂性会增加模型负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25001 2026-08-10 cs.LG 版本更新

Mitigating Gradient Pathology in PINNs through Aligned Constraint

通过对齐约束缓解PINN中的梯度病理

Yichen Luo, Peiyu Zhu, Dongxiao Hu, Jia Wang, Tailin Wu, Dapeng Lan, Yu Liu, Zhibo Pang

机构 * Department of Information Science and Engineering, KTH Royal Institute of Technology, Stockholm, Sweden(信息科学与工程系,皇家理工学院,斯德哥尔摩,瑞典) School of Advanced Manufacturing and Robotics, Peking University, Beijing, China(先进制造与机器人学院,北京大学,北京,中国) School of Advanced Technology, Xi’an Jiaotong-Liverpool University, Suzhou, China(先进技术学院,西安交通大学利物浦大学,苏州,中国) Department of AI, School of Engineering, Westlake University, Hangzhou, China(人工智能系,工程学院,西湖大学,杭州,中国)

AI总结 针对物理信息神经网络训练中梯度冲突导致的局部最优问题,提出约束对齐损失与流形提升方法,通过重新表述零阶项为对齐约束并引入延迟因子,显著提升数值稳定性和效率。

Comments Accepted by ICML 2026

Journal ref Forty-Third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07327 2026-08-10 cs.CV 版本更新

Teacher-Feature Drifting: One-Step Diffusion Distillation with Pretrained Diffusion Representations

教师特征漂移:基于预训练扩散表示的一步扩散蒸馏

Yuan Zhang, Chenyi Li, Haodong Yu, Guoqing Ma, Jiajun Zha, Yuanming Yang, Bo Wang, Wei Tang, Wenbo Li, Haoyang Huang, Nan Duan

机构 * JD Explore Academy(京东探索研究院) Peking University(北京大学) Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科技大学) Beijing Institute of Technology(北京理工大学)

AI总结 本文提出通过单步扩散蒸馏简化模型,利用预训练扩散教师自身的特征空间,无需额外网络即可实现语义特征几何的漂移,同时引入轻量模式覆盖损失以提升生成质量和多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17889 2026-08-10 cs.CV 版本更新

Identity as Presence: Towards Appearance and Voice Personalized Joint Audio-Video Generation

身份作为存在:迈向基于外观和声音的联合音频视频生成

Qin Chen, Yingjie Chen, Shilun Lin, Cai Xing, Binxin Yang, Long Zhou, Qixin Yan, Wenjing Wang, Dingming Liu, Hao Liu, Chen Li, Jing Lyu

机构 * Tencent Inc.(腾讯公司) Peking University(北京大学)

AI总结 本文提出一个统一的框架,实现身份感知的音频视频生成,通过数据整理管道和灵活的身份注入机制,提升生成内容的高保真度和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06769 2026-08-10 cs.CV cs.AI

Stitch and Tell: A Structured Multimodal Data Augmentation Method for Spatial Understanding

拼接与讲述:一种结构化多模态数据增强方法用于空间理解

Hang Yin, Xiaomin He, PeiWen Yuan, Yiwei Li, Jiayi Shi, Wenxiao Fan, Shaoxiong Feng, Kan Li

机构 * School of Computer Science, Beijing Institute of Technology(北京理工大学计算机科学学院) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) Xiaohongshu Inc(小红书公司)

AI总结 Stitch and Tell通过结构化空间监督提升视觉-语言模型的空间理解能力,有效缓解空间幻觉并提高相关任务性能。

Journal ref Advances in Neural Information Processing Systems 38 (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06183 2026-08-07 cs.AI 新提交

MicroEvo: Knowledge-Guided LLM Sampling for Efficient Microarchitecture Design Space Exploration

MicroEvo:知识引导的大语言模型采样用于高效微架构设计空间探索

Jia Xiong, Runkai Li, Chenxu Niu, Guangyuan Gao, Changwen Xing, Yifan Zhang, Xinlai Wan, Jieran Cui, Chen Bai, Yusheng Hua, Ying Wang, Ming Ling, Xi Wang, Tao Xie

机构 * Southeast University(东南大学) National Center of Technology Innovation for EDA(国家EDA技术创新中心) NVIDIA Corporation(英伟达公司) Fudan University(复旦大学) Nanjing University of Posts and Telecommunications(南京邮电大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Peking University(北京大学)

AI总结 MicroEvo是结合LLM与MCTS的知识引导框架,用于多目标微架构优化,可提升帕累托前沿质量与搜索效率,具备工业级可扩展性。

Comments Accepted by ICCAD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05611 2026-08-07 cs.CL cs.LG 新提交

FOCUS: Decoupling Expert Personas in LLMs to Enhance Domain Expert Capabilities

FOCUS:解耦大语言模型中的专家角色以提升领域专家能力

Guanyu Wang, Zidi Zhang, Xu Chu

机构 * Peking University(北京大学) The University of Sydney(悉尼大学)

AI总结 FOCUS通过正交分解解耦LLMs的专家角色,结合专家门控模块与两阶段训练策略,在多领域基准上提升了角色控制的任务准确率,性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08894 2026-08-07 cs.NE cs.AI cs.CV 版本更新

Ge$^\text{2}$mS-T: Multi-Dimensional Grouping for Ultra-High Energy Efficiency in Spiking Transformer

Ge$^\text{2}$mS-T:多维分组以实现脉冲变换器中超高能效

Zecheng Hao, Shenghao Xie, Kang Chen, Wenxuan Liu, Zhaofei Yu, Tiejun Huang

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) State Key Laboratory for Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室) Academy for Advanced Interdisciplinary Studies, Peking University(北京大学前沿交叉学科研究院) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)

AI总结 本文提出Ge$^\text{2}$mS-T架构,通过多维分组计算提升Spiking Vision Transformers的能效,解决内存、精度与能耗的平衡问题。

Comments Accepted to ACM MM 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12226 2026-08-07 cs.CV 版本更新

Ultrasound Tomography of Musculoskeletal Tissues with Generative Neural Physics

生成式神经物理实现组织力学的定量体积超声成像

Zhijun Zeng, Youjia Zheng, Chang Su, Qianhang Wu, Hao Hu, Zeyuan Dong, Yang Lv, Ligang Cui, Zhiyong Hou, Weijun Lin, Zuoqiang Shi, Yubing Li, He Sun

机构 * College of Future Technology, Peking University(未来技术学院,北京大学) National Biomedical Imaging Center, Peking University(北京大学国家生物医学成像中心) Department of Mathematical Sciences, Tsinghua University(清华大学数学科学系) School of Physical Sciences, University of Chinese Academy of Sciences(中国科学院大学物理科学学院) School of EECE, University of Chinese Academy of Sciences(中国科学院大学电子工程与计算机科学学院) Department of Orthopedics, Peking University Third Hospital(北京大学第三医院骨科部) Department of Ultrasound, Peking University Third Hospital(北京大学第三医院超声科) Department of Orthopaedic Surgery, The Third Hospital of Hebei Medical University(河北医科大学第三医院骨科部) Yau Mathematical Sciences Center, Tsinghua University(清华大学姚期智数学科学中心) Yanqi Lake Beijing Institute of Mathematical Sciences and Applications(北京燕琦湖数学科学与应用研究院)

AI总结 该研究提出生成式神经物理框架,结合生成网络与物理信息神经模拟,实现了快速高保真三维超声断层成像,可在十分钟内重建组织参数三维图谱,分辨率媲美MRI,推动定量超声断层成像用于肌肉骨骼成像的临床应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03556 2026-08-07 cs.CV cs.RO 版本更新

Afford-X: Generalizable and Slim Affordance Reasoning for Task-oriented Manipulation

Afford-X:面向任务型操作的通用且轻量化的可供性推理模型

Xiaomeng Zhu, Yuyang Li, Leiyao Cui, Pengfei Li, Huan-ang Gao, Yixin Zhu, Hao Zhao

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Department of Computer Science and Engineering, Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系) Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) Institute for Al Industry Research, Tsinghua University(清华大学人工智能产业研究院) Department of Computer Science, Tsinghua University(清华大学计算机科学系)

AI总结 研究人员推出LVIS-Aff数据集,开发了Afford-X可供性推理模型,其性能优于现有非LLM方法和此前会议论文结果,参数紧凑、推理速度快,可部署于本地设备助力机器人任务导向型操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05049 2026-08-06 cs.CV 新提交

OmniEdit-Bench: A Comprehensive Benchmark for Instruction-based Video Editing

OmniEdit-Bench:基于指令的视频编辑综合基准

Chenxuan Miao, Yutong Feng, Yi Lu, Yunfeng Yan, Donglian Qi, Shiwei Zhang, Yu Liu, Xi Chen, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学) Peking University(北京大学)

AI总结 针对现有基于指令的视频编辑基准的任务覆盖有限、指标不足的问题,OmniEdit-Bench将编辑任务分解为多维度并提出含惩罚机制的评估框架,实验显示当前IVE模型仍待提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04701 2026-08-06 cs.CV 新提交

UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models

UniWorld-View:基于视频扩散模型的大基线视图合成

Haiyang Zhou, Wangbo Yu, Chaoran Feng, Xunyu Zhou, Yonghong Tian, Li Yuan

机构 * Peking University(北京大学) Rabbitpre AI

AI总结 UniWorld-View 是结合显式 3D 指导与视频扩散建模的统一框架,可从单目输入实现可控大基线新视图合成,在基准测试中展现出优异的可控性、几何一致性与视觉保真度。

Comments Project Homepage: https://zhouhyocean.github.io/uniworld-view/ Code: https://github.com/PKU-YuanGroup/UniWorld-View

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04351 2026-08-06 cs.SD cs.AI 新提交

HyPASE: Hyperbolic Geometry for Parameter-Efficient Speech Emotion Fine-Tuning Framework for Large Audio-Language Models

HyPASE:用于大音频语言模型的参数高效语音情感微调框架的双曲几何方法

Tian Jin, Ruikang Zhang, Zefeng Zhao, Ding Luo, Jin Zeng

机构 * Tongji University(同济大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Peking University(北京大学)

AI总结 本文提出HyPASE双曲PEFT框架,利用庞加莱球模型及HGA、EMCA组件,在MELD、IEMOCAP等数据集上优于欧氏PEFT基线,实现高效的大音频语言模型语音情感微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01953 2026-08-06 cs.CL cs.LG 版本更新

Look Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy Distillation

蒸馏前先前瞻:智能体策略内蒸馏中教师指导的未来轨迹验证

Chishui Chen, Yaoyou Fan, Te Sun, Yi Yang, Chenghao Sun, Delin Mao, Hongbo Qiao, Zuowei Zhang, Junxi Wang, Chenxing Sun, Yangen Hu, Lu Pan, Xuyang Liu, Linfeng Zhang

机构 * Meituan LongCat Interaction(美团龙猫交互) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Peking University(北京大学) Nanjing University(南京大学) University of Chinese Academy of Sciences(中国科学院大学) Jilin University(吉林大学) University of Science and Technology of China(中国科学技术大学) The Hong Kong Polytechnic University(香港理工大学)

AI总结 该研究针对策略内蒸馏的学生轨迹偏差问题,提出FutureBridge-OPD方法,在多任务基准上显著优于现有方法,代码公开可用。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21105 2026-08-06 cs.CV 版本更新

HalluScope: Fine-grained Hallucination Diagnosis for Multimodal Large Language Models

HalluScope:多模态大语言模型的细粒度幻觉诊断

Weilin Jin, Mingyu Wang, Wenbo Li, Haoyang Huang, Yifan Wu, Ying Li, Gang Huang, Zhonghai Wu

机构 * Peking University(北京大学) Joy Future Academy(京东探索研究院)

AI总结 研究针对多模态大语言模型的幻觉问题,提出细粒度幻觉诊断任务,开发数据集并设计奖励函数,训练HalluScope-4B和HalluScope-8B模型,在多个基准测试中达最优,其诊断解释能有效指导目标模型纠正幻觉。

Comments Accepted to ACM Multimedia 2026 (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02778 2026-08-06 cs.CL 版本更新

When Modalities Remember: Continual Learning for Multimodal Knowledge Graphs

当模态记住:多模态知识图谱的持续学习

Linyu Li, Zhi Jin, Yichi Zhang, Dongming Jin, Yuanpeng He, Haoran Duan, Gadeng Luosang, Nyima Tashi

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) School of Computer Science, Zhejiang University(浙江大学计算机科学学院) School of Cyber Science and Engineering, Wuhan University(武汉大学网络科学与工程学院) School of Information Science and Technology, Tibet University(西藏大学信息科学与技术学院)

AI总结 本文提出MRCKG模型,通过多模态-结构协同课程和跨模态知识保存机制,解决多模态知识图谱的持续学习问题,提升新知识学习能力。

Comments Accepted at the 34th ACM International Conference on Multimedia (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01693 2026-08-06 cs.CV 版本更新

From Understanding to Erasing: Towards Complete and Stable Video Object Removal

从理解到擦除:迈向完全且稳定的视频对象移除

Dingming Liu, Wenjing Wang, Chen Li, Jing Lyu, Haotian Dong

机构 * Peking University(北京大学) WeChat Vision, Tencent Inc.(腾讯微信视觉)

AI总结 本文提出通过外部和内部指导机制,结合视觉基础模型与视频扩散模型,提升视频对象移除的物理和语义理解能力,实现清晰且连贯的移除效果,并建立首个真实世界基准测试。

Comments Code: https://github.com/WeChatCV/UnderEraser

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06140 2026-08-06 cs.CV cs.AI 版本更新

Place-it-R1: Unlocking Environment-aware Reasoning Potential of MLLM for Video Object Insertion

Place-it-R1: 解锁多模态大语言模型在视频物体插入中的环境感知推理潜力

Bohai Gu, Taiyi Wu, Dazhao Du, Jian Liu, Shuai Yang, Xiaotong Zhao, Alan Zhao, Song Guo

机构 * HKUST(香港科技大学) Tencent Video(腾讯视频) Peking University(北京大学)

AI总结 Place-it-R1通过多模态大语言模型的环境感知推理能力,实现物理一致的视频物体插入,提供两种模式以平衡保真度与合理性。

Comments https://nevsnev.github.io/Place-it-R1/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01407 2026-08-06 cs.CV cs.AI 版本更新

ZoomV: Temporal Zoom-in for Efficient Long Video Understanding

TimeSearch: 基于聚光灯和反射的层次视频搜索用于类人长视频理解

Yuan Zhang, Junwen Pan, Rui Zhang, Xin Wan, Qizhe Zhang, Ming Lu, Qi She, Shanghang Zhang

机构 * ByteDance(字节跳动) School of Computer Science, Peking University(北京大学计算机科学学院)

AI总结 TimeSearch通过Spotlight和Reflection机制,提升长视频理解的准确性和效率

Comments ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12265 2026-08-06 cs.LG cs.AI cs.CR cs.CV math.OC 版本更新

Stabilizing Multi-Attack Adversarial Training via Bandit Optimization

通过老虎机优化稳定多攻击对抗训练

Rui Wang, Zeming Wei, Xiyue Zhang, Meng Sun

机构 * Peking University(北京大学) University of Bristol(布里斯托大学)

AI总结 针对多攻击对抗训练的高开销或参数漂移问题,提出校准对抗采样(CAS)框架,将其转化为多臂老虎机优化,降低成本并提升鲁棒性。

Comments ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01628 2026-08-05 cs.CV 版本更新

Motion Beyond Morphology: Bootstrapping Cross-Category Motion Transfer from Abstract Motion Representations

超越形态的运动:从抽象运动表示引导跨类别运动迁移

Zhixue Fang, Zhimin Zhang, Bi'an Du, Zijie Meng, Yan Zhou, Wei Hu, Guoxin Zhang, Pengfei Wan, Kun Gai

机构 * Kuaishou Technology(快手科技) Peking University(北京大学)

AI总结 该研究针对现有运动迁移依赖固定结构对应关系的局限,提出两阶段框架,结合自研数据集与基准,实现跨类别运动迁移,在运动保真度和目标保留上达当前最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01127 2026-08-05 cs.CV 版本更新

MiniWorld: Democratizing the Training of Video World Models from Scratch

MiniWorld:从零开始普及视频世界模型的训练

Yian Zhao, Ruochong Zheng, Hongcan Guo, Yu Yan, Jian Zhang, Jie Chen

机构 * Peking University(北京大学)

AI总结 MiniWorld是从零开始训练流式视频世界模型的可复现框架,采用特定模型与训练策略,可在单台8-GPU服务器数天内完成训练,旨在降低训练门槛以推动相关研究。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15615 2026-08-05 cs.LG cs.CV 版本更新

MoECa: Aligning Feature Reuse with Expert Decomposition in Diffusion Transformers

MoECa: 在扩散变换器中对齐特征复用与专家分解

Maoliang Li, Haojing Chen, Jiayu Chen, Zihao Zheng, Xinhao Sun, Hailong Zou, Xiang Chen

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) School of Software Engineering, University of Electronic Science and Technology of China(电子科技大学软件工程学院)

AI总结 针对DiT-MoE中跨时间步的冗余计算,提出基于专家分支级别的细粒度缓存框架MoECa,实现分支级特征复用,并引入专家感知自适应控制和同步缓存更新,在多个模型上取得高达2.83倍加速且质量损失极小。

Comments Will appear in ACM MM'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17674 2026-08-05 cs.CV 版本更新

SVL: Empowering Spiking Neural Networks for Efficient 3D Open-World Understanding

SVL:基于脉冲的视觉-语言预训练用于高效的3D开放世界理解

Xuerui Qiu, Peixi Wu, Yaozhi Wen, Shaowei Gu, Yuqi Pan, Xinhao Luo, Bo XU, Guoqi Li

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Future Technology, University of Chinese Academy of Sciences(中国科学院大学未来技术学院) Zhongguancun Academy(中关村学院) University of Science and Technology of China(中国科学技术大学) Peking University(北京大学)

AI总结 SVL提出基于脉冲的视觉-语言预训练框架,通过多尺度三元组对齐和可重参数化的视觉-语言整合,提升SNN在3D开放世界理解中的性能,实现高效零样本3D分类和多模态问答。

Comments ICML 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23586 2026-08-05 cs.CV cs.CL cs.MM cs.SD eess.AS 版本更新

Talker-T2AV: Joint Talking Audio-Video Generation with Autoregressive Diffusion Modeling

Talker-T2AV:基于自回归扩散模型的联合说话音频视频生成

Zhen Ye, Xu Tan, Aoxiong Yin, Hongzhan Lin, Guangyan Zhang, Peiwen Sun, Yiming Li, Chi-Min Chan, Wei Ye, Shikun Zhang, Wei Xue

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学) Independent Researcher(独立研究者)

AI总结 本文提出Talker-T2AV,通过共享骨干和模态特定解码器实现音频视频联合生成,提升跨模态一致性与生成效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04301 2026-08-05 cs.CV 版本更新

Neural Surface Reconstruction from Sparse Views Using Epipolar Geometry

基于稀疏视角的神经表面重建与极几何

Xinhai Chang, Kaichen Zhou

机构 * Yuanpei College, Peking University(北京大学元培学院) MIT Media Lab and EECS, MIT(麻省理工学院媒体实验室和电子工程与计算机科学系)

AI总结 本文提出EpiS框架,利用极几何改进稀疏视角下的表面重建,通过epipolar transformer和射线聚合生成SDF-aware特征,结合几何正则化策略提升重建精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02502 2026-08-04 cs.AI 新提交

CMuon: Accelerating and Stabilizing Diffusion Transformer Training via Chunked Momentum Orthogonalization

CMuon:通过分块动量正交化加速并稳定扩散Transformer的训练

Chuyan Chen, Peng Sun, Kun Yuan

机构 * Peking University(北京大学) Westlake University(西湖大学) Zhejiang University(浙江大学)

AI总结 针对扩散Transformer训练计算成本高、普通Muon优化器存在后期收敛问题的瓶颈,提出CMuon策略,通过分块权重实现训练加速与收敛优化,在ImageNet 256上200个epoch达FID1.18,训练速度超AdamW2倍

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏