arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

共收录 239
2608.11698 2026-08-14 cs.LG cs.AI 版本更新

REOPD: Reliability-Adaptive Reward Extrapolation for On-Policy Distillation

REOPD:面向在线策略蒸馏的可靠性自适应奖励外推

Yang Sun, Lichao Ma, Houyuan Qin, Yuxin Liu, Hanyang Lu, Yao Zhu, Pinlong Cai, Guohang Yan

机构 * Peking University(北京大学) Southwest Jiaotong University(西南交通大学) University of Science and Technology of China(中国科学技术大学) School of Computer Science and Technology,University of Science and Technology of China(中国科学技术大学计算机科学与技术学院) University of Electronic Science and Technology of China(电子科技大学) School of Automation Engineering,University of Electronic Science and Technology of China(电子科技大学自动化工程学院) Renmin University of China(中国人民大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Autonomous Driving, Shanghai Artificial Intelligence Laboratory(上海人工智能实验室自动驾驶研究中心)

AI总结 本文提出面向在线策略蒸馏的可靠性自适应奖励外推框架REOPD,通过token级系数实现细粒度可靠性自适应,在多场景下优于基线方法,无需额外模型即可提升训练稳定性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03025 2026-08-14 cs.AI 版本更新

DiffImaginE: Imagine to Verify Entity Types with Diffusion

DiffImaginE:通过想象验证实体类型

Feng Zhang, Feiyu Han, Rongxin Yang, Yang Liu, Yancheng Chen, Rui Wang, Yingguang Yang, Tian Xueyun, Chongyang Zhang, Hao Zheng, Xu Kefu, Congjing Ran, Fuhai Chen, Bin Chong

机构 * Fuzhou University(福州大学) Chinese Academy of Sciences(中国科学院) Peking University(北京大学) Alibaba Group(阿里巴巴集团) University of Science and Technology of China(中国科学技术大学) Fullive Innovation (Beijing) AI Technology Co., Ltd.(福莱创新(北京)人工智能科技有限公司) Baidu(百度) Wuhan University(武汉大学)

AI总结 DiffImaginE将多模态命名实体识别的类型验证建模为条件潜在扩散推理,在Twitter-2015和Twitter-2017数据集上,相比确定性对照模型取得了一致的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06331 2026-08-14 cs.CL cs.AI cs.IR 版本更新

How Significant Are the Real Performance Gains? An Unbiased Evaluation Framework for GraphRAG

实际性能提升有多显著?GraphRAG的无偏评估框架

Qiming Zeng, Hao Luo, Yuhao Lin, Yicheng Jin, Yuxiang Wang, Fangcheng Fu, Xiao Yan, Jiawei Jiang

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) School of Computer Science, Peking University(北京大学计算机学院) Centre for Perceptual and Interactive Intelligence (CPII)(感知与交互智能中心) OceanBase

AI总结 针对GraphRAG现有评估框架的不相关问题与评估偏差缺陷,提出无偏评估框架并发现代表性GraphRAG方法的性能提升远小于此前报告结果,呼吁开展科学评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11150 2026-08-13 cs.CV 版本更新

CausalSplat: Towards Comprehensive Hierarchical Reasoning in 3D Gaussian Splatting

CausalSplat:面向3D高斯溅射的综合层级推理

Jiayu Ding, Meilu Song, Yun Chen, Wei Gao, Ge Li

机构 * Peking University(北京大学) North China Electric Power University(华北电力大学) Hunan University(湖南大学)

AI总结 针对3D高斯溅射推理局限,本文提出CausalSplat框架,结合视觉语言模型与3D场景图,构建两个推理基准,在相关任务上实现最优性能与强泛化性。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10444 2026-08-13 cs.CL cs.AI 版本更新

From Reasoning Depth to Reasoning Breadth: Evaluating Multi-Point Associative Reasoning in Large Language Models

从推理深度到推理广度:评估大型语言模型中的多点关联推理

Si'an Xie, Jiaxun Liu, Biao Yang, Wei Yuan, Fan Yang, Tingting Gao, Ming Wu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学) Kuaishou Technology(快手科技)

AI总结 该研究构建了中英双语多点关联推理基准MPAR-Bench,发现大型语言模型的推理深度未自动带来稳健的推理广度,当前基准未充分覆盖推理广度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02474 2026-08-13 cs.CV 版本更新

EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation

EchoCache:面向高效音频驱动视频生成的能量引导跨模态缓存

Jiayu Chen, Xiaoyu Wu, Rongshan Gao, Maoliang Li, Zihao Zheng, Xinhao Sun, Hailong Zou, Guojie Luo, Xiang Chen

机构 * Peking University(北京大学) Taiyuan University of Technology(太原理工大学)

AI总结 EchoCache是一种能量引导跨模态缓存框架,通过利用音频时频能量锚点与动态缓存机制,在保持音频驱动视频生成质量的同时,实现了2.46倍的推理加速,优化了延迟-质量权衡。

Comments EchoCache is honored to be accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17585 2026-08-13 cs.CV 版本更新

Pixel-Space Diffusion Transformers

像素空间扩散变换器

Renye Yan, Jikang Cheng, You Wu, Ling Liang, Wei Peng, Athanasios V. Vasilakos, Qingyu Zhao, Yu Zhang, Yimao Cai, Kilian M. Pohl, Guoying Zhao

机构 * Peking University(北京大学) Nanjing University(南京大学) Stanford University(斯坦福大学) Cornell University(康奈尔大学) University of Oulu(奥卢大学)

AI总结 本文探讨像素空间扩散变换器,针对潜在扩散模型的局限,研究直接对原始像素建模的像素空间扩散方法,介绍其在高维建模中的挑战与多模态建模优势,从多方面回顾pDiTs,总结方法、识别挑战并展望未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17598 2026-08-13 cs.RO cs.CV 版本更新

MuseVLA: An Adaptive Multimodal Sensing Vision-Language-Action Model for Robotic Manipulation

MuseVLA: 一种用于机器人操作的自适应多模态感知视觉-语言-动作模型

Xingyuming Liu, Ruichun Ma, Heyu Guo, Qixiu Li, Qingwen Yang, Lin Luo, Shiqi Jiang, Chenren Xu, Jiaolong Yang, Baining Guo

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) Microsoft Research Asia(微软亚洲研究院) Princeton University(普林斯顿大学) Tsinghua University(清华大学)

AI总结 提出MuseVLA模型,通过将传感器作为按需工具集成,实现自适应多模态感知;设计传感器图像统一表示,并引入数据合成流水线,在灵巧手操作任务中平均成功率80.6%,显著优于RGB-only和多模态基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13794 2026-08-13 cs.GR cs.CV 版本更新

BlitzGS: City-Scale Gaussian Splatting at Lightning Speed

BlitzGS:闪电速度实现城市级高斯点云渲染

Zhongtao Wang, Huishan Au, Yilong Li, Mai Su, Haojie Jin, Yisong Chen, Meng Gai, Fei Zhu, Guoping Wang

机构 * Peking University(北京大学)

AI总结 BlitzGS通过分布式3DGS框架实现城市级场景快速重建,通过分层工作负载管理减少活跃高斯点云计算量,提升渲染效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22753 2026-08-13 cs.LG 版本更新

Spend Less, Fit Better: Budget-Efficient Scaling Law Fitting via Active Experiment Selection

少花钱,多适配:通过主动实验选择实现预算高效的缩放定律拟合

Sijie Li, Shanda Li, Haowei Lin, Weiwei Sun, Ameet Talwalkar, Yiming Yang

机构 * Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学) Datadog

AI总结 本文提出一种预算感知的序列实验设计方法,通过主动选择实验来提高缩放定律拟合的准确性,实验结果显示其在多种缩放定律任务中优于传统方法,仅用10%的预算即可达到全集拟合效果。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06710 2026-08-13 cs.RO 版本更新

RLinf-VLA: A Unified and Efficient Framework for Reinforcement Learning of Vision-Language-Action Models

RLinf-VLA: 一种用于视觉-语言-动作模型强化学习的统一高效框架

Hongzhi Zang, Mingjie Wei, Si Xu, Yongji Wu, Zhen Guo, Yuanqing Wang, Hao Lin, Peihong Wang, Liangzhi Shi, Yuqing Xie, Zhexuan Xu, Zhihao Liu, Kang Chen, Wenhao Tang, Quanlu Zhang, Weinan Zhang, Chao Yu, Yu Wang

机构 * Tsinghua University(清华大学) Zhongguancun Academy(中关村学院) Infinigence AI Peking University(北京大学) UC Berkeley(加州大学伯克利分校) Harbin Institute of Technology(哈尔滨工程学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 RLinf-VLA是一种统一高效的框架,用于提升视觉-语言-动作模型在具身环境中的强化学习性能,通过统一接口和高效资源分配实现统一和可扩展的训练。

Comments Accepted to RSS 2026. This is the technical report of the RLinf Team, focusing on the algorithm side. For the system-level design, please refer to arXiv:2509.15965. The open-sourced code link: https://github.com/RLinf/RLinf

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15497 2026-08-12 cs.CV cs.GR 版本更新

AnyAct: Towards Human Reenactment of Character Motion From Video

AnyAct: 向视频中非人类角色动作的重新演绎迈进

Liuhan Chen, Lei Zhong, Jiawei Wang, Qing Shuai, Li Yuan, Leidong Fan, Qing Li, Kanglin Liu

机构 * Peking University(北京大学) Nankai University(南开大学) The University of Hong Kong(香港大学) Zhejiang University(浙江大学) Pengcheng Laboratory(鹏城实验室)

AI总结 本文研究如何从单目视频中直接推导出人类动作的初始重新演绎,其目标是将非人类角色的动作重新诠释为可编辑的人类表演,以供后续动画创作使用。核心方法是利用稀疏局部关节运动线索在结构差异大的情况下保持本质动态,提出AnyAct模型以实现基于可转移稀疏局部2D关节运动的条件人类运动生成。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11611 2026-08-12 cs.AI 版本更新

CuSearch: Curriculum Rollout Sampling via Search Depth for Agentic RAG

CuSearch:通过搜索深度进行课程展开采样以实现代理RAG

Jianghan Shen, Siqi Luo, Xinyu Cheng, Jing Xiong, Yue Li, Jiyao Liu, Jiashi Lin, Yirong Chen, Junjun He

机构 * Nanjing University(南京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Peking University(北京大学) University of Hong Kong(香港大学)

AI总结 本文提出CuSearch,通过搜索深度贪心分配策略改进代理RAG训练,提升检索监督密度,实验显示在ZeroSearch上性能提升达11.8个精确匹配点。

Comments The paper has been accepted by COLM 2026. Code: https://github.com/MrToser/CuSearch

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03922 2026-08-12 cs.CL cs.AI cs.CV 版本更新

HSSBench: Benchmarking Humanities and Social Sciences Ability for Multimodal Large Language Models

HSSBench: 多模态大语言模型在人文学与社会科学能力评估中的基准测试

Zhaolu Kang, Junhao Gong, Jiaxu Yan, Wanke Xia, Yian Wang, Ziwen Wang, Huaxuan Ding, Zhuo Cheng, Wenhao Cao, Zhiyuan Feng, Siqi He, Shannan Yan, Junzhe Chen, Xiaomin He, Chaoya Jiang, Wei Ye, Kaidong Yu, Xuelong Li

机构 * National Engineering Research Center for Software Engineering, Peking University(北京大学软件工程国家工程研究中心) Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院) Tsinghua University(清华大学) Chinese Academy of Sciences(中国科学院) University of British Columbia(不列颠哥伦比亚大学) Renmin University of China(中国人民大学)

AI总结 HSSBench是一个专门评估多模态大语言模型在人文学与社会科学任务能力的基准测试,包含多语言样本,通过协作生成数据提升跨学科推理能力。

Comments ICLR 2026 (OpenReview: https://openreview.net/forum?id=iQsKotob31)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06257 2026-08-11 cs.CV cs.HC 版本更新

MASS: Multiplayer World Models with Authoritative Shared State

MASS:具有权威共享状态的多人世界模型

Ziqi Cai, Siqi Yang, Yimu Wang, Zixian Gao, Yunheng Liu, Shuchen Weng, Erwin Wu, Kaipeng Zhang, Boxin Shi

机构 * Alaya Lab(Alaya实验室) Peking University(北京大学) Institute of Science Tokyo(东京科学大学)

AI总结 该研究提出MASS模型,通过将世界动态与视图渲染解耦,解决现有视频世界模型在多人环境中的缺陷,在多人Snake基准测试中实现更优状态精度,为多智能体世界模拟提供实用基础。

Comments Project Page: https://alaya-lab.github.io/MASS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05144 2026-08-11 cs.AI 版本更新

Argus: A General-Purpose Agentic Reasoning Runtime for Long-Horizon Tasks

Argus:面向长程推理的通用智能体运行时

Boxiu Li, Zimo Wen, Yijia Fan, Chuan Wen, Fan Yang, Hangxi Guo, Jiaao Wu, Jiachen Zhang, Junxiang Lei, Mukai Li, Ruize Tang, Runjing Gu, Shibo Hu, Sihan Chen, Sufeng Guo, Wanbo Zhang, Xian Zhang, Xiaoyu Chen, Xuanhe Zhou, Xuyao Huang, Yifei Gao, Yifei Shen, Yilin Chen, Yuheng Wu, Yuzhe Zhang, Zelong Zhao, Zhijie Deng

机构 * Microsoft(微软公司) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Nanjing University(南京大学) Tsinghua University(清华大学) The University of Hong Kong(香港大学) Peking University(北京大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Donghua University(东华大学)

AI总结 Argus是面向长程推理的通用智能体运行时,通过多角色协作与自进化,在多个基准测试中表现优于同类方法,还完成了实际应用任务并产出结构化轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02585 2026-08-11 cs.LG cs.CL 版本更新

GradCuit: Credit-Assigned Gradient Flow Enables Robust and Interpretable Test-Time Latent Reasoning

GradCuit:信用分配梯度流实现鲁棒且可解释的测试时潜在推理

Zhaoxin Yu, Qi Shen, Hengli Li, Zhaowei Zhang, Song-Chun Zhu, Chi Zhang, Zilong Zheng

机构 * Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) School of Artificial Intelligence for Science, Peking University(北京大学科学人工智能学院)

AI总结 GradCuit在测试时插入可优化潜在状态,实现序列级信用分配,在多基准上准确率优于同类方法,且鲁棒性、可解释性更强,为LLM测试时推理扩展提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09730 2026-08-11 cs.AI 版本更新

SearchSwarm: Towards Delegation Intelligence in Agentic LLMs for Long-Horizon Deep Research

SearchSwarm:面向长周期深度研究的代理LLM委托智能

Xiaochong Lan, Quan Chen, Kun Tao, Xinyu Tang, Tianshu Wang, Qianggang Cao, Xinyu Kong, Zujie Wen, Zhiqiang Zhang, Jun Zhou

机构 * Tsinghua University(清华大学) Peking University(北京大学) Ant Group(蚂蚁集团) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)

AI总结 提出SearchSwarm框架,通过监督微调将任务分解与委托决策内化到模型权重中,在BrowseComp和BrowseComp-ZH上取得同规模最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26041 2026-08-11 cs.CV 版本更新

Where and How to Prune: An Empirical Study of Visual Token Pruning for GUI Agent Navigation

重新思考GUI视觉代理中历史截图的标记剪枝:语义、空间和时间视角

Daiqiang Li, Zihao Pan, Zeyu Zhang, Xuyang Liu, Shijia Xu, Ronghao Chen, Huacan Wang, Honggang Chen, Linfeng Zhang, Zhangquan Chen, Haiyun Jiang

机构 * Sichuan University(四川大学) Sun Yat-sen University(中山大学) Australian National University(澳大利亚国立大学) Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文从语义、空间和时间角度研究GUI视觉代理中历史截图的标记剪枝,发现背景区域对界面状态转换有重要价值,随机剪枝在空间结构保留上更有效,且GUI代理具有近期效应,通过分配更多预算给近期截图可降低计算成本而不影响性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05695 2026-08-11 cs.CV 版本更新

Let Geometry GUIDE: Layer-wise Unrolling of Geometric Priors in Multimodal LLMs

让几何引导:在多模态大语言模型中逐层展开几何先验

Chongyu Wang, Ting Huang, Chunyu Sun, Xinyu Ning, Di Wang, Hao Tang

机构 * Xi’an Jiaotong University(西安交通大学) Peking University(北京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) InspireOmni

AI总结 本文提出GUIDE框架,通过多级采样和逐步融合几何先验,提升多模态大语言模型在空间推理任务中的性能。

Comments Revised manuscript with updated experiments, figures, and presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20253 2026-08-11 physics.comp-ph cs.AI cs.DC cs.LG 版本更新

SimulCost: A Cost-Aware Benchmark and Toolkit for Automating Physics Simulations with LLMs

SimulCost: 一个用于自动化物理模拟的代价感知基准与工具包

Yadi Cao, Sicheng Lai, Jiahe Huang, Yang Zhang, Zach Lawrence, Rohan Bhakta, Izzy F. Thomas, Mingyun Cao, Chung-Hao Tsai, Zihao Zhou, Yidong Zhao, Hao Liu, Alessandro Marinoni, Alexey Arefiev, Rose Yu

机构 * University of California San Diego(加州大学圣地亚哥分校) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Peking University(北京大学) University of California, Los Angeles(加州大学洛杉矶分校) California Institute of Technology(加州理工学院) ETH Zurich(苏黎世联邦理工学院)

AI总结 针对现有LLM评估忽略工具使用代价的问题,提出SimulCost基准,通过单轮和多轮参数调优任务比较LLM与传统扫描方法在准确性和计算代价上的表现,发现LLM在高精度任务中初始猜测不可靠且多轮模式效率更低。

Comments post conference revision version at ICML; update: removed CGYRO due to bug in cases search. Will add back soon

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02791 2026-08-11 cs.SE cs.AI 版本更新

Contamination Means Overestimation? A Fine-Grained Empirical Study in Code Intelligence

重新审视数据污染在代码智能中的影响

Zhen Yang, Hongyi Lin, Yifan He, Junqi Wang, Zeyu Sun, Shuo Liu, Jie Xu, Pengpeng Wang, Zhongxing Yu, Qingyuan Liang

机构 * Shandong University(山东大学) Institute of Software, Chinese Academy of sciences(中国科学院软件研究所) City University of Hong Kong(香港城市大学) Columbia University(哥伦比亚大学) Peking University(北京大学)

AI总结 本文重新审视了数据污染对代码智能模型的影响,发现不同模型在不同污染场景下的表现差异显著,挑战了污染必然导致性能高估的传统观点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18121 2026-08-11 cs.CV cs.AI 版本更新

VCU-Bridge: Hierarchical Visual Connotation Understanding via Semantic Bridging

VCU-Bridge: 通过语义桥梁实现层次化视觉隐喻理解

Ming Zhong, Yuanlei Wang, Liuzhou Zhang, Ruichuan An, Renrui Zhang, Hao Liang, Ming Lu, Ying Shen, Wentao Zhang

机构 * Zhejiang University(浙江大学) Peking University(北京大学) Sun Yat-sen University(中山大学) CUHK(香港中文大学)

AI总结 VCU-Bridge通过语义桥梁实现层次化视觉隐喻理解,构建了HVCU-Bench基准,并展示了提升MLLM能力的显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04111 2026-08-10 cs.CV cs.CL cs.LO 版本更新

GEB-Bench: Abstract Structures Told in Many Voices

GEB-Bench:多视角呈现的抽象结构

Tong Zhang, Zhiyuan Shi, Yun Peng, Tao Xie

机构 * Fudan University(复旦大学) Peking University(北京大学)

AI总结 本研究推出GEB-Bench基准,评估12种模型发现其在结构识别与跨视角映射间存在差距,仅前沿模型能缩小该差距,且表面复杂性会增加模型负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25001 2026-08-10 cs.LG 版本更新

Mitigating Gradient Pathology in PINNs through Aligned Constraint

通过对齐约束缓解PINN中的梯度病理

Yichen Luo, Peiyu Zhu, Dongxiao Hu, Jia Wang, Tailin Wu, Dapeng Lan, Yu Liu, Zhibo Pang

机构 * Department of Information Science and Engineering, KTH Royal Institute of Technology, Stockholm, Sweden(信息科学与工程系,皇家理工学院,斯德哥尔摩,瑞典) School of Advanced Manufacturing and Robotics, Peking University, Beijing, China(先进制造与机器人学院,北京大学,北京,中国) School of Advanced Technology, Xi’an Jiaotong-Liverpool University, Suzhou, China(先进技术学院,西安交通大学利物浦大学,苏州,中国) Department of AI, School of Engineering, Westlake University, Hangzhou, China(人工智能系,工程学院,西湖大学,杭州,中国)

AI总结 针对物理信息神经网络训练中梯度冲突导致的局部最优问题,提出约束对齐损失与流形提升方法,通过重新表述零阶项为对齐约束并引入延迟因子,显著提升数值稳定性和效率。

Comments Accepted by ICML 2026

Journal ref Forty-Third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07327 2026-08-10 cs.CV 版本更新

Teacher-Feature Drifting: One-Step Diffusion Distillation with Pretrained Diffusion Representations

教师特征漂移:基于预训练扩散表示的一步扩散蒸馏

Yuan Zhang, Chenyi Li, Haodong Yu, Guoqing Ma, Jiajun Zha, Yuanming Yang, Bo Wang, Wei Tang, Wenbo Li, Haoyang Huang, Nan Duan

机构 * JD Explore Academy(京东探索研究院) Peking University(北京大学) Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科技大学) Beijing Institute of Technology(北京理工大学)

AI总结 本文提出通过单步扩散蒸馏简化模型,利用预训练扩散教师自身的特征空间,无需额外网络即可实现语义特征几何的漂移,同时引入轻量模式覆盖损失以提升生成质量和多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17889 2026-08-10 cs.CV 版本更新

Identity as Presence: Towards Appearance and Voice Personalized Joint Audio-Video Generation

身份作为存在:迈向基于外观和声音的联合音频视频生成

Qin Chen, Yingjie Chen, Shilun Lin, Cai Xing, Binxin Yang, Long Zhou, Qixin Yan, Wenjing Wang, Dingming Liu, Hao Liu, Chen Li, Jing Lyu

机构 * Tencent Inc.(腾讯公司) Peking University(北京大学)

AI总结 本文提出一个统一的框架,实现身份感知的音频视频生成,通过数据整理管道和灵活的身份注入机制,提升生成内容的高保真度和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08894 2026-08-07 cs.NE cs.AI cs.CV 版本更新

Ge$^\text{2}$mS-T: Multi-Dimensional Grouping for Ultra-High Energy Efficiency in Spiking Transformer

Ge$^\text{2}$mS-T:多维分组以实现脉冲变换器中超高能效

Zecheng Hao, Shenghao Xie, Kang Chen, Wenxuan Liu, Zhaofei Yu, Tiejun Huang

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) State Key Laboratory for Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室) Academy for Advanced Interdisciplinary Studies, Peking University(北京大学前沿交叉学科研究院) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)

AI总结 本文提出Ge$^\text{2}$mS-T架构,通过多维分组计算提升Spiking Vision Transformers的能效,解决内存、精度与能耗的平衡问题。

Comments Accepted to ACM MM 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12226 2026-08-07 cs.CV 版本更新

Ultrasound Tomography of Musculoskeletal Tissues with Generative Neural Physics

生成式神经物理实现组织力学的定量体积超声成像

Zhijun Zeng, Youjia Zheng, Chang Su, Qianhang Wu, Hao Hu, Zeyuan Dong, Yang Lv, Ligang Cui, Zhiyong Hou, Weijun Lin, Zuoqiang Shi, Yubing Li, He Sun

机构 * College of Future Technology, Peking University(未来技术学院,北京大学) National Biomedical Imaging Center, Peking University(北京大学国家生物医学成像中心) Department of Mathematical Sciences, Tsinghua University(清华大学数学科学系) School of Physical Sciences, University of Chinese Academy of Sciences(中国科学院大学物理科学学院) School of EECE, University of Chinese Academy of Sciences(中国科学院大学电子工程与计算机科学学院) Department of Orthopedics, Peking University Third Hospital(北京大学第三医院骨科部) Department of Ultrasound, Peking University Third Hospital(北京大学第三医院超声科) Department of Orthopaedic Surgery, The Third Hospital of Hebei Medical University(河北医科大学第三医院骨科部) Yau Mathematical Sciences Center, Tsinghua University(清华大学姚期智数学科学中心) Yanqi Lake Beijing Institute of Mathematical Sciences and Applications(北京燕琦湖数学科学与应用研究院)

AI总结 该研究提出生成式神经物理框架,结合生成网络与物理信息神经模拟,实现了快速高保真三维超声断层成像,可在十分钟内重建组织参数三维图谱,分辨率媲美MRI,推动定量超声断层成像用于肌肉骨骼成像的临床应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03556 2026-08-07 cs.CV cs.RO 版本更新

Afford-X: Generalizable and Slim Affordance Reasoning for Task-oriented Manipulation

Afford-X:面向任务型操作的通用且轻量化的可供性推理模型

Xiaomeng Zhu, Yuyang Li, Leiyao Cui, Pengfei Li, Huan-ang Gao, Yixin Zhu, Hao Zhao

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Department of Computer Science and Engineering, Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系) Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) Institute for Al Industry Research, Tsinghua University(清华大学人工智能产业研究院) Department of Computer Science, Tsinghua University(清华大学计算机科学系)

AI总结 研究人员推出LVIS-Aff数据集,开发了Afford-X可供性推理模型,其性能优于现有非LLM方法和此前会议论文结果,参数紧凑、推理速度快,可部署于本地设备助力机器人任务导向型操作。

详情

展开后加载摘要…

URL PDF HTML 收藏