arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanjing University(南京大学)

2026-04-28 至 2026-04-28 共收录 7
2604.24575 2026-04-28 cs.CV

Diffusion Model as a Generalist Segmentation Learner

扩散模型作为通用分割学习者

Haoxiao Wang, Antao Xiang, Haiyang Sun, Peilin Sun, Changhao Pan, Yifu Chen, Minjie Hong, Weijie Wang, Shuang Chen, Yue Chen, Zhou Zhao

机构 * Zhejiang University(浙江大学) South China University of Technology(华南理工大学) Nanjing University(南京大学) Peking University(北京大学)

AI总结 本文提出DiGSeg,利用预训练扩散模型实现通用分割框架,通过编码图像和掩码到潜在空间,并结合CLIP对齐的文本路径,实现基于外观和任意文本提示的结构化分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23632 2026-04-28 cs.CV cs.MM cs.SD

Hallo-Live: Real-Time Streaming Joint Audio-Video Avatar Generation with Asynchronous Dual-Stream and Human-Centric Preference Distillation

Hallo-Live: 实时流式联合音频-视频虚拟形象生成与异步双流及以人类为中心的偏好蒸馏

Chunyu Li, Jiaye Li, Ruiqiao Mei, Haoyuan Xia, Hao Zhu, Jingdong Wang, Siyu Zhu

机构 * Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Nanjing University(南京大学) Baidu(百度)

AI总结 本文提出Hallo-Live框架,通过异步双流扩散与人类中心偏好蒸馏实现高保真实时音频视频虚拟形象生成,达到高吞吐量与低延迟,优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23580 2026-04-28 cs.RO cs.AI

PhysCodeBench: Benchmarking Physics-Aware Symbolic Simulation of 3D Scenes via Self-Corrective Multi-Agent Refinement

PhysCodeBench: 通过自校正多代理细化进行3D场景的物理感知符号模拟基准测试

Tianyidan Xie, Peiyu Wang, Yuyi Qian, Yuxuan Wang, Rui Ma, Ying Tai, Song Wu, Qian Wang, Lanjun Wang, Zili Yi

机构 * Nanjing University(南京大学) Skywork AI Jilin University(吉林大学) JIUTIAN Research(JIUTIAN研究院) Tianjin University(天津大学)

AI总结 本文提出PhysCodeBench,首个评估物理感知符号模拟的基准,包含700个手动构建的样本,通过自校正多代理框架SMRF实现67.7分的性能,优于现有模型31.4分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23574 2026-04-28 cs.CV

PhysLayer: Language-Guided Layered Animation with Depth-Aware Physics

PhysLayer:基于语言的分层动画与深度感知物理

Tianyidan Xie, Zhentao Huang, Mingjie Wang, Xin Huang, Jun Zhou, Minglun Gong, Zili Yi

机构 * Nanjing University(南京大学) University of Guelph(圭尔夫大学) Zhejiang Sci-Tech University(浙江科技大学) Dalian Maritime University(大连海事大学)

AI总结 PhysLayer通过深度感知物理模拟和语言引导,实现静态图像的分层动画生成,提升了物理真实性和可控性,实验结果显示在多个指标上均有显著提升。

Comments Accepted to ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12971 2026-04-28 cs.RO

INHerit-SG: Incremental Hierarchical Semantic Scene Graphs with RAG-Style Retrieval

INHerit-SG:增量式层次语义场景图与RAG风格检索

YukTungSamuel Fang, Zhikang Shi, Jiabin Qiu, Zixuan Chen, Jieqi Shi, Hao Xu, Jing Huo, Yang Gao

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) Beihang University(北京航空航天大学)

AI总结 本文提出INHerit-SG,通过异步双流架构构建RAG-ready知识库,解决复杂嵌入查询与持续语义图构建问题,实验表明在复杂查询中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11480 2026-04-28 cs.LG cs.AI

LearnAlign: Data Selection for LLM Reinforcement Learning with Improved Gradient Alignment

LearnAlign: 用于改进梯度对齐的LLM强化学习数据选择

Shipeng Li, Zhiqin Yang, Shikun Li, Xiaobo Xia, Hengyu Liu, Xinghua Zhang, Gaode Chen, Dong Fang, Ying Tai, Zhe Peng

机构 * Nanjing University(南京大学) The Hong Kong Polytechnic University(香港理工大学) The Chinese University of Hong Kong(香港中文大学) University of Science and Technology of China(中国科学技术大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)

AI总结 LearnAlign通过改进梯度对齐方法,智能选择训练数据以提升LLM推理能力,减少训练数据需求且性能表现优异。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01700 2026-04-28 cs.LG q-bio.QM

PoseX: AI Defeats Physics Approaches on Protein-Ligand Cross Docking

PoseX:人工智能击败物理方法在蛋白质-配体交叉对接

Yize Jiang, Xinze Li, Yuanyuan Zhang, Jin Han, Youjun Xu, Ayush Pandit, Zaixi Zhang, Mengdi Wang, Mengyang Wang, Minjie Shen, Guang Yang, Yejin Choi, Wu-Jun Li, Tianfan Fu, Fang Wu, Junhong Liu

机构 * Microcyto Purdue University(普渡大学) State Key Laboratory for Novel Software Technology at Nanjing University(南京大学新型软件技术国家重点实验室) Anew Therapeutics Stanford University(斯坦福大学) Princeton University(普林斯顿大学) Peking University(北京大学) Virginia Tech(弗吉尼亚理工大学) Imperial College London(伦敦帝国理工学院)

AI总结 PoseX设计了一个开放源代码的基准测试,评估自我对接和交叉对接,通过23种方法和718/1312个数据集,发现AI方法在对接成功率上优于物理方法,并通过放松方法和结合口袋信息提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏