arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

共收录 3038
2604.06636 2026-04-09 cs.LG cs.AI cs.CL

SHAPE: Stage-aware Hierarchical Advantage via Potential Estimation for LLM Reasoning

SHAPE:基于潜在估计的阶段感知分层优势用于大语言模型推理

Zhengyang Ai, Zikang Shan, Xiaodong Ai, Jingxian Tang, Hangkai Hu, Pinyan Lu

机构 * Huawei Taylor Lab(华为泰勒实验室) Center for Data Science, Peking University(北京大学数据科学中心) Shanghai University of Finance and Economics(上海财经大学)

AI总结 SHAPE通过潜在估计引入分层信用分配机制,提升大语言模型推理的效率与准确性,实验显示在数学推理任务中平均准确率提升3%,token消耗减少30%。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06589 2026-04-09 cs.RO

BiDexGrasp: Coordinated Bimanual Dexterous Grasps across Object Geometries and Sizes

BiDexGrasp: 跨物体几何与尺寸的协调双臂灵巧抓取

Mu Lin, Yi-Lin Wei, Jiaxuan Chen, Yuhao Lin, Shuoyu Chen, Jiangran Lyu, Jiayi Chen, Yansong Tang, He Wang, Wei-Shi Zheng

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) School of Computer Science, Peking University(北京大学计算机学院) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

AI总结 本文提出BiDexGrasp,包含大规模双臂灵巧抓取数据集和新型生成模型,通过高效区域基抓取初始化与解耦力闭合优化策略,生成协调且高质量的抓取。

Comments Project Page: https://frenkielm.github.io/BiDexGrasp.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19433 2026-04-09 cs.CV

dMLLM-TTS: Self-Verified and Efficient Test-Time Scaling for Diffusion Multi-Modal Large Language Models

dMLLM-TTS:用于扩散多模态大语言模型的自验证和高效测试时间扩展

Yi Xin, Siqi Luo, Tianxiang Xu, Qi Qin, Haoxing Chen, Kaiwen Zhu, Zhiwei Zhang, Yangfan He, Rongchao Zhang, Jinbin Bai, Shuo Cao, Bin Fu, Junjun He, Yihao Liu, Yuewen Cao, Xiaohong Liu

机构 * Nanjing University(南京大学) Shanghai Innovation Institute(上海创新研究院) Shanghai AI Lab(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出dMLLM-TTS框架,通过轨迹探索扩展和迭代细化扩展两个互补的扩展轴,提升生成多样性和稳定性,同时通过自验证机制提高效率,实验表明在GenEval基准上生成质量显著提升且效率提高6倍。

Comments Project page: https://github.com/Alpha-VLLM/Lumina-DiMOO

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07527 2026-04-09 cs.CV cs.GR

From Orbit to Ground: Generative City Photogrammetry from Extreme Off-Nadir Satellite Images

从轨道到地面:从极端俯仰角卫星图像生成城市光束摄影测量

Fei Yu, Yu Liu, Luyang Tang, Mingchao Sun, Zengye Ge, Rui Bu, Yuchao Jin, Haisen Zhao, He Sun, Yangyan Li, Mu Xu, Wenzheng Chen, Baoquan Chen

机构 * Peking University(北京大学) AMAP(高德地图) Ant Group(蚂蚁集团) Shandong University(山东大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

AI总结 本文提出两种设计选择,通过2.5D高度图和可微渲染技术,解决从稀疏轨道图像合成地面视图的挑战,实现大规模城市重建。

Comments Accepted by CVPR 2026 Findings. Project page: https://pku-vcl-geometry.github.io/Orbit2Ground/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19365 2026-04-09 cs.CV cs.AI

DeCo: Frequency-Decoupled Pixel Diffusion for End-to-End Image Generation

DeCo:频率解耦的像素扩散用于端到端图像生成

Zehong Ma, Longhui Wei, Shuai Wang, Shiliang Zhang, Qi Tian

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) Nanjing University(南京大学) Huawei Inc.(华为公司)

AI总结 DeCo通过解耦高频与低频成分生成,提升像素扩散效率,实现更高效的端到端图像生成,实验表明其在ImageNet上取得优于其他模型的性能。

Comments Accepted to CVPR2026. Project Page: https://zehong-ma.github.io/DeCo. Code Repository: https://github.com/Zehong-Ma/DeCo

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16703 2026-04-09 cs.PF cs.AI cs.LG

ShadowNPU: System and Algorithm Co-design for NPU-Centric On-Device LLM Inference

ShadowNPU:面向NPU为中心的设备端LLM推理的系统与算法协同设计

Wangsong Yin, Daliang Xu, Mengwei Xu, Gang Huang, Xuanzhe Liu

机构 * Key Lab of High Confidence Software Technologies (Peking University)(高可信软件技术重点实验室(北京大学)) State Key Laboratory of Networking and Switching Technology (BUPT)(网络与交换技术国家重点实验室(北京邮电大学))

AI总结 本文提出ShadowAttn,一种稀疏注意力模块,通过在NPU上稀疏计算少量token,减少对CPU/GPU的依赖,提升设备端LLM推理的效率和准确性。

Comments To Appear at MobiSys'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05171 2026-04-09 eess.SY cs.AI cs.SY

Towards provable probabilistic safety for scalable embodied AI systems

迈向可证明的可扩展具身AI系统的概率安全

Linxuan He, Lingxiang Fan, Qing-Shan Jia, Ang Li, Hongyan Sang, Ling Wang, Guanghui Wen, Jiwen Lu, Tao Zhang, Jie Zhou, Yi Zhang, Yisen Wang, Peng Wei, Zhongyuan Wang, Henry X. Liu, Shuo Feng

机构 * Department of Automation, Tsinghua University(清华大学自动化系) Beijing Academy of Artificial Intelligence(北京人工智能研究院) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) School of Computer, Liaocheng University(聊城大学计算机学院) Department of Automation, Southeast University(东南大学自动化学院) Department of Mechanical and Aerospace Engineering, George Washington University(乔治华盛顿大学机械与航空航天工程系) University of Michigan Transportation Research Institute(密歇根大学交通研究所) Department of Civil and Environmental Engineering, University of Michigan(密歇根大学土木与环境工程系)

AI总结 本文提出可证明的概率安全范式,旨在解决具身AI系统在复杂环境中安全验证的挑战,通过结合可证明保证与渐进式达成概率安全边界,提升系统可行性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06169 2026-04-08 cs.LG cs.AI cs.CL stat.ML

In-Place Test-Time Training

就地测试时间训练

Guhao Feng, Shengjie Luo, Kai Hua, Ge Zhang, Di He, Wenhao Huang, Tianle Cai

机构 * Peking University(北京大学)

AI总结 本文提出了一种无需重新训练的就地测试时间训练框架,通过调整MLP块的最终投影矩阵实现模型在推理时的动态更新,提升大语言模型在长上下文任务中的性能。

Comments ICLR 2026 Oral Presentation; Code is released at https://github.com/ByteDance-Seed/In-Place-TTT

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06079 2026-04-08 cs.CV cs.AI

Scientific Graphics Program Synthesis via Dual Self-Consistency Reinforcement Learning

通过双自一致性强化学习实现科学图形程序合成

Juekai Lin, Yun Zhu, Honglin Lin, Sijing Li, Tianwei Lin, Zheng Liu, Xiaoyang Wang, Wenqiao Zhang, Lijun Wu

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory, OpenDataLab(上海人工智能实验室,OpenDataLab) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学)

AI总结 本文提出双自一致性强化学习框架,结合高质量数据集和多维基准,提升科学图形到可编辑TikZ代码的转换能力,实现视觉与结构的高精度优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06074 2026-04-08 cs.CV cs.AI cs.MM

Graph-PiT: Enhancing Structural Coherence in Part-Based Image Synthesis via Graph Priors

Graph-PiT:通过图先验增强基于部分的图像合成的结构一致性

Junbin Zhang, Meng Cao, Feng Tan, Yikai Lin, Yuexian Zou

机构 * Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology(广东省超高清沉浸式媒体技术重点实验室) Shenzhen Graduate School, Peking University, China(北京大学深圳研究生院) Department of Computer Vision, Mohamed bin Zayed University of Artificial Intelligence, Abu Dhabi, United Arab Emirates(穆罕默德·本·扎耶德人工智能大学计算机视觉系)

AI总结 Graph-PiT通过图先验建模视觉组件的结构依赖,提升部分基于图像合成的结构一致性,同时保持与原始IP-Prior流程的兼容性。

Comments 11 pages, 5 figures, Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05939 2026-04-08 cs.AI cs.HC

Context-Value-Action Architecture for Value-Driven Large Language Model Agents

基于价值的大型语言模型代理的上下文-价值-行动架构

TianZe Zhang, Sirui Sun, Yuhang Xie, Xin Zhang, Zhiqiang Wu, Guojie Song

机构 * State Key Laboratory of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院通用人工智能国家重点实验室) Yuanpei College, Peking University(北京大学元培学院) School of Psychological and Cognitive Sciences, Peking University(北京大学心理与认知科学学院) Key Laboratory of Machine Perception (Ministry of Education), Peking University(北京大学机器感知重点实验室(教育部)) PKU-Wuhan Institute for Artificial Intelligence(北大武汉人工智能研究院)

AI总结 本文提出CVA架构,通过价值验证器缓解价值极化,提升代理行为的准确性和可解释性。

Comments Accepted to Findings of the Association for Computational Linguistics: ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00503 2026-04-08 cs.CV

Diff4Splat: Controllable 4D Scene Generation with Latent Dynamic Reconstruction Models

Diff4Splat:基于潜在动态重建模型的可控4D场景生成

Panwang Pan, Chenguo Lin, Jingjing Zhao, Chenxin Li, Yuchen Lin, Haopeng Li, Honglei Yan, Kairun Wen, Yunlong Lin, Yixuan Yuan, Yadong Mu

机构 * Peking University(北京大学) Xiamen University(厦门大学) CUHK(香港中文大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 Diff4Splat通过单张图像和相机轨迹生成可控的4D场景,结合视频扩散模型的生成先验与大规模4D数据集学习的几何和运动约束,在单次前向传递中直接预测可变形3D高斯场,无需测试时优化。

Comments Accepted to CVPR 2026. Project page: https://paulpanwang.github.io/Diff4Splat

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05774 2026-04-08 q-bio.GN cs.CL

GenomeQA: Benchmarking General Large Language Models for Genome Sequence Understanding

GenomeQA:用于基因组序列理解的通用大型语言模型基准测试

Weicai Long, Yusen Hou, Junning Feng, Houcheng Su, Shuo Yang, Donglin Xie, Yanlin Zhang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The University of Hong Kong(香港大学) Peking University(北京大学)

AI总结 GenomeQA旨在评估通用大型语言模型在基因组序列推理任务中的表现,包含5200个样本,涵盖六个任务家族,揭示模型在直接接触原始基因组序列时的表现。

Comments 18 pages, 9 figures, coference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05581 2026-04-08 cs.CV

High-Resolution Single-Shot Polarimetric Imaging Made Easy

高分辨率单次拍摄偏振成像的实现

Shuangfan Zhou, Chu Zhou, Heng Guo, Youwei Lyu, Boxin Shi, Zhanyu Ma, Imari Sato

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) National Institute of Informatics(国立信息学研究所) State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) National Key Laboratory of General AI, School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院通用人工智能国家重点实验室)

AI总结 本文提出EasyPolar框架,通过三相机系统和置信度引导网络实现高分辨率偏振成像,解决多视角融合中的对齐问题,提升下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05540 2026-04-08 cs.CL

Learning to Edit Knowledge via Instruction-based Chain-of-Thought Prompting

通过基于指令的思考链提示学习知识编辑

Jinhu Fu, Yan Bai, Longzhu He, Yihang Lou, Yanxiao Zhao, Li Sun, Sen Su

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学) Huawei Technologies Ltd.(华为技术有限公司) Chongqing University of Posts and Telecommunications(重庆邮电大学)

AI总结 本文提出CoT2Edit方法,通过思考链推理提升大语言模型的知识编辑能力,解决泛化差和范围窄的问题,实验显示在六个场景中表现优异。

Comments Accepted by ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05536 2026-04-08 cs.CL cs.AI

Turbulence-like 5/3 spectral scaling in contextual representations of language as a complex system

语言作为复杂系统的情境表示中呈现湍流样的5/3谱 scaling

Zhongxin Yang, Chun Bao, Yuanwei Bin, Xiang I. A. Yang, Shiyi Chen

机构 * College of Engineering, Peking University(北京大学工学院) Ningbo Institute of Digital Twin, Eastern Institute of Technology(东方理工高等研究院宁波数字孪生研究院) Shenzhen Tenfong Technology Co., Ltd.(深圳腾方科技有限公司) Mechanical Engineering, Pennsylvania State University(宾夕法尼亚州立大学机械工程系)

AI总结 研究通过变换器语言模型生成高维嵌入空间,发现文本序列中嵌入步信号的功率谱在宽频率范围内呈现接近5/3的幂律,表明语言表示具有多尺度、依赖上下文的组织特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05079 2026-04-08 cs.CV

SVAgent: Storyline-Guided Long Video Understanding via Cross-Modal Multi-Agent Collaboration

SVAgent:通过跨模态多智能体协作实现故事线引导的长视频理解

Zhongyu Yang, Zuhao Yang, Shuo Zhan, Tan Yue, Wei Pang, Yingfang Yuan

机构 * BCML, Heriot-Watt University(赫瑞瓦特大学BCML) Nanyang Technological University(南洋理工大学) Peking University(北京大学)

AI总结 SVAgent通过跨模态多智能体协作,利用故事线引导实现视频问答的高效理解,提升推理鲁棒性和答案一致性。

Comments Published in CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05765 2026-04-08 cs.AI

RL-VLA$^3$: A Flexible and Asynchronous Reinforcement Learning Framework for VLA Training

RL-VLA$^3$:一种灵活且异步的强化学习框架用于VLA训练

Haoran Sun, Yongjian Guo, Zhong Guan, Shuai Di, Xiaodong Bai, Jing Long, Tianyun Zhao, Mingxi Luo, Hongke Zhao, Likang Wu, Xiaotie Deng, Xu Chu, Xi Xiao, Sheng Wen, Yicheng Gong, Junwu Xiong

机构 * Peking University(北京大学) Tsinghua University(清华大学) Tianjin University(天津大学) JDT AI Infra(京东科技AI基础设施) Swinburne University of Technology(斯威本科技大学)

AI总结 本文提出RL-VLA$^3$,一种异步强化学习框架,通过动态批调度和灵活环境分片策略,提升VLA训练效率,实验显示其在8至256GPU上均取得85.2%的吞吐量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02978 2026-04-08 cs.CL cs.AI

Mechanistic Knobs in LLMs: Retrieving and Steering High-Order Semantic Features via Sparse Autoencoders

大语言模型中的机制调节:通过稀疏自编码器检索和引导高阶语义特征

Ruikang Zhang, Shuo Wang, Qi Su

机构 * Peking University(北京大学)

AI总结 本文提出基于稀疏自编码器的框架,通过对比特征检索管道和生成验证,实现对高阶语言行为相关语义内部特征的引导,展示了在Big Five人格特质案例中的精准双向调控效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07388 2026-04-08 cs.CL

Recent Advances in Multimodal Affective Computing: An NLP Perspective

多模态情感计算近期进展:自然语言处理视角

Guimin Hu, Weimin Lyu, Chang Sun, Zhihong Zhu, Lin Gui, Ruichu Cai, Erik Cambria, Hasti Seifi

机构 * Guangdong University of Technology(广东工业大学) Stony Brook University(石溪大学) University of Bologna(博洛尼亚大学) Peking University(北京大学) Nanyang Technological University(南洋理工大学) Arizona State University(亚利桑那州立大学)

AI总结 本文从自然语言处理视角系统回顾了多模态情感计算的最新进展,聚焦于多模态情感分析、对话中多模态情绪识别、基于方面的多模态情感分析及多标签情绪识别等四个任务,提出统一视角并探讨相关方向与挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.15095 2026-04-08 math.ST cs.DS cs.LG math.PR stat.TH

The Umeyama algorithm for matching correlated Gaussian geometric models in the low-dimensional regime

在低维情形下匹配相关高斯几何模型的Umeyama算法

Shuyang Gong, Zhangsong Li

机构 * Peking University(北京大学)

AI总结 本文研究了在低维情形下通过潜在节点排列关联的两个高斯几何模型的匹配问题,证明了Umeyama算法在特定噪声条件下可实现精确或近似恢复排列。

Comments 31 pages; updated funding information

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04875 2026-04-07 cs.CV cs.AI cs.MM

DIRECT: Video Mashup Creation via Hierarchical Multi-Agent Planning and Intent-Guided Editing

DIRECT:通过分层多智能体规划和意图引导编辑实现视频混剪创作

Ke Li, Maoliang Li, Jialiang Chen, Jiayu Chen, Zihao Zheng, Shaoqi Wang, Xiang Chen

机构 * School of Electronics Engineering and Computer Science, Peking University(北京大学电子工程与计算机科学学院) School of Computer Science, Peking University(北京大学计算机科学学院) Huazhong University of Science and Technology(华中科技大学)

AI总结 本文提出DIRECT框架,通过分层多智能体规划和意图引导编辑解决视频混剪中多模态协调问题,提出Mashup-Bench基准并验证了方法在客观和主观评估上的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04634 2026-04-07 cs.CV cs.AI

Preserving Forgery Artifacts: AI-Generated Video Detection at Native Scale

保留伪造痕迹:在原生尺度上进行AI生成视频检测

Zhengcen Li, Chenyang Jiang, Hang Zhao, Shiyang Zhou, Yunyang Mo, Feng Gao, Fan Yang, Qiben Shan, Shaocong Wu, Jingyong Su

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室) Peking University(北京大学)

AI总结 本文提出在原生尺度上进行AI生成视频检测的新方法,通过构建大规模数据集和新型框架,有效保留高频率伪影和时空不一致特征,提升检测性能。

Comments ICLR 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04474 2026-04-07 cs.LG cs.AI

MAVEN: A Mesh-Aware Volumetric Encoding Network for Simulating 3D Flexible Deformation

MAVEN:一种面向网格的体素编码网络,用于模拟3D柔性变形

Zhe Feng, Shilong Tao, Haonan Sun, Shaohan Chen, Zhanxing Zhu, Yunhuai Liu

机构 * Academy for Advanced Interdisciplinary Studies, Peking University(北京大学前沿交叉学科研究院) School of Computer Science, Peking University(北京大学计算机学院) School of Electrical and Computer Science, University of Southampton(南安普顿大学电气与计算机科学学院)

AI总结 本文提出MAVEN,一种面向网格的体素编码网络,用于模拟3D柔性变形。该网络通过显式建模高维几何网格元素,提高物理模拟的准确性。实验表明,MAVEN在多个数据集和新任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04108 2026-04-07 cs.CV

Hypothesis Graph Refinement: Hypothesis-Driven Exploration with Cascade Error Correction for Embodied Navigation

假设图细化:基于假设的探索与级联错误校正的具身导航

Peixin Chen, Guoxi Zhang, Jianwei Ma, Qing Li

机构 * Harbin Institute of Technology(哈尔滨工业大学) Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院) Peking University(北京大学)

AI总结 本文提出HGR框架,通过假设节点的可修改性实现具身导航中的定向探索,并通过级联校正系统性地纠正错误。实验显示HGR在GOAT-Bench和QA基准上均取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01870 2026-04-07 cs.LG cs.SY eess.SY

Towards Intrinsically Calibrated Uncertainty Quantification in Industrial Data-Driven Models via Diffusion Sampler

面向工业数据驱动模型中固有校准不确定性量化的方法 via 扩散采样器

Yiran Ma, Jerome Le Ny, Zhichao Chen, Zhihuan Song

机构 * College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院) Electrical Engineering Department, Polytechnique Montreal(蒙特利尔理工学院电气工程系) GERAD State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院通用人工智能国家重点实验室) Guangdong Provincial Key Laboratory of Petrochemical Equipment Fault Diagnosis, Guangdong University of Petrochemical Technology(广东石油化工学院广东省石化装备故障诊断重点实验室)

AI总结 本文提出一种基于扩散的后验采样框架,通过忠实的后验采样实现固有校准的预测不确定性量化,解决了数据驱动方法中不确定性量化难题。

Comments This manuscript has been accepted for publication in IEEE Transactions on Industrial Informatics. Copyright has been transferred to IEEE. Reuse of this material is subject to IEEE copyright restrictions

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10421 2026-04-07 cs.CV

Neural Collapse in Test-Time Adaptation

测试时适应中的神经塌陷

Xiao Chen, Zhongjing Du, Jiazhen Huang, Xu Jiang, Li Lu, Jingyan Jiang, Zhi Wang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Peking University(北京大学) Sichuan University(四川大学) Shenzhen Technology University(深圳技术大学)

AI总结 本文基于神经塌陷理论,提出NCTTA方法,通过特征与分类器对齐缓解域偏移影响,实验证明其在ImageNet-C上优于Tent。

Comments Aceepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09299 2026-04-07 cs.CV cs.SD

VABench: A Comprehensive Benchmark for Audio-Video Generation

VABench:音频视频生成的综合性基准

Daili Hua, Xizhi Wang, Bohan Zeng, Xinyi Huang, Hao Liang, Junbo Niu, Xinlong Chen, Quanqing Xu, Wentao Zhang

机构 * Peking University(北京大学) Zhongguancun Academy(中关村学院) Beijing Key Laboratory of Data Intelligence (Peking University)(北京市数据智能重点实验室(北京大学)) Ant Group(蚂蚁集团) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Huazhong University of Science and Technology(华中科技大学)

AI总结 本文提出VABench,一个用于评估同步音频视频生成能力的综合性基准,涵盖三种任务类型和15个评估维度,旨在建立新的评估标准以推动视频生成领域的发展。

Comments 24 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14194 2026-04-07 cs.CV cs.AI

VLBiasBench: A Comprehensive Benchmark for Evaluating Bias in Large Vision-Language Model

VLBiasBench: 一个用于评估大视觉-语言模型偏见的综合性基准

Sibo Wang, Xiangkui Cao, Jie Zhang, Zheng Yuan, Shiguang Shan, Xilin Chen, Wen Gao

机构 * Key Laboratory of AI Safety of CAS, Institute of Computing Technology (ICT)(中国科学院人工智能安全重点实验室,计算技术研究所) University of Chinese Academy of Sciences (UCAS)(中国科学院大学) Peking University(北京大学)

AI总结 本文提出VLBiasBench,通过覆盖九种社会偏见类别和两个交叉偏见类别的大规模数据集,评估大视觉-语言模型的偏见问题,基于15种开源和两种闭源模型进行广泛评估,揭示模型中的偏见特征。

Comments Accepted By TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04013 2026-04-07 cs.CL

RUQuant: Towards Refining Uniform Quantization for Large Language Models

RUQuant: 向大语言模型的均匀量化精修迈进

Han Liu, Haotian Gao, Changya Li, Feng Zhang, Xiaotong Zhang, Wei Wang, Hong Yu

机构 * Dalian University of Technology(大连理工大学) Peking University(北京大学) Macao Polytechnic University(澳门理工大学)

AI总结 本文提出RUQuant方法,通过理论分析和两阶段正交变换,解决激活分布非均匀导致的量化精度下降问题,在不需微调的情况下实现高精度量化。

Comments Accepted to KDD 2026. 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏