arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

共收录 3042
2601.22690 2026-02-02 cs.LG cs.AI

Do Transformers Have the Ability for Periodicity Generalization?

Transformer 是否具备周期性泛化能力?

Huanyu Liu, Ge Li, Yihong Dong, Sihan Wu, Peixu Wang, Sihao Cheng, Taozhi Chen, Kechi Zhang, Hao Zhu, Tongxuan Liu

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) College of AI, Tsinghua University(清华大学人工智能学院) School of Science and Engineering, The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)科学与工程学院)

AI总结 本文研究了 Transformer 在周期性泛化方面的局限性,通过引入抽象代数和推理视角,揭示了模型在处理复合周期性任务时的不足,并提出了可控生成基准 Coper。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22536 2026-02-02 cs.AI

Decoding in Geometry: Alleviating Embedding-Space Crowding for Complex Reasoning

解码中的几何学:缓解嵌入空间拥挤以促进复杂推理

Yixin Yang, Qingxiu Dong, Zhifang Sui

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学)

AI总结 本文提出CraEG方法,通过几何引导重新加权缓解嵌入空间拥挤,提升大语言模型在数学问题解决中的推理能力和生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22517 2026-02-02 cs.RO

RoboStriker: Hierarchical Decision-Making for Autonomous Humanoid Boxing

RoboStriker: 为自主人形 boxing 的分层决策

Kangning Yin, Zhe Cao, Wentao Dong, Weishuai Zeng, Tianyi Zhang, Qiang Zhang, Jingbo Wang, Jiangmiao Pang, Ming Zhou, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Peking University(北京大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

AI总结 RoboStriker通过分层三阶段框架实现自主人形拳击,结合动作跟踪学习与潜在空间正则化,提升竞争性能和现实迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22468 2026-02-02 cs.CV cs.AI

Training-Free Representation Guidance for Diffusion Models with a Representation Alignment Projector

无需训练的表示引导用于扩散模型的表示对齐投影器

Wenqiang Zu, Shenghao Xie, Bo Lei, Lei Ma

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

AI总结 本文提出无需训练的表示引导方法,通过引入表示对齐投影器提升扩散模型的语义对齐与图像一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22447 2026-02-02 cs.LG

Beyond Activation Patterns: A Weight-Based Out-of-Context Explanation of Sparse Autoencoder Features

超越激活模式:基于权重的稀疏自编码器特征非情境解释

Yiting Liu, Zhi-Hong Deng

机构 * State Key Laboratory of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(通用人工智能国家重点实验室,智能科学与技术学院,北京大学)

AI总结 该研究提出基于权重的解释框架,揭示稀疏自编码器特征在非情境下的功能效应,发现部分特征直接预测输出并参与注意力机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21933 2026-01-30 cs.CV

Just Noticeable Difference Modeling for Deep Visual Features

深度视觉特征的可察觉差异建模

Rui Zhao, Wenrui Li, Lin Zhu, Yajing Zheng, Weisi Lin

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(新加坡南洋理工大学计算与数据科学学院) Department of Computer Science and Technology, Harbin Institute of Technology, Harbin, China(哈尔滨工业大学计算机科学与技术学院) School of Artificial Intelligence, Beijing Normal University, Beijing, China(北京师范大学人工智能学院) School of Computer Science, Peking University, Beijing, China(北京大学计算机学院)

AI总结 本文提出FeatJND模型,用于深度视觉特征的可察觉差异建模,通过任务对齐的容忍边界提升特征质量控制和量化效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21821 2026-01-30 cs.CV

MMFineReason: Closing the Multimodal Reasoning Gap via Open Data-Centric Methods

MMFineReason: 通过以开放数据为中心的方法缩小多模态推理差距

Honglin Lin, Zheng Liu, Yun Zhu, Chonghan Qin, Juekai Lin, Xiaoran Shang, Conghui He, Wentao Zhang, Lijun Wu

机构 * Shanghai Artificial Intelligence Laboratory, OpenDataLab(上海人工智能实验室、OpenDataLab) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) The University of Hong Kong(香港大学)

AI总结 MMFineReason通过大规模多模态推理数据集和基于难度的过滤策略,提升模型推理能力与参数效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25889 2026-01-30 cs.LG

$π_\texttt{RL}$: Online RL Fine-tuning for Flow-based Vision-Language-Action Models

$π_\ exttt{RL}$: 流基于视觉-语言-动作模型的在线强化学习微调

Kang Chen, Zhihao Liu, Tonghe Zhang, Zhen Guo, Si Xu, Hao Lin, Hongzhi Zang, Xiang Li, Quanlu Zhang, Zhaofei Yu, Guoliang Fan, Tiejun Huang, Yu Wang, Chao Yu

机构 * Tsinghua University(清华大学) Peking University(北京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Carnegie Mellon University(卡内基梅隆大学) Infinigence AI Zhongguancun Academy(中关村学院)

AI总结 本文提出$π_\ exttt{RL}$方法,通过流噪声和流SDE技术,解决大规模流基于VLA模型中强化学习微调的挑战,提升模型在分布内和分布外任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21742 2026-01-30 cs.AI cs.CL cs.MA

Epistemic Context Learning: Building Trust the Right Way in LLM-Based Multi-Agent Systems

知识上下文学习:在基于大语言模型的多智能体系统中以正确方式建立信任

Ruiwen Zhou, Maojia Song, Xiaobao Wu, Sitao Cheng, Xunjian Yin, Yuxi Xie, Zhuoqun Hao, Wenyue Hua, Liangming Pan, Soujanya Poria, Min-Yen Kan

机构 * National University of Singapore(国立新加坡大学) Singapore University of Technology(新加坡科技学院) Nanyang Technological University(南洋理工大学) Duke University(杜克大学) University of Waterloo(滑铁卢大学) Microsoft(微软公司) Peking University(北京大学) University of Pennsylvania(宾夕法尼亚大学)

AI总结 本文提出Epistemic Context Learning(ECL),通过历史交互构建同伴资料以提升多智能体系统中信任建模的准确性,使小型模型在性能上超越大模型,并在多种配置中表现出良好的泛化能力。

Comments Codes and data are available at https://github.com/skyriver-2000/epistemic-context-learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21403 2026-01-30 cs.AI cs.MA

DataCross: A Unified Benchmark and Agent Framework for Cross-Modal Heterogeneous Data Analysis

DataCross: 一个统一的基准和代理框架,用于跨模态异构数据分析

Ruyi Qi, Zhou Liu, Wentao Zhang

机构 * Peking University(北京大学)

AI总结 DataCross提出一个统一的基准和代理框架,用于跨模态异构数据分析,通过多步骤联合推理提升事实性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21375 2026-01-30 cs.AI

TeachBench: A Syllabus-Grounded Framework for Evaluating Teaching Ability in Large Language Models

TeachBench: 一种基于课程的评估大语言模型教学能力的框架

Zheng Li, Siyao Song, Jingyuan Ma, Rui Li, Ying Zeng, Minghao Li, Zhifang Sui

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(信息处理国家重点实验室,计算机学院,北京大学) ByteDance BandAI(字节跳动BandAI) Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院)

AI总结 TeachBench通过多轮指导后学生表现提升评估大语言模型的教学能力,揭示不同模型和领域间教学效果的显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21188 2026-01-30 cs.RO

Disturbance-Aware Flight Control of Robotic Gliding Blimp via Moving Mass Actuation

基于移动质量作动的扰动感知机器人滑翔飞艇飞行控制

Hao Cheng, Feitian Zhang

机构 * Robotics and Control Laboratory, School of Advanced Manufacturing and Robotics, and the State Key Laboratory of Turbulence and Complex Systems, Peking University(机器人与控制实验室,先进制造与机器人学院,湍流与复杂系统国家重点实验室,北京大学)

AI总结 本文提出基于移动质量作动的扰动感知飞行控制方法,通过MHE-MPC框架提升飞艇在风扰动下的稳定性和控制性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21037 2026-01-30 cs.LG cs.AI cs.CL cs.CV

Thinking in Frames: How Visual Context and Test-Time Scaling Empower Video Reasoning

基于框架的思考:视觉上下文和测试时扩展如何增强视频推理

Chengzu Li, Zanyi Wang, Jiaang Li, Yi Xu, Han Zhou, Huanyu Zhang, Ruichuan An, Dengyang Jiang, Zhaochong An, Ivan Vulić, Serge Belongie, Anna Korhonen

机构 * University of Cambridge(剑桥大学) Pioneer Center for AI, University of Copenhagen(人工智能先锋中心,哥本哈根大学) Hong Kong University of Science(香港科学大学) University of California San Diego(加州大学圣地亚哥分校) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Peking University(北京大学)

AI总结 本文提出通过视频生成模型进行视觉推理,利用视觉上下文和测试时扩展提升视频推理能力,展示了模型在空间和时间复杂任务中的鲁棒零样本泛化能力。

Comments 8 pages, 3 figures, 3 tables (26 pages, 13 figures, 6 tables including references and appendices)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02901 2026-01-30 cs.LG cs.AI

Fairy2i: Training Complex LLMs from Real LLMs with All Parameters in $\{\pm 1, \pm i\}$

Fairy2i: 从真实LLM中训练复杂LLM,所有参数在{±1, ±i}中

Feiyu Wang, Xinyu Tan, Bokai Huang, Yihao Zhang, Guoan Wang, Peizhuang Cong, Tong Yang

机构 * Peking University(北京大学)

AI总结 Fairy2i通过将预训练实值层转换为复形式,实现极低比特量化,显著提升LLM推理效率。

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07110 2026-01-30 cs.AI

Two Heads are Better than One: Distilling Large Language Model Features Into Small Models with Feature Decomposition and Mixture

双头胜于单头:通过特征分解和混合将大语言模型特征蒸馏到小模型中

Tianhao Fu, Xinxin Xu, Weichen Xu, Jue Chen, Ruilong Ren, Bowen Deng, Xinyu Zhao, Jian Cao, Xixin Cao

机构 * Peking university(北京大学)

AI总结 本文提出CMM框架,通过特征分解和混合将大语言模型特征蒸馏到小模型中,提升市场做市效率。

Comments accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10890 2026-01-30 cs.CL

LLM$\times$MapReduce-V3: Enabling Interactive In-Depth Survey Generation through a MCP-Driven Hierarchically Modular Agent System

LLM×MapReduce-V3:通过MCP驱动的分层模块化代理系统实现交互式深入调研生成

Yu Chao, Siyu Lin, xiaorong wang, Zhu Zhang, Zihan Zhou, Haoyu Wang, Shuo Wang, Jie Zhou, Zhiyuan Liu, Maosong Sun

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, BNRist Center, Tsinghua University(计算机科学与技术系,人工智能研究院,BNRist中心,清华大学) Peking University(北京大学) Modelbest Inc.(Modelbest公司) Nanyang Technological University(南洋理工大学)

AI总结 LLM×MapReduce-V3通过MCP驱动的分层模块化代理系统实现交互式深入调研生成,提升调研内容深度与长度。

Comments Accepted by EMNLP2025 System Demonstration

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25851 2026-01-30 cs.CV

MuSLR: Multimodal Symbolic Logical Reasoning

MuSLR:多模态符号逻辑推理

Jundong Xu, Hao Fei, Yuhui Zhang, Liangming Pan, Qijun Huang, Qian Liu, Preslav Nakov, Min-Yen Kan, William Yang Wang, Mong-Li Lee, Wynne Hsu

机构 * National University of Singapore(新加坡国立大学) Stanford University(斯坦福大学) Peking University(北京大学) UniMelb(墨尔本大学) University of Auckland(奥克兰大学) MBZUAI(穆斯林人工智能研究所) University of California, Santa Barbara(加州大学圣芭芭拉分校)

AI总结 MuSLR提出了一种多模态符号逻辑推理基准,通过形式逻辑规则提升VLMs的推理能力,显著提升链式推理性能及复杂逻辑处理效果。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18546 2026-01-30 cs.CV

SEGA: A Transferable Signed Ensemble Gaussian Black-Box Attack against No-Reference Image Quality Assessment Models

SEGA:一种可转移的带符号集成高斯黑盒攻击,用于无参考图像质量评估模型

Yujia Liu, Dingquan Li, Zhixuan Li, Tiejun Huang

机构 * School of Computer Science, the National Key Laboratory for Multimedia Information Processing, National Engineering Research Center of Visual Technology, Peking University(计算机科学学院、多媒体信息处理国家级重点实验室、视觉技术工程研究中心、北京大学) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院、南洋理工大学) Department of Networked Intelligence, Pengcheng Laboratory(网络智能系、鹏城实验室)

AI总结 SEGA提出了一种可转移的黑盒攻击方法,通过高斯平滑和集成梯度来提升对无参考图像质量评估模型的攻击效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12327 2026-01-30 cs.CL cs.SI

Word Embeddings Track Social Group Changes Across 70 Years in China

词嵌入追踪中国社会群体变化70年

Yuxi Ma, Yongqian Peng, Yixin Zhu

机构 * Institute for Artificial Intelligence, Peking University(人工智能研究院,北京大学) Yuanpei College, Peking University(元培学院,北京大学)

AI总结 该研究通过分析中国媒体70年的词嵌入数据,揭示了社会群体在官方语言中的演变,强调了非西方视角在计算社会科学中的重要性。

Journal ref Proceedings of the Annual Meeting of the Cognitive Science Society, 47 (2025). Retrieved from https://escholarship.org/uc/item/57j9j7h6

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18944 2026-01-29 cs.AI cs.PL cs.SE

Neural Theorem Proving for Verification Conditions: A Real-World Benchmark

为验证条件进行神经定理证明:一个现实世界的基准测试

Qiyuan Xu, Xiaokun Luan, Renxi Wang, Joshua Ong Jun Leang, Peixin Wang, Haonan Li, Wenda Li, Conrad Watt

机构 * Nanyang Technological University(南洋理工大学) Peking University(北京大学) MBZUAI Imperial College London(帝国理工学院) East China Normal University(华东师范大学) University of Edinburgh(爱丁堡大学)

AI总结 本研究提出NTP4VC,首个现实世界多语言基准测试,评估LLMs在自动验证条件证明中的表现,揭示程序验证中的挑战与未来研究方向。

Comments Accepted in ICLR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00208 2026-01-29 cs.CV

ReactionMamba: Generating Short & Long Human Reaction Sequences

ReactionMamba: 生成短及长人类反应序列

Hajra Anwar Beg, Baptiste Chopin, Hao Tang, Mohamed Daoudi

机构 * Univ. Lille, CNRS, Centrale Lille, Institut Mines-Télécom, UMR 9189 CRIStAL(里尔大学) IMT Nord Europe, Institut Mines-Télécom, Univ. Lille, Centre for Digital Systems(IMT北欧,矿电信学院,里尔大学,数字系统中心) da/sec – Biometrics and Security Research Group, Hochschule Darmstadt(da/sec生物识别与安全研究组,达姆施塔特大学) Peking University(北京大学)

AI总结 ReactionMamba通过结合运动变分自编码器和Mamba状态空间模型,实现了高效生成短及长人类反应序列,提升了生成质量和推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20745 2026-01-29 cs.LG cs.AI

HESTIA: A Hessian-Guided Differentiable Quantization-Aware Training Framework for Extremely Low-Bit LLMs

HESTIA: 一种基于Hessian的可微量化感知训练框架用于极低比特LLMs

Guoan Wang, Feiyu Wang, Zongwei Lv, Yikun Zong, Tong Yang

机构 * School of Software and Microelectronics, Peking University, Beijing, China(软件与微电子学院,北京大学,北京,中国) School of Computer Science, Peking University, Beijing, China(计算机科学学院,北京大学,北京,中国)

AI总结 HESTIA通过Hessian引导的可微量化感知训练框架,实现极低比特LLMs的高效训练,提升模型性能。

Comments 13 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20606 2026-01-29 cs.LG cs.AI q-bio.GN

WFR-MFM: One-Step Inference for Dynamic Unbalanced Optimal Transport

WFR-MFM:动态不平衡最优传输的一步推断

Xinyu Wang, Ruoyu Wang, Qiangwei Peng, Peijie Zhou, Tiejun Li

机构 * LMAM and School of Mathematical Sciences, Peking University(理学院和数学科学学院,北京大学) Center for Machine Learning Research, Peking University(机器学习研究中心,北京大学) Center for Quantitative Biology, Peking University(定量生物学研究中心,北京大学) National Engineering Laboratory for Big Data Analysis and Applications(大数据分析与应用国家工程实验室) AI for Science Institute(人工智能科学研究院) Center for Data Science, Peking University(数据科学中心,北京大学)

AI总结 WFR-MFM通过均流框架实现动态不平衡最优传输的一步推断,显著提升推断速度并保持高准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19129 2026-01-29 cs.CV cs.AI

CLIP-Guided Unsupervised Semantic-Aware Exposure Correction

基于CLIP的无监督语义感知曝光校正

Puzhen Wu, Han Weng, Quan Zheng, Yi Zhan, Hewei Wang, Yiming Li, Jiahui Han, Rui Xu

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) School of Computer Science, Peking University(北京大学计算机学院)

AI总结 本文提出基于CLIP的无监督语义感知曝光校正方法,通过融合预训练模型的语义信息和伪地面真实生成器,有效提升曝光校正效果。

Comments Accepted at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00533 2026-01-29 cs.CV

All-in-One Video Restoration under Smoothly Evolving Unknown Weather Degradations

全场景视频修复应对平滑演变的未知天气退化

Wenrui Li, Hongtao Chen, Yao Xiao, Wangmeng Zuo, Jiantao Zhou, Yonghong Tian, Xiaopeng Fan

机构 * Department of Computer Science and Technology, Harbin Institute of Technology(计算机科学与技术系,哈尔滨工业大学) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室,深圳,中国) School of Computer Science, Peking University(计算机学院,北京大学)

AI总结 本文提出ORCANet网络,针对平滑演变的未知天气退化问题,通过递归条件和适应提示机制实现视频修复的高质量与时序一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23565 2026-01-29 cs.CV cs.AI

RxnBench: A Multimodal Benchmark for Evaluating Large Language Models on Chemical Reaction Understanding from Scientific Literature

RxnBench: 一个用于评估大语言模型在科学文献中理解化学反应的多模态基准

Hanzheng Li, Xi Fang, Yixuan Li, Chaozheng Huang, Junjie Wang, Xi Wang, Hongzhe Bai, Bojun Hao, Shenyu Lin, Huiqi Liang, Linfeng Zhang, Guolin Ke

机构 * DP Technology(DP技术公司) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Peking University(北京大学) New York University(纽约大学) Fudan University(复旦大学) Xiamen University(厦门大学) ShanghaiTech University(上海科技大学)

AI总结 RxnBench通过两个任务评估大语言模型在化学反应理解上的能力,揭示模型在深度化学逻辑和结构识别上的不足,强调需改进视觉编码和推理能力以推动AI化学发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19862 2026-01-28 cs.LG cs.GT

Calibration without Ground Truth

无需真实标注的校准

Yuqing Kong, Mingyu Song, Yizhou Wang, Yifan Wu

机构 * Peking University(北京大学) Microsoft Research(微软研究院)

AI总结 本文提出一种无需标注的校准方法,通过参考模型改进校准不准确的强模型,实现性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19435 2026-01-28 cs.GT cs.AI cs.CL

Ad Insertion in LLM-Generated Responses

在大语言模型生成响应中插入广告

Shengwei Xu, Zhaohua Chen, Xiaotie Deng, Zhiyi Huang, Grant Schoenebeck

机构 * University of Michigan(密歇根大学) Peking University(北京大学) The University of Hong Kong(香港大学)

AI总结 本文提出了解耦广告插入与响应生成、以及竞价与用户查询的框架,通过基于类型拍卖机制实现近最优的社会福利,同时提高计算效率和上下文一致性。

Comments 31 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19290 2026-01-28 cs.CL

MetaGen: Self-Evolving Roles and Topologies for Multi-Agent LLM Reasoning

MetaGen: 多智能体LLM推理中的自演化角色与拓扑

Yimeng Wang, Jiaxing Zhao, Hongbin Xie, Hexing Ma, Yuzhen Lei, Shuangxue Liu, Xuan Song, Zichen Zhang, Haoran Zhang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学计算机科学与工程系) School of Urban Planning and Design, Peking University(北京大学城市规划与设计学院)

AI总结 MetaGen通过自演化角色和拓扑提升多智能体LLM推理的准确性和效率

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19267 2026-01-28 cs.CL

DiaDem: Advancing Dialogue Descriptions in Audiovisual Video Captioning for Multimodal Large Language Models

DiaDem: 促进音频视频字幕中的对话描述以提升多模态大语言模型

Xinlong Chen, Weihong Lin, Jingyun Hua, Linli Yao, Yue Ding, Bozhou Li, Bohan Zeng, Yang Shi, Qiang Liu, Yuanxing Zhang, Pengfei Wan, Liang Wang, Tieniu Tan

机构 * New Laboratory of Pattern Recognition, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别新实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Peking University(北京大学) Nanjing University(南京大学)

AI总结 DiaDem通过合成高质量数据集和难度分区的两阶段GRPO策略,提升了音频视频字幕中的对话描述准确性,并在多种基准测试中表现出色。

Comments Project webpage: https://diadem-captioner.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏