arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

共收录 3038
2605.13859 2026-05-15 cs.NE cs.AI cs.LG

BiSpikCLM: A Spiking Language Model integrating Softmax-Free Spiking Attention and Spike-Aware Alignment Distillation

BiSpikCLM: 一种整合无Softmax脉冲注意力和脉冲感知对齐蒸馏的脉冲语言模型

Sihang Guo, Chenlin Zhou, Jiaqi Wang, Kehai Chen, Qingyan Meng, Zhengyu Ma

机构 * School of Electronic and Computer Engineering, Shenzhen Graduate School, Peking University, Shenzhen, China(电子工程学院,深圳研究生院,北京大学,深圳,中国) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室,深圳,中国) Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学,深圳,中国)

AI总结 BiSpikCLM是首个完全二进制脉冲MatMul-free因果语言模型,通过无Softmax脉冲注意力和脉冲感知对齐蒸馏实现高效训练,显著降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13786 2026-05-14 cs.LG

Interpretable Machine Learning for Antepartum Prediction of Pregnancy-Associated Thrombotic Microangiopathy Using Routine Longitudinal Laboratory Data

利用常规纵向实验室数据对妊娠相关血栓性微血管病进行可解释性机器学习预测

Chuanchuan Sun, Zhen Yu, Qin Fan, Qingchao Chen, Feng Yu

机构 * Public Health and Preventive Medicine of Peking University School of Public Health, Peking University(北京大学公共卫生学院公共卫生与预防医学系,北京大学) Department of Nephrology, Peking University International Hospital(北京大学国际医院肾内科) National Institute of Health Data Science, Peking University(北京大学国家卫生数据科学研究院) Peking University Health Science Center, Peking University(北京大学健康科学中心,北京大学)

AI总结 本文通过可解释性机器学习方法,利用常规纵向实验室数据预测妊娠相关血栓性微血管病风险,采用梯度提升算法在测试集上取得高AUC值,发现胱atin C在第6周具有早期监测潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13476 2026-05-14 cs.CV

Neural Video Compression with Domain Transfer

基于领域迁移的神经视频压缩

Tiange Zhang, Rongqun Lin, Xiandong Meng, Haofeng Wang, Xing Tian, Qi Zhang, Siwei Ma

机构 * Shenzhen Graduate School, Peking University, Shenzhen, China(北京大学深圳研究生院,深圳,中国) Pengcheng Laboratory, Shenzhen, China(鹏城实验室,深圳,中国) School of Computer Science, Peking University, Beijing, China(北京大学计算机学院,北京,中国)

AI总结 本文提出DCVC-DT框架,通过在线领域迁移机制和动态RD调整方案,提升神经视频压缩的领域适应性和压缩效率,实现6.21%的比特率节省。

Comments Accepted to ISCAS 2026 as an oral paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13452 2026-05-14 cs.RO cs.AI

CUBic: Coordinated Unified Bimanual Perception and Control Framework

CUBic:协调统一的双臂感知与控制框架

Xingyu Wang, Pengxiang Ding, Jingkai Xu, Donglin Wang, Zhaoxin Fan

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, School of Artificial Intelligence, Beihang University(北京未来区块链与隐私计算高级创新中心,人工智能学院,北京航空航天大学) Westlake University(西湖大学) Zhejiang University(浙江大学) Peking University(北京大学)

AI总结 本文提出CUBic框架,通过统一感知模型解决双臂协调问题,采用共享表示学习提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13403 2026-05-14 cs.RO cs.CV

RotVLA: Rotational Latent Action for Vision-Language-Action Model

RotVLA: 旋转的潜在动作用于视觉-语言-动作模型

Qiwei Li, Xicheng Gong, Xinghang Li, Peiyan Li, Quanyun Zhou, Hangjun Ye, Jiahuan Zhou, Yadong Mu

机构 * Wangxuan Institute of Computer Technology, Peking University(王轩计算机技术研究所,北京大学) Xiaomi Robotics(小米机器人) CASIA

AI总结 RotVLA提出基于连续旋转潜在动作表示的VLA框架,通过三元组帧学习和流匹配头实现高效动作建模,实现98.2%的LIBERO和89.6%/88.5%的RoboTwin2.0性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10415 2026-05-14 cs.CL

Aligning LLM Uncertainty with Human Disagreement in Subjectivity Analysis

对主观分析中语言模型不确定性与人类分歧的对齐

Junyu Lu, Deyi Ji, Xuanyi Liu, Lanyun Zhu, Bo Xu, Liang Yang, Xian-Sheng Hua, Hongfei Lin

机构 * School of Computer Science and Technology, Dalian University of Technology, China(大连理工大学计算机科学与技术学院) Tencent(腾讯) Peking University(北京大学) Tongji University(同济大学)

AI总结 本文提出DPUA框架,通过感知分歧和对齐不确定性,提升模型在主观分析中的可靠性与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10547 2026-05-14 cs.AI

Agent^2 RL-Bench: Can LLM Agents Engineer Agentic RL Post-Training?

Agent^2 RL-Bench: 能否让LLM代理在训练后设计自主强化学习?

Wanyi Chen, Xiao Yang, Xu Yang, Tianming Sha, Qizheng Li, Zhuo Wang, Bowen Xian, Fang Kong, Weiqing Liu, Jiang Bian

机构 * Soochow University(苏州大学) Microsoft Research Asia(微软亚洲研究院) Peking University(北京大学) Stony Brook University(石溪大学) The University of Chicago(芝加哥大学)

AI总结 Agent2 RL-Bench评估LLM代理在训练后自主设计、实现、调试和执行提升基础模型的管道能力,展示代理在强化学习中的智能行为与局限性。

Comments 37 pages, 7 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07342 2026-05-14 cs.AI

SupChain-Bench: Benchmarking Large Language Models for Real-World Supply Chain Management

SupChain-Bench:针对现实世界供应链管理的大语言模型基准测试

Shengyue Guan, Yihao Liu, Lang Cao

机构 * Alibaba Group(阿里巴巴集团) Peking University(北京大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本文提出SupChain-Bench基准测试,用于评估大语言模型在现实世界供应链管理中的表现,揭示模型执行可靠性差距,并提出SupChain-ReAct框架提升工具调用性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04804 2026-05-14 cs.CL

OmniSIFT: Modality-Asymmetric Token Compression for Efficient Omni-modal Large Language Models

OmniSIFT: 多模态非对称令牌压缩用于高效的多模态大语言模型

Yue Ding, Yiyan Ji, Jungang Li, Xuyang Liu, Xinlong Chen, Junfei Wu, Bozhou Li, Bohan Zeng, Yang Shi, Yushuo Guan, Yuanxing Zhang, Jiaheng Liu, Qiang Liu, Pengfei Wan, Liang Wang

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences (CASIA)(模式识别新实验室(NLPR)、自动化研究所、中国科学院(CASIA)) Nanjing University(南京大学) The Hong Kong University of Science(香港科学大学) Sichuan University(四川大学) Peking University(北京大学)

AI总结 OmniSIFT通过非对称令牌压缩框架提升多模态大语言模型效率,采用时空视频修剪和视觉引导音频选择模块,实现低参数高鲁棒性。

Comments [ICML 2026] Code Link: https://github.com/dingyue772/OmniSIFT

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18993 2026-05-14 cs.LG

CR-Net: Scaling Parameter-Efficient Training with Cross-Layer Low-Rank Structure

CR-Net:通过跨层低秩结构实现参数高效训练

Boao Kong, Junzhu Liang, Yuxi Liu, Renjia Deng, Kun Yuan

机构 * Peking University(北京大学)

AI总结 CR-Net通过跨层低秩结构提升大语言模型预训练效率,减少计算和内存需求,同时保持模型性能。

Comments 32 pages. Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13301 2026-05-14 cs.AI cs.CL

Achieving Gold-Medal-Level Olympiad Reasoning via Simple and Unified Scaling

通过简单统一的扩展实现金牌级竞赛推理

Yafu Li, Runzhe Zhan, Haoran Zhang, Shunkai Zhang, Yizhuo Li, Zhilin Wang, Jiacheng Chen, Futing Wang, Xuyang Hu, Yuchen Fan, Bangjie Xu, Yucheng Su, Xinmiao Han, Chenxi Li, Haodi Lei, Yufeng Zhao, Zejin Lin, Qianjia Cheng, Tong Zhu, Xiaoye Qu, Ganqu Cui, Peng Ye, Yun Luo, Zhouchen Lin, Yu Qiao, Bowen Zhou, Ning Ding, Yu Cheng

机构 * Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学)

AI总结 本文提出一种简单统一的方法,将训练好的推理模型扩展为金牌级竞赛解题器,通过反熵课程和两级强化学习提升证明搜索能力,最终在数学和物理竞赛中取得金牌水平表现。

Comments Technical Report. 77 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13167 2026-05-14 cs.CL

GeoBuildBench: A Benchmark for Interactive and Executable Geometry Construction from Natural Language

GeoBuildBench:一个用于从自然语言构建可执行几何构造的基准

Jinwoong Kim, Rui Yang, Huishuai Zhang

机构 * Peking University(北京大学) Wangxuan Institute of Computer Technology(王璇计算机技术研究院)

AI总结 GeoBuildBench评估大语言模型能否将自然语言几何问题转化为可执行构造,包含489道中文教材问题,验证了多模态模型在交互构造任务中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13111 2026-05-14 cs.CV

Pyramid Forcing: Head-Aware Pyramid KV Cache Policy for High-Quality Long Video Generation

金字塔强制:面向高质量长视频生成的头部感知金字塔KV缓存策略

Jiayu Chen, Junbei Tang, Wenbiao Zhao, Maoliang Li, Jiayi Luo, Zihao Zheng, Jiawei Yang, Guojie Luo, Xiang Chen

机构 * Peking University(北京大学) South China University of Technology(华南理工大学) Xinjiang University(新疆大学) Beihang University(北京航空航天大学) Zhongguancun Academy(中关村学院)

AI总结 本文提出Pyramid Forcing,通过识别不同头部类型并分配特定缓存策略,提升长视频生成质量,实验显示在VBench-Long上Self Forcing得分提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13099 2026-05-14 cs.SD

Bypassing Direct Reconstruction: Speech Detection from MEG via Large-Scale Audio Retrieval

绕过直接重建:通过大规模音频检索进行MEG语音检测

Boda Xiao, Bo Wang, Heping Cheng

机构 * Center for BioMed-X Research, Academy for Advanced Interdisciplinary Studies, Peking University(北京大学生物医学交叉研究学院,先进跨学科研究学院) Speech and Hearing Research Center, School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院语音听力研究中心) State Key Laboratory of General Artificial Intelligence, Beijing, China(一般人工智能国家重点实验室,中国北京) National Biomedical Imaging Center, State Key Laboratory of Membrane Biology, Institute of Molecular Medicine, Peking-Tsinghua Center for Life Sciences, College of Future Technology, Peking University(国家生物医学成像中心,膜生物学国家重点实验室,分子医学研究院,北京大学-清华大学生命科学学院,未来技术学院,北京大学)

AI总结 本文提出一种两阶段框架,通过大规模音频库检索匹配语音片段,再直接生成二元静音/语音序列,有效提升MEG语音检测性能。

Comments ranked first at LibriBrain Competition 2025 https://neural-processing-lab.github.io/2025-libribrain-competition/prizes/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13034 2026-05-14 cs.CV cs.IR

ViDR: Grounding Multimodal Deep Research Reports in Source Visual Evidence

ViDR:基于源视觉证据的多模态深度研究报告 grounding

Zhuofan Shi, Peilun Jia, Baoqin Sun, Haiyang Shen, Sixiong Xie, Yun Ma, Xiang Jing

机构 * School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) National Key Laboratory of Data Space Technology and System(数据空间技术与系统国家重点实验室) School of Software Engineering, Beijing Jiaotong University(北京交通大学软件学院) College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院)

AI总结 ViDR通过源视觉证据构建多模态深度研究报告框架,提升报告质量与证据可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12965 2026-05-14 cs.LG cs.NA math.NA

U-HNO: A U-shaped Hybrid Neural Operator with Sparse-Point Adaptive Routing for Non-stationary PDE Dynamics

U-HNO:一种U形混合神经算子,用于非平稳PDE动力学的稀疏点自适应路由

Yingzhe Ma, Xiao Yang, Yuxin Xie, Zihan Xiong, Jinliang Liu

机构 * University of Electronic Science and Technology of China(电子科技大学) Peking University(北京大学)

AI总结 U-HNO通过稀疏点自适应路由机制,在非平稳PDE动力学中实现全局傅里叶分支与局部多尺度高斯分支的动态混合,提升滚动预测精度。

Comments 26 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12940 2026-05-14 cs.LG cs.AI

The Expressivity Boundary of Probabilistic Circuits: A Comparison with Large Language Models

概率电路的表达性边界:与大语言模型的比较

Zhiyu Zhao, Xuejie Liu, Muhan Zhang, Anji Liu

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院)

AI总结 本文比较概率电路与大语言模型在自回归框架下的表现,发现概率电路通过logit空间参数化和结构分解可缩小表达性差距,但其在异质依赖拓扑下仍存在表达限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12882 2026-05-14 cs.CL cs.CV

CiteVQA: Benchmarking Evidence Attribution for Trustworthy Document Intelligence

CiteVQA:可信赖文档智能的证据归因基准测试

Dongsheng Ma, Jiayu Li, Zhengren Wang, Yijie Wang, Jiahao Kong, Weijun Zeng, Jutao Xiao, Jie Yang, Wentao Zhang, Bin Wang, Conghui He

机构 * Peking University(北京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 CiteVQA通过要求模型返回元素级边界框引用,评估文档理解中的证据归因,揭示了现有评估方法的可靠性缺口,主要贡献是引入Strict Attributed Accuracy指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06387 2026-05-14 cs.LG cs.AI

Asymmetric On-Policy Distillation: Bridging Exploitation and Imitation at the Token Level

非对称在线策略蒸馏:在令牌层面弥合利用与模仿

Nan Jia, Haojin Yang, Xing Ma, Jiesong Lian, Shuailiang Zhang, Weipeng Zhang, Ke Zeng, Xunliang Cai, Zequn Sun

机构 * Huazhong University of Science and Technology(华中科技大学) Peking University(北京大学) Meituan(美团)

AI总结 本文提出非对称在线策略蒸馏,通过局部散度最小化改进传统策略蒸馏,提升数学推理任务表现,实现更稳定的策略熵和持续工具使用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06475 2026-05-14 cs.LG

Towards Generalizable Reasoning: Group Causal Counterfactual Policy Optimization for LLM Reasoning

迈向通用性推理:面向LLM推理的群体因果反事实策略优化

Jingyao Wang, Peizheng Guo, Wenwen Qiang, Jiahuan Zhou, Huijie Guo, Changwen Zheng, Hui Xiong

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) Wangxuan Institute of Computer Technology, Peking University(北京大学王宣计算机技术研究所) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 本文提出群体因果反事实策略优化方法,通过反事实奖励提升LLM推理的通用性,强调推理过程的鲁棒性和有效性,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21577 2026-05-14 cs.LG

Collaborative Parameter Learning: Mitigating Forgetting via Parameter-Level Gradient Analysis

协同参数学习:通过参数级梯度分析缓解遗忘

Mutian Yang, Zisen Zhan, Yutong Chen, Haolin Li, Kaiwen Wang, Kaili Zheng, Yuguang Wang, Qi Wang, Jiandong Gao, Ji Wu

机构 * Department of Electronic Engineering, Tsinghua University, Beijing, China(清华大学电子工程系,北京,中国) Institute of Medical Technology, Peking University Health Science Center, Peking University, Beijing, China(北京大学医学部医学技术研究所,北京大学,北京,中国) College of Information Science and Engineering, Northeastern University, Shenyang, China(东北大学信息科学与工程学院,沈阳,中国) College of AI, Tsinghua University, Beijing, China(清华大学人工智能学院,北京,中国) Beijing National Research Center for Information Science and Technology, Beijing, China(北京信息科学与技术国家研究中心,北京,中国)

AI总结 本文提出协同参数学习方法,通过分析参数级梯度相似性,识别冲突参数和协作参数,冻结冲突参数以减少遗忘,提升模型在多任务和多语言场景下的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09675 2026-05-14 cs.CL

d-TreeRPO: Towards More Reliable Policy Optimization for Diffusion Language Models

d-TreeRPO:迈向更可靠的扩散语言模型策略优化

Leyi Pan, Shuchang Tao, Yunpeng Zhai, Zheyu Fu, Liancheng Fang, Minghua He, Lingzhe Zhang, Zhaoyang Liu, Bolin Ding, Aiwei Liu, Lijie Wen

机构 * Tsinghua University(清华大学) Tongyi Lab(通义实验室) University of Illinois at Chicago(伊利诺伊大学香槟分校) Peking University(北京大学)

AI总结 本文提出d-TreeRPO框架,通过树状回滚和可验证奖励提升扩散语言模型策略优化的可靠性,理论证明预测信心提升可减少预测概率偏差,并在多个推理基准上取得显著提升。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08411 2026-05-14 cs.AI cs.RO

Prismatic World Model: Learning Compositional Dynamics for Planning in Hybrid Systems

棱柱世界模型:学习组合动力学以在混合系统中规划

Mingwei Li, Xiaoyuan Zhang, Chengwei Yang, Zilong Zheng, Yaodong Yang

机构 * Beijing Institute of Technology(北京理工大学) Peking University(北京大学) NLCo Lab, Beijing Institute for General Artificial Intelligence(北大师范学院实验室,北京人工智能研究院)

AI总结 本文提出Prismatic World Model,通过分解混合动力学为可组合的原始构件,解决机器人领域中基于模型的规划问题,提升轨迹优化算法的精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10642 2026-05-14 cs.RO cs.AI

UniJEPA: Enhancing Robot Policy via Unified Continuous and Discrete Representation Learning

UniJEPA:通过统一的连续和离散表示学习增强机器人策略

Jianke Zhang, Yucheng Hu, Yanjiang Guo, Xiaoyu Chen, Yichen Liu, Wenna Chen, Chaochao Lu, Jianyu Chen

机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University, Beijing, China.(清华大学交叉信息研究院) Shanghai Qi Zhi Institute, Shanghai, China(上海启智研究院) Peking University, Beijing, China(北京大学) Shanghai AI Lab, Shanghai, China(上海人工智能实验室)

AI总结 本文提出UniJEPA,通过大规模预训练学习高维视觉特征,结合理解、规划和连续未来表示学习,提升机器人在开放环境中的任务执行能力。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15953 2026-05-14 cs.RO

ViTacFormer: Learning Cross-Modal Representation for Visuo-Tactile Dexterous Manipulation

ViTacFormer:学习跨模态表示以实现视觉-触觉灵巧操作

Liang Heng, Haoran Geng, Kaifeng Zhang, Pieter Abbeel, Jitendra Malik

机构 * University of California, Berkeley(加州大学伯克利分校) Peking University(北京大学) Sharpa

AI总结 本文提出ViTacFormer,通过跨注意力编码器融合高分辨率视觉与触觉,并结合自回归触觉预测头提升精度与鲁棒性,实现多指手的模仿学习,成功完成高精度灵巧操作任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14375 2026-05-14 cs.LG cs.CL

Causal Fine-Tuning under Latent Confounded Shift

潜在混杂偏移下的因果微调

Jialin Yu, Yuxiang Zhou, Haoxuan Li, Junchi Yu, Mengyue Yang, Yulan He, Nevin L. Zhang, Philip Torr, Ricardo Silva

机构 * University of Oxford, United Kingdom(牛津大学) Queen Mary University of London, United Kingdom(伦敦玛丽女王大学) Peking University, China(北京大学) University of Bristol, United Kingdom(布里斯托大学) King's College London, United Kingdom(伦敦国王学院) Hong Kong University of Science(香港科学大学) University College London, United Kingdom(伦敦大学学院)

AI总结 本文提出Causal Fine-Tuning方法,通过结构因果模型分解表示为稳定高层和敏感低层成分,提升模型在存在潜在混杂偏移时的鲁棒性,实验显示优于其他基线方法。

Comments ICML 2026 Camera Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12549 2026-05-14 cs.CV

What Happens Before Decoding? Prefill Determines GUI Grounding in VLMs

解码之前发生了什么?预填充决定了VLMs中的GUI接地

Jiaping Lin, Fei Shen, Junzhe Li, Ping Nie, Fei Yu, Ming Li, Haizhou Li

机构 * Guangming Laboratory(光明实验室) National University of Singapore(新加坡国立大学) Peking University(北京大学) University of Waterloo(滑铁卢大学) The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳))

AI总结 本文研究了VLMs中GUI接地的两阶段机制,发现预填充阶段决定候选UI元素,解码阶段进一步优化坐标。提出Re-Prefill方法通过引入注意力引导的第二预填充阶段提升目标选择精度,实验显示在多个基准上提升4.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12480 2026-05-13 cs.CV cs.AI

OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation

OmniNFT: 多模态联合音频视频生成的模态感知强化学习

Guohui Zhang, XiaoXiao Ma, Jie Huang, Hang Xu, Hu Yu, Siming Fu, Yuming Li, Zeyue Xue, Lin Song, Haoyang Huang, Nan Duan, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) Peking University(北京大学) JD Explore Academy(京东探索研究院)

AI总结 本文提出OmniNFT,通过模态感知强化学习框架解决多模态联合生成中的模态一致性、梯度不平衡和信用分配问题,提升音频视频感知质量与同步性能。

Comments Project page: https://zghhui.github.io/OmniNFT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12154 2026-05-13 cs.AI

MM-OptBench: A Solver-Grounded Benchmark for Multimodal Optimization Modeling

MM-OptBench:一种面向多模态优化建模的求解器导向基准

Zhong Li, Qi Huang, Yuxuan Zhu, Mohammad Mohammadi Amiri, Niki van Stein, Thomas Bäck, Matthijs van Leeuwen, Zaiwen Wen, Lincen Yang

机构 * Great Bay University(大湾大学) Leiden University(莱顿大学) Rensselaer Polytechnic Institute(伦塞拉尔理工学院) Peking University(北京大学)

AI总结 本文提出MM-OptBench,一个基于求解器的多模态优化建模基准,通过文本和视觉信息生成数学模型和求解器代码,评估9种多模态大语言模型在不同难度实例上的表现,结果显示任务仍远未解决。

Comments Paper under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12061 2026-05-13 cs.AI

SAGE: A Self-Evolving Agentic Graph-Memory Engine for Structure-Aware Associative Memory

SAGE:一种自演化代理图记忆引擎,用于结构感知的联想记忆

Juntong Wang, Haoyue Zhao, guanghui Pan, Xiyuan Wang, Yanbo Wang, Qiyan Deng, Muhan Zhang

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学校) School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学校)

AI总结 SAGE通过自演化机制和图记忆引擎提升长期记忆能力,在多跳问答、开放领域检索等任务中表现出色,显著提高了证据恢复和检索效率。

详情

展开后加载摘要…

URL PDF HTML 收藏