arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

共收录 3038
2604.27934 2026-05-01 cs.AI cs.CL

MM-StanceDet: Retrieval-Augmented Multi-modal Multi-agent Stance Detection

MM-StanceDet:基于检索的多模态多智能体立场检测

Weihai Lu, Zhejun Zhao, Yanshu Li, Huan He

机构 * Peking University(北京大学) Baidu Inc(百度公司) Brown University(布朗大学) Amazon(亚马逊)

AI总结 本文提出MM-StanceDet框架,通过整合检索增强、多模态分析代理、辩论阶段和自我反思,解决多模态立场检测中的上下文 grounding、跨模态解释模糊和单次推理脆弱问题,实验表明其在五个数据集上优于现有方法。

Comments Accepted on ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27861 2026-05-01 cs.CR cs.CL cs.LG

TwinGate: Stateful Defense against Decompositional Jailbreaks in Untraceable Traffic via Asymmetric Contrastive Learning

TwinGate: 通过非对称对比学习实现对不可追踪流量中分解性劫持的有状态防御

Bowen Sun, Chaozhuo Li, Yaodong Yang, Yiwei Wang, Chaowei Xiao

机构 * Johns Hopkins University(约翰霍普金斯大学) Microsoft Research Asia(微软亚洲研究院) Peking University(北京大学) University of California, Merced(加州大学默塞德分校)

AI总结 针对LLM中分解性劫持威胁,TwinGate通过非对称对比学习在共享潜在空间中聚类语义不同但意图匹配的恶意片段,同时利用冻结编码器抑制良性主题重叠导致的误报,实现高效防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27763 2026-05-01 cs.AI

Intent2Tx: Benchmarking LLMs for Translating Natural Language Intents into Ethereum Transactions

Intent2Tx:评估大语言模型将自然语言意图转换为以太坊交易的基准测试

Zhuoran Pan, Yue Li, Zhi Guan, Jianbin Hu, Zhong Chen

机构 * Taiyuan University of Technology(太原科技大学) Peking University(北京大学)

AI总结 本文提出Intent2Tx基准测试,基于真实以太坊链上数据,评估大语言模型将自然语言意图转换为功能正确、状态依赖的链上交易的能力,发现现有模型在多步规划和泛化能力上存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22615 2026-05-01 cs.RO

GazeVLA: Learning Human Intention for Robotic Manipulation

GazeVLA:学习人类意图以促进机器人操作

Chengyang Li, Kaiyi Xiong, Yuan Xu, Lei Qian, Yizhou Wang, Wentao Zhu

机构 * Shanghai Jiao Tong University(上海交通大学) Eastern Institute of Technology, Ningbo(宁波东部科技研究院) Peking University(北京大学) ShanghaiTech University(上海科技大学)

AI总结 本文提出GazeVLA框架,通过学习人类意图弥合人机之间的固有差距,提升机器人操作性能。

Comments Project page: https://gazevla.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14988 2026-05-01 cs.CV

Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: A Comprehensive Evaluation

在细粒度图像任务上评估大型视觉-语言模型:全面评估

Hong-Tao Yu, Yuxin Peng, Serge Belongie, Xiu-Shen Wei

机构 * School of Computer Science and Engineering, School of Intelligence Science and Engineering and Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications, Southeast University, China(东南大学计算机科学与工程学院、智能科学与工程学院及新一代人工智能技术及其跨学科应用关键实验室,中国) Wangxuan Institute of Computer Technology, Peking University, China(北京大学王轩计算机技术研究所,中国) University of Copenhagen, Denmark(丹麦哥本哈根大学)

AI总结 本文提出FG-BMK基准,通过101万问题和33万张图像评估LVLMs的语义识别与细粒度特征表示能力,揭示训练范式、模态对齐等对性能的影响,为未来模型设计提供指导。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27699 2026-05-01 cs.AI

Bridging Values and Behavior: A Hierarchical Framework for Proactive Embodied Agents

连接价值与行为:一种面向主动具身代理的分层框架

Chunhui Zhang, Yuxuan Wang, Aoyang Qin, Yi-Long Lu, Kunlun Wu, Yizhou Wang, Wei Wang

机构 * State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) School of Computer Science, Peking University(北京大学计算机学院) Tsinghua University(清华大学) Nat’l Eng. Research Center of Visual Technology, Peking University(北京大学视觉技术国家工程研究中心) Institute for AI, Peking University(北京大学人工智能研究院) State Key Laboratory of General Artificial Intelligence, Peking University(通用人工智能国家重点实验室,北京大学)

AI总结 本文提出ValuePlanner框架,通过分层认知架构分离高阶价值调度与低阶行动执行,结合LLM生成符号子目标并用PDDL规划器转化为行动计划,通过反馈机制提升自主性,实验表明其能生成连贯的长期自主行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27491 2026-05-01 cs.CV

Uni-HOI:A Unified framework for Learning the Joint distribution of Text and Human-Object Interaction

Uni-HOI: 一种学习文本与人-物交互联合分布的统一框架

Mengfei Zhang, Jinlu Zhang, Zhigang Tu

机构 * Wuhan University(武汉大学) Peking University(北京大学) Institute for Clarity in Documentation(文档清晰研究所) Inria Paris-Rocquencourt(巴黎-罗quentcourt研究所) Rajiv Gandhi University(拉贾·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒研究实验室)

AI总结 本文提出Uni-HOI框架,通过结合大语言模型和VQ-VAE,统一建模文本、人体运动和物运动的联合分布,解决多模态交互任务中的数据异质性问题。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27340 2026-05-01 cs.AI

Investigating More Explainable and Partition-Free Compositionality Estimation for LLMs: A Rule-Generation Perspective

探究更可解释且无分区的组合性估计方法:从规则生成的角度

Ziyao Xu, Cong Wang, Houfeng Wang

机构 * National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(国家多媒体信息处理重点实验室,计算机学院,北京大学) OPPO AI Center(OPPO人工智能中心)

AI总结 本文提出从规则生成角度评估LLM组合性的新方法,解决现有测试的局限性,通过字符串到网格任务实验揭示LLM的组合性特征与不足。

Comments Accepted at ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26960 2026-05-01 cs.CY cs.AI

LLM Biases

LLM偏见

Jinhui Han, Ming Hu, Xilin Zhang

机构 * Guanghua School of Management, Peking University(北京大学光华管理学院) Rotman School of Management, University of Toronto(多伦多大学罗特曼管理学院)

AI总结 本文研究了基于Transformer的生成推荐系统中四种系统性偏见机制,指出其可能影响长期多样性和用户选择,强调需关注运营风险而非仅依赖性能指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25367 2026-05-01 cs.CV

Self-DACE++: Robust Low-Light Enhancement via Efficient Adaptive Curve Estimation

Self-DACE++:通过高效自适应曲线估计实现鲁棒低光照增强

Jianyu Wen, Jun Xie, Feng Chen, Zhepeng Wang, Chenhao Wu, Tong Zhang, Yixuan Yu, Piotr Swierczynski

机构 * Lenovo Research(联想研究院) Imperial College London(帝国理工学院伦敦分校) Southern University of Science(南方科技大学) Peking University(北京大学) NODAR Inc.(NODAR公司)

AI总结 本文提出Self-DACE++,一种改进的无监督轻量级低光照图像增强框架,通过增强自适应调整曲线提升计算效率与恢复质量,实现实时高效增强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24564 2026-05-01 cs.CL cs.IR cs.IT math.IT

MEG-RAG: Quantifying Multi-modal Evidence Grounding for Evidence Selection in RAG

MEG-RAG: 多模态证据 grounding 的量化研究以提升 RAG 中的证据选择

Xihang Wang, Zihan Wang, Chengkai Huang, Quan Z. Sheng, Lina Yao

机构 * Institute for Clarity in Documentation(清晰文档研究所) Inria Paris-Rocquencourt(巴黎- Rocquencourt 国家信息与自动化研究所) Rajiv Gandhi University(拉吉夫·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒尔研究实验室) Zhejiang University(浙江大学) Peking University(北京大学) University of New South Wales(新南威尔士大学) Macquarie University(麦考瑞大学) CSIRO’s Data61(CSIRO 数据61)

AI总结 本文提出 MEG-RAG 框架,通过语义感知的多模态证据 grounding 方法提升 RAG 中的证据选择准确性与多模态一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24026 2026-05-01 cs.CL cs.AI

From Skill Text to Skill Structure: The Scheduling-Structural-Logical Representation for Agent Skills

从技能文本到技能结构:面向智能体技能的调度-结构-逻辑表示

Qiliang Liang, Hansi Wang, Zhong Liang, Yang Liu

机构 * Key Laboratory of Computational Linguistics, Ministry of Education, Peking University(计算语言学重点实验室,教育部,北京大学) School of Computer Science, Peking University(北京大学计算机学院) Department of Chinese Language and Literature, Peking University(北京大学中文语言文学系)

AI总结 本文提出调度-结构-逻辑(SSL)表示法,通过解耦技能调度信号、执行结构和逻辑证据,提升智能体技能的可搜索性和可审查性,实验表明其在技能发现和风险评估任务中优于纯文本基线。

Comments 21 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23763 2026-05-01 cs.CV

Edit Where You Mean: Region-Aware Adapter Injection for Mask-Free Local Image Editing

在需要的地方编辑:区域感知的适配器注入用于无掩码的局部图像编辑

Honghao Cai, Xiangyuan Wang, Yunhao Bai, Haohua Chen, Tianze Zhou, Runqi Wang, Wei Zhu, Yibo Chen, Xu Tang, Yao Hu, Zhen Li

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Beijing University of Aeronautics and Astronautics(北京航空航天大学) Tsinghua University(清华大学) Peking University(北京大学) Xiaohongshu Inc.(小红书公司)

AI总结 本文提出AdaptEdit框架,通过区域感知适配器实现无掩码的局部图像编辑,结合轻量级Block Adapter和SpatialGate提升编辑精度,同时通过Region-Aware Loss优化训练目标,实现无需用户掩码的高质量编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19571 2026-05-01 cs.CV

TransSplat: Unbalanced Semantic Transport for Language-Driven 3DGS Editing

TransSplat:不平衡语义传输用于语言驱动的3DGS编辑

Yanhui Chen, Jiahong Li, Jingchao Wang, Junyi Lin, Zixin Zeng, Yang Shi

机构 * Guangdong University of Technology(广东工业大学) Peking University(北京大学)

AI总结 TransSplat通过不平衡语义传输解决语言驱动3DGS编辑中2D证据与3D高斯之间的语义对应问题,提升局部编辑精度和结构一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04978 2026-05-01 cs.AI

Aligning Perception, Reasoning, Modeling and Interaction: A Survey on Physical AI

对齐感知、推理、建模与交互:物理AI的综述

Kun Xiang, Terry Jingchen Zhang, Yinya Huang, Jixi He, Zirong Liu, Yueling Tang, Ruizhe Zhou, Lijing Luo, Youpeng Wen, Xiuwei Chen, Bingqian Lin, Jianhua Han, Hang Xu, Hanhui Li, Bin Dong, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) ETH Zurich(苏黎世联邦理工学院) ETH AI Center(苏黎世联邦理工学院人工智能中心) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) Yinwang Intelligent Technology Co., Ltd.(云网智能技术有限公司) Peking University and Beijing International Center for Mathematical Research(北京大学和北京国际数学研究中心)

AI总结 本文综述了物理AI,探讨了理论物理推理与应用物理理解的区别,并分析了基于物理的方法如何提升AI在现实世界中的理解能力,推动更安全、可推广的AI系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02679 2026-05-01 cs.LG cs.GR cs.HC stat.ME

Visual Analysis of Multi-outcome Causal Graphs

多结果因果图的可视化分析

Mengjie Fan, Jinlu Yu, Daniel Weiskopf, Nan Cao, Huai-Yu Wang, Liang Zhou

机构 * Institute of Medical Technology, Peking University Health Science Center(北京大学人民医院医学技术研究所) National Institute of Health Data Science (NIHDS), Peking University(北京大学国家健康数据科学研究院) Chalmers University of Technology(挑战大学) NIHDS, Peking University(北京大学国家健康数据科学研究院) Visualization Research Center (VISUS), University of Stuttgart(斯图加特大学可视化研究中心) iDV x Lab, Tongji University(同济大学iDV x实验室) National Institute of Traditional Chinese Medicine Constitution and Preventive Treatment of Diseases, Beijing University of Chinese Medicine(北京中医药大学国家中医体质与疾病预防治疗研究所)

AI总结 本文提出多结果因果图的可视化方法,用于比较不同结果变量的因果图。通过与医学专家合作,设计了两种可视化技术,用于比较多种因果发现算法,并通过案例研究和用户测试验证方法有效性。

Journal ref EEE Transactions on Visualization and Computer Graphics, vol. 31, no. 1, pp. 656-666, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26951 2026-04-30 cs.CL cs.AI cs.LG

Turning the TIDE: Cross-Architecture Distillation for Diffusion Large Language Models

将TIDE转向:用于扩散大语言模型的跨架构蒸馏

Gongbo Zhang, Wen Wang, Ye Tian, Li Yuan

机构 * Peking University(北京大学) Zhejiang University(浙江大学)

AI总结 本文提出TIDE框架,通过跨架构蒸馏提升扩散大语言模型性能,采用三个模块解决不同架构间的知识转移问题,在八个基准测试中平均提升1.53分,尤其在代码生成任务中表现突出。

Comments 15 pages, 3 figures. Code: https://github.com/PKU-YuanGroup/TIDE

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26614 2026-04-30 cs.CV

State Beyond Appearance: Diagnosing and Improving State Consistency in Dial-Based Measurement Reading

超越外观:诊断并改进基于指针的测量读数中的状态一致性

Yuanze Hu, Gen Li, Yuqin Lan, Qingchen Yu, Zhichao Yang, Junwei Jing, Zhaoxin Fan, Xiaotie Deng

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing(未来区块链与隐私计算北京先进创新中心) Beihang University(北航) Fudan University(复旦大学) Peking University(北京大学)

AI总结 本文研究了多模态大语言模型在指针式测量读数任务中的表现问题,发现现有模型在状态一致性上存在缺陷,提出TriSCA框架以提升状态一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26279 2026-04-30 cs.CV

High-Dimensional Noise to Low-Dimensional Manifolds: A Manifold-Space Diffusion Framework for Degraded Hyperspectral Image Classification

高维噪声到低维流形:一种用于退化超光谱图像分类的流形空间扩散框架

Boxiang Yang, Ning Chen, Xia Yue, Yichang Luo, Yingbo Fan, Haoyuan Zhang, Haoyu Ma, Jun Yue, Shanjun Mao

机构 * Institute of Remote Sensing and Geographic Information System, Peking University(遥感与地理信息系统研究所,北京大学) Beijing Key Laboratory of Spatio-temporal Perception and Urban Resilience, Peking University(北京时空感知与城市韧性重点实验室,北京大学) School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空航天信息研究所) Institute of energy, Peking University(北京大学能源研究所) School of Mechanics and Engineering Science, Peking University(北京大学力学与工程科学学院) School of Automation, Central South University(中南大学自动化学院)

AI总结 本文提出一种流形空间扩散框架,通过判别光谱-空间重建任务将高维退化数据映射到低维流形,利用扩散模型稳定潜在特征,提升复杂退化条件下的分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25131 2026-04-30 cs.LG cs.AI

Towards Unified Multi-task EEG Analysis with Low-Rank Adaptation

迈向统一的多任务EEG分析与低秩适应

Sicheng Dai, Kai Chen, Hongwang Xiao, Shan Yu, Qiwei Ye

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artifcial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) State Key Laboratory of Brain Cognition(脑认知国家重点实验室) Beijing Academy of Artificial Intelligence(北京人工智能研究院) State Key Laboratory of Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室)

AI总结 本文提出MTEEG框架,通过低秩适应模块解决多任务EEG分析中的任务冲突问题,展示了多任务方法在提升性能和降低计算成本方面的优势。

Journal ref EMBC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18112 2026-04-30 cs.CL cs.MM

Retrieval-Augmented Multimodal Model for Fake News Detection

增强检索的多模态模型用于虚假新闻检测

Yiheng Li, Weihai Lu, Hanyi Yu, Yue Wang

机构 * University of International Business and Economics(国际商务经济大学) Peking University(北京大学) University of Southern California(南加州大学) Upstart Holdings, Inc.(Upstart Holdings公司)

AI总结 本文提出RAMM模型,通过多模态大语言模型和抽象叙述对齐模块,解决虚假新闻检测中跨实例叙述一致性缺失和领域知识不足的问题,实验验证了其有效性。

Comments Accepted to SIGIR 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07080 2026-04-30 cs.RO cs.LG

VLN-Cache: Enabling Token Caching for VLN Models with Visual/Semantic Dynamics Awareness

VLN-Cache: 通过视觉/语义动态感知实现VLN模型的令牌缓存

Zihao Zheng, Zhihao Mao, Xingyue Zhou, Jiayu Chen, Maoliang Li, Xinhao Sun, Hailong Zou, Zhaobo Zhang, Xuanzhe Liu, Donggang Cao, Hong Mei, Xiang Chen

机构 * School of Computer Science, Peking University(北京大学计算机科学系) School of Computer Science, China University of Geosciences (Wuhan)(中国地质大学(武汉)计算机科学系) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) School of Electronics Engineering and Computer Science, Peking University(北京大学电子工程与计算机科学系)

AI总结 本文提出VLN-Cache框架,通过视觉动态感知和语义动态感知解决VLN模型中因视角和语义变化导致的缓存失效问题,实验显示在R2R-CE模拟基准上实现1.52倍的速度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13606 2026-04-30 cs.CV

ChartVerse: Scaling Chart Reasoning via Reliable Programmatic Synthesis from Scratch

ChartVerse: 通过从零开始可靠程序合成实现图表推理的扩展

Zheng Liu, Honglin Lin, Chonghan Qin, Xiaoyang Wang, Xin Gao, Yu Li, Mengzhang Cai, Yun Zhu, Zhanping Zhong, Qizhi Pei, Zhuoshi Pan, Xiaoran Shang, Bin Cui, Conghui He, Wentao Zhang, Lijun Wu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Zhongguancun Academy(中关村学院) Beijing Key Laboratory of Software and Hardware Cooperative Artificial Intelligence Systems(北京市软件与硬件协同人工智能系统重点实验室)

AI总结 ChartVerse通过从零开始生成复杂图表和可靠推理数据,解决开放源模型开发中高质量训练数据缺乏的问题,采用RPE量化图表复杂度并生成高复杂度图表,结合truth-anchored inverse QA合成和CoT蒸馏提升推理深度。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18165 2026-04-30 cs.AI cs.CL cs.LG cs.SE

Saber: An Efficient Sampling with Adaptive Acceleration and Backtracking Enhanced Remasking for Diffusion Language Model

Saber: 一种高效的采样方法,具有自适应加速和回溯增强的重新遮蔽,用于扩散语言模型

Yihong Dong, Zhaoyu Ma, Xue Jiang, Zhiyuan Fan, Jiaru Qian, Yongmin Li, Jianha Xiao, Zhi Jin, Rongyu Cao, Binhua Li, Fei Huang, Yongbin Li, Ge Li

机构 * School of Computer Science, Peking University(北京大学计算机科学系) Tongyi Lab, Alibaba Group(阿里云实验室)

AI总结 本文提出Saber算法,通过动态调整每步未遮蔽令牌数量和回溯机制提升代码生成的推理速度和输出质量,实验显示在多个基准上Pass@1准确率提升1.9%,推理速度提升251.4%。

Comments Accepted to ACL 2026 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16591 2026-04-30 cs.CL

Heterogeneous Adaptive Policy Optimization: Tailoring Optimization to Every Token's Nature

异质自适应策略优化:针对每个token的性质进行定制化优化

Zheng Liu, Mengjie Liu, Siwei Wen, Mengzhang Cai, Bin Cui, Conghui He, Wentao Zhang

机构 * Peking University Shanghai AI Laboratory(北京大学上海人工智能实验室) Beihang University(北京航空航天大学) Shanghai AI Laboratory(上海人工智能实验室) Peking University Zhongguancun Academy, 5 Beijing Key Laboratory of Software and Hardware Cooperative Artificial Intelligence Systems(北京大学中关村学院,5北京软件硬件协同人工智能系统重点实验室)

AI总结 本文提出HAPO算法,通过熵度量异质性指导优化,实现细粒度调节。算法包含四个核心组件,通过token级处理提升LLM在数学推理、代码和逻辑任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07852 2026-04-30 cs.GR cs.AI

Vertex Features for Neural Global Illumination

顶点特征用于神经全局光照

Rui Su, Honghao Dong, Haojie Jin, Yisong Chen, Guoping Wang, Sheng Li

机构 * School of Computer Science, Peking University(北京大学计算机科学学院)

AI总结 本文提出神经顶点特征,通过在网格顶点存储可学习特征,提升神经渲染任务的内存效率和特征表示,尤其在神经辐射度中表现优异。

Comments Accepted by ACM SIGGRAPH Asia'2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02494 2026-04-30 cs.CL cs.AI cs.CV

MINOS: A Multimodal Evaluation Model for Bidirectional Generation Between Image and Text

MINOS:一种用于图像与文本双向生成的多模态评估模型

Junzhe Zhang, Huixuan Zhang, Xinyu Hu, Li Lin, Mingqi Gao, Shi Qiu, Xiaojun Wan

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王萱计算机技术研究所) School of Physics, Peking University(北京大学物理学院)

AI总结 本文提出MINOS模型,通过严格质量控制策略构建Minos-57K多模态评估数据集,结合SFT和偏好对齐训练策略,在16个跨领域数据集中取得最佳性能。

Comments Accepted to the Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09925 2026-04-30 cs.CV

FLARE: Fully Integration of Vision-Language Representations for Deep Cross-Modal Understanding

FLARE:完全整合视觉-语言表示以实现深度跨模态理解

Zheng Liu, Mengjie Liu, Jingzhou Chen, Jingwei Xu, Bin Cui, Conghui He, Wentao Zhang

机构 * Peking University Shanghai AI Laboratory(北京大学上海人工智能实验室) Nanjing University(南京大学) Peking University(北京大学) Shanghai AI Laboratory(上海人工智能实验室) Zhongguancun Academy Beijing Key Laboratory of Data Intelligence and Security(中关村北京数据智能与安全重点实验室)

AI总结 FLARE通过全视觉-语言对齐与整合范式实现深度跨模态理解,提出文本引导视觉编码、上下文感知对齐解码、双语义映射损失和文本驱动VQA合成等核心方法,展现优于现有方法的性能与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17897 2026-04-30 cs.GR cs.CV

Real-time Global Illumination for Dynamic 3D Gaussian Scenes

动态3D高斯场景的实时全局光照

Chenxiao Hu, Meng Gai, Guoping Wang, Sheng Li

机构 * Peking University(北京大学)

AI总结 本文提出实时全局光照方法及动态3D高斯模型与网格的渲染管线,通过快速复合随机光线追踪算法和优化的3D高斯光栅化技术,实现高质量光照效果,支持动态场景和多光源设置。

Comments accepted by IEEE Transactions on Visualization and Computer Graphics

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04872 2026-04-30 cs.CL cs.AI

TinyR1-32B-Preview: Boosting Accuracy with Branch-Merge Distillation

TinyR1-32B-Preview: 通过分支-合并蒸馏提升精度

Lin Sun, Guangxiang Zhao, Xiaoqi Jian, Yuhan Wu, Weihong Lin, Yongfu Zhu, Qilong Shi, Change Jia, Aomufei Yuan, Yuxuan Tian, Linglin Zhang, Jinzhu Wu, Junfeng Ran, Sai-er Hu, Zihan Jiang, Junting Zhou, Wenrui Liu, Xusen Xiao, Bin Cui, Tong Yang, Xiangzheng Zhang

机构 * Qiyuan Tech(启元科技) Peking University(北京大学)

AI总结 本文提出分支-合并蒸馏方法,通过领域特定监督微调和跨领域知识迁移,提升模型压缩效果,实验显示在数学、编程和科学领域均取得显著提升。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏