arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

共收录 3042
2512.00903 2025-12-02 cs.CV cs.RO

SwiftVLA: Unlocking Spatiotemporal Dynamics for Lightweight VLA Models at Minimal Overhead

SwiftVLA: 解锁轻量VLA模型的时空动态以最小的开销

Chaojun Ni, Cheng Chen, Xiaofeng Wang, Zheng Zhu, Wenzhao Zheng, Boyuan Wang, Tianrun Chen, Guosheng Zhao, Haoyun Li, Zhehao Dong, Qiang Zhang, Yun Ye, Yang Wang, Guan Huang, Wenjun Mei

机构 * GigaAI Peking University(北京大学) Moxin (Huzhou) Technology Co., Ltd.(摩西(湖州)科技有限公司) Tsinghua University(清华大学) X-Humanoid Project(X-人形项目)

AI总结 SwiftVLA通过4D视觉几何Transformer和Fusion Tokens提升轻量VLA模型的时空推理能力,实现高效且性能优异的视觉-语言-动作处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00553 2025-12-02 cs.LG cs.AI stat.ML

List Replicable Reinforcement Learning

可复制的强化学习

Bohan Zhang, Michael Chen, A. Pavan, N. V. Vinodchandran, Lin F. Yang, Ruosong Wang

机构 * Peking University(北京大学) Iowa State University(爱荷华州立大学) University of Nebraska–Lincoln(内布拉斯加大学林肯分校) University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 本文提出了一种可证明高效的表格RL算法,通过保证列表复杂度保持在多项式范围内,解决强化学习中的可复制性问题,并通过创新的规划策略和状态可达性测试机制提升算法稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00473 2025-12-02 cs.CV cs.AI

RealGen: Photorealistic Text-to-Image Generation via Detector-Guided Rewards

RealGen:通过检测器引导的奖励实现逼真文本到图像生成

Junyan Ye, Leiqi Zhu, Yuncheng Guo, Dongzhi Jiang, Zilong Huang, Yifan Zhang, Zhiyuan Yan, Haohuan Fu, Conghui He, Weijia Li

机构 * Shanghai AI Lab(上海人工智能实验室) Sun Yat-Sen University(中山大学) Nanjing University(南京大学) CUHK MMLab(香港中文大学多模态实验室) Tsinghua University(清华大学) Peking University(北京大学)

AI总结 RealGen通过检测器引导的奖励机制提升文本到图像生成的真实感和细节,优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20561 2025-12-02 cs.CV cs.CL

Does Understanding Inform Generation in Unified Multimodal Models? From Analysis to Path Forward

在统一多模态模型中,理解是否会影响生成?从分析到未来路径

Yuwei Niu, Weiyang Jin, Jiaqi Liao, Chaoran Feng, Peng Jin, Bin Lin, Zongjian Li, Bin Zhu, Weihao Yu, Li Yuan

机构 * Peking University(北京大学) Chongqing University(重庆大学) HKU MMLab(香港大学多模态实验室) PengCheng Laboratory(鹏城实验室)

AI总结 研究通过UniSandbox分析统一多模态模型中理解与生成之间的差距,发现显式链式思维和自训练方法能有效弥合这一差距,并揭示查询架构的潜在CoT特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02852 2025-12-02 eess.SY cs.RO cs.SY

Curvature-Constrained Vector Field for Motion Planning of Nonholonomic Robots

具有曲率约束的向量场用于非完整机器人运动规划

Yike Qiao, Xiaodong He, An Zhuo, Zhiyong Sun, Weimin Bao, Zhongkui Li

机构 * School of Advanced Manufacturing and Robotics, Peking University(先进制造与机器人学院,北京大学) School of Automation and Electrical Engineering, University of Science and Technology Beijing(自动化与电气工程学院,北京科技大学) China Aerospace Science and Technology Corporation(中国航天科技集团)

AI总结 本文提出了一种具有曲率约束的向量场方法,用于非完整机器人运动规划,通过共同开发向量场和控制律,实现目标配置的收敛与轨迹曲率的限制。

Comments IEEE T-RO accepted, 20 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07338 2025-12-02 cs.RO cs.AI

Delta-Triplane Transformers as Occupancy World Models

Delta-Triplane Transformers 作为占用世界模型

Haoran Xu, Peixi Peng, Guang Tan, Yiqian Chang, Yisen Zhao, Yonghong Tian

机构 * School of Intelligent Systems Engineering, Shenzhen Campus of Sun Yat-sen University(南方科技大学深圳校区智能系统工程学院) Peng Cheng Laboratory(鹏城实验室) School of Electronic and Computer Engineering, Shenzhen Graduate School, Peking University(北京大学深圳研究生院电子与计算机工程学院) School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区计算机科学与技术学院) School of Computer Science, Peking University(北京大学计算机学院)

AI总结 Delta-Triplane Transformers 通过紧凑的3D表示和增量预测策略,提升自动驾驶中占用世界模型的效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00076 2025-12-02 cs.RO cs.CV

Arcadia: Toward a Full-Lifecycle Framework for Embodied Lifelong Learning

Arcadia:迈向一个完整的生命周期框架用于具身终身学习

Minghe Gao, Juncheng Li, Yuze Lin, Xuqi Liu, Jiaming Ji, Xiaoran Pan, Zihan Xu, Xian Li, Mingjie Li, Wei Ji, Rong Wei, Rui Tang, Qizhou Wang, Kai Shen, Jun Xiao, Qi Wu, Siliang Tang, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Unitree Tech(单位树科技) Peking University(北京大学) Nanjing University(南京大学) Manycore Tech(Manycore科技) Bytedance Seed(字节跳动种子) University of Adelaide(阿德莱德大学)

AI总结 Arcadia提出了一种闭环框架,通过紧密耦合四个阶段实现具身终身学习,支持持续改进和端到端泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17808 2025-12-02 cs.LG

Remote Sensing-Oriented World Model

面向遥感的世界模型

Yuxi Lu, Biao Wu, Zhidong Li, Kunqi Li, Chenya Huang, Huacan Wang, Qizhen Lan, Ronghao Chen, Ling Chen, Bin Liang

机构 * University of Technology Sydney (UTS)(悉尼技术大学) University of Chinese Academy of Sciences (UCAS)(中国科学院大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Peking University(北京大学)

AI总结 本文提出首个面向遥感的世界模型框架,通过RemoteBAGEL模型在RSWISE基准上实现空间推理的高效外推。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23476 2025-12-01 cs.AI

Thinking by Doing: Building Efficient World Model Reasoning in LLMs via Multi-turn Interaction

通过多轮交互构建高效的LLM世界模型推理:WMAct

Bao Shu, Yan Cai, Jianjian Sun, Chunrui Han, En Yu, Liang Zhao, Jingcheng Hu, Yinmin Zhang, Haoran Lv, Yuang Peng, Zheng Ge, Xiangyu Zhang, Daxin Jiang, Xiangyu Yue

机构 * CUHK MMLab(香港中文大学MMLab) Peking University(北京大学) StepFun Tsinghua University(清华大学)

AI总结 WMAct通过高效交互和主动推理机制,使LLM在复杂环境中实现高效世界模型推理,提升任务解决能力和迁移性能。

Comments 17 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23391 2025-12-01 cs.CL

Ambiguity Awareness Optimization: Towards Semantic Disambiguation for Direct Preference Optimization

模糊性意识优化:朝着直接偏好优化的语义消歧

Jian Li, Shenglin Yin, Yujia Zhang, Alan Zhao, Xi Chen, Xiaohui Zhou, Pengfei Xu

机构 * AI Technology Center of OVB, Tencent, China(腾讯OVB人工智能技术中心,中国) School of Computer Science, Peking University, China(北京大学计算机学院,中国)

AI总结 本文提出模糊性意识优化(AAO)方法,通过计算偏好对的语义相似性自动重新加权模糊内容,有效提升直接偏好优化的性能。

Comments Accepted at EMNLP 2025 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22991 2025-12-01 cs.CV

Guiding Visual Autoregressive Models through Spectrum Weakening

通过频谱弱化引导视觉自回归模型

Chaoyang Wang, Tianmeng Yang, Jingdong Wang, Yunhai Tong

机构 * Peking University(北京大学) Baidu(百度)

AI总结 本文提出了一种无需重新训练的频谱弱化框架,用于提升视觉自回归模型的生成质量与条件对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07565 2025-12-01 cs.CV

OpenDance: Multimodal Controllable 3D Dance Generation with Large-scale Internet Data

OpenDance: 基于大规模互联网数据的多模态可控3D舞蹈生成

Jinlu Zhang, Zixi Kang, Libin Liu, Jianlong Chang, Qi Tian, Feng Gao, Yizhou Wang

机构 * Peking University(北京大学) Huawei Cloud(华为云)

AI总结 OpenDance通过构建大规模舞蹈数据集和提出统一的可控生成框架,实现了多模态的3D舞蹈生成,支持音乐、文本、关键点和轨迹等多种条件控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22532 2025-12-01 cs.CV cs.AI

CoT4AD: A Vision-Language-Action Model with Explicit Chain-of-Thought Reasoning for Autonomous Driving

CoT4AD: 一种具有显式推理链的视觉-语言-动作模型用于自动驾驶

Zhaohui Wang, Tengbo Yu, Hao Tang

机构 * Peking University(北京大学)

AI总结 CoT4AD通过引入显式推理链提升自动驾驶中的视觉-语言-动作模型的推理能力,实现更精确的因果推理和决策。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22374 2025-12-01 cs.LO cs.AI

Distributed Knowing How

分布式知道如何

Bin Liu, Yanjing Wang

机构 * Department of Philosophy, Peking University(哲学系,北京大学)

AI总结 本文提出分布式知识-如何的概念,结合多步骤与联盟框架,构建了强完备的证明系统。

Comments In Proceedings TARK 2025, arXiv:2511.20540

Journal ref EPTCS 437, 2025, pp. 80-97

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22134 2025-12-01 cs.CV cs.RO

DualVLA: Building a Generalizable Embodied Agent via Partial Decoupling of Reasoning and Action

DualVLA: 通过推理与行动部分解耦构建通用具身代理

Zhen Fang, Zhuoyang Liu, Jiaming Liu, Hao Chen, Yu Zeng, Shiting Huang, Zehui Chen, Lin Chen, Shanghang Zhang, Feng Zhao

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(脑启发智能感知与认知国家重点实验室,中国科学技术大学) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,北京大学计算机学院) CUHK(香港大学)

AI总结 DualVLA通过推理与行动部分解耦,提升通用具身代理的行动与多模态理解平衡能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22055 2025-12-01 cs.CV cs.MM

OralGPT-Omni: A Versatile Dental Multimodal Large Language Model

OralGPT-Omni: 一种多功能的牙科多模态大语言模型

Jing Hao, Yuci Liang, Lizhuo Lin, Yuxuan Fan, Wenkai Zhou, Kaixin Guo, Zanting Ye, Yanpeng Sun, Xinyu Zhang, Yanqi Yang, Qiankun Li, Hao Tang, James Kit-Hon Tsoi, Linlin Shen, Kuo Feng Hung

机构 * Faculty of Dentistry, The University of Hong Kong(香港大学牙科学院) College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) The Hong Kong University of Science and Technology (GZ)(香港科学与技术大学) School of Biomedical Engineering, Southern Medical University(南方医科大学生物医学工程学院) Singapore University of Technology and Design(新加坡科技与设计大学) University of Auckland(奥克兰大学) University of Science and Technology of China(中国科学技术大学) School of Computer Science, Peking University(北京大学计算机学院) College of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院)

AI总结 OralGPT-Omni是一种专门用于牙科的多模态大语言模型,通过TRACE-CoT数据集和四阶段训练范式,实现了对牙科图像的高效分析和高准确率评估。

Comments 47 pages, 42 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21395 2025-12-01 cs.CV cs.AI

Monet: Reasoning in Latent Visual Space Beyond Images and Language

Monet: 在图像和语言之外的潜在视觉空间推理

Qixun Wang, Yang Shi, Yifei Wang, Yuanxing Zhang, Pengfei Wan, Kun Gai, Xianghua Ying, Yisen Wang

机构 * Peking University(北京大学) Kling Team(Kling团队) Amazon AGI SF Lab(Amazon AGI SF实验室) MIT(麻省理工学院)

AI总结 Monet通过在潜在视觉空间中直接推理,提升多模态大语言模型的视觉推理能力,解决了潜在-视觉对齐和嵌入监督不足的问题,展示了在现实世界和抽象视觉任务中的优越表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20789 2025-12-01 cs.LG

Aligning Inductive Bias for Data-Efficient Generalization in State Space Models

在状态空间模型中实现数据高效泛化的归纳偏置对齐

Qiyu Chen, Guozhang Chen

机构 * School of Computer Science, National Key Laboratory for Multimedia Information Processing, Peking University, China(计算机学院、多媒体信息处理国家重点实验室、北京大学) School of Physics, Peking University, China(物理学院、北京大学)

AI总结 本文提出任务依赖初始化方法,通过功率谱匹配提升状态空间模型的数据效率和泛化能力。

Comments We withdraw this submission to make substantial revisions and improvements on experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04182 2025-12-01 cs.CL cs.AI

COPO: Causal-Oriented Policy Optimization for Hallucinations of MLLMs

COPO:面向MLLM幻觉的因果导向策略优化

Peizheng Guo, Jingyao Wang, Wenwen Qiang, Jiahuan Zhou, Changwen Zheng, Gang Hua

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Software Chinese Academy of Sciences(中国科学院软件研究所) Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所) Amazon.com, Inc.(亚马逊公司)

AI总结 COPO通过引入因果完整性奖励和GRPO框架,解决多模态大语言模型的幻觉问题,通过令牌级因果约束确保输出的正确性和证据基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16915 2025-12-01 cs.CV

DreamO: A Unified Framework for Image Customization

DreamO:图像定制的统一框架

Chong Mou, Yanze Wu, Wenxu Wu, Zinan Guo, Pengze Zhang, Yufeng Cheng, Yiming Luo, Fei Ding, Shiwen Zhang, Xinghui Li, Mengtian Li, Mingcong Liu, Yi Zhang, Shaojin Wu, Songtao Zhao, Jian Zhang, Qian He, Xinglong Wu

机构 * Peking University(北京大学)

AI总结 DreamO提出了一种统一的图像定制框架,通过扩散变压器和渐进式训练策略,实现多种条件的无缝集成与高质量定制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10068 2025-12-01 cs.CV cs.AI cs.CL

Mavors: Multi-granularity Video Representation for Multimodal Large Language Model

Mavors:多粒度视频表示用于多模态大语言模型

Yang Shi, Jiaheng Liu, Yushuo Guan, Zhenhua Wu, Yuanxing Zhang, Zihao Wang, Weihong Lin, Jingyun Hua, Zekun Wang, Xinlong Chen, Bohan Zeng, Wentao Zhang, Fuzheng Zhang, Wenjing Yang, Di Zhang

机构 * Peking University(北京大学) Kling Team(Kling团队) Nanjing University(南京大学) CASIA(中国科学院自动化研究所)

AI总结 Mavors通过多粒度视频表示方法,提升多模态大语言模型在长视频理解中的时空模式保留与计算效率平衡能力。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20090 2025-11-27 cs.AR cs.AI

R3A: Reliable RTL Repair Framework with Multi-Agent Fault Localization and Stochastic Tree-of-Thoughts Patch Generation

R3A:一种可靠的RTL修复框架,结合多智能体故障定位和随机树状思维补丁生成

Zizhang Luo, Fan Cui, Kexing Zhou, Runlin Guo, Mile Xia, Hongyuan Hou, Yun Liang

机构 * Peking University(北京大学) Beihang University(北航)

AI总结 R3A通过多智能体故障定位和随机树状思维补丁生成方法,有效提高了RTL修复的可靠性,修复率高达90.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17464 2025-11-27 cs.LG cs.AI stat.ML

Data Valuation by Fusing Global and Local Statistical Information

通过融合全局和局部统计信息进行数据估值

Xiaoling Zhou, Ou Wu, Michael K. Ng, Hao Jiang

机构 * Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) Hong Kong Baptist University(香港 Baptist大学) Renmin University of China(中国人民大学)

AI总结 本文提出融合全局和局部统计信息的增强数据估值方法,通过正则化项优化Shapley值估计,并引入动态数据估值技术提升计算效率。

Comments 35 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.03167 2025-11-27 math.OC cs.LG stat.ML

Decentralized Bilevel Optimization: A Perspective from Transient Iteration Complexity

去中心化双层优化:从瞬态迭代复杂度的角度视角

Boao Kong, Shuchen Zhu, Songtao Lu, Xinmeng Huang, Kun Yuan

机构 * Center for Data Science, Peking University(北京大学数据科学中心) Center for Machine Learning Research, Peking University AI for Science Institute(北京大学人工智能科学研究院机器学习研究中心)

AI总结 本文提出D-SOBA框架,通过分析瞬态迭代复杂度,首次理论探讨了网络拓扑、数据异质性及嵌套双层结构对去中心化随机双层优化的影响。

Comments 64 pages. Accepted by Journal of Machine Learning Research (JMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20422 2025-11-26 cs.AI cs.CV cs.GR cs.RO

VibraVerse: A Large-Scale Geometry-Acoustics Alignment Dataset for Physically-Consistent Multimodal Learning

VibraVerse: 一个大规模的几何-声学对齐数据集,用于物理一致的多模态学习

Bo Pang, Chenxi Xu, Jierui Ren, Guoping Wang, Sheng Li

机构 * Peking University(北京大学)

AI总结 VibraVerse通过构建几何-声学对齐数据集,实现了物理一致的多模态学习,支持几何到声音预测、声音引导的形状重建等任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20145 2025-11-26 cs.CV

Vision-Language Models for Automated 3D PET/CT Report Generation

用于自动化3D PET/CT报告生成的视觉-语言模型

Wenpei Jiao, Kun Shang, Hui Li, Ke Yan, Jiajin Zhang, Guangjie Yang, Lijuan Guo, Yan Wan, Xing Yang, Dakai Jin, Zhaoheng Xie

机构 * Institute of Medical Technology and National Biomedical Imaging Center, Peking University(北京大学医学技术研究院和国家生物医学成像中心) Peking University People’s Hospital(北京大学人民医院) Peking University Third Hospital(北京大学第三医院) DAMO Academy, Alibaba Group(阿里巴巴集团达摩院) The Affiliated Hospital of Qingdao University(青岛大学附属医院) The First Affiliated Hospital of Henan Medical University(河南医科大学第一附属医院) Jiujiang City Key Laboratory of Cell Therapy, Jiu Jiang NO.1 People’s Hospital(九江市细胞治疗重点实验室,九江市第一人民医院)

AI总结 本文提出PETRG-3D模型,通过3D双分支框架和风格适应提示,提升PET/CT报告生成的自动化水平,实验显示其在自然语言和临床指标上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25628 2025-11-26 cs.CL

EHR-R1: A Reasoning-Enhanced Foundational Language Model for Electronic Health Record Analysis

EHR-R1: 一种增强推理能力的基础语言模型用于电子健康记录分析

Yusheng Liao, Chaoyi Wu, Junwei Liu, Shuyang Jiang, Pengcheng Qiu, Haowen Wang, Yun Yue, Shuai Zhen, Jian Wang, Qianrui Fan, Jinjie Gu, Ya Zhang, Yanfeng Wang, Yu Wang, Weidi Xie

机构 * Shanghai Jiao Tong University(上海交通大学) Intelligence Healthcare Department, AntGroup(智能医疗部,蚂蚁集团) Intelligence Computing and Sensing Laboratory, Peking University(智能计算与感知实验室,北京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学)

AI总结 EHR-R1是一种针对电子健康记录分析设计的增强推理能力的基础语言模型,通过大规模推理数据集和多阶段训练方法提升了EHR分析的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17818 2025-11-26 cs.CV

ContextFlow: Training-Free Video Object Editing via Adaptive Context Enrichment

ContextFlow: 无训练视频物体编辑通过自适应上下文增强

Yiyang Chen, Xuanhua He, Xiujun Ma, Yue Ma

机构 * State Key Laboratory of General Artifical Intelligence, Peking University, Beijing, China(北京人工智能基础理论国家重点实验室,北京大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 ContextFlow通过自适应上下文增强解决无训练视频物体编辑中的保真度和时间一致性问题,实现高精度编辑效果。

Comments The project page is at https://yychen233.github.io/ContextFlow-page

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17177 2025-11-26 cs.CL cs.CV cs.LG

FlagEval Findings Report: A Preliminary Evaluation of Large Reasoning Models on Automatically Verifiable Textual and Visual Questions

FlagEval Findings Report: 对大推理模型在自动可验证文本和视觉问题上的初步评估

Bowen Qin, Chen Yue, Fang Yin, Hui Wang, JG Yao, Jiakang Liu, Jing-Shu Zheng, Miguel Hu Chen, Richeng Xuan, Shibei Meng, Shiqi Zhou, Teng Dai, Tong-Shuai Ren, Wei Cui, Xi Yang, Xialin Du, Xiaojing Xu, Xue Sun, Xuejing Li, Yaming Liu, Yesheng Liu, Ying Liu, Yonghua Lin, Yu Zhao, Yunduo Zhang, Yuwen Luo, Zheqi He, Zhiyuan He, Zhongyuan Wang

机构 * BAAI FlagEval Team(百度人工智能研究院FlagEval团队) State Key Laboratory of Multimedia Information Processing(多媒体信息处理国家重点实验室) Peking University(北京大学)

AI总结 FlagEval报告对大推理模型在自动可验证文本和视觉问题上的初步评估进行了研究,提出了ROME基准以测试视觉线索推理能力。

Comments Project homepage: https://flageval-baai.github.io/LRM-Eval/ This work will also be presented at NeurIPS 2025 Workshop on Foundations of Reasoning in Language Models (FoRLM); update with trials on Gemini 3 Pro

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16441 2025-11-26 cs.LG stat.ML

Categorical Flow Matching on Statistical Manifolds

统计流匹配在统计流形上的应用

Chaoran Cheng, Jiahan Li, Jian Peng, Ge Liu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Peking University(北京大学)

AI总结 统计流匹配通过几何视角在统计流形上实现精确似然计算,提升复杂模式学习能力。

Comments Accepted to NeurIPS 2024 as a conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏