arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

共收录 3042
2601.01915 2026-01-06 cs.CV

TalkPhoto: A Versatile Training-Free Conversational Assistant for Intelligent Image Editing

TalkPhoto: 一种多功能的无需训练的对话式智能图像编辑助手

Yujie Hu, Zecheng Tang, Xu Jiang, Weiqi Li, Jian Zhang

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学)

AI总结 TalkPhoto通过对话交互实现无需训练的多功能图像编辑,利用提示模板分层调用现有高级编辑方法,提升编辑精度与质量。

Comments a Conversational Assistant for Intelligent Image Editing

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23239 2026-01-06 cs.CV

RS-Prune: Training-Free Data Pruning at High Ratios for Efficient Remote Sensing Diffusion Foundation Models

RS-Prune: 无需训练的数据裁剪以高比例提升高效遥感扩散基础模型

Fan Wei, Runmin Dong, Yushan Lai, Yixiang Yang, Zhaoyang Luo, Jinxiao Zhang, Miao Yang, Shuai Yuan, Jiyao Zhao, Bin Luo, Haohuan Fu

机构 * Department of Earth System Science, Tsinghua University(清华大学地球系统科学系) School of Artificial Intelligence, Sun Yat-sen University(中山大学人工智能学院) National Supercomputing Center in Shenzhen(深圳国家超算中心) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生学院) Department of Geography, The University of Hong Kong(香港大学地理系) Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所)

AI总结 RS-Prune提出一种无需训练的高比例数据裁剪方法,通过局部信息与全局多样性结合,提升遥感扩散模型的收敛性和生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09922 2026-01-06 cs.LG

Improving the Euclidean Diffusion Generation of Manifold Data by Mitigating Score Function Singularity

通过缓解分数函数奇异性和改进欧几里得扩散生成流形数据

Zichen Liu, Wei Zhang, Tiejun Li

机构 * Center for Data Science, Peking University(北京大学数据科学中心) Zuse Institute Berlin(柏林泽尼茨研究所) Center for Machine Learning Research, Peking University(北京大学机器学习研究中心) LMAM and School of Mathematical Sciences, Peking University(北京大学数学科学学院)

AI总结 本文提出Niso-DM和Tango-DM方法,通过缓解分数函数的奇异性和改进欧几里得扩散生成流形数据的准确性。

Journal ref 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.21027 2026-01-06 cs.GT cs.AI cs.LG cs.MA

Fusion-PSRO: Nash Policy Fusion for Policy Space Response Oracles

融合-PSRO:用于策略空间响应预言机的纳什策略融合

Jiesong Lian, Yucong Huang, Chengdong Ma, Mingzhi Wang, Ying Wen, Long Hu, Yixue Hao

机构 * Huazhong University of Science \& Technology, Wuhan, China School of Software Microelectronics, Peking University, Beijing, China Institute for Artificial Intelligence, Peking University, Beijing, China Shanghai Jiao Tong University, Shanghai, China Guangdong HUST Industrial Technology Research Institute

AI总结 Fusion-PSRO通过纳什策略融合改进策略初始化,提升零和博弈中策略空间响应预言机的性能。

Comments Accepted by ECAI 2025

Journal ref Frontiers in Artificial Intelligence and Applications 413 (2025) 2562-2569

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01868 2026-01-06 cs.CL

DermoGPT: Open Weights and Open Data for Morphology-Grounded Dermatological Reasoning MLLMs

DermoGPT: 开放权重和开放数据用于基于形态的皮肤病学推理大语言模型

Jinghan Ru, Siyuan Yan, Yuguo Yin, Yuexian Zou, Zongyuan Ge

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学) Faculty of Information Technology, Monash University(信息科技学院,莫纳什大学)

AI总结 DermoGPT通过开放权重和数据提升皮肤病学推理的MLLM性能,实现与专家诊断流程的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01749 2026-01-06 cs.CV

MANGO:Natural Multi-speaker 3D Talking Head Generation via 2D-Lifted Enhancement

MANGO:通过2D提升增强实现自然多说话者3D说话头生成

Lei Zhu, Lijian Lin, Ye Zhu, Jiahao Wu, Xuehan Hou, Yu Li, Yunfei Liu, Jie Chen

机构 * International Digital Economy Academy(国际数字经济学院) School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学)

AI总结 MANGO通过两阶段框架和2D提升增强,实现自然多说话者3D说话头生成,提升对话行为的真实感和可控性。

Comments 20 pages, 11i figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01618 2026-01-06 cs.RO

Action-Sketcher: From Reasoning to Action via Visual Sketches for Long-Horizon Robotic Manipulation

动作草图生成器:通过视觉草图实现从推理到动作的长周期机器人操作

Huajie Tan, Peterson Co, Yijie Xu, Shanyu Rong, Yuheng Ji, Cheng Chi, Xiansheng Chen, Qiongyu Zhang, Zhongxia Zhao, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(1 多媒体信息处理国家重点实验室,计算机科学学院,北京大学) Beijing Academy of Artificial Intelligence(2 北京人工智能研究院) University of Sydney(3 新南威尔士大学) Institute of Automation, Chinese Academy of Sciences(4 中国科学院自动化研究所)

AI总结 动作草图生成器通过视觉草图实现从推理到动作的长周期机器人操作,结合视觉-语言-动作框架提升任务执行的鲁棒性和可解释性。

Comments 26 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01392 2026-01-06 cs.SD cs.CL eess.AS

SAFE-QAQ: End-to-End Slow-Thinking Audio-Text Fraud Detection via Reinforcement Learning

SAFE-QAQ: 通过强化学习实现端到端的慢思考音频-文本欺诈检测

Peidong Wang, Zhiming Ma, Xin Dai, Yongkang Liu, Shi Feng, Xiaocui Yang, Wenxing Hu, Zhihao Wang, Mingjun Pan, Li Yuan, Daling Wang

机构 * Northeastern University, China(东北大学) China Mobile Internet Company Ltd.(中国移动互联网有限公司) Shanghai University of Electric Power, China(上海电力大学) Peking University, Shenzhen, China(北京大学深圳分校)

AI总结 SAFE-QAQ通过强化学习实现端到端音频-文本欺诈检测,有效提升准确性、效率和实时处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01357 2026-01-06 cs.LG physics.flu-dyn

Towards LLM-enabled autonomous combustion research: A literature-aware agent for self-corrective modeling workflows

迈向基于大语言模型的自主燃烧研究:一种文献感知的代理用于自修正建模工作流

Ke Xiao, Haoze Zhang, Runze Mao, Han Li, Zhi X. Chen

机构 * State Key Laboratory of Turbulence and Complex Systems, School of Mechanics and Engineering Science, Peking University(湍流与复杂系统国家重点实验室,力学与工程科学学院,北京大学) AI for Science Institute (AISI)(人工智能科学研究院(AISI))

AI总结 FlamePilot是一种基于大语言模型的代理,通过自动化和自修正的CFD工作流提升燃烧建模研究效率,实现高可执行性和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01022 2026-01-06 cs.CV cs.AI cs.LG

Decoupling Amplitude and Phase Attention in Frequency Domain for RGB-Event based Visual Object Tracking

频域中解耦幅度与相位注意力以实现RGB-事件视觉目标跟踪

Shiao Wang, Xiao Wang, Haonan Zhao, Jiarui Xu, Bo Jiang, Lin Zhu, Xin Zhao, Yonghong Tian, Jin Tang

机构 * School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) Northeastern University(东北大学) Beijing Institute of Technology(北京理工大学) School of Computer and Communication Engineering, University of Science and Technology Beijing(北京科技大学计算机与通信工程学院) Peng Cheng Laboratory(鹏城实验室) National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(北京大学多媒体信息处理国家重点实验室) School of Electronic and Computer Engineering, Shenzhen Graduate School, Peking University(北京大学深圳研究生院电子与计算机工程学院)

AI总结 本文提出了一种在频域中解耦幅度与相位注意力的RGB-事件视觉目标跟踪方法,通过高频信息融合和运动引导稀疏化模块提升跟踪性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23650 2026-01-06 cs.RO

Do You Have Freestyle? Expressive Humanoid Locomotion via Audio Control

你有即兴能力吗?通过音频控制实现 expressive 人形 locomotion

Zhe Li, Cheng Chi, Yangyang Wei, Boan Zhu, Tao Huang, Zhenguo Sun, Yibo Peng, Pengwei Wang, Zhongyuan Wang, Fangzhou Liu, Chang Xu, Shanghang Zhang

机构 * BAAI(北京人工智能研究院) University of Sydney(悉尼大学) Harbin Institute of Technology(哈尔滨工业大学) Hong Kong University of Science and Technology(香港科学与技术大学) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学)

AI总结 RoboPerform 是首个通过音频直接生成音乐舞蹈和语音手势的人形运动框架,实现了低延迟、高保真的即兴运动表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13251 2026-01-06 cs.SD

DisCo-Speech: Controllable Zero-Shot Speech Generation with A Disentangled Speech Codec

DisCo-Speech: 基于解耦语音编解码器的可控零样本语音生成

Tao Li, Wenshuo Ge, Zhichao Wang, Zihao Cui, Yong Ma, Yingying Gao, Chao Deng, Shilei Zhang, Junlan Feng

机构 * China Mobile Nineverse Artificial Intelligence Technology (Beijing) Co., Ltd.(中国移动Nineverse人工智能技术(北京)有限公司) Nineverse Institute of Artificial Intelligence(Nineverse人工智能研究院) The State Key Laboratory of Multimedia Information Processing, Peking University, Beijing, China(多媒体信息处理国家重点实验室,北京大学,北京,中国)

AI总结 DisCo-Speech通过解耦语音编解码器实现可控零样本语音生成,提升语音克隆与语调控制性能。

Comments Updated with 6,000 hours of additional training data and improved performance. Expanded appendix with ablation studies, training objectives, and hyperparameter settings for better reproducibility. Audio and code links included

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06084 2026-01-06 cs.CV

AdaptInfer: Adaptive Token Pruning for Vision-Language Model Inference with Dynamical Text Guidance

AdaptInfer: 用于视觉-语言模型推理的自适应令牌剪枝与动态文本引导

Weichen Zhang, Zhui Zhu, Ningbo Li, Shilong Tao, Kebin Liu, Yunhao Liu

机构 * Global Innovation Exchange, Tsinghua University(清华大学全球创新交流中心) Department of Automation, Tsinghua University(清华大学自动化系) School of Computer Science, Peking University(北京大学计算机科学系)

AI总结 AdaptInfer通过动态文本引导和自适应令牌剪枝,有效降低视觉-语言模型推理成本,提升推理效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04308 2026-01-06 cs.RO cs.AI cs.CV

RoboRefer: Towards Spatial Referring with Reasoning in Vision-Language Models for Robotics

RoboRefer: 向视觉语言模型在机器人中的空间指称推理迈进

Enshen Zhou, Jingkun An, Cheng Chi, Yi Han, Shanyu Rong, Chi Zhang, Pengwei Wang, Zhongyuan Wang, Tiejun Huang, Lu Sheng, Shanghang Zhang

机构 * School of Software, Beihang University(北京航空航天大学软件学院) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

AI总结 RoboRefer通过整合深度编码器和强化微调方法,实现了视觉语言模型在机器人中的空间指称推理,提升了复杂场景下的交互能力。

Comments Accepted by NeurIPS 2025. Project page: https://zhoues.github.io/RoboRefer/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.01228 2026-01-06 cs.CV

RaffeSDG: Random Frequency Filtering enabled Single-source Domain Generalization for Medical Image Segmentation

RaffeSDG:随机频率过滤赋能的单源领域泛化用于医学图像分割

Heng Li, Haojin Li, Jianyu Chen, Mingyang Ou, Hai Shu, Heng Miao

机构 * Faculty of Biomedical Engineering, Shenzhen University of Advanced Technology(深圳先进技术大学生物医学工程学院) The Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学计算机科学与工程系) The Department of Biostatistics, School of Global Public Health, New York University(纽约大学全球公共卫生学院生物统计学系) Department of Ophthalmology, Peking University People's Hospital(北京大学人民医院眼科部门) Beijing Key Laboratory of Ocular Disease and Optometry Science, Peking University People’s Hospital(北京大学人民医院眼病与视光学科学重点实验室)

AI总结 RaffeSDG通过随机频率过滤和结构显著性学习,实现单源域医学图像分割的领域泛化与跨域推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.05809 2026-01-06 math.NA cs.LG cs.NA

Two-hidden-layer ReLU neural networks and finite elements

具有两个隐藏层的ReLU神经网络与有限元

Pengzhan Jin

机构 * National Engineering Laboratory for Big Data Analysis and Applications, Peking University, Beijing(大数据分析与应用国家工程实验室,北京大学,北京)

AI总结 本文提出通过两个隐藏层ReLU神经网络弱表示有限元函数,并探讨其在逼近能力分析中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.05067 2026-01-06 cs.AI cs.LG stat.ML

On the Representation of Pairwise Causal Background Knowledge and Its Applications in Causal Inference

关于成对因果背景知识的表示及其在因果推断中的应用

Zhuangyan Fang, Ruiqi Zhao, Yue Liu, Yangbo He

机构 * Peking University(北京大学) Xiaomi Corporation(小米公司) Inspur Industrial Innovation (Shandong) Intelligent Manufacturing Co., Ltd.(Inspur工业创新(山东)智能制造有限公司) Renmin University of China(中国人民大学)

AI总结 本文提出通过直接因果子句(DCC)统一表示三种成对因果背景知识,并证明因果效应的可识别性仅依赖于分解的MPDAG。

Journal ref Journal of Machine Learning Research 26, 1-73 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00887 2026-01-06 cs.CV

VideoCuRL: Video Curriculum Reinforcement Learning with Orthogonal Difficulty Decomposition

VideoCuRL: 通过正交难度分解实现视频课程强化学习

Hongbo Jin, Kuanwei Lin, Wenhao Zhang, Yichen Jin, Ge Li

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学)

AI总结 VideoCuRL通过正交分解视频理解中的视觉复杂性和认知复杂性,提出了一种新的课程强化学习框架,提升了视频推理和感知任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00590 2026-01-05 cs.CV

SafeMo: Linguistically Grounded Unlearning for Trustworthy Text-to-Motion Generation

SafeMo: 语言引导的去学习用于可信的文本到运动生成

Yiling Wang, Zeyu Zhang, Yiran Wang, Hao Tang

机构 * The Australian National University(澳大利亚国立大学) Peking University(北京大学)

AI总结 SafeMo通过整合MMU策略,实现安全的人类运动生成,提升安全性和实用性平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00303 2026-01-05 cs.CL cs.AI

DepFlow: Disentangled Speech Generation to Mitigate Semantic Bias in Depression Detection

DepFlow:解耦语音生成以缓解抑郁检测中的语义偏差

Yuxin Li, Xiangyu Zhang, Yifei Li, Zhiwei Guo, Haoyang Zhang, Eng Siong Chng, Cuntai Guan

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) School of Electrical Engineering and Telecommunications, UNSW(新南威尔士大学电信工程学院) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) Center for AI in Medicine (C-AIM), Lee Kong Chian School of Medicine, NTU(人工智能医学中心(C-AIM)、李光耀医学院、南洋理工大学)

AI总结 DepFlow通过三阶段框架解耦语音生成,缓解抑郁症检测中的语义偏差,提升模型鲁棒性并提供可控合成平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00163 2026-01-05 cs.RO

SLEI3D: Simultaneous Exploration and Inspection via Heterogeneous Fleets under Limited Communication

SLEI3D: 基于异构舰队的同步探索与勘察及有限通信下的实时通信

Junfeng Chen, Yuxiao Zhu, Xintong Zhang, Bing Luo, Meng Guo

机构 * School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院) Division of Natural and Applied Sciences, Duke Kunshan University(杜克昆山大学自然科学与应用科学系)

AI总结 SLEI3D通过异构舰队实现同步探索与勘察,并在有限通信条件下进行实时通信。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12369 2026-01-05 cs.CV

WorldMem: Long-term Consistent World Simulation with Memory

WorldMem: 基于记忆的长期一致世界模拟

Zeqi Xiao, Yushi Lan, Yifan Zhou, Wenqi Ouyang, Shuai Yang, Yanhong Zeng, Xingang Pan

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 WorldMem通过引入记忆库和注意力机制,实现了长期一致的世界模拟,提升了场景生成的准确性和动态建模能力。

Comments Project page at https://xizaoqu.github.io/worldmem/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04454 2026-01-05 cs.CL

Inner-Probe: Discovering Copyright-related Data Generation in LLM Architecture

Inner-Probe: 在LLM架构中发现与版权相关的数据生成

Qichao Ma, Rui-Jie Zhu, Peiye Liu, Renye Yan, Fahong Zhang, Ling Liang, Meng Li, Zhaofei Yu, Zongwei Wang, Yimao Cai, Tiejun Huang

机构 * School of Computer Science and the State Key Laboratory of Multimedia Information Processing, Peking University(计算机科学系和多媒体信息处理国家重点实验室,北京大学) Institute for Artificial Intelligence, Peking University(人工智能研究院,北京大学) department of Electrical and Computer Engineering, University of California, Santa Cruz(电气与计算机工程系,加州大学圣克鲁兹分校) Alibaba DAMO Academy, Beijing(阿里巴巴达摩院,北京) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学) School of Integrated Circuits, Peking University(集成电路系,北京大学) YanXin MicroElectronics Co., Ltd.(YXME), Shanghai, China(燕芯微电子有限公司(YXME),上海,中国)

AI总结 Inner-Probe通过分析LLM生成过程中多头注意力机制,实现对受版权数据子集影响的高效检测与非受版权文本识别。

Comments Accepted by IEEE Transactions on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.25000 2026-01-01 cs.CV

Bi-C2R: Bidirectional Continual Compatible Representation for Re-indexing Free Lifelong Person Re-identification

Bi-C2R: 双向连续兼容表示用于无重新索引的终身人物重识别

Zhenyu Cui, Jiahuan Zhou, Yuxin Peng

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王萱计算机技术研究所)

AI总结 本文提出Bi-C2R框架,解决无重新索引的终身人物重识别问题,通过双向连续兼容表示实现新旧模型特征的兼容性,提升重识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24321 2026-01-01 cs.CV cs.RO

UniAct: Unified Motion Generation and Action Streaming for Humanoid Robots

UniAct:面向人形机器人的统一动作生成与动作流

Nan Jiang, Zimo He, Wanhe Yu, Lexi Pang, Yunhao Li, Hongjie Li, Jieming Cui, Yuhan Li, Yizhou Wang, Yixin Zhu, Siyuan Huang

机构 * Institute for AI, Peking University(人工智能研究院,北京大学) Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院) School of Psychological and Cognitive Sciences, Peking University(心理学与认知科学学院,北京大学) School of Computer Science, Peking University(计算机科学学院,北京大学) Yuanpei College, Peking University(元培学院,北京大学) School of Foreign Languages, Peking University(外语学院,北京大学) School of EECS, Peking University(电子工程与科学学院,北京大学) Huazhong University of Science and Technology(华中科技大学) State Key Lab of General AI(通用人工智能国家重点实验室) Nat’l Eng. Research Center of Visual Technology(视觉技术国家工程研究中心) Beijing Key Laboratory of Behavior and Mental Health, Peking University(北京行为与心理健康重点实验室,北京大学) Embodied Intelligence Lab, PKU-Wuhan Institute for Artificial Intelligence(具身智能实验室,北京大学-武汉人工智能研究院)

AI总结 UniAct通过统一感知与控制框架,实现人形机器人在多模态指令下的高效动作生成与实时执行,提升零样本跟踪成功率19%。

Comments Project page: https://jnnan.github.io/uniact/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24263 2026-01-01 cs.AI

Constrained Language Model Policy Optimization via Risk-aware Stepwise Alignment

通过风险感知的逐步对齐实现约束语言模型策略优化

Lijun Zhang, Lin Li, Wei Wei, Yajie Qi, Huizhong Song, Jun Wang, Yaodong Yang, Jiye Liang

机构 * Key Laboratory of Computational Intelligence and Chinese Information Processing of Ministry of Education, School of Computer and Information Technology, Shanxi University(教育部计算智能与中文信息处理重点实验室,计算机与信息技术学院,山西大学) University College London(伦敦大学学院) Institute for AI, Peking University(北京大学人工智能研究院)

AI总结 本文提出风险感知的逐步对齐方法,通过嵌套风险度量提升语言模型策略优化的安全性与鲁棒性,有效抑制高影响有害行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23983 2026-01-01 cs.CV

DriveExplorer: Images-Only Decoupled 4D Reconstruction with Progressive Restoration for Driving View Extrapolation

DriveExplorer: 基于图像的解耦4D重建与渐进修复用于驾驶视角外推

Yuang Jia, Jinlong Wang, Jiayi Zhao, Chunlam Li, Shunzhou Wang, Wei Gao

机构 * Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology(广东省级超高清沉浸媒体技术重点实验室) School of Electronic and Computer Engineering(电子与计算机工程学院) Shenzhen Graduate School, Peking University(北京大学深圳研究生院)

AI总结 DriveExplorer通过图像解耦和渐进修复实现驾驶视角外推,利用4D高斯框架和扩散模型提升重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00742 2026-01-01 cs.CV cs.AI eess.IV

Zoomer: Adaptive Image Focus Optimization for Black-box MLLM

Zoomer: 为黑盒大语言模型实现自适应图像聚焦优化

Jiaxu Qian, Chendong Wang, Yifan Yang, Chaoyun Zhang, Huiqiang Jiang, Xufang Luo, Yu Kang, Qingwei Lin, Anlan Zhang, Shiqi Jiang, Ting Cao, Tianjun Mao, Suman Banerjee, Guyue Liu, Saravan Rajmohan, Dongmei Zhang, Yuqing Yang, Qi Zhang, Lili Qiu

机构 * Microsoft(微软公司) Peking University(北京大学) University of Wisconsin Madison(威斯康星大学麦迪逊分校) University of Southern California(南加州大学)

AI总结 Zoomer通过自适应图像聚焦优化提升黑盒MLLM的多模态理解能力,显著提升准确性并减少token使用

Comments TMLR accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10481 2026-01-01 cs.CL

xVerify: Efficient Answer Verifier for Reasoning Model Evaluations

xVerify:用于推理模型评估的高效答案验证器

Ding Chen, Qingchen Yu, Pengyuan Wang, Mengting Hu, Wentao Zhang, Zhengren Wang, Bo Tang, Feiyu Xiong, Xinchi Li, Chao Wang, Minchuan Yang, Zhiyu Li

机构 * China Telecom Research Institute(中国电信研究院) MemTensor (Shanghai) Technology Co., Ltd.(MemTensor(上海)技术有限公司) College of Software, Nankai University(南开大学软件学院) Center for Data Science, Peking University(北京大学数据科学中心) Peking University(北京大学) Data Development Center of China Telecom(中国电信数据开发中心)

AI总结 xVerify是一种高效答案验证器,通过VAR数据集训练,能够准确评估推理模型的等价性判断和最终答案提取,实验表明其在多个任务中表现优异。

Comments 35 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22942 2026-01-01 cs.RO cs.AI

AINav: Large Language Model-Based Adaptive Interactive Navigation

AINav: 基于大语言模型的自适应交互导航

Kangjie Zhou, Yao Mu, Haoyang Song, Yi Zeng, Pengying Wu, Han Gao, Chang Liu

机构 * School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院) AI Institute, School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机学院人工智能研究所)

AI总结 AINav通过基于大语言模型的自适应交互导航方法,实现复杂环境中的路径规划与目标达成。

Comments 13 pages, 12 figures, accepted to IEEE Robotics & Automation Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏