arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

共收录 3042
2503.21614 2026-01-01 cs.CL

A Survey of Efficient Reasoning for Large Reasoning Models: Language, Multimodality, and Beyond

大推理模型高效推理的综述:语言、多模态与更远的探索

Xiaoye Qu, Yafu Li, Zhao-Chen Su, Weigao Sun, Jianhao Yan, Dongrui Liu, Ganqu Cui, Daizong Liu, Shuxian Liang, Junxian He, Peng Li, Wei Wei, Jing Shao, Chaochao Lu, Yue Zhang, Xian-Sheng Hua, Bowen Zhou, Yu Cheng

机构 * Shanghai AI Laboratory(上海人工智能实验室) Soochow University(苏州大学) Westlake University(西湖大学) Peking University(北京大学) Tongji University(同济大学) The Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学) Huazhong University of Science and Technology(华中科技大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文综述了大推理模型在提升推理效率方面的最新研究,聚焦于语言、多模态及未来方向,旨在推动该领域的发展。

Comments Update recent RL papers. Project page: https://github.com/XiaoYee/Awesome_Efficient_LRM_Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23703 2025-12-30 cs.RO

Robo-Dopamine: General Process Reward Modeling for High-Precision Robotic Manipulation

Robo-Dopamine:高精度机器人操作的通用过程奖励建模

Huajie Tan, Sixiang Chen, Yijie Xu, Zixiao Wang, Yuheng Ji, Cheng Chi, Yaoxu Lyu, Zhongxia Zhao, Xiansheng Chen, Peterson Co, Shaoxuan Xie, Guocai Yao, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(1 多媒体信息处理国家重点实验室,计算机学院,北京大学) Beijing Academy of Artificial Intelligence(2 北京人工智能研究院) University of Sydney(3 新南威尔士大学) Institute of Automation, Chinese Academy of Sciences(4 中国科学院自动化研究所)

AI总结 Robo-Dopamine通过多视角奖励融合和分步奖励离散化,提出了一种通用过程奖励模型,提升机器人操作的精准度和策略学习效率。

Comments 27 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23343 2025-12-30 cs.CL cs.AI cs.CV

AI Meets Brain: Memory Systems from Cognitive Neuroscience to Autonomous Agents

AI 与大脑:从认知神经科学到自主代理的记忆系统

Jiafeng Liang, Hao Li, Chang Li, Jiaqi Zhou, Shixin Jiang, Zekun Wang, Changkai Ji, Zhihao Zhu, Runxuan Liu, Tao Ren, Jinlan Fu, See-Kiong Ng, Xia Liang, Ming Liu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Fudan University(复旦大学) Peking University(北京大学) National University of Singapore(新加坡国立大学)

AI总结 本文从认知神经科学到自主代理,系统综合了记忆的跨学科知识,探讨了记忆的定义、功能、分类、存储机制及安全问题,并展望了多模态记忆系统和技能获取的未来研究方向。

Comments 57 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21233 2025-12-30 cs.RO

UniTacHand: Unified Spatio-Tactile Representation for Human to Robotic Hand Skill Transfer

UniTacHand: 一体化的空间触觉表示用于人到机械手技能转移

Chi Zhang, Penglin Cai, Haoqi Yuan, Chaoyi Xu, Zongqing Lu

机构 * Peking University(北京大学) BeingBeyond

AI总结 UniTacHand通过统一空间触觉表示,实现从人类到机械手的零样本触觉政策转移,提升触觉驱动的灵巧操作能力。

Comments The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17703 2025-12-30 cond-mat.str-el cond-mat.mtrl-sci cs.LG physics.comp-ph

Revisiting the Broken Symmetry Phase of Solid Hydrogen: A Neural Network Variational Monte Carlo Study

重新审视固态氢的破缺对称相:一种神经网络变分蒙特卡洛研究

Shengdu Chai, Chen Lin, Xinyang Dong, Yuqiang Li, Wanli Ouyang, Lei Wang, X. C. Xie

机构 * Interdisciplinary Center for Theoretical Physics(理论物理交叉中心) Information Sciences (ICTPIS), Fudan University(信息科学(ICTPIS),复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Department of Engineering, University of Oxford(工程系,牛津大学) Beijing National Laboratory for Condensed Matter Physics(北京凝聚态物理实验室) Institute of Physics, Chinese Academy of Sciences(物理研究所,中国科学院) Department of Information Engineering, The Chinese University of Hong Kong(信息工程系,香港中文大学) International Center for Quantum Materials, School of Physics, Peking University(国际量子材料中心,物理系,北京大学) Hefei National Laboratory(合肥国家实验室)

AI总结 本文通过神经网络变分蒙特卡洛方法研究固态氢的破缺对称相,发现其基态结构候选者Cmcm空间群对称性,并验证其稳定性及与实验数据的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15560 2025-12-30 cs.CV

GRAN-TED: Generating Robust, Aligned, and Nuanced Text Embedding for Diffusion Models

GRAN-TED: 生成稳健、对齐且细腻的文本嵌入以用于扩散模型

Bozhou Li, Sihan Yang, Yushuo Guan, Ruichuan An, Xinlong Chen, Yang Shi, Pengfei Wan, Wentao Zhang, Yuanxing zhang

机构 * Peking University(北京大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Xi’an Jiaotong University(西安交通大学) School of Artificial Intelligence, UCAS(清华大学人工智能学院)

AI总结 GRAN-TED提出了一种生成稳健、对齐且细腻的文本嵌入以用于扩散模型的范式,通过TED-6K基准提升文本编码器性能,显著加快扩散模型训练速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15965 2025-12-30 cs.LG cs.AI cs.DC

RLinf: Flexible and Efficient Large-scale Reinforcement Learning via Macro-to-Micro Flow Transformation

RLinf: 通过宏到微流转换实现灵活高效的大型强化学习

Chao Yu, Yuanqing Wang, Zhen Guo, Hao Lin, Si Xu, Hongzhi Zang, Quanlu Zhang, Yongji Wu, Chunyang Zhu, Junhao Hu, Zixiao Huang, Mingjie Wei, Yuqing Xie, Ke Yang, Bo Dai, Zhexuan Xu, Jiakun Du, Xiangyuan Wang, Xu Fu, Letong Shi, Zhihao Liu, Kang Chen, Weilin Liu, Gang Liu, Boxun Li, Jianlei Yang, Zhi Yang, Guohao Dai, Yu Wang

机构 * Tsinghua University(清华大学) Zhongguancun Academy(中关村学院) Infinigence AI Peking University(北京大学) UC Berkeley(加州大学伯克利分校) Beihang University(北航) Shanghai Jiaotong University(上海交通大学)

AI总结 RLinf通过宏到微流转换范式,实现了高效灵活的大型强化学习训练系统,显著提升了训练吞吐量。

Comments GitHub Repo: https://github.com/RLinf/RLinf

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01967 2025-12-30 cs.CL cs.AI cs.HC

Analyzing Cognitive Differences Among Large Language Models through the Lens of Social Worldview

通过社会世界观的视角分析大型语言模型的认知差异

Jiatao Li, Yanheng Li, Xiaojun Wan

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机技术研究院) Information Management Department, Peking University(北京大学信息管理系) Renmin University of China(中国人民大学)

AI总结 本研究通过社会世界观分类法分析大型语言模型的认知差异,揭示其在动态社会环境中的适应性与认知灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09602 2025-12-30 physics.flu-dyn cs.AI cs.CL

Fine-tuning a Large Language Model for Automating Computational Fluid Dynamics Simulations

针对计算流体力学模拟的大型语言模型微调

Zhehao Dong, Zhen Lu, Yue Yang

机构 * State Key Laboratory for Turbulence and Complex Systems, College of Engineering, Peking University, Beijing 100871, China(湍流与复杂系统国家重点实验室,工程学院,北京大学,北京100871,中国) HEDPS-CAPT, Peking University, Beijing 100871, China(HEDPS-CAPT,北京大学,北京100871,中国)

AI总结 通过微调领域特定LLM,实现从自然语言到CFD模拟配置的自动化,提升复杂工程流程的效率和准确性。

Journal ref Theor. Appl. Mech. Lett. 15, 100594 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09832 2025-12-30 stat.ML cs.DS cs.LG math.PR math.ST stat.TH

Computational Lower Bounds for Correlated Random Graphs via Algorithmic Contiguity

通过算法连续性计算相关随机图的下界

Zhangsong Li

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院)

AI总结 本文通过算法连续性理论,证明了在相关随机图和稀疏块模型中,低于特定阈值的计算问题存在计算难度下界。

Comments This substantially improves the results and simplifies the proofs in an earlier version

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19413 2025-12-30 cs.CV

Multi-scale Latent Point Consistency Models for 3D Shape Generation

多尺度潜在点一致性模型用于3D形状生成

Bi'an Du, Wei Hu, Renjie Liao

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所) Department of Electrical and Computer Engineering, University of British Columbia(不列颠哥伦比亚大学电气与计算机工程系)

AI总结 多尺度潜在点一致性模型通过多尺度潜在整合和3D空间注意力,提升3D形状生成效率和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00735 2025-12-30 physics.flu-dyn cs.LG

Generative prediction of flow fields around an obstacle using the diffusion model

利用扩散模型生成障碍物周围的流场预测

Jiajun Hu, Zhen Lu, Yue Yang

机构 * State Key Laboratory for Turbulence and Complex Systems, College of Engineering, Peking University, Beijing 100871, China(湍流与复杂系统国家重点实验室,工程学院,北京大学,北京100871,中国) HEDPS-CAPT, Peking University, Beijing 100871, China(HEDPS-CAPT,北京大学,北京100871,中国)

AI总结 本文提出了一种基于扩散模型的几何到流场预测方法,通过U-Net和交叉注意力机制实现对障碍物周围流场的高效预测,并在复杂几何条件下展现优越性能。

Journal ref Phys. Rev. Fluids 10, 094903 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22744 2025-12-30 cs.LG

Bridging Global Intent with Local Details: A Hierarchical Representation Approach for Semantic Validation in Text-to-SQL

弥合全局意图与局部细节:一种用于文本到SQL语义验证的层次表示方法

Rihong Qiu, Zhibang Yang, Xinke Jiang, Weibin Liao, Xin Gao, Xu Chu, Junfeng Zhao, Yasha Wang

机构 * Peking University(北京大学)

AI总结 HEROSQL通过整合逻辑计划和抽象语法树,提升文本到SQL的语义验证效果,实现更准确的细粒度语义检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22737 2025-12-30 cs.CL

WeDLM: Reconciling Diffusion Language Models with Standard Causal Attention for Fast Inference

WeDLM:弥合扩散语言模型与标准因果注意力以实现快速推理

Aiwei Liu, Minghua He, Shaoxun Zeng, Sijun Zhang, Linhao Zhang, Chuhan Wu, Wei Jia, Yuan Liu, Xiao Zhou, Jie Zhou

机构 * WeChat AI, Tencent(腾讯微信AI) Peking University(北京大学) Tsinghua University(清华大学)

AI总结 WeDLM通过使用标准因果注意力实现高效并行解码,显著提升推理速度,优于优化的AR引擎。

Comments 23 pages, 8 figures, project page: https://wedlm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10369 2025-12-30 cs.CV

Breaking the Vicious Cycle: Coherent 3D Gaussian Splatting from Sparse and Motion-Blurred Views

打破恶性循环:从稀疏和运动模糊视图中进行一致的3D高斯点扩散

Zhankuo Xu, Chaoran Feng, Yingtao Li, Jianbin Zhao, Jiashu Yang, Wangbo Yu, Li Yuan, Yonghong Tian

机构 * Peking University(北京大学) School of Electronics and Computer Engineering, Peking University(电子与计算机工程学院,北京大学)

AI总结 CoherentGS通过双先验策略和双生成模型,解决稀疏模糊视图下的3D重建问题,实现高保真重建。

Comments 20 pages, 14 figures. Manuscript v2: add the view selection of training in the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20368 2025-12-30 cs.AI

AI-SearchPlanner: Modular Agentic Search via Pareto-Optimal Multi-Objective Reinforcement Learning

AI-SearchPlanner: 通过帕累托最优多目标强化学习实现模块化代理搜索

Lang Mei, Zhihan Yang, Xiaohan Yu, Huanyao Zhang, Chong Chen

机构 * Huawei Cloud BU, China(华为云业务部,中国) School of Computer Science, Peking University(北京大学计算机学院)

AI总结 AI-SearchPlanner通过帕累托最优多目标强化学习提升冻结QA模型的搜索规划性能,实现模块化代理搜索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12611 2025-12-30 cs.CL

Who Writes What: Unveiling the Impact of Author Roles on AI-generated Text Detection

谁写什么:揭示作者角色对AI生成文本检测的影响

Jiatao Li, Xiaojun Wan

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机技术研究院)

AI总结 研究揭示作者角色(如性别、CEFR熟练度等)对AI生成文本检测的影响,提出多因素分析方法,为更公平的检测系统提供实证支持和框架。

Comments ACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21220 2025-12-29 cs.AI cs.CV cs.RO

RoboSafe: Safeguarding Embodied Agents via Executable Safety Logic

RoboSafe: 通过可执行的安全逻辑保障具身智能体

Le Wang, Zonghao Ying, Xiao Yang, Quanchen Zou, Zhenfei Yin, Tianlin Li, Jian Yang, Yaodong Yang, Aishan Liu, Xianglong Liu

机构 * Beihang University(北航大学) AI Security Lab(360AI安全实验室) The University of Sydney(悉尼大学) Nanyang Technological University(南洋理工大学) Peking University(北京大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

AI总结 RoboSafe通过可执行的安全逻辑保障具身智能体,减少危险行为并保持任务性能。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21185 2025-12-29 cs.CV cs.GR

UltraShape 1.0: High-Fidelity 3D Shape Generation via Scalable Geometric Refinement

UltraShape 1.0:通过可扩展的几何细化实现高保真的3D形状生成

Tanghui Jia, Dongyu Yan, Dehao Hao, Yang Li, Kaiyi Zhang, Xianyi He, Lanjiong Li, Yuhan Wang, Jinnan Chen, Lutao Jiang, Qishen Yin, Long Quan, Ying-Cong Chen, Li Yuan

机构 * Shenzhen Graduate School, Peking University(北京大学深圳研究生院) The Hong Kong University of Science(香港科学大学) National University of Singapore(新加坡国立大学) S-Lab, Nanyang Technological University(南洋理工大学S实验室)

AI总结 UltraShape 1.0通过可扩展的几何细化方法实现高质量3D形状生成,采用两阶段流程提升几何质量,支持公开数据集的精细化处理。

Comments 14 pages, 10 figures, Technical Report,

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02978 2025-12-29 cs.CV

Self-Supervised Skeleton-Based Action Representation Learning: A Benchmark and Beyond

自监督骨骼基动作表示学习:一个基准与更远

Jiahang Zhang, Lilang Lin, Shuai Yang, Jiaying Liu

机构 * Wangxuan Institute of Computer Technology(王轩计算机技术研究所) Peking University(北京大学)

AI总结 本文提出了一种新的自监督学习方法,通过整合多粒度的表示学习目标,提升骨骼动作表示的泛化能力,并在多个下游任务中验证了其有效性。

Comments IJCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02519 2025-12-29 cs.AI cs.LG

Creative Agents: Empowering Agents with Imagination for Creative Tasks

创意代理:通过想象力赋能代理以完成创意任务

Penglin Cai, Chi Zhang, Yuhui Fu, Haoqi Yuan, Zongqing Lu

机构 * School of Computer Science Peking University(北京大学计算机学院)

AI总结 本研究提出通过增强想象力的创意代理,首次在Minecraft生存模式中实现多样化建筑创建,利用大语言模型和扩散模型提升创造力表现。

Comments The first two authors contribute equally

Journal ref Proceedings of the 41st Conference on Uncertainty in Artificial Intelligence (UAI 2025), PMLR 244:471-496

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21675 2025-12-29 cs.CV

UniPercept: Towards Unified Perceptual-Level Image Understanding across Aesthetics, Quality, Structure, and Texture

UniPercept:迈向跨美学、质量、结构和纹理的统一感知级图像理解

Shuo Cao, Jiayang Li, Xiaohui Li, Yuandong Pu, Kaiwen Zhu, Yuanting Gao, Siqi Luo, Yi Xin, Qi Qin, Yu Zhou, Xiangyu Chen, Wenlong Zhang, Bin Fu, Yu Qiao, Yihao Liu

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Nanjing University(南京大学) Sun Yat-sen University(中山大学) Tele-AI Website(Tele-AI网站)

AI总结 UniPercept通过领域自适应预训练和任务对齐强化学习,实现跨美学、质量、结构和纹理的统一感知级图像理解,优于现有多模态大语言模型。

Comments 27 pages, 14 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21627 2025-12-29 cs.RO

AstraNav-Memory: Contexts Compression for Long Memory

AstraNav-Memory: 长记忆中的上下文压缩

Botao Ren, Junjun Hu, Xinda Xue, Minghua Luo, Jintao Chen, Haochen Bai, Liangliang You, Mu Xu

机构 * Amap, Alibaba Group(阿里巴巴集团Amap) Tsinghua University(清华大学) Peking University(北京大学)

AI总结 AstraNav-Memory通过高效的视觉上下文压缩模块和Qwen2.5-VL导航策略,实现了长记忆的压缩存储与高效导航,提升了在新环境中的探索能力和熟悉环境中的路径效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21617 2025-12-29 cs.CV

CausalFSFG: Rethinking Few-Shot Fine-Grained Visual Categorization from Causal Perspective

CausalFSFG: 从因果视角重新思考少样本细粒度视觉分类

Zhiwen Yang, Jinglin Xu, Yuxin Pen

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所) School of Intelligence Science and Technology, University of Science and Technology Beijing(北京科技大学智能科学与技术学院)

AI总结 CausalFSFG从因果视角提出新方法,通过干预多尺度编码器和特征重建消除虚假相关性,提升少样本细粒度视觉分类性能。

Comments 12 pages, 5 figures, accepted by IEEE TMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21540 2025-12-29 cs.AI

Leash: Adaptive Length Penalty and Reward Shaping for Efficient Large Reasoning Model

Leash:自适应长度惩罚与奖励塑造用于高效大推理模型

Yanhao Li, Lu Ma, Jiaran Zhang, Lexiang Tang, Wentao Zhang, Guibo Luo

机构 * Peking University(北京大学) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 Leash通过自适应长度惩罚与奖励塑造,有效提升大模型推理效率,减少推理长度60%同时保持性能竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21527 2025-12-29 cs.LG

Generative Actor Critic

生成性行为批判者

Aoyang Qin, Deqian Kong, Wei Wang, Ying Nian Wu, Song-Chun Zhu, Sirui Xie

机构 * Department of Automation, Tsinghua University(清华大学自动化系) Beijing Institute of General Artificial Intelligence (BIGAI)(北京通用人工智能研究院) Department of Statistics and Data Science, UCLA(UCLA统计与数据科学系) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Department of Computer Science, UCLA(UCLA计算机科学系)

AI总结 生成性行为批判者通过学习轨迹和回报的联合分布生成模型,实现离线预训练模型与在线经验的高效结合,提升离线到在线的改进能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21476 2025-12-29 cs.CV cs.AI

GPF-Net: Gated Progressive Fusion Learning for Polyp Re-Identification

GPF-Net:门控渐进融合学习用于息肉重识别

Suncheng Xiang, Xiaoyang Wang, Junjie Jiang, Hejia Wang, Dahong Qian

机构 * Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Shanghai Fifth People's Hospital(上海第五人民医院)

AI总结 GPF-Net通过门控渐进融合学习提升息肉重识别性能,结合多模态融合策略优于现有单模态模型。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17376 2025-12-29 cs.CV

Towards Deeper Emotional Reflection: Crafting Affective Image Filters with Generative Priors

迈向更深层次的情感反思:基于生成先验的富有情感的图像滤镜

Peixuan Zhang, Shuchen Weng, Jiajun Tang, Si Li, Boxin Shi

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) State Key Laboratory of Multimedia Information Processing and National Engineering Research Center of Visual Technology, School of Computer Science, Peking University(北京大学多媒体信息处理国家重点实验室和视觉技术国家工程研究中心)

AI总结 本文提出AIF任务,通过生成先验提升图像情感表达,实现更深层次的情感反思。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13030 2025-12-29 cs.CV cs.LG cs.RO

Motus: A Unified Latent Action World Model

Motus:一个统一的潜在动作世界模型

Hongzhe Bi, Hengkai Tan, Shenghao Xie, Zeyuan Wang, Shuhe Huang, Haitian Liu, Ruowen Zhao, Yao Feng, Chendong Xiang, Yinze Rong, Hongyan Zhao, Hanyu Liu, Zhizhong Su, Lei Ma, Hang Su, Jun Zhu

机构 * Dept. of Comp. Sci. and Tech., Institute for AI, BNRist Center, THBI Lab, Tsinghua-Bosch Joint ML Center, Tsinghua University(计算机科学与技术系,人工智能研究院,BNRist中心,THBI实验室,清华-博世联合机器学习中心,清华大学) Peking University(北京大学) Horizon Robotics

AI总结 Motus通过统一的潜在动作世界模型整合理解、视频生成和动作模块,利用光流和三阶段训练流程提升大规模动作预训练效果,实现模拟与现实场景中的性能突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18699 2025-12-29 cs.CV

Affective Image Editing: Shaping Emotional Factors via Text Descriptions

情感图像编辑:通过文本描述塑造情感因素

Peixuan Zhang, Shuchen Weng, Chengxuan Zhu, Binghao Tang, Zijian Jia, Si Li, Boxin Shi

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications, China(北京邮电大学人工智能学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) State Key Laboratory for Multimedia Information Processing and National Engineering Research Center of Visual Technology, School of Computer Science, Peking University, China(多媒体信息处理国家重点实验室和视觉技术国家工程研究中心,北京大学计算机学院)

AI总结 AIEdiT通过文本描述实现情感图像编辑,利用情感映射器和MLLM生成符合用户情感需求的图像。

详情

展开后加载摘要…

URL PDF HTML 收藏