arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

共收录 3015
2608.13560 2026-08-14 cs.CV cs.AI cs.CL 新提交

AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design

AutoDesign:面向长视距智能体设计的元工具优化

Yaxin Luo, Haobin Jiang, Jialv Zou, Xu Huang, Wenhao Yan, Haodong Li, Zhengrong Yue, Jing Li, Xiaofu Chen, Xiaohan Zhao, Jiacheng Liu, Jiacheng Cui, Zhiqiang Shen, Xiaotong Li

机构 * Meituan(美团) MBZUAI(Mohamed bin Zayed University of Artificial Intelligence) Huazhong University of Science and Technology(华中科技大学) Peking University(北京大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 AutoDesign是符合人类设计先验的元工具优化框架,以论文转海报生成任务为实例,在PosterBench上性能优于Claude Design,集成其学习的DesignHarness可提升代码智能体性能,且获人类最高偏好。

Comments Tech Report. Code at: https://github.com/Yaxin9Luo/AutoDesign

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13555 2026-08-14 cs.RO cs.AI cs.CV 新提交

HumanTracker: Towards Comprehensive and Human-Aligned Motion Tracking Benchmark

HumanTracker:面向全面且与人类对齐的运动跟踪基准

Dairu Liu, Zekun Qi, Jiayu Zeng, Ruixi Yu, Yu Guan, Yintianrun Zhang, Xuchuan Chen, Sikai Liang, Zekai Li, Chenghuai Lin, Xinqiang Yu, Wenyao Zhang, He Wang, Li Yi

机构 * Nankai University(南开大学) Tsinghua University(清华大学) Galbot Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Shanghai Qi Zhi Institute(上海启智研究院)

AI总结 针对人形运动跟踪评估与人类感知不符、基准多样性不足的问题,提出HumanTracker基准及偏好对齐指标HumanScore,该指标可更好预测人类偏好并揭示运动学指标遗漏的接触与稳定性故障。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13538 2026-08-14 cs.CL 新提交

SAEVerbalizer: Generating Explanations for Sparse Autoencoder Features via Representation Verbalization

SAEVerbalizer:通过表示 verbalization 为稀疏自编码器特征生成解释

Weihan Meng, Hongzhu Guo, Yi Jing, Dewen Liu, Zijun Yao, Xiaozhi Wang, Lei Hou, Juanzi Li

机构 * Tsinghua University(清华大学) Peking University(北京大学) Fudan University(复旦大学)

AI总结 该研究提出 SAEVerbalizer 框架,通过微调 LLM 下游层生成 SAE 特征的自然语言解释,解决了传统解释方法的表面性与低效率问题,其 verbalization 能力可泛化、迁移并扩展到不同 LLM 的 SAE 特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13467 2026-08-14 cs.LG 新提交

Active-Trace Complexity Bounds for Moreau--Yosida Unadjusted Langevin Sampling

Moreau-Yosida未校正朗之万采样的活动迹复杂度界

Yuchen Xin, Zhihua Zhang

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院)

AI总结 该研究针对非光滑复合目标的MYULA,推导其离散化误差由参考活动迹控制,证明Moreau偏差界,给出迭代次数复杂度,针对结构化惩罚得到更优的精度依赖关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13263 2026-08-14 cs.AI cs.DC cs.OS 新提交

vToken: Token-Level Virtualization for Reclaimable KV Caches

vToken:用于可回收KV缓存的令牌级虚拟化技术

Yuanhang Gao, Xiangrui Yang, Yuanfeng Chen, Hongjia Chen, Qianru Lv, Wenfei Wu, Dongsheng Li

机构 * National University of Defense Technology(国防科技大学) Peking University(北京大学)

AI总结 vToken是一种轻量级令牌级虚拟化层,可解耦逻辑令牌活性与物理块放置,在保留PagedAttention兼容性的同时,提升KV缓存回收效率与服务吞吐量,降低策略集成代码量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12866 2026-08-14 cs.RO 新提交

AMR-Pose: An Active LED Marker-Based Relative Pose Estimation Framework With Probabilistic Switching PnP for Cooperative AUVs

AMR-Pose:一种用于协作自主水下航行器(AUV)的基于主动LED标记的相对位姿估计框架,结合概率切换PnP算法

Zeyu Sha, Xiaorui Wang, Mingyang Yang, Feitian Zhang

机构 * Peking University(北京大学)

AI总结 本文提出AMR-Pose框架,采用含红、蓝LED的标记模块,结合PSwPnP算法实现协作AUV的鲁棒相对位姿估计,经水池及闭环实验验证其准确性与实时性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12385 2026-08-14 cs.AI 新提交

Dual-Flow Transformers: Decoupling the Primary Prefill Path from Additional Decode Computation

双流式Transformer:将主预填路径与额外解码计算解耦

Liming Liu, Mingze Wang, Tuo Zhao

机构 * Georgia Institute of Technology(佐治亚理工学院) Peking University(北京大学)

AI总结 该研究提出双流式Transformer,将主预填路径与额外解码计算解耦,通过共享权重与缓存降低推理成本,在多架构与数据配置下实现更低验证损失,且可灵活分配MoE专家预算。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12337 2026-08-14 cs.CL 新提交

From Refuse to Richness: Rubric Rewards for Long-Form Hallucination Reinforcement Learning

从拒答到丰富:用于长文本幻觉强化学习的评分规则奖励

Yudong Wang, Zhe Yang, Wenhan Ma, Rang Li, Qibin Yang, Weimin Xiong, Jiangshan Duo, Liang Zhao, Zhifang Sui

机构 * Peking University(北京大学) Xiaomi(小米)

AI总结 该研究针对长文本幻觉强化学习的「拒答-丰富度」权衡,提出用关键要点评分规则定义奖励,发现软组合依据、评分规则覆盖率与相关性的奖励能实现最佳平衡,提升了依据性与分布外迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12331 2026-08-14 cs.CL cs.AI 新提交

Thought-Aware KV Cache Compaction for Reasoning via Adaptive Attention Matching

基于自适应注意力匹配的思维感知KV缓存压缩方法用于推理

Yang Liu, Bin Chong, Chongyang Zhang, Hao Zheng, Jiayu Liang, Xu Kefu

机构 * Tsinghua University(清华大学) Peking University(北京大学) Soochow University(苏州大学)

AI总结 该研究针对推理语言模型 KV 缓存的内存瓶颈问题,提出思维感知注意力匹配(TAM)方法,通过三种机制实现高效压缩,在降低内存占用的同时保持了推理准确率。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11698 2026-08-14 cs.LG cs.AI 版本更新

REOPD: Reliability-Adaptive Reward Extrapolation for On-Policy Distillation

REOPD:面向在线策略蒸馏的可靠性自适应奖励外推

Yang Sun, Lichao Ma, Houyuan Qin, Yuxin Liu, Hanyang Lu, Yao Zhu, Pinlong Cai, Guohang Yan

机构 * Peking University(北京大学) Southwest Jiaotong University(西南交通大学) University of Science and Technology of China(中国科学技术大学) School of Computer Science and Technology,University of Science and Technology of China(中国科学技术大学计算机科学与技术学院) University of Electronic Science and Technology of China(电子科技大学) School of Automation Engineering,University of Electronic Science and Technology of China(电子科技大学自动化工程学院) Renmin University of China(中国人民大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Autonomous Driving, Shanghai Artificial Intelligence Laboratory(上海人工智能实验室自动驾驶研究中心)

AI总结 本文提出面向在线策略蒸馏的可靠性自适应奖励外推框架REOPD,通过token级系数实现细粒度可靠性自适应,在多场景下优于基线方法,无需额外模型即可提升训练稳定性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03025 2026-08-14 cs.AI 版本更新

DiffImaginE: Imagine to Verify Entity Types with Diffusion

DiffImaginE:通过想象验证实体类型

Feng Zhang, Feiyu Han, Rongxin Yang, Yang Liu, Yancheng Chen, Rui Wang, Yingguang Yang, Tian Xueyun, Chongyang Zhang, Hao Zheng, Xu Kefu, Congjing Ran, Fuhai Chen, Bin Chong

机构 * Fuzhou University(福州大学) Chinese Academy of Sciences(中国科学院) Peking University(北京大学) Alibaba Group(阿里巴巴集团) University of Science and Technology of China(中国科学技术大学) Fullive Innovation (Beijing) AI Technology Co., Ltd.(福莱创新(北京)人工智能科技有限公司) Baidu(百度) Wuhan University(武汉大学)

AI总结 DiffImaginE将多模态命名实体识别的类型验证建模为条件潜在扩散推理,在Twitter-2015和Twitter-2017数据集上,相比确定性对照模型取得了一致的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06331 2026-08-14 cs.CL cs.AI cs.IR 版本更新

How Significant Are the Real Performance Gains? An Unbiased Evaluation Framework for GraphRAG

实际性能提升有多显著?GraphRAG的无偏评估框架

Qiming Zeng, Hao Luo, Yuhao Lin, Yicheng Jin, Yuxiang Wang, Fangcheng Fu, Xiao Yan, Jiawei Jiang

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) School of Computer Science, Peking University(北京大学计算机学院) Centre for Perceptual and Interactive Intelligence (CPII)(感知与交互智能中心) OceanBase

AI总结 针对GraphRAG现有评估框架的不相关问题与评估偏差缺陷,提出无偏评估框架并发现代表性GraphRAG方法的性能提升远小于此前报告结果,呼吁开展科学评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12314 2026-08-13 cs.CV 新提交

StateFlow: Building, Evolving, and Accessing 3D World States for Previsualization

StateFlow:用于预可视化的3D世界状态的构建、演化与访问

Yuyang Yin, Zixiang Li, Longxuan Deng, Hongkai Li, Shifang Zhao, Junnan Liu, Weirong Huang, Mengyu Wang, Tianxiao Fu, Yikai Wang, Peng-Shuai Wang, Xiaojie Jin, Yao Zhao, Yunchao Wei

机构 * Beijing Jiaotong University(北京交通大学) Mootion AI Beijing Normal University(北京师范大学) Peking University(北京大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

AI总结 StateFlow是一种以状态为中心的预可视化框架,通过构建、演化、访问可编辑3D世界的三阶段方法,提升生成预可视化的可控性与迭代编辑能力,可生成高质量3D世界用于视频创作和游戏原型设计。

Comments Project Page: https://yuyangyin.github.io/StateFlow

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11748 2026-08-13 cs.CV 新提交

Dual Modality Prompted Diffusion Priors for Zero Shot Hyperspectral Pansharpening

用于零样本高光谱 pansharpening 的双模态提示扩散先验

Pengwei Xie, Fei Zhu, Jiajun Li, Xiangyuan Liu, Xiangyuan Liu, Kangqing Shen, Gemine Vivone

机构 * School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) Peking University(北京大学) National Center for Applied Mathematics Shenzhen (NCAMS), Southern University of Science and Technology(南方科技大学深圳应用数学国家中心) Department of Automation, Tsinghua University(清华大学自动化系) National Research Council of Italy, Institute of Integrated Methodologies for Earth Observation (CNR-IMIOT)(意大利国家研究委员会综合地球观测方法研究所)

AI总结 该研究针对零样本高光谱 pansharpening 问题,提出双模态提示扩散模型 DIDM,通过双模态提示注入与全色引导正则化实现空间细节与光谱保真的平衡,在多数据集实验中取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11150 2026-08-13 cs.CV 版本更新

CausalSplat: Towards Comprehensive Hierarchical Reasoning in 3D Gaussian Splatting

CausalSplat:面向3D高斯溅射的综合层级推理

Jiayu Ding, Meilu Song, Yun Chen, Wei Gao, Ge Li

机构 * Peking University(北京大学) North China Electric Power University(华北电力大学) Hunan University(湖南大学)

AI总结 针对3D高斯溅射推理局限,本文提出CausalSplat框架,结合视觉语言模型与3D场景图,构建两个推理基准,在相关任务上实现最优性能与强泛化性。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10444 2026-08-13 cs.CL cs.AI 版本更新

From Reasoning Depth to Reasoning Breadth: Evaluating Multi-Point Associative Reasoning in Large Language Models

从推理深度到推理广度:评估大型语言模型中的多点关联推理

Si'an Xie, Jiaxun Liu, Biao Yang, Wei Yuan, Fan Yang, Tingting Gao, Ming Wu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学) Kuaishou Technology(快手科技)

AI总结 该研究构建了中英双语多点关联推理基准MPAR-Bench,发现大型语言模型的推理深度未自动带来稳健的推理广度,当前基准未充分覆盖推理广度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02474 2026-08-13 cs.CV 版本更新

EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation

EchoCache:面向高效音频驱动视频生成的能量引导跨模态缓存

Jiayu Chen, Xiaoyu Wu, Rongshan Gao, Maoliang Li, Zihao Zheng, Xinhao Sun, Hailong Zou, Guojie Luo, Xiang Chen

机构 * Peking University(北京大学) Taiyuan University of Technology(太原理工大学)

AI总结 EchoCache是一种能量引导跨模态缓存框架,通过利用音频时频能量锚点与动态缓存机制,在保持音频驱动视频生成质量的同时,实现了2.46倍的推理加速,优化了延迟-质量权衡。

Comments EchoCache is honored to be accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17585 2026-08-13 cs.CV 版本更新

Pixel-Space Diffusion Transformers

像素空间扩散变换器

Renye Yan, Jikang Cheng, You Wu, Ling Liang, Wei Peng, Athanasios V. Vasilakos, Qingyu Zhao, Yu Zhang, Yimao Cai, Kilian M. Pohl, Guoying Zhao

机构 * Peking University(北京大学) Nanjing University(南京大学) Stanford University(斯坦福大学) Cornell University(康奈尔大学) University of Oulu(奥卢大学)

AI总结 本文探讨像素空间扩散变换器,针对潜在扩散模型的局限,研究直接对原始像素建模的像素空间扩散方法,介绍其在高维建模中的挑战与多模态建模优势,从多方面回顾pDiTs,总结方法、识别挑战并展望未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17598 2026-08-13 cs.RO cs.CV 版本更新

MuseVLA: An Adaptive Multimodal Sensing Vision-Language-Action Model for Robotic Manipulation

MuseVLA: 一种用于机器人操作的自适应多模态感知视觉-语言-动作模型

Xingyuming Liu, Ruichun Ma, Heyu Guo, Qixiu Li, Qingwen Yang, Lin Luo, Shiqi Jiang, Chenren Xu, Jiaolong Yang, Baining Guo

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) Microsoft Research Asia(微软亚洲研究院) Princeton University(普林斯顿大学) Tsinghua University(清华大学)

AI总结 提出MuseVLA模型,通过将传感器作为按需工具集成,实现自适应多模态感知;设计传感器图像统一表示,并引入数据合成流水线,在灵巧手操作任务中平均成功率80.6%,显著优于RGB-only和多模态基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13794 2026-08-13 cs.GR cs.CV 版本更新

BlitzGS: City-Scale Gaussian Splatting at Lightning Speed

BlitzGS:闪电速度实现城市级高斯点云渲染

Zhongtao Wang, Huishan Au, Yilong Li, Mai Su, Haojie Jin, Yisong Chen, Meng Gai, Fei Zhu, Guoping Wang

机构 * Peking University(北京大学)

AI总结 BlitzGS通过分布式3DGS框架实现城市级场景快速重建,通过分层工作负载管理减少活跃高斯点云计算量,提升渲染效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22753 2026-08-13 cs.LG 版本更新

Spend Less, Fit Better: Budget-Efficient Scaling Law Fitting via Active Experiment Selection

少花钱,多适配:通过主动实验选择实现预算高效的缩放定律拟合

Sijie Li, Shanda Li, Haowei Lin, Weiwei Sun, Ameet Talwalkar, Yiming Yang

机构 * Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学) Datadog

AI总结 本文提出一种预算感知的序列实验设计方法,通过主动选择实验来提高缩放定律拟合的准确性,实验结果显示其在多种缩放定律任务中优于传统方法,仅用10%的预算即可达到全集拟合效果。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06710 2026-08-13 cs.RO 版本更新

RLinf-VLA: A Unified and Efficient Framework for Reinforcement Learning of Vision-Language-Action Models

RLinf-VLA: 一种用于视觉-语言-动作模型强化学习的统一高效框架

Hongzhi Zang, Mingjie Wei, Si Xu, Yongji Wu, Zhen Guo, Yuanqing Wang, Hao Lin, Peihong Wang, Liangzhi Shi, Yuqing Xie, Zhexuan Xu, Zhihao Liu, Kang Chen, Wenhao Tang, Quanlu Zhang, Weinan Zhang, Chao Yu, Yu Wang

机构 * Tsinghua University(清华大学) Zhongguancun Academy(中关村学院) Infinigence AI Peking University(北京大学) UC Berkeley(加州大学伯克利分校) Harbin Institute of Technology(哈尔滨工程学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 RLinf-VLA是一种统一高效的框架,用于提升视觉-语言-动作模型在具身环境中的强化学习性能,通过统一接口和高效资源分配实现统一和可扩展的训练。

Comments Accepted to RSS 2026. This is the technical report of the RLinf Team, focusing on the algorithm side. For the system-level design, please refer to arXiv:2509.15965. The open-sourced code link: https://github.com/RLinf/RLinf

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11205 2026-08-12 cs.CV 新提交

AdvFD: Boosting Visual Generation via Adversarial Fr'echet Distance Loss

AdvFD:通过对抗性Fréchet距离损失提升视觉生成性能

Mingju Gao, Jingkai Zhou, Kun Gai, Changqian Yu, Hao Tang

机构 * Peking University(北京大学) KlingAI(可灵AI)

AI总结 本研究提出AdvFD算法,通过补充静态Fréchet损失的对抗学习表示并引入真实特征白化,解决Fréchet攻击问题,提升了JiT、pMF等骨干网络的单步生成器后训练性能。

Comments Project Page: https://gasaiyu.github.io/AdvFD-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11201 2026-08-12 cs.CV 新提交

VidForensics-M1: Meta-Detection Reinforcement Learning with Verifiable Temporal Grounding for AI-Generated Video Forensics

VidForensics-M1:用于AI生成视频取证的、具备可验证时间定位的元检测强化学习

Bowei Liu, Zheng Lu, Yuhan Bian, Xinchen Zhang, Xingming Shui, Yuesheng Huang, Xuhuan Li, Zihao Liu, Yifan Yang, Jun Zhou, Xiu Li

机构 * Tsinghua University(清华大学) Peking University(北京大学) Renmin University of China(中国人民大学) Microsoft(微软公司)

AI总结 该研究针对AI生成视频检测泛化性不足的问题,首次将元检测引入该领域,提出结合可验证时间证据的VidForensics-M1模型及相关机制,实现了鲁棒可泛化的检测。

Comments 27 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11019 2026-08-12 cs.LG 新提交

DEFT: Data-Efficient Frequency-domain Top-k Sampling via Inverse Discrete Fourier Transform for Spatiotemporal Dynamical Systems Modeling

DEFT:用于时空动力系统建模的、基于逆离散傅里叶变换的数据高效频域Top-k采样方法

Hengbo Xiao, Jiale Liu, Jiahao Song, Guannan He

机构 * Peking University(北京大学)

AI总结 DEFT是一种频域数据采样方法,通过逆离散傅里叶变换生成物理一致的训练数据,可减少数据需求且提升泛化能力,在多个PDE及电池退化系统建模任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10682 2026-08-12 cs.CV 新提交

Visual Geometry Foundation-Aware Gaussians for Single-Frame Surround-View Driving Reconstruction

面向单帧环视驾驶场景重建的视觉几何基础感知高斯模型

Junhong Lin, Jinlong Wang, Xianda Guo, Yanlun Peng, Wei Zheng, Guoqing Liu, Hanli Wang, Tiesong Zhao, Wei Gao

机构 * Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology(广东省超高清沉浸式媒体技术重点实验室) School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) Peng Cheng Laboratory(鹏城实验室) Wuhan University(武汉大学) Great Wall Motor(长城汽车) Minieye Corporation(Minieye公司) Tongji University(同济大学) Fuzhou University(福州大学)

AI总结 本文提出VGGD框架,通过引入视觉几何先验、双路径颈部等模块,在nuScenes基准上实现了单帧环视驾驶场景重建的最优渲染质量与几何一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10602 2026-08-12 cs.CV cs.GR 新提交

Gaussian Sculpting: End-to-End Controllable Surface Reconstruction via Field Optimization

高斯雕刻:通过场优化实现端到端可控的表面重建

Ke Jiaxin, Juncheng Liu, Yi Wang, Zhouhui Lian, Bin Liu, Shengfa Wang, Xiangjia He

机构 * Dalian University of Technology(大连理工大学) Massey University(梅西大学) Peking University(北京大学) University of Nottingham Ningbo China(宁波诺丁汉大学)

AI总结 针对3DGS在视角有限时表面重建精度不足且几何误差难校正的问题,本文提出高斯雕刻框架,通过双层训练策略结合多分辨率细分方案实现高质量可控表面重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10299 2026-08-12 cs.CL 新提交

Co-Evolution in Agentic Systems: Toward Self-Directed Evolution Beyond Human Design

智能体系统中的协同进化:迈向超越人类设计的自主进化

Qing Zong, Jiayu Liu, Junhao Shen, Zecong Tang, Linsi Wu, Yuxuan Liu, Rui Wang, Zhaowei Wang, Weiqi Wang, Cheng Qian, Xiusi Chen, Yangqiu Song

机构 * Hong Kong University of Science and Technology(香港科技大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) Peking University(北京大学)

AI总结 本综述聚焦智能体系统的协同进化,提出三阶段分类法梳理其发展,探讨相关开放挑战,为构建超越人类设计路径的自主智能体系统提供统一基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15497 2026-08-12 cs.CV cs.GR 版本更新

AnyAct: Towards Human Reenactment of Character Motion From Video

AnyAct: 向视频中非人类角色动作的重新演绎迈进

Liuhan Chen, Lei Zhong, Jiawei Wang, Qing Shuai, Li Yuan, Leidong Fan, Qing Li, Kanglin Liu

机构 * Peking University(北京大学) Nankai University(南开大学) The University of Hong Kong(香港大学) Zhejiang University(浙江大学) Pengcheng Laboratory(鹏城实验室)

AI总结 本文研究如何从单目视频中直接推导出人类动作的初始重新演绎,其目标是将非人类角色的动作重新诠释为可编辑的人类表演,以供后续动画创作使用。核心方法是利用稀疏局部关节运动线索在结构差异大的情况下保持本质动态,提出AnyAct模型以实现基于可转移稀疏局部2D关节运动的条件人类运动生成。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11611 2026-08-12 cs.AI 版本更新

CuSearch: Curriculum Rollout Sampling via Search Depth for Agentic RAG

CuSearch:通过搜索深度进行课程展开采样以实现代理RAG

Jianghan Shen, Siqi Luo, Xinyu Cheng, Jing Xiong, Yue Li, Jiyao Liu, Jiashi Lin, Yirong Chen, Junjun He

机构 * Nanjing University(南京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Peking University(北京大学) University of Hong Kong(香港大学)

AI总结 本文提出CuSearch,通过搜索深度贪心分配策略改进代理RAG训练,提升检索监督密度,实验显示在ZeroSearch上性能提升达11.8个精确匹配点。

Comments The paper has been accepted by COLM 2026. Code: https://github.com/MrToser/CuSearch

详情

展开后加载摘要…

URL PDF HTML 收藏