arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

2026-07-21 至 2026-07-21 共收录 16
2607.18110 2026-07-21 cs.LG cs.CL 新提交

LLM-as-a-Coach: Experiential Learning for Non-Verifiable Tasks

大语言模型作为教练:不可验证任务的体验式学习

Tianzhu Ye, Li Dong, Guanheng Chen, He Zhu, Xun Wu, Shaohan Huang, Furu Wei

机构 * Microsoft Research(微软研究院) Tsinghua University(清华大学) Peking University(北京大学)

AI总结 研究不可验证任务,提出体验式学习(EL),将LLM反馈模型从评判转为教练,通过提炼体验知识提供密集监督,在开放式任务上表现优于基于规则的RL,泛化性好且减轻奖励作弊。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18091 2026-07-21 cs.CV cs.GR cs.LG 新提交

SciForma: Structure-Faithful Generation of Scientific Diagrams

SciForma:科学图表的结构忠实生成

Yuxuan Luo, Peng Zhang, Xinjie Zhang, Xun Guo, Zhouhui Lian, Yan Lu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机技术研究所) State Key Lab of CAD & CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) Microsoft Research Asia(微软亚洲研究院)

AI总结 研究针对科学图表结构保真度问题,提出SciForma框架,分解图表质量为三个结构轴,用M-DPO优化,策划训练和评估数据,实现迭代编辑,使SciForma-9B超越开源基线和GPT-Image-1.5,提升科学图表生成的结构保真度。

Comments 30 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18062 2026-07-21 cs.RO cs.CV 新提交

UniETP: Unifying Environments for Generalizable Embodied Task Planning

UniETP:统一用于通用具身任务规划的环境

Peiran Xu, Jiaqi Zheng, Ziyou Wang, Yadong Mu

机构 * Peking University(北京大学)

AI总结 针对具身任务规划中模拟器和数据集孤立的问题,提出UniETP统一接口,整合四个常用模拟器,兼具标准化与多样性,构建新数据集,通过实验评估模型具身规划能力并分析瓶颈。

Comments We are actively working on releasing the codes and data

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17973 2026-07-21 cs.AI 新提交

SAGE: Subgoal-Conditioned Action Generation for Latent World Model Planning

SAGE:用于潜在世界模型规划的子目标条件动作生成

Letian Cheng, Qi Zhang, Yisen Wang

机构 * Peking University(北京大学)

AI总结 研究潜在世界模型规划中提议质量受限问题,提出先验条件规划器,利用目标条件生成器预测潜在子目标,结合不同时长子目标作先验,实验证明该方法显著提升长期规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17701 2026-07-21 cs.AI 新提交

ProEvent: An Event-centric Benchmark for Proactive Agents

ProEvent:面向主动智能体的以事件为中心的基准测试

Guanzhen Li, Liangming Pan, Leye Wang

机构 * School of Computing, Peking University(北京大学计算机学院)

AI总结 针对主动智能体研究忽视事件中心协助及评估难的问题,引入ProEvent基准测试,基于即时通讯聊天评估智能体维护用户时间表能力,实验发现当前智能体存在过度反应和事件取消处理难等问题,揭示了大语言模型的根本局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17656 2026-07-21 cs.CV 新提交

BMFA: Boundary-Minority Free-Energy Adaptive Screening

BMFA:边界少数自由能自适应筛选

Wenyan Xu, Alizer Wong

机构 * Guangdong University of Technology(广东工业大学) School of Computer Science, Peking University(北京大学计算机科学学院)

AI总结 研究视觉Transformer处理空间冗余令牌的问题,提出边界少数自由能自适应筛选(BMFA)方法,通过构建分层近似并递归细化块来改进,经多项实验验证,该方法能降低低估、缩小差距并保持准确率。

Comments 14 pages. Experiments include synthetic analysis, COCO, LVIS, closed-loop DeiT-Tiny evaluation, and ImageNet-1K classification

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17599 2026-07-21 cs.CV 新提交

ConsiSpace: Learning Geometric Consistency Matters for Video Spatial Reasoning

ConsiSpace:学习几何一致性对视频空间推理很重要

Ting Huang, Zhenyu Zhang, Wenyuan Huang, Jian Yang, Hao Tang

机构 * School of Intelligent Science and Technology, Nanjing University(南京大学智能科学与技术学院) School of Computer Science, Peking University(北京大学计算机科学学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

AI总结 针对视频空间推理中现有模型难以聚合一致空间证据的问题,提出ConsiSpace框架,通过构建几何一致内存及采用统一一致性自监督强化学习,在三个空间推理基准测试上取得成绩提升,平均得分比最强基线高12.6分。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17399 2026-07-21 cs.CV 新提交

The PanAf-SBR Dataset: Social Behaviour Recognition for Wild Great Apes

泛非社会行为识别数据集:野生大猩猩的社会行为识别

Maciej Braszczok, Otto Brookes, Xiaoxuan Ma, Federico Rossano, Yixin Zhu, Mimi Arandjelovic, Hjalmar Kühl, Majid Mirmehdi, Tilo Burghardt

机构 * University of Bristol(布里斯托大学) Wild Chimpanzee Foundation(野生黑猩猩基金会) Carnegie Mellon University(卡内基梅隆大学) University of California(加利福尼亚大学) Peking University(北京大学) Max Planck Institute for Evolutionary Anthropology(马克斯·普朗克进化人类学研究所) Senckenberg Museum of Natural History(森肯伯格自然历史博物馆)

AI总结 研究旨在解决野生大猩猩社会行为识别数据不足问题,引入PanAf-SBR数据集,结合AlphaChimp架构建立基准,通过双向迁移学习实验发现跨数据集预训练对特定类别有益,还研究了背景上下文在其中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17386 2026-07-21 cs.CV 新提交

SkyVLaM: Multimodal Large Language Model for UAV Video Understanding in Remote Sensing

SkyVLaM:用于遥感中无人机视频理解的多模态大语言模型

Kaiwen Jing, Ruixu Jia, Bingyao Li, Ruizhe Ou, Ming Wu, Chuang Zhang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学) Beijing Wuzi University(北京物资学院)

AI总结 针对无人机视频理解任务,提出多模态大语言模型SkyVLaM,通过时间基感知器构建稀疏令牌,正则化稀疏基,自适应选择密集段,联合大语言模型处理,还构建SkyVid,实验证明其能有效分配视觉令牌预算,提升语言条件视频分割效果。

Comments Accepted by WAICA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17342 2026-07-21 cs.CV cs.AI 新提交

STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition

STAR:用于交互识别的骨骼令牌对齐与重排

Yuhang Wen, Mengyuan Liu, Zixuan Tang, Junsong Yuan, Sirui Li, Beichen Ding

机构 * State Key Laboratory of General Artificial Intelligence, Peking University, Shenzhen Graduate School(北京大学深圳研究生院通用人工智能国家重点实验室) University at Buffalo SUNY(纽约州立大学布法罗分校) Department of Computer and Information Science, University of Pennsylvania(宾夕法尼亚大学计算机与信息科学系)

AI总结 针对人机和人与人交互识别,提出STAR方法,通过骨骼令牌对齐与重排,利用实体重排、交互式时空令牌及视觉交互编码等组件,结合骨骼与RGB视频数据学习特征,经对比学习对齐表示,实验验证其性能优于现有方法。

Comments Accepted for publication in IEEE Transactions on Multimedia (IEEE TMM)

Journal ref IEEE Transactions on Multimedia, vol. 28, pp. 4652-4665, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17251 2026-07-21 cs.CV 新提交

VecFontLLM: Anchor-Guided Direct Synthesis of Chinese Vector Fonts

VecFontLLM:基于锚点引导的中文矢量字体直接合成

Hao Yuan, Yuxuan Luo, Xing Chen, Zhouhui Lian

机构 * Fuzhou University(福州大学) Peking University(北京大学)

AI总结 研究旨在解决直接生成中文矢量字体的难题,提出VecFontLLM这一基于锚点引导的多模态大语言模型,通过锚点预测、细化及贝塞尔控制点完成来合成矢量字形,实现高质量少样本合成,实验显示其相比现有方法有显著优势。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17157 2026-07-21 cs.CV cs.AI 新提交

VLA-ReID: Video-Level Association for Re-Identification in Multi-Object Tracking with Highly Similar Objects

VLA-ReID:具有高度相似对象的多目标跟踪中用于重新识别的视频级关联

Yanrong Qin, Xiaoyan Cao, Yao Yao

机构 * Glasgow College, University of Electronic Science and Technology of China(电子科技大学格拉斯哥学院) Key Laboratory for Urban Habitat Environmental Science and Technology, School of Environment and Energy, Peking University Shenzhen Graduate School(北京大学深圳研究生院环境与能源学院城市人居环境科学与技术重点实验室) School of Management Science and Real Estate, Chongqing University(重庆大学管理科学与房地产学院)

AI总结 针对多目标跟踪中对象外观相似时身份保持难的问题,提出VLA-ReID方法,将重新识别建模为视频级关联,通过聚合历史轨迹特征等进行全局关联优化,实验显示该方法有效提升多项指标并减少身份切换。

Comments 11 pages, 8 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16873 2026-07-21 cs.CV 新提交

InfoDense: Density-Aware Regional Decisive Replay for Memory-Efficient Incremental Face Forgery Detection

InfoDense:用于内存高效增量式人脸伪造检测的密度感知区域决定性重放

Jikang Cheng, Hao Shen, Xueyi Zhang, Guangcheng Wang, Zhongyuan Wang, Renye Yan, Baojin Huang

机构 * Huazhong Agricultural University(华中农业大学) Peking University(北京大学) National University of Singapore(新加坡国立大学) Nantong University(南通大学) Wuhan University(武汉大学)

AI总结 针对人脸伪造技术发展带来的检测挑战及传统方法的问题,提出密度感知区域决定性重放策略InfoDense,通过定位决定性补丁、排序候选片段、自适应合并样本等步骤,有效减轻灾难性遗忘,提升跨域泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16768 2026-07-21 cs.LG 新提交

Robust Losses from Univariate Base Functions for Noisy-Label Learning

用于噪声标签学习的单变量基函数鲁棒损失

Peng Hu, Jianwei Ma

机构 * School of Mathematics, Harbin Institute of Technology(哈尔滨工业大学数学学院) School of Earth and Space Sciences, Peking University(北京大学地球与空间科学学院)

AI总结 针对噪声标签学习问题,提出从单变量基函数构建鲁棒多类损失的框架,开发两种方案并分析其性质,推导理论标准,所提损失在多噪声设置下经实验验证有竞争力或更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16409 2026-07-21 cs.CV cs.AI cs.LG 新提交

Think, Plan, Paint: Layout-Aware Reasoning for Controllable Image Generation in Unified Models

思考、规划、绘制:统一模型中用于可控图像生成的布局感知推理

Junhao Liu, Jian-Wei Zhang, Tao Huang, Miles Yang, Zhao Zhong, Liefeng Bo

机构 * Tencent(腾讯) Peking University(北京大学)

AI总结 研究针对统一多模态大语言模型在可控图像生成中难以遵循复杂空间指令的问题,提出ATLAS框架,采用“思考、规划、绘制”范式及布局共享表示,经强化学习提升性能,在图像生成等任务中效果显著,还支持相关编辑与多模态基础,并引入评估基准。

Comments 22 pages, 12 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16304 2026-07-21 cs.CV 新提交

Dual-Domain Self-Supervised Artifact Removal Framework for Photoacoustic Computed Tomography

用于光声计算机断层扫描的双域自监督伪影去除框架

Yucheng Zhou, Shuang Li, Yu Zhang, Yibing Wang, Chulhong Kim, Seongwook Choi, Changhui Li

机构 * College of Future Technology, Peking University(北京大学未来技术学院) Pohang University of Science and Technology(浦项科技大学)

AI总结 针对光声计算机断层扫描因检测条件稀疏产生的重建伪影问题,提出用轻量级暹罗神经网络及复合损失函数的自监督伪影去除框架,能有效抑制伪影并提升计算效率。

Comments 13 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏