arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

共收录 3020
2607.11886 2026-07-14 cs.CV 新提交

Read It Back: Pretrained MLLMs Are Zero-Shot Reward Models for Text-to-Image Generation

读回:预训练的多模态语言模型是文本到图像生成的零样本奖励模型

Runhui Huang, Qihui Zhang, Zhe Liu, Yu Gao, Jie Wu, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) ByteDance Seed(字节跳动Seed) Peking University(北京大学)

AI总结 研究提出SpectraReward将预训练多模态语言模型转为图像生成强化学习奖励模型,用图像条件提示对数似然作奖励,还引入Self-SpectraReward形成闭环框架。经广泛实验验证,二者能提升生成性能,表明奖励-策略对齐是关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11696 2026-07-14 cs.AI 新提交

Think Through a Bottleneck: Hourglass Reasoning for Rigorous Induction

突破瓶颈:用于严格归纳的沙漏推理

Huan Zhu

机构 * Peking University(北京大学)

AI总结 研究针对大语言模型少样本归纳推理能力不足的问题,提出沙漏推理方法,通过在推理阶段强制实现严格上下文隔离,构建符号编码器 - 解码器。实验表明该方法在多基准测试中显著提升准确率,证实收益源于阶段隔离和初始归纳质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11481 2026-07-14 cs.RO 新提交

Towards Human-level Dexterous Teleoperation

迈向人类水平的灵巧遥操作

Puhao Li, Zeyuan Chen, Yingying Wu, Pengkun Wei, Yuyang Li, Tianyu Wang, Jiaxiao Shi, Mingrui Yu, Baoxiong Jia, Song-chun Zhu, Tengyu Liu, Siyuan Huang

机构 * Tsinghua University(清华大学) State Key Lab of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,字节跳动公司) Peking University(北京大学)

AI总结 研究如何通过遥操作赋予机器人手内灵巧性,提出TeleDexter手 - 物体协同跟踪控制器,利用混合奖励训练,经单阶段强化学习及随机化处理可零样本迁移到真实机器人,在多项任务上取得高成功率并能训练自主策略。

Comments Project Website: https://bigai-dex.github.io/blog/teledexter/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11172 2026-07-14 cs.AI cs.LG 新提交

STAMP: Provenance-Guided Credit Assignment for Deep Search Agents

STAMP:深度搜索智能体的溯源引导信用分配

Ke Xu, Han Xu, Xinran Chen, Yuqian Wang, Zhixuan Li, Xiaojian Liu, Changwo Wu, Jianqiang Xia, Yuchen Li

机构 * Baidu Inc.(百度公司) Peking University(北京大学)

AI总结 研究深度搜索智能体强化学习中奖励-信用不匹配问题,提出STAMP方法,通过基于参考的验证器和首次曝光归因确定信用,经符号保留优势调制注入信用,实验表明该方法能提升GRPO基线分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11126 2026-07-14 cs.LG 新提交

ToolAtlas: Learning Once, Reusing Everywhere with Tool-Side Memory

ToolAtlas:通过工具端内存实现一次学习、处处复用

Yue Fang, Zhibang Yang, Fangkai Yang, Xiaoting Qin, Liqun Li, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) Microsoft(微软)

AI总结 研究针对大语言模型代理依赖外部工具时工具知识难共享问题,提出ToolAtlas框架,通过执行验证探测构建提供商端工具内存,经实验证明该框架能有效提升性能且可跨环境和框架复用,确立了提供商端工具内存范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11042 2026-07-14 cs.SE cs.AI 新提交

BackendForge: Benchmarking Agentic End-to-End Code Generation with Backend Services

BackendForge:使用后端服务对智能端到端代码生成进行基准测试

Yuzhe Guo, Mengzhou Wu, Yuan Cao, Jialei Wei, Dezhi Ran, Wei Yang, Tao Xie

机构 * Key Lab of HCST (PKU), MOE(北京大学计算机科学与技术国家重点实验室;软件学院,北京大学) SCS, Peking University(北京通明湖信息技术应用创新中心) Beijing Tongming Lake Information Technology Application Innovation Center (TLAIC)(复旦大学高级计算系统研究所) Fudan University Institute of Systems for Advanced Computing(上海开放计算系统研究所) Shanghai Institute of Systems for Open Computing

AI总结 研究智能端到端代码生成评估问题,引入BackendForge基准,给定规范和契约让大语言模型生成容器化服务,用测试和代码代理共同进化测试预言机和参考服务,发现当前大语言模型虽能实现部分API行为,但生成完整后端服务仍有困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10789 2026-07-14 cs.AI 新提交

Imaging-101: Benchmarking LLM Coding Agents on Scientific Computational Imaging

成像101:在科学计算成像上对大语言模型编码智能体进行基准测试

Siyi Chen, Jiahe Ying, Yixuan Jia, Yuxuan Gu, Enze Ye, Weimin Bai, Zhijun Zeng, Shaochi Ren, Binhong Gao, Yubing Li, Tianhan Zhang, He Sun

机构 * College of Future Technology and the National Biomedical Imaging Center, Peking University(北京大学未来技术学院和国家生物医学成像中心) AI for Science Institute (AISI)(科学人工智能研究所) University of Michigan(密歇根大学) State Key Laboratory of Acoustics and Marine Information, Institute of Acoustics, Chinese Academy of Sciences(中国科学院声学研究所声场声信息国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) School of Astronautics, Beihang University(北京航空航天大学宇航学院) Key Laboratory of Spacecraft Design Optimization and Dynamic Simulation Technologies, Ministry of Education(教育部航天器设计优化与动态仿真技术重点实验室)

AI总结 研究针对计算成像构建正确重建管道费力的问题,引入含57个任务的Imaging-101基准及三个评估轨道,评估七个前沿大语言模型,发现应用编码智能体于计算成像存在系统性挑战,指出技能增强、领域专业化智能体是可靠成像辅助的途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10655 2026-07-14 cs.RO 新提交

Artificial Foveated Perception for Mitigating Shortcut Learning in Robotic Foundation Models

用于减轻机器人基础模型中捷径学习的人工中央凹感知

Xiatao Sun, Yuan Zhuang, Mateo Sanchez Lopez Negrete, Matei-Victor Coldea, Chen Liang, Haoyang Zhang, Che Liu, Ziyao Zeng, Shawn Li, Qian Wang, Fei Miao, Daniel Rakita

机构 * Yale University(耶鲁大学) University of Connecticut(康涅狄格大学) Peking University(北京大学) Imperial College London(帝国理工学院) Digients

AI总结 研究机器人基础模型因捷径学习难以稳健部署的问题,提出人工中央凹感知模块AFP,通过预测任务条件掩码辅助微调,使策略关注任务相关区域,实验证明其能减少微调时间、抑制过拟合并提升泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10566 2026-07-14 cs.CV eess.IV 新提交

Quantum Compressed Sensing CT Reconstruction Algorithm Based on Penalized Weighted Least Squares and Guided Total Variation

基于惩罚加权最小二乘法和引导全变差的量子压缩感知CT重建算法

Yuwen Zhang, Yujie Liu, Ao Wang, Yikuang Yuluo, Shuangyang Zhong, Haijun Yu, Yixing Huang

机构 * Peking University Health Science Center(北京大学医学部)

AI总结 研究针对现有基于QUBO的稀疏视图CT重建的局限,提出结合PWLS和GTV的量子压缩感知CT方法,经二进制编码形成统一QUBO模型,实验表明该方法重建质量最佳,为量子辅助稀疏视图CT重建提供了概念验证。

Comments 14 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10557 2026-07-14 cs.CL 新提交

UNIBROWSE: A Data-to-Agent Framework for Multimodal BrowseComp

UNIBROWSE:用于多模态浏览比较的数据到智能体框架

Xiyu Wei, Qingwei Zong, Zhuocheng Yu, Sujian Li

机构 * Key Laboratory of Computational Linguistics, MOE, Peking University(教育部计算语言学重点实验室,北京大学) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) School of Computer Science, Peking University(北京大学计算机科学学院)

AI总结 研究多模态浏览比较任务,提出UNIBROWSE统一数据管道,同时生成三种模式训练数据,增强知识图谱,引入探索度度量。经此训练的35B规模智能体在多模态浏览比较基准测试中性能领先,超多个闭源智能体工作流程。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10369 2026-07-14 cs.RO cs.AI 新提交

VINE: Taming Generative Control Policies for Reinforcement Learning

VINE:驯服强化学习中的生成控制策略

Rushuai Yang, Zhuo Han, Houlin Li, Hecheng Wang, Zhichao Wu, Rui Zhang, Zhaowei Zhang, Zihong Chen, Xiaohan Yan, Chiming Liu, Yi Chen, Wei Shan, Maoqing Yao

机构 * AgiBot(未知机构) The Hong Kong University of Science and Technology(香港科技大学) Peking University(北京大学)

AI总结 研究针对流匹配策略在值梯度强化学习中训练不稳定的问题,提出VINE方法。该方法通过在去噪步骤重建插值状态,创建稳定可微路径,实现稳定的端到端值梯度优化,在相关基准和任务中表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10296 2026-07-14 cs.AI cs.CL 新提交

SPARK: Susceptibility-Guided Profiling and Steering of Latent Reasoning States in Large Language Models

SPARK:大语言模型中基于敏感性的潜在推理状态分析与引导

Dongxu Zhang, Yiding Sun, Zihao Guo, Xiangyang Yang, Kai Tang, Lin Chen, Cheng Tan, Jihua Zhu

机构 * Xi’an Jiaotong University(西安交通大学) Peking University(北京大学) Tencent(腾讯)

AI总结 研究大语言模型推理失败问题,提出SPARK方法,利用隐藏状态响应诊断推理状态并引导测试时干预,通过长度控制敏感性等手段,在实验中提升了Qwen3系列模型性能,证明敏感性对推理失败诊断及干预的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09866 2026-07-14 cs.RO cs.AI 新提交

Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning

Robo-ValueRL:离线到在线强化学习的可靠价值估计

Wenke Xia, Pei Ren, Wenbo Yu, Yizhuo Zhang, Jifan Li, Yixue Zhang, Yinuo Zhao, Qingyang Gao, Jianlong Fu, Jian Tang, Ji-Rong Wen, Zhengping Che, Di Hu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) Beijing Forestry University(北京林业大学) Peking University(北京大学) Microsoft Research(微软研究院)

AI总结 研究离线到在线强化学习中价值函数可靠性对策略优化的影响,提出Robo-ValueRL框架,通过特定指标评估价值估计可靠性并用于策略预训练和在线改进,实验显示其能有效提升下游策略性能,突出价值引导数据利用对策略改进的重要性。

Comments Please refer to our website: https://gewu-lab.github.io/Robo-ValueRL/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06537 2026-07-14 cs.RO 版本更新

UniLM-Nav: A Unified Framework for Zero-Shot Last-Mile Navigation

UniLM-Nav:零样本最后一英里导航的统一框架

Zhuofan Zhang, Tianxu Wang, Guoxi Zhang, Yixiong Lin, Xilin Wang, Hongming Xu, Qing Li, Song-Chun Zhu, Lifeng Fan

机构 * Tsinghua University(清华大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,字节跳动公司人工智能研究院) Harbin Institute of Technology(哈尔滨工业大学) Peking University(北京大学)

AI总结 研究移动操作中最后一英里导航问题,提出UniLM-Nav统一框架,通过多模态大语言模型后端分解任务为视图选择、功能接地和姿态推理,在OVMM基准上优于现有方法,还验证了在实际机器人上的适用性。

Comments Project page: https://unilm-nav.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29473 2026-07-14 cs.CV 版本更新

MAVIN: Multi-Shot Audio-Visual Generation with Customized Narrative Control

MAVIN:具有叙事控制的多镜头视听生成

Kaiqi Liu, Yunyao Mao, Ziqi Cai, Zheng Geng, Jing Wang, Qiulin Wang, Xintao Wang, Pengfei Wan, Kun Gai, Shuchen Weng, Boxin Shi

机构 * Peking University(北京大学) Kling Team, Kuaishou Technology(快手团队) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Sun Yat-sen University(中山大学)

AI总结 提出MAVIN框架,通过边界感知注意力、ID感知传播和多智能体脚本管线,实现多镜头视听生成中的叙事控制,解决时间错位、可控性差和脚本不完整问题。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02776 2026-07-14 cs.RO 版本更新

XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations

XR-1:通过学习统一的视觉-运动表示实现多功能的视觉-语言-动作模型

Shichao Fan, Kun Wu, Zhengping Che, Xinhua Wang, Di Wu, Fei Liao, Ning Liu, Yixue Zhang, Zhen Zhao, Zhiyuan Xu, Meng Li, Qingjie Liu, Shanghang Zhang, Min Wan, Jian Tang

机构 * Beijing Innovation Center of Humanoid Robotics, Beijing, China(北京人形机器人创新中心,北京,中国) School of Mechanical Engineering and Automation, Beihang University, Beijing, China(北京航空航天大学机械工程及自动化学院,北京,中国) State Key Laboratory of Virtual Reality Technology and Systems, SCSE, Beihang University, Beijing, China(虚拟现实技术与系统国家重点实验室,SCSE,北京航空航天大学,北京,中国) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University, Beijing, China(多媒体信息处理国家重点实验室,计算机科学学院,北京大学,北京,中国)

AI总结 XR-1通过学习统一的视觉-运动表示,解决视觉-语言-动作模型在低级动作生成和跨数据源领域差距的挑战,提出三阶段训练方法并验证了其在多种机器人和任务上的优越性能。

Comments Accepted to ICML2026 as Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16112 2026-07-14 cs.CV 版本更新

AutoV: Loss-Oriented Ranking for Visual Prompt Retrieval in LVLMs

AutoV:面向视觉提示检索的损失导向排名用于大视觉-语言模型

Yuan Zhang, Chun-Kai Fan, Sicheng Yu, Junwen Pan, Tao Huang, Ming Lu, Kuan Cheng, Qi She, Shanghang Zhang

机构 * School of Computer Science, Peking University(北京大学计算机学院) ByteDance Inc.(字节跳动公司) Shanghai Jiao Tong University(上海交通大学)

AI总结 AutoV通过损失导向的提示检索提升大视觉-语言模型在图像理解等任务中的性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04338 2026-07-14 cs.LG 版本更新

Riemannian Denoising Diffusion Probabilistic Models

黎曼去噪扩散概率模型

Zichen Liu, Wei Zhang, Christof Schütte, Tiejun Li

机构 * Center for Data Science, Peking University(数据科学中心,北京大学) Zuse Institute Berlin(柏林Zuse研究所) Institute of Mathematics, Freie Universität Berlin(柏林自由大学数学研究所) LMAM and School of Mathematical Sciences, Center for Machine Learning Research and Center for Data Science, Peking University(LMAM和数学系,机器学习研究中心和数据科学中心,北京大学)

AI总结 本文提出了一种基于投影方案的黎曼去噪扩散概率模型,适用于更一般的流形,无需复杂的几何信息,通过理论分析和实验验证展示了其在高维流形数据建模中的有效性。

Journal ref Communications in Mathematical Sciences, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03636 2026-07-14 stat.ML cs.LG math.ST stat.AP stat.ME stat.TH 版本更新

Likelihood Matching for Diffusion Models

扩散模型的似然匹配

Lei Qian, Wu Su, Yanqi Huang, Song Xi Chen

机构 * Center for Data Science(数据科学中心) Peking University(北京大学) Guanghua School of Management(光华管理学院) Department of Statistics and Data Science(统计与数据科学系) Tsinghua University(清华大学)

AI总结 研究提出似然匹配方法训练扩散模型,通过建立目标数据分布似然与反向扩散样本路径似然的等价关系,利用拟似然近似反向转移密度,估计得分和海森矩阵函数,引入随机采样器,建立一致性并提供收敛保证,经评估验证了该方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07372 2026-07-14 cs.CL cs.AI 版本更新

Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models

通过可扩展查找实现条件记忆:大语言模型稀疏性的新轴

Xin Cheng, Rui Tian, Wangding Zeng, Damai Dai, Qinyu Chen, Bingxuan Wang, Zhenda Xie, Kezhao Huang, Xingkai Yu, Chengqi Deng, Shangyan Zhou, Chenggang Zhao, Zhewen Hao, Yukun Li, Han Zhang, Zhengyan Zhang, Yixu Wei, M. Y Xu, Huishuai Zhang, Dongyan Zhao, Wenfeng Liang

机构 * Peking University(北京大学) DeepSeek-AI

AI总结 研究针对Transformer缺乏知识查找原语的问题,引入条件记忆及Engram模块,通过制定稀疏分配问题发现U形缩放定律,扩展Engram至27B参数,在多领域提升性能,揭示其优势,为下一代稀疏模型提供重要建模原语。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18549 2026-07-14 cs.LG cs.CR cs.RO

ARBoids: Adaptive Residual Reinforcement Learning With Boids Model for Cooperative Multi-USV Target Defense

ARBoids: 基于Boids模型的自适应残差强化学习用于协同多无人水下航行器目标防御

Jiyue Tao, Tongsheng Shen, Dexin Zhao, Feitian Zhang

机构 * Robotics and Control Laboratory, School of Advanced Manufacturing and Robotics, and the State Key Laboratory of Turbulence and Complex Systems, Peking University(机器人与控制实验室,先进制造与机器人学院,湍流与复杂系统国家重点实验室,北京大学) National Innovation Institute of Defense Technology(国防技术创新研究院)

AI总结 ARBoids通过结合Boids模型和深度强化学习,提出了一种自适应残差强化学习框架,用于提升多无人水下航行器在对抗性机动下的目标拦截性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03578 2026-07-14 cs.LG stat.ML 版本更新

Distributionally Robust Reinforcement Learning with Interactive Data Collection: Fundamental Hardness and Near-Optimal Algorithms

具有交互式数据收集的分布鲁棒强化学习:基本难度与近最优算法

Miao Lu, Han Zhong, Tong Zhang, Jose Blanchet

机构 * Department of Management Science and Engineering, Stanford University(斯坦福大学管理科学与工程系) Center for Data Science, Peking University(北京大学数据科学中心) Department of Computer Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校计算机科学系)

AI总结 针对强化学习中模拟与现实的差距,提出分布鲁棒强化学习,通过交互式数据收集应对挑战。因支持转移难题,引入消失最小值假设,给出近最优算法,扩展到新公式和博弈,应用于库存控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09587 2026-07-13 cs.RO 新提交

CoDiMAD: Diffusion-Based Privileged Distillation for Communication-Free Multi-Robot Coordination

CoDiMAD:基于扩散的特权蒸馏用于无通信多机器人协调

Jiyue Tao, Shunheng Xin, Tongsheng Shen, Dexin Zhao, Feitian Zhang

机构 * Peking University(北京大学) National Innovation Institute of Defense Technology(国防科技创新研究院)

AI总结 研究无通信多机器人协调问题,提出CoDiMAD三阶段框架,先训练特权预言机,再构建数据集,最后将预言机蒸馏到学生智能体中,通过扩散反向过程采样动作,实验证明其性能优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09204 2026-07-13 cs.CL cs.LG 新提交

Complexity-Guided Component-wise Initialization for Language Model Pretraining

用于语言模型预训练的复杂度引导的逐组件初始化

Konstantin Garbers, Nicholas Oh

机构 * Peking University(北京大学)

AI总结 研究预训练语言模型中反复出现的谱模式能否用于初始化,通过分析多个检查点构建初始化方案并与其他方法比较,发现预训练权重复用有竞争力,但仅粗略谱匹配非可靠策略,预训练谱是有用诊断,有效复用需保留更多信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09084 2026-07-13 cs.LG cs.CY 新提交

A Survey on the Green Development of Large Models: From Resource-Efficient Architectures to Hardware-Software Co-Design

大模型绿色发展综述:从资源高效架构到软硬件协同设计

Linhui Xiao, Guiping Cao, Mingyue Guo, Xianchao Guan, Fan Yang, Ming Tao, Xin Li, Yuxin Peng, Yaowei Wang

机构 * Pengcheng Laboratory(鹏城实验室) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Peking University(北京大学)

AI总结 综述大模型绿色发展,涵盖资源高效架构与软硬件协同设计,回顾高效模型构建、训练部署策略、节能硬件等进展,探讨其在关键领域应用,讨论挑战与方向,为大模型可持续发展提供路线图。

Comments This paper has been accepted by CJE (2026), paper homepage: https://cje.ejournal.org.cn/article/doi/10.23919/cje.2025.00.438

Journal ref Chinese Journal of Electronics, vol. 35, no. 5, pp. 1-24, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06988 2026-07-13 cs.RO cs.AI 新提交

WAM-TTT: Steering World-Action Models by Watching Human Play at Test Time

WAM-TTT:在测试时通过观察人类行为来引导世界行动模型

Yusen Feng, Bingchen Han, Jiangran Lyu, Kai Liu, Yixin Zheng, Yuxuan Wan, Weiheng Liu, Sun Han, Ruiqin Li, Yulong Zhang, Fangfu Liu, Xuesong Shi, Libin Liu, Yizhou Wang, Zhizheng Zhang, He Wang

机构 * Peking University(北京大学) Galbot CASIA(中国科学院自动化所) Tsinghua University(清华大学)

AI总结 研究旨在解决引导机器人基础模型的难题,提出WAM-TTT框架,通过自监督视频预测吸收人类视频到自适应内存,经元训练阶段对齐人机行为,测试时仅用未标记人类视频,实现高效可重复引导且优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16515 2026-07-13 cs.CV cs.CR cs.LG

Penny Wise, Pixel Foolish: Bypassing Price Constraints in Multimodal Agents via Visual Adversarial Perturbations

精打细算,却愚弄像素:通过视觉对抗扰动在多模态智能体中绕过价格限制

Jiachen Qian, Zhaolu Kang

机构 * City University of Hong Kong(香港城市大学) Peking University(北京大学)

AI总结 研究发现多模态大语言模型在价格受限环境下易受视觉误导,提出PriceBlind攻击框架,通过语义解耦损失提升图像嵌入精度,实现80%的攻击成功率,并展示鲁棒编码和防御机制对攻击的抑制效果。

Comments 15 pages, 4 figures, 13 tables

Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pages 16059-16073, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08646 2026-07-10 cs.CL cs.AI 新提交

UltraX: Refining Pre-Training Data at Scale with Adaptive Programmatic Editing

UltraX:通过自适应编程编辑大规模精炼预训练数据

Xinlong Zhao, Dongsheng Liu, Hengyu Zhao, Zixuan Fu, Zheng Wang, Jie Cai, Jie Zhou, Qiang Ma, Xuanhe Zhou, Xu Han, Yudong Wang, Zhiyuan Liu

机构 * Peking University(北京大学) ModelBest Inc.(ModelBest公司) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 研究针对训练数据极限下大语言模型高质量数据利用问题,提出UltraX框架,通过引入插入完善编辑功能空间,构建程序监督生成管道,经实验验证其在各语料库平均性能最高,数据效率和精炼可靠性强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08497 2026-07-10 cs.CV cs.AI cs.CL cs.LG 新提交

Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing

用于多模态理解、生成和编辑的认知结构多模态智能体

Feng Wang, Canmiao Fu, Zhipeng Huang, Chen Li, Jing Lyu, Ge Li

机构 * Peking University(北京大学) Tencent Inc(腾讯公司)

AI总结 研究针对统一多模态模型在长时多模态对话中的局限,提出认知结构多模态智能体,通过外化视觉信息等方式改进。开发统一场景引擎,构建评估基准。实验显示该智能体检索准确率高、推理时间减半,还介绍了工具包,为长时多模态智能体提供新范式。

Comments 16 pages, 7 figures, 8 tables. Project page: https://caseclose.github.io/cma-harness/ Code: https://github.com/caseclose/cma-harness

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08359 2026-07-10 cs.RO cs.AI 新提交

FSD-VLN: Fast-Slow Dual-System Modeling for Aerial Long-Horizon Vision-Language Navigation

FSD-VLN:用于空中长距离视觉语言导航的快慢双系统建模

Xueke Zhu, Qingyan Meng, Liutao Yu, Wei Zhang, Zhengyu Ma, Huihui Zhou, Yonghong Tian

机构 * Pengcheng Laboratory(鹏城实验室) Shenzhen Institutes of Advanced Technology(中国科学院深圳先进技术研究院) Peking University(北京大学)

AI总结 研究空中长距离视觉语言导航问题,提出FSD-VLN快慢双系统架构,将语义推理与低延迟飞行命令解耦,通过两个异步分支及时间感知自适应优化器实现,实验表明该方法提升导航成功率,减少推理延迟和运行时间。

详情

展开后加载摘要…

URL PDF HTML 收藏