arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

2026-05-01 至 2026-05-01 共收录 16
2604.27934 2026-05-01 cs.AI cs.CL

MM-StanceDet: Retrieval-Augmented Multi-modal Multi-agent Stance Detection

MM-StanceDet:基于检索的多模态多智能体立场检测

Weihai Lu, Zhejun Zhao, Yanshu Li, Huan He

机构 * Peking University(北京大学) Baidu Inc(百度公司) Brown University(布朗大学) Amazon(亚马逊)

AI总结 本文提出MM-StanceDet框架,通过整合检索增强、多模态分析代理、辩论阶段和自我反思,解决多模态立场检测中的上下文 grounding、跨模态解释模糊和单次推理脆弱问题,实验表明其在五个数据集上优于现有方法。

Comments Accepted on ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27861 2026-05-01 cs.CR cs.CL cs.LG

TwinGate: Stateful Defense against Decompositional Jailbreaks in Untraceable Traffic via Asymmetric Contrastive Learning

TwinGate: 通过非对称对比学习实现对不可追踪流量中分解性劫持的有状态防御

Bowen Sun, Chaozhuo Li, Yaodong Yang, Yiwei Wang, Chaowei Xiao

机构 * Johns Hopkins University(约翰霍普金斯大学) Microsoft Research Asia(微软亚洲研究院) Peking University(北京大学) University of California, Merced(加州大学默塞德分校)

AI总结 针对LLM中分解性劫持威胁,TwinGate通过非对称对比学习在共享潜在空间中聚类语义不同但意图匹配的恶意片段,同时利用冻结编码器抑制良性主题重叠导致的误报,实现高效防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27763 2026-05-01 cs.AI

Intent2Tx: Benchmarking LLMs for Translating Natural Language Intents into Ethereum Transactions

Intent2Tx:评估大语言模型将自然语言意图转换为以太坊交易的基准测试

Zhuoran Pan, Yue Li, Zhi Guan, Jianbin Hu, Zhong Chen

机构 * Taiyuan University of Technology(太原科技大学) Peking University(北京大学)

AI总结 本文提出Intent2Tx基准测试,基于真实以太坊链上数据,评估大语言模型将自然语言意图转换为功能正确、状态依赖的链上交易的能力,发现现有模型在多步规划和泛化能力上存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22615 2026-05-01 cs.RO

GazeVLA: Learning Human Intention for Robotic Manipulation

GazeVLA:学习人类意图以促进机器人操作

Chengyang Li, Kaiyi Xiong, Yuan Xu, Lei Qian, Yizhou Wang, Wentao Zhu

机构 * Shanghai Jiao Tong University(上海交通大学) Eastern Institute of Technology, Ningbo(宁波东部科技研究院) Peking University(北京大学) ShanghaiTech University(上海科技大学)

AI总结 本文提出GazeVLA框架,通过学习人类意图弥合人机之间的固有差距,提升机器人操作性能。

Comments Project page: https://gazevla.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14988 2026-05-01 cs.CV

Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: A Comprehensive Evaluation

在细粒度图像任务上评估大型视觉-语言模型:全面评估

Hong-Tao Yu, Yuxin Peng, Serge Belongie, Xiu-Shen Wei

机构 * School of Computer Science and Engineering, School of Intelligence Science and Engineering and Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications, Southeast University, China(东南大学计算机科学与工程学院、智能科学与工程学院及新一代人工智能技术及其跨学科应用关键实验室,中国) Wangxuan Institute of Computer Technology, Peking University, China(北京大学王轩计算机技术研究所,中国) University of Copenhagen, Denmark(丹麦哥本哈根大学)

AI总结 本文提出FG-BMK基准,通过101万问题和33万张图像评估LVLMs的语义识别与细粒度特征表示能力,揭示训练范式、模态对齐等对性能的影响,为未来模型设计提供指导。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27699 2026-05-01 cs.AI

Bridging Values and Behavior: A Hierarchical Framework for Proactive Embodied Agents

连接价值与行为:一种面向主动具身代理的分层框架

Chunhui Zhang, Yuxuan Wang, Aoyang Qin, Yi-Long Lu, Kunlun Wu, Yizhou Wang, Wei Wang

机构 * State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) School of Computer Science, Peking University(北京大学计算机学院) Tsinghua University(清华大学) Nat’l Eng. Research Center of Visual Technology, Peking University(北京大学视觉技术国家工程研究中心) Institute for AI, Peking University(北京大学人工智能研究院) State Key Laboratory of General Artificial Intelligence, Peking University(通用人工智能国家重点实验室,北京大学)

AI总结 本文提出ValuePlanner框架,通过分层认知架构分离高阶价值调度与低阶行动执行,结合LLM生成符号子目标并用PDDL规划器转化为行动计划,通过反馈机制提升自主性,实验表明其能生成连贯的长期自主行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27491 2026-05-01 cs.CV

Uni-HOI:A Unified framework for Learning the Joint distribution of Text and Human-Object Interaction

Uni-HOI: 一种学习文本与人-物交互联合分布的统一框架

Mengfei Zhang, Jinlu Zhang, Zhigang Tu

机构 * Wuhan University(武汉大学) Peking University(北京大学) Institute for Clarity in Documentation(文档清晰研究所) Inria Paris-Rocquencourt(巴黎-罗quentcourt研究所) Rajiv Gandhi University(拉贾·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒研究实验室)

AI总结 本文提出Uni-HOI框架,通过结合大语言模型和VQ-VAE,统一建模文本、人体运动和物运动的联合分布,解决多模态交互任务中的数据异质性问题。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27340 2026-05-01 cs.AI

Investigating More Explainable and Partition-Free Compositionality Estimation for LLMs: A Rule-Generation Perspective

探究更可解释且无分区的组合性估计方法:从规则生成的角度

Ziyao Xu, Cong Wang, Houfeng Wang

机构 * National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(国家多媒体信息处理重点实验室,计算机学院,北京大学) OPPO AI Center(OPPO人工智能中心)

AI总结 本文提出从规则生成角度评估LLM组合性的新方法,解决现有测试的局限性,通过字符串到网格任务实验揭示LLM的组合性特征与不足。

Comments Accepted at ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26960 2026-05-01 cs.CY cs.AI

LLM Biases

LLM偏见

Jinhui Han, Ming Hu, Xilin Zhang

机构 * Guanghua School of Management, Peking University(北京大学光华管理学院) Rotman School of Management, University of Toronto(多伦多大学罗特曼管理学院)

AI总结 本文研究了基于Transformer的生成推荐系统中四种系统性偏见机制,指出其可能影响长期多样性和用户选择,强调需关注运营风险而非仅依赖性能指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25367 2026-05-01 cs.CV

Self-DACE++: Robust Low-Light Enhancement via Efficient Adaptive Curve Estimation

Self-DACE++:通过高效自适应曲线估计实现鲁棒低光照增强

Jianyu Wen, Jun Xie, Feng Chen, Zhepeng Wang, Chenhao Wu, Tong Zhang, Yixuan Yu, Piotr Swierczynski

机构 * Lenovo Research(联想研究院) Imperial College London(帝国理工学院伦敦分校) Southern University of Science(南方科技大学) Peking University(北京大学) NODAR Inc.(NODAR公司)

AI总结 本文提出Self-DACE++,一种改进的无监督轻量级低光照图像增强框架,通过增强自适应调整曲线提升计算效率与恢复质量,实现实时高效增强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24564 2026-05-01 cs.CL cs.IR cs.IT math.IT

MEG-RAG: Quantifying Multi-modal Evidence Grounding for Evidence Selection in RAG

MEG-RAG: 多模态证据 grounding 的量化研究以提升 RAG 中的证据选择

Xihang Wang, Zihan Wang, Chengkai Huang, Quan Z. Sheng, Lina Yao

机构 * Institute for Clarity in Documentation(清晰文档研究所) Inria Paris-Rocquencourt(巴黎- Rocquencourt 国家信息与自动化研究所) Rajiv Gandhi University(拉吉夫·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒尔研究实验室) Zhejiang University(浙江大学) Peking University(北京大学) University of New South Wales(新南威尔士大学) Macquarie University(麦考瑞大学) CSIRO’s Data61(CSIRO 数据61)

AI总结 本文提出 MEG-RAG 框架,通过语义感知的多模态证据 grounding 方法提升 RAG 中的证据选择准确性与多模态一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24026 2026-05-01 cs.CL cs.AI

From Skill Text to Skill Structure: The Scheduling-Structural-Logical Representation for Agent Skills

从技能文本到技能结构:面向智能体技能的调度-结构-逻辑表示

Qiliang Liang, Hansi Wang, Zhong Liang, Yang Liu

机构 * Key Laboratory of Computational Linguistics, Ministry of Education, Peking University(计算语言学重点实验室,教育部,北京大学) School of Computer Science, Peking University(北京大学计算机学院) Department of Chinese Language and Literature, Peking University(北京大学中文语言文学系)

AI总结 本文提出调度-结构-逻辑(SSL)表示法,通过解耦技能调度信号、执行结构和逻辑证据,提升智能体技能的可搜索性和可审查性,实验表明其在技能发现和风险评估任务中优于纯文本基线。

Comments 21 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23763 2026-05-01 cs.CV

Edit Where You Mean: Region-Aware Adapter Injection for Mask-Free Local Image Editing

在需要的地方编辑:区域感知的适配器注入用于无掩码的局部图像编辑

Honghao Cai, Xiangyuan Wang, Yunhao Bai, Haohua Chen, Tianze Zhou, Runqi Wang, Wei Zhu, Yibo Chen, Xu Tang, Yao Hu, Zhen Li

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Beijing University of Aeronautics and Astronautics(北京航空航天大学) Tsinghua University(清华大学) Peking University(北京大学) Xiaohongshu Inc.(小红书公司)

AI总结 本文提出AdaptEdit框架,通过区域感知适配器实现无掩码的局部图像编辑,结合轻量级Block Adapter和SpatialGate提升编辑精度,同时通过Region-Aware Loss优化训练目标,实现无需用户掩码的高质量编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19571 2026-05-01 cs.CV

TransSplat: Unbalanced Semantic Transport for Language-Driven 3DGS Editing

TransSplat:不平衡语义传输用于语言驱动的3DGS编辑

Yanhui Chen, Jiahong Li, Jingchao Wang, Junyi Lin, Zixin Zeng, Yang Shi

机构 * Guangdong University of Technology(广东工业大学) Peking University(北京大学)

AI总结 TransSplat通过不平衡语义传输解决语言驱动3DGS编辑中2D证据与3D高斯之间的语义对应问题,提升局部编辑精度和结构一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04978 2026-05-01 cs.AI

Aligning Perception, Reasoning, Modeling and Interaction: A Survey on Physical AI

对齐感知、推理、建模与交互:物理AI的综述

Kun Xiang, Terry Jingchen Zhang, Yinya Huang, Jixi He, Zirong Liu, Yueling Tang, Ruizhe Zhou, Lijing Luo, Youpeng Wen, Xiuwei Chen, Bingqian Lin, Jianhua Han, Hang Xu, Hanhui Li, Bin Dong, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) ETH Zurich(苏黎世联邦理工学院) ETH AI Center(苏黎世联邦理工学院人工智能中心) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) Yinwang Intelligent Technology Co., Ltd.(云网智能技术有限公司) Peking University and Beijing International Center for Mathematical Research(北京大学和北京国际数学研究中心)

AI总结 本文综述了物理AI,探讨了理论物理推理与应用物理理解的区别,并分析了基于物理的方法如何提升AI在现实世界中的理解能力,推动更安全、可推广的AI系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02679 2026-05-01 cs.LG cs.GR cs.HC stat.ME

Visual Analysis of Multi-outcome Causal Graphs

多结果因果图的可视化分析

Mengjie Fan, Jinlu Yu, Daniel Weiskopf, Nan Cao, Huai-Yu Wang, Liang Zhou

机构 * Institute of Medical Technology, Peking University Health Science Center(北京大学人民医院医学技术研究所) National Institute of Health Data Science (NIHDS), Peking University(北京大学国家健康数据科学研究院) Chalmers University of Technology(挑战大学) NIHDS, Peking University(北京大学国家健康数据科学研究院) Visualization Research Center (VISUS), University of Stuttgart(斯图加特大学可视化研究中心) iDV x Lab, Tongji University(同济大学iDV x实验室) National Institute of Traditional Chinese Medicine Constitution and Preventive Treatment of Diseases, Beijing University of Chinese Medicine(北京中医药大学国家中医体质与疾病预防治疗研究所)

AI总结 本文提出多结果因果图的可视化方法,用于比较不同结果变量的因果图。通过与医学专家合作,设计了两种可视化技术,用于比较多种因果发现算法,并通过案例研究和用户测试验证方法有效性。

Journal ref EEE Transactions on Visualization and Computer Graphics, vol. 31, no. 1, pp. 656-666, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏