DocDancer: Towards Agentic Document-Grounded Information Seeking
DocDancer:迈向基于文档的信息检索代理
机构 * Peking University(北京大学) ; Shanghai AI Lab(上海人工智能实验室) ; Tencent AI Lab(腾讯人工智能实验室)
AI总结 DocDancer是一种开源文档问答代理,通过工具驱动框架和数据合成管道提升文档理解能力。
高校专区
DocDancer:迈向基于文档的信息检索代理
机构 * Peking University(北京大学) ; Shanghai AI Lab(上海人工智能实验室) ; Tencent AI Lab(腾讯人工智能实验室)
AI总结 DocDancer是一种开源文档问答代理,通过工具驱动框架和数据合成管道提升文档理解能力。
DVD:一种检测大规模语言模型评估中变体污染的稳健方法
机构 * Beihang University(北京航空航天大学) ; Peking University(北京大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Shanghai Jiao Tong University(上海交通大学) ; Tsinghua University(清华大学)
AI总结 DVD通过分析生成分布的方差检测大规模语言模型评估中的变体污染,优于多种现有检测方法。
LinguaGame: 一种基于语言的多智能体对话生成博弈论范式
机构 * Tsinghua University(清华大学) ; University of California, Berkeley(加州大学伯克利分校) ; Peking University(北京大学) ; East China University of Political Science and Law(中国政法大学)
AI总结 LinguaGame通过博弈论范式提升多智能体对话生成的通信效率,利用语言感知推理实现意图和策略的高效沟通。
超越二元偏好:通过解耦属性对齐扩散模型以实现细粒度标准
机构 * Zhejiang University(浙江大学) ; University of Electronic Science and Technology of China(电子科技大学) ; Peking University(北京大学) ; University of Nottingham Ningbo China(诺丁汉大学宁波分校)
AI总结 本文提出CPO方法,通过解耦属性实现扩散模型对细粒度标准的对齐,提升生成质量与专业对齐能力。
安全与效用冲突并非全球性:通过头部层面诊断的手术对齐
机构 * Baidu Inc.(百度公司) ; School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) ; School of Computer Science, Peking University(北京大学计算机学院) ; State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(中国科学院计算技术研究所人工智能安全重点实验室)
AI总结 本文提出CAST框架,通过头部层面诊断与稀疏微调相结合,解决LLMs中安全与效用冲突问题,减少训练损失并提升安全性。
迈向大型语言模型命题逻辑推理的机理理解
机构 * MOE Key Lab of Computational Linguistics, Peking University(教育部计算语言学重点实验室,北京大学)
AI总结 本文通过分析Qwen3在PropLogic-MI数据集上的表现,揭示了大型语言模型在命题逻辑推理中采用的结构化计算机制。
NL2Repo-Bench: 向编码代理的长周期仓库生成评估迈进
机构 * Nanjing University(南京大学) ; Peking University(北京大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Beihang University(北航)
AI总结 NL2Repo-Bench通过评估编码代理在长周期内生成仓库的能力,揭示了自主软件开发中的核心挑战。
GAPO:面向现实世界代码LLM的鲁棒优势估计
机构 * Shanghai Jiao Tong University(上海交通大学) ; Tencent(腾讯) ; Zhejiang University(浙江大学) ; Shenzhen University(深圳大学) ; Peking University(北京大学)
AI总结 GAPO通过自适应Q机制提升代码编辑LLM的鲁棒性,实现领域内和领域外精确匹配的显著提升。
哇,哇,val!一个综合的具身世界模型评估图灵测试
机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) ; Beijing Innovation Center of Humanoid Robotics(人形机器人创新中心) ; The Hong Kong University of Science and Technology(香港科技大学)
AI总结 本文提出Wow-wo-val基准测试,评估视频基础模型在具身人工智能中的生成能力,发现其在长期规划和物理一致性上表现有限,揭示了现实世界与生成视频之间的差距。
基于技能感知的反事实交互导航:通过技能感知视觉语言模型
机构 * School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院) ; Department of Mechanical and Automation Engineering, The Chinese University of Hong Kong(香港中文大学机械与自动化工程系) ; College of Design and Engineering, National University Of Singapore(新加坡国立大学设计与工程学院) ; Department of Computer Science, The University of Manchester(曼彻斯特大学计算机科学系)
AI总结 CoINS通过整合技能感知推理与稳健执行,提升机器人在复杂环境中的交互导航能力。
Comments 17 pages, 13 figures
决定后再检索:一种无训练框架,结合不确定性引导触发和双路径检索
机构 * Baidu Inc(百度公司) ; The University of Hong Kong(香港大学) ; Peking University(北京大学)
AI总结 DTR通过不确定性引导触发和双路径检索,提升问答性能并减少冗余检索。
语义增强的事件到视频重建范式:Semantic-E2VID
机构 * organization= Department of Electrical ; Electronic Engineering, The University of Hong Kong , city= Hong Kong , country= China ; organization= School of Artificial Intelligence, Beijing University of Posts ; organization= State Key Laboratory of Multimedia Information Processing ; National Engineering Research Center of Visual Technology, School of Computer Science, Peking University , city= Beijing , postcode= 100871 , country= China
AI总结 Semantic-E2VID通过引入语义学习和融合机制,提升事件到视频重建的准确性与语义完整性。
VISTA: 通过无训练动态推理路由缓解视频大语言模型中的语义惯性
机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学)
AI总结 VISTA通过动态推理路由和潜在推理共识机制,缓解视频大语言模型中的语义惯性问题,提升视频理解性能。
Comments 19 pages, 7 figures
PM4Bench: 通过平行多语言多模态多任务语料库对大型视觉-语言模型进行基准测试
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学) ; Peking University(北京大学) ; Sun Yat-Sen University(中山大学) ; Chinese University of Hong Kong(香港中文大学)
AI总结 PM4Bench通过平行多语言多模态多任务语料库评估大型视觉-语言模型,揭示跨语言性能差异与OCR能力的关系。
Comments Equal contribution: Junyuan Gao, Jiahe Song, Jiang Wu; Corresponding author: Conghui He
U-REPA: 对齐扩散U-Net与ViT
机构 * State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(人工智能通用基础理论国家重点实验室,智能科学与技术学院,北京大学) ; Huawei Noah’s Ark Lab(华为诺亚实验室) ; The University of Sydney(悉尼大学) ; School of Mathematical Sciences, Peking University(数学科学学院,北京大学)
AI总结 U-REPA通过改进的表示对齐方法,提升扩散模型在U-Net架构中的生成质量和收敛速度。
Comments 22 pages, 8 figures
Journal ref NeurIPS 2025
ETR: 以结果为导向的弹性信任区域用于策略优化
机构 * Alibaba Group(阿里巴巴集团) ; Peking University(北京大学)
AI总结 ETR通过动态信任区域机制,提升策略优化的信号利用效率和探索稳定性。
针对图生成扩散模型的推断攻击
机构 * Hong Kong Baptist University(香港 Baptist 大学) ; Peking University(北京大学)
AI总结 本文针对图生成扩散模型提出三种推断攻击,并设计防御机制以减少信息泄露风险。
Comments This work has been accepted by USENIX Security 2026
SyncThink: 一种无需训练的策略,用于将推理饱和与推理终止对齐
机构 * National Key Laboratory for Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家级重点实验室) ; School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) ; School of Computer Science, Peking University(北京大学计算机科学学院)
AI总结 SyncThink是一种无需训练的解码方法,通过监控模型自身的推理过渡信号来终止推理,从而减少CoT的开销并提高推理效率。
Comments 14 pages, 8 figures
超越直接生成:一种分解方法用于利用LLM进行精心构思的剧本创作
机构 * Alibaba Group(阿里巴巴集团) ; Peking University(北京大学)
AI总结 本研究提出双阶段细化框架,通过分解生成方法提升LLM在剧本创作中的表现,实现高质量剧本生成。
OmniNav:一个统一的框架,用于前瞻性探索和视觉-语言导航
机构 * Alibaba Group(阿里巴巴集团) ; Peking University(北京大学)
AI总结 OmniNav通过统一框架实现多导航任务和前沿探索,提升机器人自主导航的精度与泛化能力。
超越化学问答:利用模块化化学操作评估LLM的化学推理
机构 * Pengcheng Laboratory(鹏城实验室) ; International Digital Economy Academy(国际数字经济学院) ; School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) ; School of AI for Science, Peking University(北京大学科学人工智能学院) ; Yale University(耶鲁大学)
AI总结 本文提出ChemCoTBench框架,通过模块化化学操作评估LLM在化学推理中的能力,解决分子优化和反应预测等复杂任务。
Comments Accepted by NeurIPS 2025 Dataset Track, 22 pages, 10 figures
SPIO:基于LLM的多智能体规划的集成与选择策略在自动化数据科学中的应用
机构 * Enhans ; Peking University(北京大学) ; Yale University(耶鲁大学)
AI总结 SPIO通过基于LLM的多智能体规划,在自动化数据科学中实现了集成与选择策略,提升了流程的灵活性和准确性。
Comments Under Review
通过语义层面内部推理图检测检索增强生成中的忠实性幻觉
机构 * Wangxuan Institute of Computer Technology, Peking University(王轩计算机技术研究所,北京大学) ; Institute of Artificial Intelligence and Future Networks, Beijing Normal University(人工智能与未来网络研究院,北京师范大学)
AI总结 本文提出基于语义层面内部推理图的方法,用于检测检索增强生成中的忠实性幻觉,通过构建依赖关系图和动态阈值调整提升检测性能。
Agent.xpu: 高效调度代理LLM工作负载于异构SoC
机构 * School of Computer Science, Peking University(北京大学计算机科学学院) ; The University of Hong Kong(香港大学) ; National Key Laboratory for Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室)
AI总结 Agent.xpu通过异构执行图和流感知协调技术,高效调度代理LLM工作负载,提升主动吞吐量和反应性响应性能
AnyDepth:深度估计变得简单
机构 * The University of Melbourne(墨尔本大学) ; Peking University(北京大学) ; Shanghai University of Engineering Science(上海工程技术大学)
AI总结 AnyDepth提出了一种轻量且以数据为中心的框架,通过简单深度变换器和质量过滤策略提升零样本单目深度估计的效率和准确性。
假设-验证:基于路径并行的微服务推测根本原因分析
机构 * Peking University(北京大学) ; Alibaba Group(阿里巴巴集团) ; Tsinghua University(清华大学)
AI总结 SpecRCA通过假设-验证范式提升微服务系统根本原因分析的准确性和效率。
Comments accepted by ICSE-NIER'26
基于代理记忆的递归推理用于微服务根因定位
机构 * Peking University(北京大学) ; Alibaba Group(阿里巴巴集团) ; Tsinghua University(清华大学) ; Institute of Artificial Intelligence(人工智能研究院)
AI总结 本文提出AMER-RCL框架,通过递归推理和代理记忆提升微服务根因定位的准确性和效率。
Comments accepted by ICSE-SEIP'26
RxnCaption:将反应图解析重新表述为视觉提示引导的描述生成
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学) ; Beihang University(北航) ; Peking University(北京大学) ; South China Normal University(华南师范大学) ; Northwestern Polytechnical University(西北工业大学)
AI总结 RxnCaption通过将反应图解析转化为视觉提示引导的描述生成任务,提升化学反应数据的机器可读性,并构建大规模数据集推动AI在化学领域的应用。
对抗间接提示注入的指令检测
机构 * Renmin University of China(中国人民大学) ; Peking University Shenzhen Graduate School(北京大学深圳研究生院) ; Wuhan University(武汉大学) ; University of Science and Technology of China(中国科学技术大学) ; Hong Kong University of Science and Technology(香港科技大学) ; Sony AI(索尼人工智能) ; Microsoft Research Asia(微软亚洲研究院)
AI总结 本文提出InstructDetector,通过检测LLMs行为状态来识别IPI攻击,实现高检测准确率和低攻击成功率。
Comments 16 pages, 4 figures
CalliReader:通过嵌入对齐的视觉-语言模型 contextualizing 中文书法
机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机技术研究院)
AI总结 CalliReader通过字符级切片、视觉-文本对齐和嵌入指令微调,解决中文书法的上下文识别问题,实现比现有方法和专业书法家更高的准确性与更低的幻觉率。
Comments 11 pages
Journal ref Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV) 2025