In-Place Test-Time Training
就地测试时间训练
机构 * Peking University(北京大学)
AI总结 本文提出了一种无需重新训练的就地测试时间训练框架,通过调整MLP块的最终投影矩阵实现模型在推理时的动态更新,提升大语言模型在长上下文任务中的性能。
Comments ICLR 2026 Oral Presentation; Code is released at https://github.com/ByteDance-Seed/In-Place-TTT
高校专区
就地测试时间训练
机构 * Peking University(北京大学)
AI总结 本文提出了一种无需重新训练的就地测试时间训练框架,通过调整MLP块的最终投影矩阵实现模型在推理时的动态更新,提升大语言模型在长上下文任务中的性能。
Comments ICLR 2026 Oral Presentation; Code is released at https://github.com/ByteDance-Seed/In-Place-TTT
通过双自一致性强化学习实现科学图形程序合成
机构 * Zhejiang University(浙江大学) ; Shanghai Artificial Intelligence Laboratory, OpenDataLab(上海人工智能实验室,OpenDataLab) ; Shanghai Jiao Tong University(上海交通大学) ; Peking University(北京大学)
AI总结 本文提出双自一致性强化学习框架,结合高质量数据集和多维基准,提升科学图形到可编辑TikZ代码的转换能力,实现视觉与结构的高精度优化。
Graph-PiT:通过图先验增强基于部分的图像合成的结构一致性
机构 * Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology(广东省超高清沉浸式媒体技术重点实验室) ; Shenzhen Graduate School, Peking University, China(北京大学深圳研究生院) ; Department of Computer Vision, Mohamed bin Zayed University of Artificial Intelligence, Abu Dhabi, United Arab Emirates(穆罕默德·本·扎耶德人工智能大学计算机视觉系)
AI总结 Graph-PiT通过图先验建模视觉组件的结构依赖,提升部分基于图像合成的结构一致性,同时保持与原始IP-Prior流程的兼容性。
Comments 11 pages, 5 figures, Accepted by ICME 2026
基于价值的大型语言模型代理的上下文-价值-行动架构
机构 * State Key Laboratory of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院通用人工智能国家重点实验室) ; Yuanpei College, Peking University(北京大学元培学院) ; School of Psychological and Cognitive Sciences, Peking University(北京大学心理与认知科学学院) ; Key Laboratory of Machine Perception (Ministry of Education), Peking University(北京大学机器感知重点实验室(教育部)) ; PKU-Wuhan Institute for Artificial Intelligence(北大武汉人工智能研究院)
AI总结 本文提出CVA架构,通过价值验证器缓解价值极化,提升代理行为的准确性和可解释性。
Comments Accepted to Findings of the Association for Computational Linguistics: ACL 2026
Diff4Splat:基于潜在动态重建模型的可控4D场景生成
机构 * Peking University(北京大学) ; Xiamen University(厦门大学) ; CUHK(香港中文大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 Diff4Splat通过单张图像和相机轨迹生成可控的4D场景,结合视频扩散模型的生成先验与大规模4D数据集学习的几何和运动约束,在单次前向传递中直接预测可变形3D高斯场,无需测试时优化。
Comments Accepted to CVPR 2026. Project page: https://paulpanwang.github.io/Diff4Splat
GenomeQA:用于基因组序列理解的通用大型语言模型基准测试
机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; The University of Hong Kong(香港大学) ; Peking University(北京大学)
AI总结 GenomeQA旨在评估通用大型语言模型在基因组序列推理任务中的表现,包含5200个样本,涵盖六个任务家族,揭示模型在直接接触原始基因组序列时的表现。
Comments 18 pages, 9 figures, coference
高分辨率单次拍摄偏振成像的实现
机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) ; National Institute of Informatics(国立信息学研究所) ; State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) ; National Key Laboratory of General AI, School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院通用人工智能国家重点实验室)
AI总结 本文提出EasyPolar框架,通过三相机系统和置信度引导网络实现高分辨率偏振成像,解决多视角融合中的对齐问题,提升下游任务性能。
通过基于指令的思考链提示学习知识编辑
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Peking University(北京大学) ; Huawei Technologies Ltd.(华为技术有限公司) ; Chongqing University of Posts and Telecommunications(重庆邮电大学)
AI总结 本文提出CoT2Edit方法,通过思考链推理提升大语言模型的知识编辑能力,解决泛化差和范围窄的问题,实验显示在六个场景中表现优异。
Comments Accepted by ACL 2026 main conference
语言作为复杂系统的情境表示中呈现湍流样的5/3谱 scaling
机构 * College of Engineering, Peking University(北京大学工学院) ; Ningbo Institute of Digital Twin, Eastern Institute of Technology(东方理工高等研究院宁波数字孪生研究院) ; Shenzhen Tenfong Technology Co., Ltd.(深圳腾方科技有限公司) ; Mechanical Engineering, Pennsylvania State University(宾夕法尼亚州立大学机械工程系)
AI总结 研究通过变换器语言模型生成高维嵌入空间,发现文本序列中嵌入步信号的功率谱在宽频率范围内呈现接近5/3的幂律,表明语言表示具有多尺度、依赖上下文的组织特性。
SVAgent:通过跨模态多智能体协作实现故事线引导的长视频理解
机构 * BCML, Heriot-Watt University(赫瑞瓦特大学BCML) ; Nanyang Technological University(南洋理工大学) ; Peking University(北京大学)
AI总结 SVAgent通过跨模态多智能体协作,利用故事线引导实现视频问答的高效理解,提升推理鲁棒性和答案一致性。
Comments Published in CVPR2026
RL-VLA$^3$:一种灵活且异步的强化学习框架用于VLA训练
机构 * Peking University(北京大学) ; Tsinghua University(清华大学) ; Tianjin University(天津大学) ; JDT AI Infra(京东科技AI基础设施) ; Swinburne University of Technology(斯威本科技大学)
AI总结 本文提出RL-VLA$^3$,一种异步强化学习框架,通过动态批调度和灵活环境分片策略,提升VLA训练效率,实验显示其在8至256GPU上均取得85.2%的吞吐量提升。
大语言模型中的机制调节:通过稀疏自编码器检索和引导高阶语义特征
机构 * Peking University(北京大学)
AI总结 本文提出基于稀疏自编码器的框架,通过对比特征检索管道和生成验证,实现对高阶语言行为相关语义内部特征的引导,展示了在Big Five人格特质案例中的精准双向调控效果。
多模态情感计算近期进展:自然语言处理视角
机构 * Guangdong University of Technology(广东工业大学) ; Stony Brook University(石溪大学) ; University of Bologna(博洛尼亚大学) ; Peking University(北京大学) ; Nanyang Technological University(南洋理工大学) ; Arizona State University(亚利桑那州立大学)
AI总结 本文从自然语言处理视角系统回顾了多模态情感计算的最新进展,聚焦于多模态情感分析、对话中多模态情绪识别、基于方面的多模态情感分析及多标签情绪识别等四个任务,提出统一视角并探讨相关方向与挑战。
在低维情形下匹配相关高斯几何模型的Umeyama算法
机构 * Peking University(北京大学)
AI总结 本文研究了在低维情形下通过潜在节点排列关联的两个高斯几何模型的匹配问题,证明了Umeyama算法在特定噪声条件下可实现精确或近似恢复排列。
Comments 31 pages; updated funding information