Convex Efficient Coding
凸高效编码
AI总结 本文提出了一种可 tractable 但灵活的规范性表征理论,通过优化表征相似性证明了一类凸优化问题,包括线性和非线性神经网络及半非负矩阵分解等,为神经编码提供了新的理论框架。
Comments 37 pages, 4 figures
Journal ref Proceedings of the 14th International Conference on Learning Representations, 2026
期刊&会议
International Conference on Learning Representations · 会议 · Machine Learning
凸高效编码
AI总结 本文提出了一种可 tractable 但灵活的规范性表征理论,通过优化表征相似性证明了一类凸优化问题,包括线性和非线性神经网络及半非负矩阵分解等,为神经编码提供了新的理论框架。
Comments 37 pages, 4 figures
Journal ref Proceedings of the 14th International Conference on Learning Representations, 2026
语言模型中的并行令牌预测
机构 * Department of Computer Science, University of California, Irvine(加州大学伊维特分校计算机科学系) ; Chan-Zuckerberg Initiative(张博士基金会) ; Pyramidal AI(金字塔人工智能) ; Computer Science & AI in Science Institute, University of California, Irvine(加州大学伊维特分校计算机科学与科学人工智能研究所)
AI总结 提出并行令牌预测框架,通过引入随机输入变量实现多令牌联合预测,提升语言模型解码效率。
Comments Accepted at ICLR 2026
测量不确定性校准
机构 * Spotify
AI总结 本文提出了一种非渐近的校准误差上界方法,通过修改分类器以高效限制校准误差,同时保持性能,适用于实际数据集。
Comments ICLR 2026, 28 pages
在生成过程中思考:面向个性化长文本生成的即兴推理
机构 * University of Science and Technology of China(科学技术大学) ; National University of Singapore(国立新加坡大学) ; The Chinese University of Hong Kong(香港中文大学) ; National Engineering Laboratory for BITA, University of Science and Technology of China(BITA国家工程实验室,科学技术大学)
AI总结 FlyThinker通过在生成过程中进行动态推理,提升个性化长文本生成的效率和效果。
Comments Published as a conference paper at ICLR 2026
MotionStream: 通过交互式运动控制实现实时视频生成
机构 * Seoul National University(首尔国立大学) ; Adobe Research(Adobe研究) ; Carnegie Mellon University(卡内基梅隆大学) ; Morpheus AI
AI总结 MotionStream通过交互式运动控制实现实时视频生成,利用因果注意力机制和蒸馏技术,实现亚秒延迟和高效率的无限长视频流式生成。
Comments ICLR 2026, Project webpage: https://joonghyuk.com/motionstream-web/
EchoMind: 一种相互关联的多级基准,用于评估共情语音语言模型
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Shenzhen Research Institute of Big Data(深圳大数据研究院) ; Shenzhen Loop Area Institute(深圳河套学院)
AI总结 EchoMind是一种多级基准,用于评估SLMs在共情对话中的能力,揭示了现有模型在处理高表现性语音线索方面的不足。
Comments Speech Language Models, Spoken Language Understanding, Vocal Cue Perception, Empathetic Dialogue, Benchmark Evaluation; Accepted by ICLR 2026
抓取任意区域:迈向多模态大语言模型的精确、上下文像素理解
机构 * New Laboratory of Pattern Recognition (NLPR), State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences (CASIA)(模式识别新实验室、多模态人工智能系统国家重点实验室、自动化研究所、中国科学院(CASIA)) ; University of Chinese Academy of Sciences(中国科学院大学) ; Peking University(北京大学) ; Wuhan University(武汉大学) ; ByteDance(字节跳动)
AI总结 GAR通过RoI对齐特征重放技术实现多区域精准理解与复杂推理,提升多模态大语言模型的上下文感知能力。
Comments ICLR 2026 Camera Ready Version
SceneCOT: 在3D场景中引导链式推理
机构 * State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) ; Peking University(北京大学) ; Tsinghua University(清华大学)
AI总结 本文提出SCENECOT框架,通过分解复杂任务并构建视觉线索,首次在3D场景中实现 grounded 链式推理,提升场景理解的推理能力。
Comments Accepted by ICLR 2026. Project page: https://scenecot.github.io/
细粒度微调在激活差异中留下明显可读的痕迹
机构 * EPFL(苏黎世联邦理工学院) ; Ecole Normale Supérieure Paris-Saclay(巴黎-萨克雷高等师范学校) ; Université Paris-Saclay(巴黎-萨克雷大学) ; Harvard University(哈佛大学) ; MATS
AI总结 研究发现狭窄微调会在激活中留下明显痕迹,揭示了微调领域偏见,并警告了使用此类模型进行广泛微调研究的局限性。
Comments ICLR 2026
通过将多视角重建网络缝合到视频生成器中实现文本到3D
机构 * ETH Zurich(苏黎世联邦理工学院) ; Google(谷歌)
AI总结 VIST3A通过将多视角重建网络缝合到视频生成器中,实现文本到3D生成,提升3D场景生成质量。
Comments ICLR 2026 (Oral), Project page: https://gohyojun15.github.io/VIST3A/
非渐近分析的符合化回归效率
AI总结 本文研究了符合化回归的非渐近效率界,通过SGD训练分位数和中位数回归,建立了预测集长度与理想区间的偏差界,揭示了不同误覆盖水平下的收敛率相变。
Comments Published as a conference paper at ICLR 2026
VidGuard-R1: 通过推理MLLMs和RL进行AI生成视频检测与解释
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Microsoft Research(微软研究院)
AI总结 VidGuard-R1通过推理MLLMs和强化学习,实现AI生成视频的高准确检测与可解释性分析。
Comments Accepted to ICLR 2026
超球面潜在变量改进连续令牌自回归生成
机构 * DP Technology(DP技术公司) ; Microsoft Research(微软研究院)
AI总结 SphereAR通过超球面约束解决自回归生成中的方差崩溃问题,在ImageNet生成中达到新的SOTA,超越了扩散和掩码生成模型。
Comments ICLR version
超越基准:语言模型推理能力的抗污染评估
AI总结 BeyondBench通过算法问题生成提供抗污染的推理评估,揭示语言模型在复杂任务中的推理缺陷。
Comments Accepted to ICLR 2026 Conference
BridgeDrive: 基于扩散桥的闭环轨迹规划扩散策略
机构 * Bosch (China) Investment Ltd(博世(中国)投资有限公司)
AI总结 BridgeDrive提出一种基于锚点的扩散桥策略,通过实时闭环轨迹规划提升自动驾驶的安全性和效率。
Comments Accepted for publication at ICLR 2026
TabStruct: 表格数据结构忠实性度量
机构 * Department of Computer Science and Technology, University of Cambridge(计算机科学与技术系,剑桥大学) ; Télécom Paris, Institut Polytechnique de Paris(巴黎理工 Télécom Paris)
AI总结 TabStruct提出了一种新的评估框架,结合结构忠实性和传统评估维度,引入全局效用度量,提供对13个表格生成器的全面评估。
Comments Accepted by the Fourteenth International Conference on Learning Representations (ICLR 2026 Oral)
泛音:用于清洁、高效和灵活物理模拟器的循环补丁调制
机构 * University of Cambridge(剑桥大学) ; Flatiron Institute(Flatiron研究所) ; Polymathic AI(多维人工智能)
AI总结 Overtone通过动态补丁大小控制,在保持精度的同时提升计算效率,适用于复杂物理模拟场景。
Comments 48 pages, 24 Figures. For code, see https://github.com/payelmuk150/patch-modulator
Journal ref Published as a conference paper at ICLR 2026
可追溯证据增强的视觉 grounded 推理:评估与方法论
机构 * New Laboratory of Pattern Recognition (NLPR), State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所模式识别新实验室,多模态人工智能系统国家重点实验室,中国科学院)
AI总结 TreeVGR 通过强化学习提升视觉 grounded 推理,实现更准确的定位与可解释的推理路径,验证了可追溯性对提升视觉推理能力的关键作用。
Comments ICLR 2026 Camera Ready Version
为何强化微调能更好地使大语言模型保留先验知识:从数据角度出发
机构 * Fudan University(复旦大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Collaborative Innovation Center of Intelligent Visual Computing(上海智能视觉计算协同创新中心)
AI总结 本文通过数据视角揭示强化微调(RFT)相较于监督微调(SFT)在保留大语言模型先验知识方面的优势,发现RFT通过强化正确样本与基模型对齐,有效减少对先验知识的干扰。
Comments Accepted by ICLR 2026
InterActHuman: 多概念人类动画与布局对齐的音频条件
机构 * The Chinese University of Hong Kong(香港中文大学) ; ByteDance(字节跳动)
AI总结 InterActHuman通过引入布局对齐的音频条件,实现多概念人类动画,支持多身份的精确控制与高质量视频生成。
Comments ICLR 2026 Camera Ready Version. TL;DR: The first multi-person dialogue video generation method from pairs of reference image and audio via explicit layout-aligned condition injection. Project page https://zhenzhiwang.github.io/interacthuman/
EDINET-Bench:利用日本财务报表评估大语言模型在复杂财务任务中的表现
机构 * Sakana AI ; Kyoto University(京都大学)
AI总结 EDINET-Bench通过日本财务报表评估大语言模型在复杂财务任务中的表现,揭示其在会计欺诈检测、盈利预测等任务中仍面临挑战,需更真实的模拟和推理支持。
Comments Accepted to ICLR 2026
连续思维链实现并行探索与推理
机构 * University of Michigan - Ann Arbor(密歇根大学安娜堡分校) ; Google Research NYC(谷歌纽约研究)
AI总结 本文提出CoT2连续思维链方法,通过并行探索与推理提升模型性能,解决组合子集和问题并优化推理效率。
Comments ICLR 2026
VTool-R1: 通过在多模态工具使用上的强化学习使VLMs学会通过图像思考
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Michigan Ann Arbor(密歇根大学安娜堡分校) ; Independent Researcher(独立研究者)
AI总结 VTool-R1通过强化学习训练视觉语言模型生成多模态思考链,提升其通过图像进行推理的能力。
Comments ICLR 2026
PhysLLM:利用大语言模型进行跨模态远程生理传感
机构 * Shenzhen University(深圳大学) ; Great Bay University(大鹏大学) ; National Engineering Laboratory for Big Data System Computing Technology(大数据系统计算技术国家工程实验室) ; Dongguan Key Laboratory for Intelligence and Information Technology(东莞智能与信息技术重点实验室) ; Guangdong Medical University(广东医科大学) ; Southern Medical University (Dongguan People’s Hospital)(南方医科大学(东莞人民医院)) ; Macao Polytechnic University(澳门理工学院)
AI总结 PhysLLM通过结合大语言模型与领域特定的rPPG组件,利用跨模态学习提升远程生理传感的准确性和鲁棒性。
Comments Accepted by International Conference on Learning Representations (ICLR) 2026
解析人类对大语言模型的偏好:基于HUMAINE框架的民主意识评估
AI总结 HUMAINE框架通过多维、人口统计学意识的评估方法,揭示了人类对大语言模型的偏好差异,发现年龄是主要分歧轴,且不同评估维度的判别能力差异显著。
Comments Published as a conference paper at ICLR 2026. 21 pages, 11 figures. https://openreview.net/forum?id=kVaE2kYjtV