UniSVQ: 2-bit Unified Scalar-Vector Quantization
UniSVQ: 2比特统一标量-向量量化
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 提出UniSVQ,通过将码字参数化为整数格点的仿射变换,统一标量和向量量化,实现2比特量化下性能优于标量量化、媲美向量量化,且推理吞吐更高。
Comments Accepted by ICML 2026
高校专区
UniSVQ: 2比特统一标量-向量量化
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 提出UniSVQ,通过将码字参数化为整数格点的仿射变换,统一标量和向量量化,实现2比特量化下性能优于标量量化、媲美向量量化,且推理吞吐更高。
Comments Accepted by ICML 2026
基于滤波差分分析的VVenC中运动矢量差合并加速
机构 * University of Science and Technology of China(中国科学技术大学) ; Hupan Laboratory(湖畔实验室)
AI总结 提出基于分数运动矢量滤波差分分析的快速MMVD算法,通过2抽头滤波器近似8抽头滤波器推导增益准则,并引入对称偏移推断和十字形降采样点积优化,显著降低搜索比和复杂度。
Comments 5 pages, 4 tables, 4 figures
一视频一世界:将单目视频转化为物理4D场景
机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; SparcAI Inc(SparcAI公司) ; University of Science and Technology of China(中国科学技术大学) ; The Hong Kong Polytechnic University(香港理工大学) ; University of Electronic Science and Technology of China(电子科技大学) ; Nanyang Technological University(南洋理工大学) ; Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)
AI总结 提出OVOW,首个无需训练的系统,从单目视频重建实例级、可仿真的4D网格场景,通过视觉语言模型发现实例、类别感知重建、迭代优化恢复尺度与位姿、物理装配确保接触支撑,并建立结构化视频到4D评估基准。
Comments Accepted by ECCV 2026. Project Page: https://OneVideoOneWorld.github.io/
Triospect:一种针对多样化攻击的鲁棒统计AI生成文本检测的三维框架
机构 * Zhejiang University(浙江大学) ; Zhejiang University of Technology(浙江工业大学) ; Westlake University(西湖大学) ; Shanghai Polytechnic University(上海第二工业大学) ; University of Science and Technology of China(中国科学技术大学)
AI总结 提出Triospect三维检测框架,通过分析文本的内容(核心思想)和表达(风格元素)来增强对17种攻击的鲁棒性,在Humanize-16K和RAID数据集上分别提升AUROC 22.3%和9.1%。
Comments TACL final version, 12 pages, 9 figures, and 9 tables
ADAPT: 通过偏好调优实现注意力动态对齐以增强多模态大模型的忠实性
机构 * University of Science and Technology of China(中国科学技术大学) ; Huawei Technologies Ltd.(华为技术有限公司) ; State Key Laboratory of Communication Content Cognition, People’s Daily Online(人民网传播内容认知国家重点实验室)
AI总结 针对多模态大模型生成中的幻觉问题,提出ADAPT框架,通过跨注意力视觉锚点、注意力监督推理和视觉注意力引导DPO直接干预文本到图像的跨注意力动态,在多个基准上将幻觉率降低40%-60%。
Comments Accepted by ECCV 2026
Reflect-R1:长视频理解中基于证据驱动的自纠正反思
机构 * Tsinghua University(清华大学) ; Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) ; Nanyang Technological University(南洋理工大学) ; University of Science and Technology of China(中国科学技术大学) ; Shenzhen University(深圳大学) ; University of California(加利福尼亚大学) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 提出Reflect-R1框架,通过直觉、验证、仲裁三阶段管道动态检索客观视觉证据,并设计阶段解耦强化学习算法SD-GRPO解决策略耦合,在长视频理解基准上达到最优性能。
Comments 2026 ECCV
IterCAD:一种用于视觉引导的CAD生成与编辑的迭代多模态智能体
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 提出IterCAD,一种闭环交互式CAD生成与编辑的多模态智能体框架,通过渐进式SFT和几何感知强化学习优化,在代码可执行性和几何精度上显著超越现有方法。
ComAct: 通过COM即行动范式重构专业软件操作
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 提出COM即行动范式,将专业软件交互转化为确定性程序合成,解决GUI代理的脆弱性和API代理的异构性问题;构建ComCADBench基准和ComActor自校正代理,在工业CAD软件上实现SOTA性能。
LARA: 视觉-语言-动作模型的潜在动作表示对齐
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 提出LARA框架,通过表示对齐联合优化潜在动作模型和视觉-语言-动作模型,利用人类视频数据提升机器人操作性能,在模拟和真实基准上平均提升约10%、5%和15%。
HAT-4D: 通过人机协作从单目视频提升4D多物体交互
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Innovation Institute(上海创新研究院) ; University of Science and Technology of China(中国科学技术大学) ; Math Magic
AI总结 提出HAT-4D框架,结合视觉大模型与多级人工反馈,从单目视频重建多物体的3D几何、时序动态和物理交互,解决遮挡和深度歧义,无需多相机系统。
Comments Accepted to ECCV 2026. 15 pages of main text and 39 pages of appendices. Project page: https://lijiaxin0111.github.io/HAT4D/
面向扩散模型的类别频率引导噪声调度
机构 * Hefei University of Technology(合肥工业大学) ; University of Science and Technology of China(中国科学技术大学) ; The University of Hong Kong(香港大学) ; The Chinese University of Hong Kong(香港中文大学) ; Nanyang Technological University(南洋理工大学)
AI总结 针对低频类别在扩散模型中因低密度区域导致评分估计不准和生成质量差的问题,提出类别频率引导的噪声调度(CFRG),为低频类别分配更大尺度噪声,在CIFAR-100-LT和ImageNet-LT上显著提升生成质量。
Comments technical report
MER-R1:通过慢-快思维协同的多模态情感推理
机构 * University of Science and Technology of China(中国科学技术大学) ; SenseTime Research(商汤科技研究院) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)
AI总结 提出MER-R1强化学习框架,利用慢-快思维互补性优化多模态情感识别,通过双目标解耦和置信度校准联合优化召回率与精确度,实现SOTA性能。
Comments Under review
SemCityLoc: 使用语义3D城市模型的航空6自由度定位
机构 * Technical University of Munich(慕尼黑工业大学) ; University of Cambridge(剑桥大学) ; University of Science and Technology of China(中国科学技术大学) ; Munich Center for Machine Learning(慕尼黑机器学习中心) ; Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) ; ETH Zurich(苏黎世联邦理工学院)
AI总结 提出SemCityLoc,通过语义-几何对齐将航空位姿估计转化为结构化表面配准,利用基础模型视觉先验和标准化LoD城市模型,在重复遮挡环境中提升位姿判别性,并引入首个真实基准SemCityLockeD,实现定位误差从9.89m降至2.62m。
Comments accepted by ECCV 2026
PhyEditBench: 一个用于物理感知图像编辑的真实世界多阶段基准
机构 * Nanjing University(南京大学) ; SDU(山东大学) ; HRBEU(哈尔滨工程大学) ; SDUTCM(山东中医药大学) ; USTC(中国科学技术大学)
AI总结 提出PhyEditBench基准,通过分层分类和真实/反物理实例评估编辑模型的物理理解能力,并引入训练无关基线PhyWorld利用视频生成推理。
Comments 19 pages, 6 figures, 2 tables. Accepted to ECCV 2026
DeformGen: 基于动力学的拓扑增强用于可变形操作策略学习
机构 * Shanghai Jiao Tong University(上海交通大学) ; Eastern Institute of Technology, Ningbo(宁波东方理工大学) ; Tsinghua University(清华大学) ; The Hong Kong Polytechnic University(香港理工大学) ; University of Science and Technology of China(中国科学技术大学) ; Zhongguancun Academy(中关村学院) ; Microsoft Research(微软研究院)
AI总结 提出DeformGen框架,通过局部物理扰动和动力学前向模拟生成拓扑一致的可变形状态,并利用变形场扭曲转移操作轨迹,联合增强状态分布与操作行为,提升可变形操作策略学习。
BiPACE:基于双模拟引导与动作反事实估计的LLM智能体策略优化
机构 * University of Chicago(芝加哥大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Stanford University(斯坦福大学) ; University of Science and Technology of China(中国科学技术大学) ; Meituan(美团)
AI总结 针对分组强化学习中状态-动作信用分配不匹配问题,提出BiPACE优势估计器,通过双模拟引导的状态聚类和动作反事实基线,在无需批评网络或额外采样的前提下提升LLM智能体训练效果。
ASSCG:自动驾驶中快慢LLM规划的恰到好处门控
机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) ; Department of Automation, University of Science and Technology of China(中国科学技术大学自动化系) ; Beijing University of Aeronautics and Astronautics(北京航空航天大学) ; Lenovo Group Limited(联想集团)
AI总结 提出自适应慢系统控制门(ASSCG),通过帧级查询/缓存/丢弃决策优化快慢规划器调用,结合RWKV骨干网络和GRPO风格强化学习,在nuPlan和NAVSIM上分别提升性能并降低延迟。
Follow Your Track: 由3D轨迹控制的精确骨骼动画
机构 * School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学技术学院) ; State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), CASIA(多模态人工智能系统全国重点实验室(MAIS),中国科学院自动化研究所) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
AI总结 提出ACT框架,利用骨骼表示和3D轨迹实现高效、可控的4D动画,通过路由轨迹注入器实现精确轨迹到关节映射,显著提升时间一致性和控制精度。
解耦侦察与利用:测量基于LLM的Web渗透测试的能力边界
机构 * University of Science and Technology of China(中国科学技术大学) ; Suzhou Institute for Advanced Research, University of Science and Technology of China(中国科学技术大学苏州先进研究院) ; Nanjing University of Science and Technology(南京理工大学) ; Research Institute, Runjian Co., Ltd(润杰有限公司研究院)
AI总结 提出解耦评估框架分离侦察与利用阶段,发现LLM代理在准确漏洞上下文下功能成功率可达90.0%,但自主侦察召回率仅约50.0%,揭示了能力差距。
Joycent: 基于扩散的口音语音合成,无需口音音素预测
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 提出Joycent,一种基于扩散模型的口音TTS方法,直接从标准音素序列和语音参考合成口音语音,无需口音音素预测,通过条件层归一化集成口音和说话人表征,并引入WhisAID口音识别模型,在保持说话人身份的同时提升口音自然度。
逃离自我确认陷阱:一种用于智能体经验学习的执行-蒸馏-验证范式
机构 * Zhejiang University(浙江大学) ; Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Northwestern Polytechnical University(西北工业大学) ; University of Science and Technology of China(中国科学技术大学) ; Shanghai Jiaotong University(上海交通大学)
AI总结 提出EDV框架,通过多智能体并行执行、第三方蒸馏和共识验证,解决单智能体经验学习中的自我确认陷阱问题,在三个长时任务基准上取得一致提升。
Comments 28 pages, 11 figures
RAVEN: 一种面向金融时间序列预测的机制感知可变上下文专家网络
机构 * University of Science and Technology of China(科学技术大学) ; Shanghai Black Wing Asset Management Co., Ltd.(上海黑翼资产管理有限公司) ; College of Sciences, Shanghai University(上海大学理学院) ; The Chinese University of Hong Kong(香港中文大学) ; Qitan Technology Co., Ltd.(启元科技有限公司)
AI总结 针对金融时间序列非平稳、低信噪比及机制依赖特性,提出RAVEN框架,通过自适应确定上下文窗口和嵌套专家路由实现状态最优预测,在多项指标上超越现有方法。
ZeroGVC:基于自回归扩散先验的零样本生成式视频压缩
机构 * University of Science and Technology of China(中国科学技术大学) ; Huawei Inc(华为公司)
AI总结 提出ZeroGVC,一种零样本生成式视频压缩框架,利用预训练自回归扩散先验,通过码本引导的自回归潜压缩和双向参考模式,在超低码率下实现高质量感知重建,无需额外训练。
SICI:一种揭示LLM立场检测中相变的语义-语用复杂度指数
机构 * School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学网络空间安全学院) ; School of Artificial Intelligence, Shenzhen Technology University(深圳技术大学人工智能学院)
AI总结 提出SICI指数,从七维语义-语用复杂度诊断立场检测难度,揭示LLM错误随复杂度增加从过度归因到集中弃权的相变规律,且干预方法仅沿归因-弃权轴移动而非消除瓶颈。
Flow6D: 离散到连续的流匹配用于高效且准确的类别级6D姿态估计
机构 * Zhejiang University(浙江大学) ; University of Science and Technology of China(中国科学技术大学) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 提出Flow6D分层流匹配框架,通过两阶段离散潜空间定位-连续姿态回归策略,先离散化姿态参数并用离散流匹配缩小搜索空间,再连续流匹配预测局部残差优化姿态,在合成和真实数据集上以70 FPS实现实时推理,性能优于现有方法。
Comments Accepted for publication in IEEE Robotics and Automation Letters (RA-L), 2026
迈向根记忆:面向个性化大语言模型的隐式逻辑记忆检索基准与增强
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 针对现有记忆系统依赖语义相似性而忽略逻辑关键记忆的问题,构建首个高质量基准IMLogic,并提出根记忆表示与RootMem框架,通过结构化逻辑记忆提升个性化LLM检索性能。
PRIDE: 特权信息增强的共情对话生成蒸馏方法
机构 * Anhui Robot Technology Standard Innovation Base, School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院安徽机器人技术标准创新基地)
AI总结 提出PRIDE方法,利用训练时可用但推理时不可用的特权信息(如心理标注或未来事件摘要),通过共情推理提示、多源注意力机制和双对齐损失,将大模型的共情推理能力蒸馏到小模型,在资源受限场景下保持性能。
AdaReP:模型失配下的自适应重规划用于神经世界模型预测控制
机构 * Shanghai Jiao Tong University(上海交通大学) ; Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院) ; University of Science and Technology of China(中国科学技术大学)
AI总结 针对神经世界模型预测控制中重规划计算开销大的问题,提出AdaReP方法,通过在线自适应调整重规划容忍度,在保持任务性能的同时大幅减少规划器计算量。
Comments Accepted at ICANN 2026. This arXiv version contains supplementary materials and appendices that are omitted from the conference version due to space limitations
SkillAudit:从固定套件基准测试到以技能为中心的评估
机构 * Northeastern University(东北大学) ; City University of Hong Kong(香港城市大学) ; Northwestern University(西北大学) ; Fudan University(复旦大学) ; University of Science and Technology of China(中国科学技术大学) ; Santa Clara University(圣克拉拉大学) ; Fenz AI ; Ohio State University(俄亥俄州立大学) ; University of Glasgow(格拉斯哥大学) ; National University of Singapore(新加坡国立大学) ; DeciLix Lab(DeciLix实验室)
AI总结 提出SkillAudit框架,自动生成技能的多维度评估报告,涵盖效用、效率/成本和安全性,通过基线比较和两阶段检测解决固定套件评估的不足。
Comments Preprint. Project page: https://skillaudit.github.io/. Code and evaluation artifacts: https://github.com/SkillAudit/skillaudit
MacAgentBench: 在真实macOS桌面上基准测试AI代理
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Xi’an Jiaotong University(西安交通大学) ; Fudan University(复旦大学) ; University of Science and Technology of China(中国科学技术大学) ; Zhejiang University(浙江大学) ; East China Normal University(华东师范大学) ; Tsinghua University(清华大学)
AI总结 提出MacAgentBench,包含676个跨25个应用的任务,采用规则评估和细粒度多检查点评分,实验表明最佳配置(OpenClaw上的Claude Opus 4.6)达到73.7% Pass@1,优势主要来自技能库而非框架设计。