Grounded World Model for Semantically Generalizable Planning
基于语义泛化的世界模型用于规划
机构 * Independent(独立) ; EPFL(瑞士联邦理工学院洛桑) ; Beihang University(北京航空航天大学) ; University of Toronto(多伦多大学) ; NUS(新加坡国立大学)
AI总结 本文提出基于视觉-语言对齐潜在空间的世界模型,用于改进视觉-运动模型控制,实现更广泛的语义泛化能力。
高校专区
基于语义泛化的世界模型用于规划
机构 * Independent(独立) ; EPFL(瑞士联邦理工学院洛桑) ; Beihang University(北京航空航天大学) ; University of Toronto(多伦多大学) ; NUS(新加坡国立大学)
AI总结 本文提出基于视觉-语言对齐潜在空间的世界模型,用于改进视觉-运动模型控制,实现更广泛的语义泛化能力。
探索知识冲突以实现忠实的LLM推理:基准与方法
机构 * School of Computer Science and Technology, Xi'an Jiaotong University(西安交通大学计算机科学与技术学院) ; Department of Computer Science, The University of Manchester(曼彻斯特大学计算机科学系) ; Hunan University(湖南大学) ; National University of Singapore(新加坡国立大学)
AI总结 本文提出ConflictQA基准,揭示LLM在处理跨源知识冲突时的不足,并提出XoT框架以提升异构冲突证据推理的可靠性。
Comments Accepted at SIGIR 2026
穿透欺骗:在多模态新闻中揭示误导性创作者意图
机构 * National University of Singapore(新加坡国立大学) ; Yunnan University(云南大学)
AI总结 本文提出DeceptionDecoded基准数据集,通过意图引导模拟框架生成12000组图像-描述对,旨在揭示多模态虚假信息中的误导性意图,评估14种最新视觉-语言模型,发现其在意图推理上存在不足,提出系统合成数据以提升模型意图理解能力。
Comments ICLR 2026
通过高阶代理对齐实现多模态数据集蒸馏
机构 * University of Science and Technology of China(中国科学技术大学) ; Xidian University(西安电子科技大学) ; National University of Singapore(新加坡国立大学) ; The University of Sydney(悉尼大学)
AI总结 本文提出HoPA方法,通过紧凑代理捕捉高阶跨模态对齐,解决多模态数据集蒸馏中的异质性和复杂跨模态交互问题,实现可扩展的联合蒸馏。
WaveMoE: 一种用于时间序列预测的小波增强混合专家基础模型
机构 * Sun Yat-sen University(中山大学) ; Xiaomi Corporation(小米集团) ; National University of Singapore(新加坡国立大学)
AI总结 WaveMoE通过整合小波域表示提升时间序列预测能力,采用双路径架构和共享专家路由机制,实验表明其在16个基准数据集上具有提升预测性能的潜力。
Comments Presented at ICLR 2026 TSALM Workshop (1st Workshop on Time Series in the Age of Large Models)
从感知到规划:通过课程学习进化自主任务导向的空间时间推理
机构 * Zhejiang University(浙江大学) ; Tianjin University(天津大学) ; Qingdao University(青岛大学) ; Shanghai Jiao Tong University(上海交通大学) ; National University of Singapore(新加坡国立大学)
AI总结 本文提出EgoTSR框架,通过课程学习提升任务导向的空间时间推理能力,解决静态感知和动态环境中的时空幻觉问题,实验显示其在长周期推理任务中准确率达92.4%。
CARO:用于鲁棒内容审核的类比推理优化
机构 * National Engineering Laboratory for Big Data System Computing Technology(大数据系统计算技术国家工程实验室) ; Shenzhen University(深圳大学) ; Tsinghua University(清华大学) ; National University of Singapore(新加坡国立大学)
AI总结 CARO通过两阶段训练框架提升LLM的类比推理能力,有效缓解内容审核中的误导性决策短路问题,实验显示其在模糊审核基准上平均F1得分提升24.9%。
Comments Accepted to ACL 2026 findings; under official publication process
CHAIRO:面向LLMs的上下文分层类比归纳与推理优化
机构 * National Engineering Laboratory for Big Data System Computing Technology(国家大数据系统计算技术工程实验室) ; Shenzhen University(深圳大学) ; Tsinghua University(清华大学) ; National University of Singapore(新加坡国立大学)
AI总结 本文提出CHAIRO框架,通过类比示例提升规则归纳和决策可靠性,在内容审核中实现更准确和可解释的规则生成。
Comments Accepted to ACL 2026 main conference; under official publication process
UDAPose:无监督领域适应用于低光人类姿态估计
机构 * University of Mississippi(密西西比大学) ; National University of Singapore(新加坡国立大学) ; Duksung Women’s University(德成女子大学) ; ASUS Intelligent Cloud Services (AICS)(华硕智能云服务(AICS))
AI总结 UDAPose提出了一种新的框架,通过合成低光图像并动态融合视觉线索与姿态先验,提升低光环境下的人体姿态估计性能。
Comments Accepted at CVPR 2026
AIM-Bench:通过细粒度分层控制进行情感图像操纵的基准测试与改进
机构 * Xi'an Jiaotong University(西安交通大学) ; Zhengzhou University(郑州大学) ; National University of Singapore(新加坡国立大学) ; Fudan University(复旦大学) ; Zhejiang Lab(之江实验室)
AI总结 本文提出AIM-Bench,通过细粒度分层控制进行情感图像操纵的基准测试,改进了现有图像编辑基准的不足,提出了AIM-40k数据集并提升了模型性能。
基于不确定性的集成学习在心脏磁共振语义分割中的应用
机构 * Sichuan University(四川大学) ; National University of Singapore(新加坡国立大学) ; West China Women's and Children's Hospital(四川大学华西第二医院)
AI总结 本文提出基于不确定性的集成学习方法,通过全局不确定性提升心肌分割整体和末Slice性能,引入End Coefficient量化末Slice准确性,实验表明在ACDC和M&Ms数据集上取得接近SOTA的Dice相似系数和更优的末Slice分割效果。
通过双重投影实现闭式概念擦除
机构 * National University of Singapore(新加坡国立大学) ; Shanghai Jiao Tong University(上海交通大学) ; University of Nevada, Reno(内华达大学里诺分校)
AI总结 本文提出一种无需训练的线性变换框架,通过两次闭式步骤实现安全高效的概念擦除,实验显示其性能优于现有方法并能更忠实保留非目标概念。
随机Kaczmarz与SGD在贪心步长下的最后一轮收敛
机构 * University of Michigan(密歇根大学) ; National University of Singapore(新加坡国立大学)
AI总结 研究SGD在贪心步长下对光滑二次插值问题的最后轮收敛,证明t次迭代达到O(1/t^{3/4})收敛速度,改进了Attia等人提出的O(1/t^{1/2})保证。
R2E-VID:通过时间门控的两阶段鲁棒路由用于弹性边缘-云视频推理
机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Peng Cheng Laboratory(鹏城实验室) ; National University of Singapore(新加坡国立大学) ; Beijing Kuaishou Technology Co., Ltd.(北京快手科技有限公司)
AI总结 本文提出R2E-VID框架,通过时间门控机制实现边缘-云视频推理的两阶段鲁棒路由,提升路由效率并降低计算成本。
Comments 10 pages, 10 figures
LETGAMES: 一种基于大语言模型的认知训练游戏化方法用于认知障碍患者
机构 * Shanghai University of Finance and Economics(上海财经大学) ; Northwest Polytechnical University(西北工业大学) ; Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究所) ; College of Computer Science, Sichuan University(四川大学计算机学院)
AI总结 LETGAMES通过大语言模型生成个性化互动叙事游戏,针对特定认知领域设计挑战,并通过对话策略提供指导,通过心理学基础评估协议验证其有效性,展示了在认知训练工具中的潜力。
Comments 53 pages
KSDiff: 关键帧增强型语音感知双路径扩散模型用于面部动画
机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院)
AI总结 本文提出KSDiff框架,通过双路径语音编码器和关键帧建立学习模块,提升语音驱动面部动画的唇同步和头部姿态自然度。
Comments Paper accepted at ICASSP 2026, 5 pages, 3 figures, 3 tables
CoMelSinger:基于离散令牌的零样本歌唱合成与结构旋律控制与指导
机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院)
AI总结 CoMelSinger通过离散编码器模型实现零样本歌唱合成,采用结构化旋律控制与对比学习策略,提升旋律准确性与音色一致性。
Comments Published in IEEE Transactions on Audio, Speech and Language Processing (TASLP). 13 pages, 5 figures, 5 tables