arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanyang Technological University(南洋理工大学)

共收录 2380
2512.12602 2026-05-11 cs.LG

Exact Flow Linear Attention: Exact Solution from Continuous-Time Dynamics

精确流线性注意力:从连续时间动态中获得精确解

Jingdi Lei, Di Zhang, Soujanya Poria

机构 * Nanyang Technological University(南洋理工大学) Fudan University(复旦大学)

AI总结 本文提出EFLA,通过连续时间动态的精确闭式流替代delta规则线性注意力的一阶更新,保持其代数结构和效率,提升稳定性和性能。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07510 2026-05-11 cs.CV cs.CL cs.IR

InterLV-Search: Benchmarking Interleaved Multimodal Agentic Search

InterLV-Search:交错多模态代理搜索基准测试

Bohan Hou, Jiuning Gu, Jiayan Guo, Ronghao Dang, Sicong Leng, Xin Li, Xuemeng Song, Jianfei Yang

机构 * Nanyang Technological University(南洋理工大学) Shandong University(山东大学) Damo Academy, Alibaba Group(阿里达摩院)

AI总结 本文提出InterLV-Search基准测试,用于评估交错语言-视觉代理搜索,包含多层级任务,涵盖主动视觉证据搜索、受控离线交错多模态搜索和开放网页交错多模态搜索,揭示当前系统在视觉证据获取、搜索控制及多模态证据整合方面的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07481 2026-05-11 cs.CR cs.AI

Vaporizer: Breaking Watermarking Schemes for Large Language Model Outputs

Vaporizer: 拆解大型语言模型输出的水印方案

Jonathan Hong Jin Ng, Anh Tu Ngo, Anupam Chattopadhyay

机构 * College of Computing and Data Science(计算与数据科学学院) Nanyang Technological University(南洋理工大学)

AI总结 本文研究了最新水印方案的有效性,通过多种攻击策略揭示现有水印系统的优劣,提出改进安全性的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07175 2026-05-11 cs.LG cs.AI

Learning Multi-Relational Graph Representations for DNA Methylation-Based Biological Age Estimation

学习多关系图表示以用于基于DNA甲基化的生物年龄估计

Qing Qing, Xikun Zhang, Zhongyuan Zhang, Jiarui Liu, Xingtong Yu, Xiaotao Shen, Ziqi Xu, Qixin Zhang, Zhe Wang, Renqiang Luo

机构 * Jilin University(吉林大学) RMIT University(皇家墨尔本理工大学) The Chinese University of Hong Kong(香港中文大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出RelAge-GNN框架,通过构建三种互补图捕捉CpG位点间的共甲基化、基因组共定位和基因级关联,提升DNA甲基化数据的生物年龄预测准确性与相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06812 2026-05-11 cs.AI

Towards Security-Auditable LLM Agents: A Unified Graph Representation

迈向安全可审计的LLM代理:一种统一的图表示

Chaofan Li, Lyuye Zhang, Jintao Zhai, Siyue Feng, Xichun Yang, Huahao Wang, Shihan Dou, Yu Ji, Yutao Hu, Yueming Wu, Yang Liu, Deqing Zou

机构 * Huazhong University of Science and Technology(华中科技大学) Nanyang Technological University(南洋理工大学) Fudan University(复旦大学) Chongqing University of Posts and Telecommunications(重庆邮电大学) Donghua University(东华大学)

AI总结 本文提出Agent-BOM统一图表示,用于解决LLM代理系统中执行意图与物理事件间的语义鸿沟问题,通过构建分层属性有向图实现安全审计与风险评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21824 2026-05-11 cs.CV cs.AI

SteelDefectX: A Multi-Form Vision-Language Dataset and Benchmark for Steel Surface Defect Analysis

SteelDefectX:一种用于钢铁表面缺陷分析的多形式视觉-语言数据集和基准

Shuxian Zhao, Jie Gui, Baosheng Yu, Dacheng Tao

机构 * Southeast University(东南大学) Purple Mountain Laboratories(紫金山实验室) Nanyang Technological University(南洋理工大学)

AI总结 本文提出SteelDefectX数据集,包含7778张图像和25种缺陷类别,提供多形式文本标注,涵盖视觉-语言分类、分割及跨数据集迁移等任务,揭示文本设计对工业视觉-语言学习的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05359 2026-05-11 cs.CV

Multimodal Latent Reasoning via Hierarchical Visual Cues Injection

多模态潜在推理 via 分层视觉提示注入

Yiming Zhang, Qiangyu Yan, Borui Jiang, Kai Han

机构 * Nanyang Technological University(南洋理工大学) Huawei Noah's Ark Lab(华为诺亚实验室)

AI总结 本文提出HIVE框架,通过分层视觉提示注入实现多模态潜在推理,提升模型在对齐潜在空间中的多步推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23770 2026-05-11 cs.LG cs.AI

SB-TRPO: Towards Safe Reinforcement Learning with Hard Constraints

SB-TRPO:迈向带有硬约束的安全强化学习

Dominik Wagner, Ankit Kanwar, Luke Ong

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算学院和数据科学学院,新加坡) Sony Corporation(索尼公司)

AI总结 SB-TRPO通过动态平衡成本降低与奖励提升,提供硬约束强化学习的原理性算法,确保安全性和奖励的改进,实验显示其在安全约束下平衡性能最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18085 2026-05-11 cs.RO cs.AI

Continually Evolving Skill Knowledge in Vision Language Action Model

视觉语言动作模型中的持续演进技能知识

Yuxuan Wu, Guangming Wang, Zhiheng Yang, Tianchen Deng, Maoqing Yao, Brian Sheil, Hesheng Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) University of Cambridge(剑桥大学) Beihang University(北京航空航天大学) Nanyang Technological University(南洋理工大学) MIT SMART(麻省理工学院SMART实验室) AgiBot

AI总结 本文提出Stellar VLA框架,通过无需增加参数的持续模仿学习方法,实现视觉语言动作模型的持续知识积累,实验表明其在任务专精和知识转移方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09907 2026-05-11 cs.AI cs.CV

Learning to Pose Problems: Reasoning-Driven and Solver-Adaptive Data Synthesis

学习提出问题:基于推理和求解器适应的数据合成

Yongxian Wei, Yilin Zhao, Zixuan Hu, Li Shen, Xinrui Chen, Runxi Cheng, Sinan Du, Hao Yu, Chun Yuan, Dian Li

机构 * Tsinghua University(清华大学) Tencent(腾讯) Nanyang Technological University(南洋理工大学) Sun Yat-sen University(中山大学)

AI总结 本文提出一种基于推理和求解器适应的数据合成方法,通过生成相关问题对并利用推理模型生成中间步骤,提升问题设计策略,实验表明在多个基准上实现了3.4%的平均提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09598 2026-05-11 cs.LG

Amortized Multi-Objective Optimization Across Tasks with Generative Solution Modeling

跨任务的 amortized 多目标优化与生成解建模

Tingyang Wei, Jiao Liu, Abhishek Gupta, Chin Chun Ooi, Puay Siew Tan, Yew-Soon Ong

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算与数据科学学院,新加坡) School of Mechanical Sciences, Indian Institute of Technology, Goa, India(印度理工学院Goa分校机械科学学院,印度) Centre for Frontier AI Research, Agency for Science, Technology and Research, Singapore(新加坡科技研究局前沿人工智能研究中心) Singapore Institute of Manufacturing Technology, Agency for Science, Technology and Research, Singapore(新加坡制造技术研究所,新加坡科技研究局)

AI总结 本文提出一种新型参数化多目标贝叶斯优化器,通过生成解采样和跨任务协同搜索,实现连续任务偏好空间中的解预测,避免重复昂贵评估。

Comments Accepted by IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06481 2026-05-08 cs.RO

OA-WAM: Object-Addressable World Action Model for Robust Robot Manipulation

OA-WAM:面向鲁棒机器人操作的对象可寻址世界动作模型

Yushan Liu, Peibo Sun, Shoujie Li, Yifan Xie, Lingfeng Zhang, Xintao Chao, Shiyuan Dong, Fang Chen, Xiao-Ping Zhang, Wenbo Ding

机构 * Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学)

AI总结 OA-WAM通过分解帧为N+1槽状态,结合文本、图像和动作历史,提升机器人操作的鲁棒性,其可寻址对象状态在场景扰动下表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06264 2026-05-08 cs.LG

Can Attribution Predict Risk? From Multi-View Attribution to Planning Risk Signals in End-to-End Autonomous Driving

属性能否预测风险?从多视图属性到端到端自动驾驶中的规划风险信号

Le Yang, Ruoyu Chen, Haijun Liu, Jiawei Liang, ShangQuan Sun, Xiaochun Cao

机构 * Sun Yat-sen University(中山大学) University of Chinese Academy of Sciences(中国科学院大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出了一种层次化属性框架,用于端到端规划中的风险预测,通过提取三种属性统计作为预测信号,提升了对轨迹误差和碰撞检测的预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06165 2026-05-08 cs.AI

Post Reasoning: Improving the Performance of Non-Thinking Models at No Cost

事后推理:在不增加成本的情况下提升非思考模型的性能

Richmond Sin Jing Xuan, Rishabh Bhardwaj, Soujanya Poria

机构 * Nanyang Technological University(南洋理工大学)

AI总结 本文提出Post-Reasoning方法,通过在生成最终回答后让模型解释答案,提升指令微调模型的性能,且不增加延迟或token成本,在117种模型-基准设置中提升了88.19%的性能,平均相对提升17.37%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06076 2026-05-08 cs.CL

Navigating by Old Maps: The Pitfalls of Static Mechanistic Localization in LLM Post-Training

用旧地图导航:在LLM微调中静态机械定位的陷阱

Hang Chen, Jiaying Zhu, Hongyang Chen, Hongxu Liu, Xinyu Yang, Wenya Wang

机构 * School of Computer Science and Technology(计算机科学与技术学院) Xi’an Jiaotong University(西安交通大学) School of Computer Science and Engineering(计算机科学与工程学院) The Chinese University of Hong Kong(香港中文大学) Shaanxi Co., Ltd(陕西有限公司) China Mobile Group(中国移动集团) College of Computing and Data Science(计算与数据科学学院) Nanyang Technological University(南洋理工大学)

AI总结 研究探讨了在LLM微调中静态机械定位的局限性,提出三种新指标分析电路演变,并强调需要前瞻性机制定位。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05951 2026-05-08 cs.AI

HaM-World: Soft-Hamiltonian World Models with Selective Memory for Planning

HaM-World: 带选择性记忆的软哈密顿世界模型用于规划

Haoyun Tang, Haodong Cui, Keyao Xu, Kun Wang, Zhandong Mei

机构 * Xi’an Jiaotong University(西安交通大学) Huazhong University of Science and Technology(华中科技大学) Nankai University(南开大学) Nanyang Technological University(南洋理工大学)

AI总结 HaM-World通过分解潜在状态为规范子空间和上下文子空间,结合Mamba选择性状态空间记忆,提升规划稳定性与鲁棒性,实现高精度预测和任务完成。

Comments 22 pages, 5 figures. Code: https://github.com/HaoyunT/HaM_World

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00113 2026-05-08 cs.MA cs.AI cs.CE cs.CY cs.SI

AI Agents Alone Are Not (Yet) Sufficient for Social Simulation

仅靠AI代理不足以进行社会模拟

Yiming Li, Dacheng Tao

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算机与数据科学学院,新加坡)

AI总结 本文指出LLM代理单独使用不足以实现真实的社会动态,提出需考虑环境互动和调度机制的统一框架。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08110 2026-05-08 cs.CV cs.CL cs.LG

The ART of Composition: Attention-Regularized Training for Compositional Visual Grounding

构图的艺术:用于组合视觉定位的注意力正则化训练

Jiayun Luo, Mir Rayat Imtiaz Hossain, Pritam Sarkar, Boyang Li, Leonid Sigal

机构 * The University of British Columbia(不列颠哥伦比亚大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出CompART,通过分解标题为以对象为中心的短语并构建复合短语,提升多对象定位能力,验证了其在多种视觉语言模型上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05818 2026-05-08 cs.CR cs.AI cs.CL

LeakDojo: Decoding the Leakage Threats of RAG Systems

LeakDojo:解码RAG系统的泄漏威胁

Maosen Zhang, Jianshuo Dong, Boting Lu, Wenyue Li, Xiaoping Zhang, Tianwei Zhang, Han Qiu

机构 * Tsinghua University, China(清华大学, 中国) Ant International, China(蚂蚁集团, 中国) Nanyang Technological University, Singapore(南洋理工大学, 新加坡)

AI总结 LeakDojo通过可控评估揭示RAG系统泄漏风险,发现查询生成和对抗指令独立影响泄漏,且指令能力越强泄漏风险越高,RAG可信度提升可能增加泄漏风险。

Comments Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05776 2026-05-08 cs.AI

HEDP: A Hybrid Energy-Distance Prompt-based Framework for Domain Incremental Learning

HEDP:一种基于能量-距离提示的领域增量学习混合框架

Yu Feng, Zhen Tian, Haoran Luo, Xie Yu, Diancheng Cheng, Haoyue Zheng, Shuai Lyu, Ping Zong, Lianyuan Li, Xin Ge, Yifan Zhu

机构 * China Mobile Research Institute, China(中国移动研究院) Beihang University, China(北京航空航天大学) Beijing University of Posts and Telecommunications, China(北京邮电大学) Nanyang Technological University, Singapore(南洋理工大学)

AI总结 HEDP提出一种混合能量-距离提示框架,通过能量正则化损失和混合能量-距离加权机制提升领域分离性和适应性,在多个基准上实现2.57%的准确率提升,有效缓解灾难性遗忘。

Comments 13 pages, 6 figures, Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05668 2026-05-08 cs.AI cs.CV

Large Vision-Language Models Get Lost in Attention

大视觉-语言模型在注意力中迷失

Gongli Xi, Ye Tian, Mengyu Yang, Huahui Yi, Liang Lin, Xiaoshuai Hao, Kun Wang, Wendong Wang

机构 * School of Cyberspace Security, Beijing University of Posts(信息安全学院,北京邮电大学) State Key Laboratory of Networking and Switching Technology, Beijing University of Posts(网络与交换技术国家重点实验室,北京邮电大学) School of Computer Science (National Pilot Software Engineering School), Beijing University of Posts(计算机科学学院(国家试点软件工程学院),北京邮电大学) Nanyang Technological University, Singapore(新加坡南洋理工大学) Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China(信息工程研究所,中国科学院北京研究院)

AI总结 研究揭示大视觉-语言模型中注意力与前馈网络的作用差异,提出基于信息论和几何的统一框架,发现注意力模块存在冗余问题。

Comments 25 pages, 10 figures. Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05267 2026-05-08 cs.SE cs.AI

Bridging Generation and Training: A Systematic Review of Quality Issues in LLMs for Code

连接生成与训练:LLMs用于代码的品质问题系统综述

Kaifeng He, Xiaojun Zhang, Peiliang Cai, Mingwei Liu, Yanlin Wang, Chong Wang, Kaifeng Huang, Bihuan Chen, Xin Peng, Zibin Zheng

机构 * Sun Yat-sen University(中山大学) Nanyang Technological University(南洋理工大学) Tongji University(同济大学) Fudan University(复旦大学)

AI总结 本文系统综述114项研究,探讨训练数据质量如何影响代码生成质量,建立统一分类体系,提出18种传播机制,并总结检测与缓解技术,指出质量保障正从事后过滤转向数据驱动的闭环修复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26227 2026-05-08 cs.CV

HOI-aware Adaptive Network for Weakly-supervised Action Segmentation

面向HOI的自适应网络用于弱监督动作分割

Runzhong Zhang, Suchen Wang, Yueqi Duan, Yansong Tang, Yue Zhang, Yap-Peng Tan

机构 * Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) Beijing Jiaotong University(北京交通大学)

AI总结 本文提出AdaAct网络,通过利用视频级的时空局部人-物交互作为先验知识,动态适应HOI序列以区分模糊动作,实验验证了方法的有效性。

Comments Accepted to IJCAI 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13670 2026-05-08 cs.LG

Advancing Analytic Class-Incremental Learning through Vision-Language Calibration

通过视觉-语言校准推进分析类增量学习

Binyu Zhao, Wei Zhang, Xingrui Yu, Zhaonian Zou, Ivor Tsang

机构 * School of Computer Science and Technology, Harbin Institute of Technology, China(哈尔滨工业大学计算机科学与技术学院) CFAR and IHPC, Agency for Science, Technology and Research (A*STAR), Singapore(新加坡科技研究局(A*STAR)的CFAR和IHPC) College of Computing and Data Science, Nanyang Technological University, Singapore(新加坡南洋理工大学计算与数据科学学院)

AI总结 本文提出VILA框架,通过双级视觉语言校准策略解决预训练模型分析类增量学习中的表示刚性问题,提升学习效率与稳定性,在多个基准测试中表现优异。

Comments 20 pages, 11 figures, 9 tables. Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07322 2026-05-08 cs.RO cs.AI

Action-to-Action Flow Matching

动作到动作流匹配

Jindou Jia, Gen Li, Xiangyu Chen, Tuo An, Yuxuan Hu, Jingliang Li, Xinying Guo, Jianfei Yang

机构 * MARS Lab, Nanyang Technological University(南洋理工大学MARS实验室)

AI总结 本文提出A2A方法,通过利用前一动作的本体感知信息进行初始化,避免了随机噪声采样带来的高延迟问题,提升了动作生成的效率和鲁棒性。

Comments 20 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19972 2026-05-08 cs.CV

Boosting Reasoning in Large Multimodal Models via Activation Replay

通过激活回放提升大多模态模型的推理能力

Yun Xing, Xiaobin Hu, Qingdong He, Jiangning Zhang, Shuicheng Yan, Shijian Lu, Yu-Gang Jiang

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(国立新加坡大学) Tencent Youtu Lab(腾讯云图实验室) Zhejiang University(浙江大学) Fudan University(复旦大学)

AI总结 本文通过激活回放方法提升大模型的多模态推理能力,通过操控低熵激活来增强推理性能,验证了该方法在数学、视觉代理和视频推理等场景中的有效性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14594 2026-05-08 cs.AI

SynBench: A Benchmark for Differentially Private Text Generation

SynBench:差分隐私文本生成的基准测试

Yidan Sun, Viktor Schlegel, Srinivasan Nandakumar, Iqra Zahid, Yuping Wu, Yulong Wu, Hao Li, Jie Zhang, Warren Del-Pinto, Goran Nenadic, Siew Kei Lam, Anil Anthony Bharath

机构 * Imperial College London, Imperial Global Singapore(帝国学院伦敦,帝国全球新加坡) University of Manchester, United Kingdom(曼彻斯特大学,英国) CFAR and IHPC, Agency for Science, Technology and Research (A*STAR), Singapore(CFAR和IHPC,科技研究局(A*STAR),新加坡) Nanyang Technological University, Singapore(南洋理工大学,新加坡) Imperial College London, United Kingdom(帝国学院伦敦,英国)

AI总结 本文提出SynBench基准测试,通过标准化评估框架和隐私审计,评估不同规模的LLM生成模型在差分隐私下的性能,揭示隐私数据生成与预训练数据的关联性对生成质量的影响。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16516 2026-05-08 cs.LG cs.AI

Amortized Linear-time Exact Shapley Value for Product-Kernel Methods

产品核方法的 amortized 线性时间精确 Shapley 值

Majid Mohammadi, Siu Lun Chau, Krikamol Muandet

机构 * Rational Intelligence Lab, CISPA Helmholtz Center for Information Security(理性智能实验室,信息安全中心(CISPA)) Department of Computer Science, Vrije Universiteit Amsterdam(阿姆斯特丹自由大学计算机科学系) Epistemic Intelligence & Computation Lab, College of Computing & Data Science, Nanyang Technological University(认知智能与计算实验室,南洋理工大学计算机与数据科学学院)

AI总结 本文提出 PKeX-Shapley 算法,利用产品核的乘法结构在二次时间内精确计算所有特征的 Shapley 值,实现 amortized 线性时间 per 特征,扩展至 MMD 和 HSIC 等统计方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01638 2026-05-05 cs.CV

Omni-Fake: Benchmarking Unified Multimodal Social Media Deepfake Detection

Omni-Fake:面向社交媒体的统一多模态深度伪造检测基准测试

Tianxiao Li, Zhenglin Huang, Haiquan Wen, Yiwei He, Xinze Li, Bingyu Zhu, Wuhui Duan, Congang Chen, Zeyu Fu, Yi Dong, Baoyuan Wu, Jason Li, Guangliang Cheng

机构 * University of Liverpool(利物浦大学) University of Exeter(埃克塞特大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Nanyang Technological University(南洋理工大学)

AI总结 本文提出Omni-Fake多模态深度伪造检测基准,包含大规模数据集和分布外基准,支持联合检测-定位-解释协议,并提出基于强化学习的多模态检测器,提升检测准确性和可解释性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01520 2026-05-05 cs.CV cs.CL

MIRL: Mutual Information-Guided Reinforcement Learning for Vision-Language Models

MIRL:基于互信息的强化学习用于视觉-语言模型

Yin Zhang, Jiaxuan Zhao, Zonghan Wu, Zengxiang Li, Junfeng Fang, Kun Wang, Qingsong Wen, Yilei Shao

机构 * School of Mathematics, Tianjin University, Tianjin, China(天津大学数学学院) Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China(中国科学院信息工程研究所) Shanghai Advanced Institute of Finance (SAIFS), East China Normal University, Shanghai, China(上海先进金融研究所(SAIFS),东华大学) ENN Group, Digital Technology Research Institute, China(ENN集团,数字技术研究院) Nanyang Technological University, Singapore(南洋理工大学) National University of Singapore, Singapore(新加坡国立大学)

AI总结 MIRL通过利用生成描述与视觉输入之间的互信息,解决视觉语言模型在复杂推理任务中的感知误差和幻觉问题,提升回答准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏