arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

National University of Singapore(新加坡国立大学)

共收录 2370
2510.12476 2026-05-01 cs.CL cs.AI

When Personalization Tricks Detectors: The Feature-Inversion Trap in Machine-Generated Text Detection

当个性化技巧欺骗检测器:机器生成文本检测中的特征反向陷阱

Lang Gao, Xuhui Li, Chenxi Wang, Mingzhe Li, Wei Liu, Zirui Song, Jinghui Zhang, Rui Yan, Preslav Nakov, Xiuying Chen

机构 * MBZUAI ByteDance(字节跳动) National University of Singapore(新加坡国立大学) Wuhan University(武汉大学)

AI总结 本文提出了一种检测器在个性化文本中性能变化的预测方法,揭示了特征反向陷阱对检测器鲁棒性的影响,并通过实验验证了该方法的有效性。

Comments Oral of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06752 2026-04-30 cs.LG cs.NA math.NA stat.ME stat.ML

Latent Autoencoder Ensemble Kalman Filter for Nonlinear Data assimilation

潜在自编码器集合卡尔曼滤波器用于非线性数据同化

Xin T. Tong, Yanyan Wang, Liang Yan

机构 * Department of Mathematics, National University of Singapore(新加坡国立大学数学系) School of Mathematics, Southeast University(东南大学数学学院)

AI总结 本文提出了一种潜在自编码器集合卡尔曼滤波器,通过在学习的潜在空间中重构同化问题,解决传统卡尔曼滤波在强非线性动态下的性能问题,实现稳定且可解释的同化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08826 2026-04-30 cs.CL cs.AI

Affective Flow Language Model for Emotional Support Conversation

情感流动语言模型用于情感支持对话

Chenghui Zou, Ning Wang, Tiesunlong Shen, Luwei Xiao, Chuan Ma, Xiangpeng Li, Rui Mao, Erik Cambria

机构 * College of computer science, Chongqing University(重庆大学计算机学院) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出AFlow模型,通过建模多轮对话中的连续情感流动,提供细粒度监督以提升情感支持对话中的策略一致性和共情响应质量。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03691 2026-04-30 cs.RO

Source-Free Bistable Fluidic Gripper for Size-Selective and Stiffness-Adaptive Grasping

无源双稳液体夹爪用于尺寸选择性和刚度自适应抓取

Zhihang Qin, Yueheng Zhang, Wan Su, Linxin Hou, Shenghao Zhou, Zhijun Chen, Yu Jun Tan, Cecilia Laschi

机构 * Advanced Robotics Centre, National University of Singapore(新加坡国立大学先进机器人中心) Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电子与计算机工程系)

AI总结 本文提出一种无外部能源的双稳液体夹爪,通过内部液体重新分布实现稳定且尺寸选择性的抓取,具备自适应刚度调节能力,适用于水下和野外环境。

Journal ref Proc. IEEE Int. Conf. on Soft Robotics (RoboSoft), Kanazawa, Japan, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25914 2026-04-29 cs.CL

DV-World: Benchmarking Data Visualization Agents in Real-World Scenarios

DV-World:在现实场景中评估数据可视化代理的基准测试

Jinxiang Meng, Shaoping Huang, Fangyu Lei, Jingyu Guo, Haoxiang Liu, Jiahao Su, Sihan Wang, Yao Wang, Enrui Wang, Ye Yang, Hongze Chai, Jinming Lv, Anbang Yu, Huangjing Zhang, Yitong Zhang, Yiming Huang, Zeyao Ma, Shizhu He, Jun Zhao, Kang Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) National University of Singapore(新加坡国立大学) Renmin University of China(中国人民大学)

AI总结 DV-World通过260个任务评估数据可视化代理在现实专业生命周期中的能力,涵盖表格操作、视觉进化和意图对齐,采用混合评估框架揭示现有模型在复杂数据可视化挑战中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25562 2026-04-29 cs.CR cs.AI

SnapGuard: Lightweight Prompt Injection Detection for Screenshot-Based Web Agents

SnapGuard: 基于截图的轻量级提示注入检测方法

Mengyao Du, Han Fang, Haokai Ma, Jiahao Chen, Kai Xu, Quanjun Yin, Ee-Chien Chang

机构 * National University of Defense Technology(国防科技大学) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学)

AI总结 针对基于截图的网络代理面临的提示注入攻击问题,提出SnapGuard方法,通过视觉稳定指标和文本信号分析实现高效检测,达到F1得分0.75,速度提升8倍。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25259 2026-04-29 cs.LG

DGLight: DQN-Guided GRPO Fine-Tuning of Large Language Models for Traffic Signal Control

DGLight:基于DQN的GRPO对大语言模型进行交通信号控制的微调

Chenbo Yu

机构 * National University of Singapore(新加坡国立大学)

AI总结 本文提出DGLight框架,通过预训练大语言模型适应交通信号控制,采用CoLight深度Q网络估计交通状态的动作价值,并利用GRPO优化策略,实现可解释的信号决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25128 2026-04-29 cs.CV

ResetEdit: Precise Text-guided Editing of Generated Image via Resettable Starting Latent

ResetEdit: 通过可重置的起始潜在实现生成图像的精确文本引导编辑

Hanyi Wang, Han Fang, Zheng Wang, Shilin Wang, Ee-Chien Chang

机构 * Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(科学技术大学) Wuhan University(武汉大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出ResetEdit框架,通过在生成过程中嵌入可恢复的潜在信息,实现高精度文本引导编辑,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22339 2026-04-29 cs.CV

Flow4DGS-SLAM: Optical Flow-Guided 4D Gaussian Splatting SLAM

Flow4DGS-SLAM:基于光流的4D高斯点划法SLAM

Yunsong Wang, Gim Hee Lee

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院)

AI总结 本文提出基于光流的4D高斯点划法SLAM框架,通过光流引导实现动态环境的高效重建与姿态估计,结合时间一致性模型提升训练效率和动态重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07802 2026-04-29 cs.CV cs.AI

Latent Anomaly Knowledge Excavation: Unveiling Sparse Sensitive Neurons in Vision-Language Models

潜在异常知识挖掘:揭示视觉-语言模型中的稀疏敏感神经元

Shaotian Li, Shangze Li, Chuancheng Shi, Wenhua Wu, Yanqiu Wu, Xiaohan Yu, Fei Shen, Tat-Seng Chua

机构 * Macquarie University(麦考瑞大学) Nanjing University of Science and Technology(南京理工大学) The University of Sydney(悉尼大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出LAKE框架,通过挖掘视觉-语言模型中稀疏敏感神经元,实现异常检测的内在可解释性,实验表明其在工业基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26783 2026-04-29 cs.CV cs.AI

Can We Change the Stroke Size for Easier Diffusion?

我们能否通过改变笔触大小来使扩散更简单?

Yunwei Bai, Ying Kiat Tan, Yao Shu, Tsuhan Chen

机构 * National University of Singapore(新加坡国立大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 本文研究通过控制笔触大小改变监督目标的粗糙度,以缓解低信噪比下的预测挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24317 2026-04-28 cs.CV

Don't Pause! Every prediction matters in a streaming video

不要暂停!在流媒体视频中每个预测都至关重要

Dibyadip Chatterjee, Zhanzhong Pang, Fadime Sener, Yale Song, Angela Yao

机构 * National University of Singapore(新加坡国立大学) Google Inc.(谷歌公司)

AI总结 本文提出SPOT-Bench基准,通过多轮主动查询评估流媒体感知能力,引入Timeliness-F1指标,发现离线模型易产生无用预测,提出AsynKV方法提升流媒体响应性能。

Comments 29 pages, 14 figures; https://dibschat.github.io/SPOT-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11541 2026-04-28 cs.LG cs.AI

Question-Adaptive Graph Learning for Multi-hop Retrieval Augmented Generation

针对多跳检索的问答图学习

Yuchen Yan, Peiyan Zhang, Zhihua Liu, Hao Wang, Yatao Bian, Weiming Li, Xiaoshuai Hao

机构 * Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系) Hong Kong University of Science(香港科学大学)

AI总结 本文提出一种多跳问答检索的图学习框架,通过多信息层级知识图和问题自适应图神经网络,提升复杂语义问题的理解与噪声抑制能力,实验表明在高跳数问题上提升33.8%。

Comments Accepted by SIGIR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12009 2026-04-28 cs.CV

LatentStealth: Unnoticeable and Efficient Adversarial Attacks on Expressive Human Pose and Shape Estimation

LatentStealth: 一种无痕且高效的对抗攻击方法用于表达性人体姿态和形状估计

Zhiying Li, Guanggang Geng, Yeying Jin, Shuyuan Lin, Fengyuan Ma, Zhaoxin Fan, Lili Wang

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, School of Artificial Intelligence, Beihang University(北京未来区块链与隐私计算高级创新中心,人工智能学院,北航) College of Cyber Security, Jinan University(网络安全学院,暨南大学) National University of Singapore(新加坡国立大学) School of Computer Science and Information Engineering, Hefei University of Technology(计算机科学与信息工程学院,合肥工业大学) School of Computer Science and Engineering, Beihang University(计算机科学与工程学院,北航)

AI总结 本文提出LatentStealth方法,通过利用自然图像的结构化潜在表示,在潜在空间中生成并优化对抗扰动,实现无痕高效的对抗攻击,揭示当前系统关键安全漏洞。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24029 2026-04-28 cs.CV cs.CL cs.IR cs.MM

DeepTaxon: An Interpretable Retrieval-Augmented Multimodal Framework for Unified Species Identification and Discovery

DeepTaxon: 一种可解释的检索增强多模态框架,用于统一的物种识别与发现

Jiawei Wang, Ming Lei, Yaning Yang, Xinyan Lin, Yuquan Le, Qiwei Ma, Zhiwei Xu, Zheqi Lv, Yuchen Ang, Zhe Quan, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) Hunan University(湖南大学) Xiangtan University(湘潭大学) Hunan Normal University(湖南师范大学) Zhejiang University(浙江大学) Cornell University(康奈尔大学) Meituan(美团)

AI总结 DeepTaxon通过可解释的检索增强多模态框架,统一物种识别与发现,通过检索证据进行链式推理,提升识别和发现的准确性与可解释性。

Comments 13 pages, 6 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23775 2026-04-28 cs.RO

Vision-Language-Action Safety: Threats, Challenges, Evaluations, and Mechanisms

视觉-语言-动作安全性:威胁、挑战、评估与机制

Qi Li, Bo Yin, Weiqi Huang, Ruhao Liu, Bojun Zou, Runpeng Yu, Jingwen Ye, Weihao Yu, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) Monash University(墨尔本大学) Peking University(北京大学)

AI总结 本文探讨了视觉-语言-动作模型的安全性问题,分析了其在训练和推理阶段的威胁与防御机制,总结了评估方法及六个部署领域的安全挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23761 2026-04-28 cs.RO

Unleashing the Agility of Wheeled-Legged Robots for High-Dynamic Reflexive Obstacle Evasion

释放轮腿机器人在高动态反射性障碍规避中的敏捷性

Yongen Zhao, Zihao Xu, Wenzhi Lu, Zhen Chu, Ce Hao

机构 * School of Mechanical Engineering, Tianjin University(天津大学机械工程学院) School of Computing, National University of Singapore(新加坡国立大学计算机学院) Beijing Zhongguancun Academy(北京中关村学院) DeepRobotics(深睿科技)

AI总结 本文提出AWARE框架,通过层次强化学习实现轮腿机器人在动态环境中的敏捷避障,展现多样化的运动模式和规避行为,验证了轮腿机器人在高动态威胁下的敏捷性。

Comments 8 pages, 8 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23648 2026-04-28 cs.RO

Safe Navigation in Unknown and Cluttered Environments via Direction-Aware Convex Free-Region Generation

通过方向感知的凸自由区域生成实现未知和杂乱环境中的安全导航

Zhicheng Song, Yongjian Li, Kai Chen, Yulin Li, Fan Shi, Jun Ma

机构 * Robotics and Autonomous Systems Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)机器人与自主系统方向) Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电子与计算机工程系)

AI总结 本文提出一种结合候选运动方向与机器人几何的凸自由区域生成框架,通过连续安全轨迹生成实现持续无碰撞运动,实验表明该方法在杂乱2D导航场景中生成更符合后续导航的自由区域,并在3D和真实世界中验证了其扩展性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14295 2026-04-28 cs.RO cs.MA

Aegis: Automated Error Generation and Attribution for Multi-Agent Systems

Aegis:多智能体系统的自动化错误生成与归因

Fanqi Kong, Ruijie Zhang, Huaxiao Yin, Guibin Zhang, Xiaofei Zhang, Ziang Chen, Zhaowei Zhang, Xiaoyuan Zhang, Song-Chun Zhu, Xue Feng

机构 * Peking University Beijing Institute of General Artificial Intelligence(北京大学北京通用人工智能研究院) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Tsinghua University(清华大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出Aegis框架,通过自动化生成大规模多智能体系统错误数据,提升错误归因能力,实验表明其模型性能可与专有模型媲美。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23212 2026-04-28 stat.ML cs.LG math.ST stat.TH

Learning Curves and Benign Overfitting of Spectral Algorithms in Large Dimensions

谱算法在高维空间中的学习曲线与良性过拟合

Weihao Lu, Qian Lin, Yingcun Xia, Dongming Huang

机构 * Department of Statistics and Data Science, National University of Singapore(新加坡国立大学统计与数据科学系) Department of Statistics and Data Science, Tsinghua University(清华大学统计与数据科学系)

AI总结 本文研究了高维环境下谱算法的学习曲线和良性过拟合现象,揭示了在不同正则化条件下学习曲线的三阶段特性,并展示了在特定光滑性条件下良性过拟合的出现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23193 2026-04-28 cs.DS cs.LG cs.NA math.NA math.PR stat.ML

Well-Conditioned Oblivious Perturbations in Linear Space

线性空间中条件良好的盲扰动

Shabarish Chenakkod, Michał Dereziński, Xiaoyu Dong, Mark Rudelson

机构 * University of Michigan, Ann Arbor, MI, USA(密歇根大学,安阿伯分校) National University of Singapore, Singapore(新加坡国立大学)

AI总结 本文提出一种低开销的盲扰动方法,通过稀疏扰动和模式矩阵降低矩阵条件数,提升共轭梯度算法效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22839 2026-04-28 cs.CV cs.AI

From Skeletons to Pixels: Few-Shot Precise Event Spotting via Representation and Prediction Distillation

从骨骼到像素:通过表示和预测蒸馏实现少样本精确事件定位

Zhong Han Ervin Yeoh, Jiang Kan

机构 * Department of Business Analytics(商业分析系) School of Computing(计算学院) National University of Singapore(新加坡国立大学)

AI总结 本文提出两种互补的蒸馏策略,通过多模态蒸馏提升少样本精确事件定位的泛化能力,实验表明在网球和花样滑冰数据集中均优于单一模态基线。

Comments 39 pages, 4 figures, ISACE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15889 2026-04-28 eess.AS cs.SD

A Stabilized Hybrid Active Noise Control Algorithm of GFANC and FxNLMS with Online Clustering

一种结合GFANC和FxNLMS的稳定混合主动降噪算法

Zhengding Luo, Haozhe Ma, Boxiang Wang, Ziyi Yang, Dongyuan Shi, Woon-Seng Gan

机构 * 1 School of Electrical \& Electronic Engineering, Nanyang Technological University, Singapore 2 School of Computing, National University of Singapore, Singapore 3 Northwestern Polytechnical University, China

AI总结 本文提出一种混合GFANC-FxNLMS算法,结合两者优势,通过在线聚类模块提升稳定性,实现快速响应和低稳态误差。

Comments Accepted by 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026)

Journal ref ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01897 2026-04-28 cs.LG cs.IT math.IT math.OC

MLorc: Momentum Low-rank Compression for Memory Efficient Large Language Model Adaptation

MLorc: 动量低秩压缩用于内存高效的大型语言模型适应

Wei Shen, Zhang Yaxiang, Minhui Huang, Mengfan Xu, Jiawei Zhang, Cong Shen

机构 * University of Virginia(弗吉尼亚大学) National University of Singapore(新加坡国立大学) Meta University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

AI总结 本文提出MLorc方法,通过压缩和重建矩阵参数动量以降低内存消耗,相比LoRA和GaLore在内存效率和训练动态保留方面更优,理论和实验均验证其有效性。

Comments AISTATS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07160 2026-04-28 cs.CV

Motion-aware Contrastive Learning for Temporal Panoptic Scene Graph Generation

面向时间的对比学习用于时序全景场景图生成

Thong Thanh Nguyen, Xiaobao Wu, Yi Bin, Cong-Duy T Nguyen, See-Kiong Ng, Anh Tuan Luu

机构 * Institute of Data Science (IDS)(数据科学研究所) National University of Singapore(新加坡国立大学) Nanyang Technological University (NTU)(南洋理工大学) Tongji University(同济大学)

AI总结 本文提出一种面向时间的对比学习框架,通过学习运动模式提升时序全景场景图生成的性能,实验表明在视频和4D数据集上优于现有方法。

Comments Accepted at AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07157 2026-04-28 cs.CV

Multi-Scale Contrastive Learning for Video Temporal Grounding

多尺度对比学习用于视频时间定位

Thong Thanh Nguyen, Yi Bin, Xiaobao Wu, Zhiyuan Hu, Cong-Duy T Nguyen, See-Kiong Ng, Anh Tuan Luu

机构 * Institute of Data Science (IDS), National University of Singapore(数据科学研究所(IDS),新加坡国立大学) Tongji University(同济大学) Nanyang Technological University (NTU)(南洋理工大学)

AI总结 本文提出多尺度对比学习框架,通过多阶段视频编码器生成样本,无需数据增强或在线记忆库,提升视频时间定位的语义表达。

Comments Accepted at AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20834 2026-04-27 cs.RO

PokeVLA: Empowering Pocket-Sized Vision-Language-Action Model with Comprehensive World Knowledge Guidance

PokeVLA:通过全面的世界知识指导赋能便携式视觉-语言-动作模型

Yupeng Zheng, Xiang Li, Songen Gu, Yuhang Zheng, Shuai Tian, Weize Li, Linbo Wang, Senyu Fei, Pengfei Li, Yinfeng Gao, Zebin Xing, Yilun Chen, Qichao Zhang, Haoran Li, Wenchao Ding

机构 * CASIA(中国科学院自动化研究所) TARS Robotics(TARS机器人实验室) Tsinghua University(清华大学) Fudan University(复旦大学) National University of Singapore(新加坡国立大学) Tongji University(同济大学)

AI总结 本文提出PokeVLA,一种轻量但强大的具身体验模型,通过预训练视觉语言模型和多视角目标感知学习提升机器人操作效率与空间认知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22577 2026-04-27 cs.AI cs.CL

QuantClaw: Precision Where It Matters for OpenClaw

QuantClaw:在OpenClaw中至关重要的精度

Manyi Zhang, Ji-Fu Li, Zhongao Sun, Xiaohao Liu, Zhenhua Dong, Xianzhi Yu, Haoli Bai, Xiaobo Xia

机构 * Huawei Technologies(华为技术有限公司) National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

AI总结 QuantClaw通过动态分配精度优化任务性能,降低计算成本和延迟,提升多轮推理效率。

Comments Blog: https://sparkengineai.github.io/QuantClaw

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22170 2026-04-27 cs.LG cs.IR

Sharpness-Aware Poisoning: Enhancing Transferability of Injective Attacks on Recommender Systems

增强推荐系统注入攻击的转移性:锐度感知污染

Junsong Xie, Yonghui Yang, Pengyang Shao, Le Wu

机构 * Key Laboratory of Knowledge Engineering with Big Data(大数据知识工程重点实验室) Hefei University of Technology(合肥工业大学) Intelligent Interconnected Systems Laboratory of Anhui Province(安徽省智能互联系统实验室) National University of Singapore(新加坡国立大学)

AI总结 本文提出锐度感知污染方法,通过寻找近似最坏情况的受害者模型来优化污染数据,提升攻击在不同模型间的转移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22519 2026-04-27 cs.RO

Clutter-Robust Vision-Language-Action Models through Object-Centric and Geometry Grounding

通过对象中心和几何约束实现抗杂波的视觉-语言-动作模型

Khoa Vo, Taisei Hanyu, Yuki Ikebe, Trong Thang Pham, Nhat Chung, Minh Nhat Vu, Duy Nguyen Ho Minh, Anh Nguyen, Anthony Gunderman, Chase Rainwater, Ngan Le

机构 * University of Arkansas(阿拉巴马大学) National University of Singapore(新加坡国立大学) TU Wien(维也纳技术大学) Max Planck Research School for Intelligent Systems(智能系统马克斯·普朗克研究学校) University of Stuttgart(斯图加特大学) University of Liverpool(利物浦大学)

AI总结 本文提出OBEYED-VLA框架,通过分离感知接地与动作推理提升视觉-语言-动作模型在现实环境中的鲁棒性,特别是在存在干扰物、目标缺失和背景变化等挑战性场景中表现优异。

Comments Under review. Project website: https://uark-aicv.github.io/OBEYED_VLA

详情

展开后加载摘要…

URL PDF HTML 收藏