arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanyang Technological University(南洋理工大学)

共收录 208
2607.11029 2026-07-24 cs.RO cs.CV 版本更新

Learning to Navigate Efficiently with Only 0.58M Trainable Parameters

仅用58万个可训练参数学习高效导航

Edward Beng Wai Tan, Siew-Kei Lam

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

AI总结 研究视觉导航中单个任务族所需规模及替代结构,提出分解式导航模型,仅用少量可训练参数,在导航任务中接近最先进模型性能,还能用于无目标探索,故障模式可解析纠正。

Comments 6 pages, 4 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12338 2026-07-24 cs.LG 版本更新

Wireless TokenCom: RL-Based Tokenizer Agreement for Multi-User Wireless Token Communications

无线令牌通信:基于强化学习的多用户无线令牌通信中的令牌化协议

Farshad Zeinali, Mahdi Boloursaz Mashhadi, Rahim Tafazolli

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院,南洋理工大学,新加坡)

AI总结 本文提出基于强化学习的混合框架,用于多用户无线TokenCom中的令牌化协议,提升语义质量和资源效率,减少视频传输中的冻结事件。

Comments Submitted to IEEE Journal for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16615 2026-07-24 cs.CV 版本更新

Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers

用于高效扩散变压器的可训练对数线性稀疏注意力

Yifan Zhou, Zeqi Xiao, Tianyi Wei, Shuai Yang, Xingang Pan

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) Wangxuan Institute of Computer Technology, Peking University(北京大学王萱计算机技术研究所)

AI总结 研究针对扩散变压器二次自注意力成本限制长序列扩展问题,提出可训练的对数线性稀疏注意力机制LLSA,通过分层结构降低成本,经实验验证其能加速注意力推理和DiT训练,为高效训练长序列DiTs提供方向。

Comments Code is available at: https://github.com/SingleZombie/LLSA

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12413 2026-07-24 cs.AI cs.HC 版本更新

Understanding Critical Thinking in Generative Artificial Intelligence Use: Development, Validation, and Correlates of the Critical Thinking in AI Use Scale

生成式人工智能使用中的批判性思维:批判性思维在AI使用中的量表开发、验证与关联因素

Gabriel R. Lau, Wei Yan Low, Louis Tay, Ysabel Guevarra, Dragan Gašević, Andree Hartanto

机构 * School of Social Sciences, Nanyang Technological University(南洋理工大学社会科学学院) Interdisciplinary Graduate Programme, Nanyang Technological University(南洋理工大学跨学科研究生项目) College of Health and Human Sciences, Purdue University(普渡大学健康与人类科学学院) School of Social Sciences, Singapore Management University(新加坡管理学院社会科学学院) Faculty of Information Technology, Monash University(墨尔本大学信息技术学院)

AI总结 本研究开发并验证了13项批判性思维在AI使用中的量表,发现其包含验证、动机和反思三个因子,并与开放性、外向性、积极情感和AI使用频率正相关,且能预测更频繁的验证策略和更高的真实性判断准确性。

Journal ref Computers in Human Behavior Reports, 22, 101103 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27852 2026-07-23 cs.GR cs.CV 版本更新

ClothTransformer: Unified Latent-Space Transformers for Scalable Cloth Simulation

ClothTransformer: 用于可扩展布料模拟的统一潜空间变换器

Yu Zhang, Yidi Shao, Wenqi Ouyang, Yushi Lan, Zhexin Liang, Chengrui Wu, Xudong Xu, Xingang Pan

机构 * S-Lab, Nanyang Technological University, Singapore(新加坡南洋理工大学S实验室,南洋理工大学,新加坡) Feeling AI University of Oxford(牛津大学) Nanyang Technological University(南洋理工大学) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 提出ClothTransformer,通过将布料模拟重构为潜空间中的自回归序列建模,使用统一Transformer架构处理多种场景,实现比现有方法低4-9倍的误差,并引入可扩展潜空间公式和穿透自由数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04802 2026-07-23 cs.CV 版本更新

VISTA-Bench: Do Vision-Language Models Really Understand Visualized Text as Well as Pure Text?

VISTA-Bench: 视觉-语言模型是否真的能像纯文本一样理解可视化文本?

Qing'an Liu, Juntong Feng, Yuhao Wang, Xinzhe Han, Yujie Cheng, Yue Zhu, Haiwen Diao, Yunzhi Zhuge, Huchuan Lu

机构 * Dalian University of Technology(大连理工大学) Nanyang Technological University(南洋理工大学)

AI总结 VISTA-Bench通过对比纯文本和可视化文本问题,揭示了视觉-语言模型在处理可视化文本时的模态差距,发现模型在语义相同的情况下表现显著下降。

Comments 32 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02694 2026-07-23 cs.CV cs.AI 版本更新

DocShield: Towards AI Document Safety via Evidence-Grounded Agentic Reasoning

DocShield:通过证据导向的智能代理推理实现AI文档安全

Fanwei Zeng, Changtao Miao, Jing Huang, Zhiya Tan, Shutao Gong, Xiaoming Yu, Yang Wang, Weibin Yao, Joey Tianyi Zhou, Jianshu Li, Ying Yan

机构 * Ant Group(蚂蚁集团) Nanyang Technological University(南洋理工大学) CFAR and IHPC, Agency for Science, Technology and Research (A*STAR), Singapore(新加坡科技研究局(A*STAR)计算与先进机器人中心及高性能计算研究所)

AI总结 本文提出DocShield框架,通过视觉-逻辑联合推理解决文档伪造检测问题,采用CCT机制和多任务奖励优化,提升检测准确性和解释性,实验显示其在多个基准测试中表现优异。

Comments 10 pages, 4 figures, 5 tables. Preprint. arXiv admin note: text overlap with arXiv:2512.21482

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15368 2026-07-22 cs.CV eess.IV 版本更新

Aligned Stable Inpainting: Mitigating Unwanted Object Insertion and Preserving Color Consistency

对齐稳定修复:缓解不需要的对象插入并保持颜色一致性

Yikai Wang, Junqiu Yu, Chenjie Cao, Xiangyang Xue, Yanwei Fu

机构 * Nanyang Technological University(南洋理工大学) Tencent Hunyuan3D(腾讯 Hunyuan3D) Fudan University(复旦大学) Fudan ISTBI–ZJNU Algorithm Centre for Brain-Inspired Intelligence(复旦大学 ISTBI–浙师大脑启发式智能算法中心) Zhejiang Normal University(浙江师范大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 本文提出ASUKA框架,通过重建先验和专有VAE解码器解决生成修复中的对象插入和颜色不一致问题,提升修复图像的质量和一致性。

Comments Update: more exps and analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06442 2026-07-22 cs.CV cs.RO 版本更新

WHU-PCPR: A cross-platform heterogeneous point cloud dataset for place recognition in complex urban scenes

WHU-PCPR:用于复杂城市场景中地点识别的跨平台异构点云数据集

Xianghong Zou, Jianping Li, Yandi Yang, Weitong Wu, Yuan Wang, Qiegen Liu, Zhen Dong

机构 * School of Advanced Manufacturing, Nanchang University(南昌大学先进制造学院) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) Department of Geomatics Engineering, University of Calgary(卡尔加里大学测绘工程系) School of Earth Sciences and Engineering, Hohai University(河海大学地球科学与工程学院) School of Geography and Environment, Jiangxi Normal University(江西师范大学地理与环境学院) School of Information Engineering, Nanchang University(南昌大学信息工程学院) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室) Hubei Luojia Laboratory(湖北省珞珈实验室)

AI总结 针对现有PCPR数据集在场景、平台和传感器方面缺乏多样性的问题,建立跨平台异构点云数据集WHU-PCPR,其具备独特特征。基于此对几种PCPR方法评估分析,讨论关键挑战与未来方向,推动相关研究发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04438 2026-07-21 cs.CV cs.AI cs.HC cs.MA cs.MM 版本更新

ResearchStudio-Reel: Automate the Last Mile of Research from Paper to Poster, Video, and Blog

ResearchStudio-Reel:实现从论文到海报、视频和博客的研究最后一公里自动化

Lingao Xiao, Yalun Dai, Yangyu Huang, Qihao Zhao, Wenshan Wu, Hugo He, Ruishuo Chen, Jin Jiang, Qianli Ma, Jiahuan Zhang, Xin Zhang, Ying Xin, Yang Ou, Yan Xia, Scarlett Li, Longbo Huang, Zhipeng Zhang, Yang He, Yap Kim Hui, Yan Lu

机构 * Microsoft Research(微软研究院) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Westlake University(西湖大学) CFAR, A*STAR(计算科学与工程研究所,新加坡科技研究局)

AI总结 研究传播自动化困难,以往方法有局限。该研究提出将最后一公里构建为技能组合,实例化ResearchStudio-Reel,包括共享提取器、可编辑生成器和交互式收敛层,能产出多种可编辑工件,效果优于现有系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19341 2026-07-21 cs.CV cs.CL cs.SD 版本更新

Native Active Perception as Reasoning for Omni-Modal Understanding

原生主动感知作为全模态理解的推理

Zhenghao Xing, Ruiyang Xu, Yuxuan Wang, Jinzheng He, Ziyang Ma, Qize Yang, Yunfei Chu, Jin Xu, Junyang Lin, Chi-Wing Fu, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) Qwen Team, Alibaba Group(阿里巴巴集团Qwen团队)

AI总结 提出OmniAgent,一种基于POMDP迭代观察-思考-行动循环的原生全模态智能体,通过主动感知将推理复杂度与视频时长解耦,在多个基准上达到开源模型最优性能。

Comments Accepted at ICML 2026. Code and models: https://github.com/harryhsing/omniagent

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01395 2026-07-21 eess.SY cs.RO cs.SY 版本更新

Quasi-Static Control of Discrete Cosserat Rod

离散Cosserat杆的准静态控制

Srishti Siddharth, Domenico Campolo, Ravi Banavar

机构 * Centre for Systems and Control(系统与控制中心) Indian Institute of Technology Bombay(印度理工学院班加罗尔) Nanyang Technological University(南洋理工大学)

AI总结 针对使用Cosserat杆建模的软体机器人,基于分段常应变空间离散化方法,利用外部力/力矩作为控制输入,设计应变空间和任务空间的状态反馈线性化控制律,实现末端执行器轨迹跟踪和形状控制。

Comments Accepted to 17th APCA International Conference on Automatic Control and Soft Computing (CONTROLO 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07008 2026-07-21 cs.CV cs.LG 版本更新

Where Not to Learn: Prior-Aligned Training with Subset-based Attribution Constraints for Reliable Decision-Making

不应学习的地方:基于子集归因约束的先验对齐训练以实现可靠的决策制定

Ruoyu Chen, Shangquan Sun, Xiaoqing Guo, Sanyi Zhang, Kangwei Liu, Shiming Liu, Zhangcheng Wang, Qunli Zhang, Wei Wang, Hua Zhang, Xiaochun Cao

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) University of Chinese Academy of Sciences(中国科学院大学) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系) Communication University of China(中国传媒大学) Imperial College London(伦敦帝国学院) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区网络科学与技术学院)

AI总结 本文提出了一种基于归因的先验对齐方法,通过子集选择归因技术约束模型依赖于人类先验区域,从而提升决策的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20804 2026-07-21 cs.AI 版本更新

MMGraphRAG: Bridging Vision and Language with Interpretable Multimodal Knowledge Graphs

MMGraphRAG: 通过可解释的多模态知识图谱弥合视觉与语言的鸿沟

Xueyao Wan, Hang Yu

机构 * Harbin Institute of Technology(哈尔滨工业大学) Nanyang Technological University(南洋理工大学)

AI总结 MMGraphRAG通过引入可解释的多模态知识图谱,解决多模态场景下的实体链接和跨模态推理问题,实现最先进的多模态信息处理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05356 2026-07-20 cs.CV 版本更新

ReCal3R: Reliability-Calibrated Learning Rates for Streaming 3D Reconstruction

ReCal3R:面向流式3D重建的可靠性校准学习率

Xinze Li, Yiyuan Wang, Pengxu Chen, Weifeng Su, Weisi Lin, Wentao Cheng

机构 * Beijing Normal-Hong Kong Baptist University(北京师范大学-香港浸会大学联合国际学院) Hong Kong Baptist University(香港浸会大学) Jilin University(吉林大学) Guangdong Provincial Key Laboratory of Interdisciplinary Research and Application for Data Science(广东省数据科学交叉研究与应用重点实验室) Nanyang Technological University(南洋理工大学)

AI总结 针对流式3D重建中循环场景状态易被噪声观测破坏的问题,提出可靠性校准学习率方法ReCal3R,在不增加额外开销的前提下大幅提升长序列重建精度。

Comments 23 pages, 7 figures. Project Page: https://powertony102.github.io/recal3r.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05750 2026-07-20 cs.LG cs.AI 版本更新

Are Heterogeneous Graph Neural Networks Truly Effective for Node Classification? A Causal Perspective

异构图神经网络在节点分类中真的有效吗?因果视角

Xiao Yang, Xuejiao Zhao, Zhiqi Shen

机构 * College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学) Joint NTU-UBC Research Centre of Excellence in Active Living for the Elderly (LILY), Nanyang Technological University(老年人积极生活卓越研究中心(LILY),南洋理工大学) Alibaba-NTU Singapore Joint Research Institute (ANGEL), Nanyang Technological University(阿里巴巴-南洋理工大学新加坡联合研究机构(ANGEL),南洋理工大学)

AI总结 从模型架构和异构信息角度研究异构图神经网络用于节点分类,通过复现实验和因果中介分析框架,发现模型架构和复杂度对性能无因果效应,异构信息通过增加同质性等产生正向因果效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12356 2026-07-17 cs.RO 版本更新

VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation

VistaVLA:用于机器人操作的几何和语义感知3D高斯基础VLA

Mohan Liu, Zhihao Gu, Xuanyu Chen, Haitian Zhang, Kaimin Mao, Yan Wu, Wei-Yun Yau, Lin Wang

机构 * EmPACT Lab, Nanyang Technological University(南洋理工大学EmPACT实验室) Institute for Infocomm Research (I2R), A*STAR(资讯通信研究院(I2R),新加坡科技研究局)

AI总结 研究针对VLA模型缺乏3D表示的问题,提出VistaVLA框架,通过3D高斯原语构建几何和语义感知的3D认知表示,利用MtQ机制压缩令牌,在模拟和真实环境评估中有效提升VLA性能,尤其在真实场景中显著提高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26261 2026-07-17 cs.LG stat.ML 版本更新

Contrastive Conformal Sets

对比性符合集

Yahya Alkhatib, Wee Peng Tay

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(南洋理工大学电气与电子工程学院)

AI总结 本文提出一种基于对比学习的符合集方法,通过最小体积覆盖集和可学习多范数约束,实现对正样本的覆盖和负样本的排除,提升了在图像数据集上的包含-排除平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01977 2026-07-17 cs.RO cs.AI cs.CV 版本更新

Seeing Through Uncertainty: Free-Energy-Inspired Real-Time Adaptation for Robust Visual Navigation

在不确定性中看见:一种基于自由能原理的实时感知适应鲁棒视觉导航方法

Maytus Piriyajitakonkij, Rishabh Dev Yadav, Mingfei Sun, Mengmi Zhang, Wei Pan

机构 * Department of Computer Science, The University of Manchester(曼彻斯特大学计算机科学系) Institute for Infocomm Research (I2R), Agency for Science, Technology and Research (A*STAR)(信息与通信研究院(I2R)、科技研究局(A*STAR)) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

AI总结 FEP-Nav通过结合自由能原理与实时感知适应,提升机器人在复杂视觉环境中的导航鲁棒性。

Comments Accepted for publication in IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10948 2026-07-16 cs.CV 版本更新

ClusIR: Towards Cluster-Guided All-in-One Image Restoration

ClusIR:迈向集群引导的一体化图像恢复

Shengkai Hu, Jiaqi Ma, Xu Zhang, Yongcheng Jing, Lefei Zhang, Jun Wan

机构 * Zhongnan University of Economics and Law(中南财经政法大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Yunnan University(云南大学) Nanyang Technological University(南洋理工大学) Wuhan University(武汉大学)

AI总结 研究针对一体化图像恢复中现有方法无法适应复杂退化的问题,提出ClusIR框架,通过可学习聚类建模退化语义,利用概率集群引导路由机制和退化感知频率调制模块,在多场景下取得有竞争力的图像恢复性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22415 2026-07-16 cs.CV cs.AI 版本更新

Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models

多模态大语言模型中用于视觉归因的证据重组与预测上下文残差化

Jiawei Liang, Jianjie Huang, Ruoyu Chen, Xianghao Jiao, Siyuan Liang, Shiming Liu, Xiaochun Cao

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Zhongguancun Academy(中关村学院) University of Chinese Academy of Sciences(中国科学院大学) Nanyang Technological University(南洋理工大学) Department of Mechanical Engineering, Imperial College London(伦敦帝国理工学院机械工程系)

AI总结 研究多模态大语言模型token级视觉证据难检查问题,提出基于证据重组和预测上下文残差化的ERCR框架,经实验验证该框架能改善目标token视觉证据、减轻上下文干扰,为视觉证据检查提供实用改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11132 2026-07-15 cs.CV 版本更新

From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering

从回顾到前瞻:面向知识驱动视觉问答的自我鼓励回顾蒸馏

Yu Zhao, Ying Zhang, Xuhui Sui, Baohang Zhou, Xinying Qian, Li Shen, Dacheng Tao

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

AI总结 本文提出HinD框架,通过知识鼓励偏好优化提升多模态大语言模型的知识推理能力,实验表明其在OK-VQA和A-OKVQA上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27270 2026-07-15 cs.AI stat.ML 版本更新

Quantification of Credal Uncertainty: A Distance-Based Approach

可信不确定性量化:基于距离的方法

Xabier Gonzalez-Garcia, Siu Lun Chau, Julian Rodemann, Michele Caprio, Krikamol Muandet, Humberto Bustince, Sébastien Destercke, Eyke Hüllermeier, Yusuf Sale

机构 * Public University of Navarre(纳瓦拉公立大学) Nanyang Technological University(南洋理工大学) CISPA Helmholtz Center for Information Security(CISPA亥姆霍兹信息安全中心) LMU Munich(慕尼黑大学) The University of Manchester(曼彻斯特大学) Université de Technologie de Compiègne(贡比涅技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) German Research Center for Artificial Intelligence (DFKI, DSA)(德国人工智能研究中心)

AI总结 本文提出基于距离的方法量化可信集中的总、随机和epistemic不确定性,通过积分概率度量框架获得可解释且计算高效的多类分类不确定性度量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08164 2026-07-14 cs.CV 版本更新

Continual Test-Time Adaptation in Computer Vision: Methods, Benchmarks, and Future Directions

计算机视觉中的持续测试时间适应:方法、基准和未来方向

Sarthak Kumar Maharana, Shambhavi Mishra, Yunbei Zhang, Shuaicheng Niu, Taki Hasan Rafi, Jihun Hamm, Marco Pedersoli, Jose Dolz, Yunhui Guo

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) LIVIA ETS Montreal, ILLS International Laboratory on Learning Systems (ILLS)(蒙特利尔LIVIA ETS,学习系统国际实验室(ILLS)) Tulane University(路易斯安那州立大学) Nanyang Technological University(南洋理工大学) Hanyang University(翰阳大学)

AI总结 本文针对计算机视觉中训练与测试数据分布不同的问题,定义CTTA问题,分析持续域转移模式,提出分层分类法将现有方法分为三类,回顾代表性方法并展示实验结果,讨论局限性与新兴方向,为持续测试时间适应研究提供路线图。

Comments TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11637 2026-07-14 cs.AI 版本更新

TouchThinker: Scaling Tactile Commonsense Reasoning to the Open World with Large-scale Data and Action-aware Representation

TouchThinker: 通过大规模数据和动作感知表示将触觉常识推理扩展到开放世界

Kailin Lyu, Di Wu, Pengwei Zhang, Yuhang Zheng, Yingxin Lai, Long Xiao, Kangyi Wu, Pengna Li, Chen Gao, Lianyu Hu, Xiaobin Hu, Jie Hao, Ce Hao, Weihao Yuan, Shuicheng Yan

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) National University of Singapore(新加坡国立大学) Zhongguancun Academy(中关村学院) Xiamen University(厦门大学) Xi’an Jiaotong University(西安交通大学) Nanyang Technological University(南洋理工大学) Nanjing University(南京大学)

AI总结 提出TouchThinker框架,通过构建百万级多源触觉数据集TouchThinker-1M和动作感知建模,将触觉常识推理扩展到开放世界,在多个数据集上取得竞争性表现。

Comments 18 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06280 2026-07-14 cs.CV 版本更新

Eulerian Motion Guidance: Robust Image Animation via Bidirectional Geometric Consistency

欧拉运动引导:基于双向几何一致性的鲁棒图像动画

Thong Nguyen, Khoi M. Le, Cong-Duy Nguyen, Luu Anh Tuan, See-Kiong Ng, Chunyan Miao

机构 * National University of Singapore(新加坡国立大学) Centre for AI Research, VinUniversity(Vin大学人工智能研究中心) Nanyang Technological University(南洋理工大学)

AI总结 提出使用相邻帧欧拉运动场引导生成,并通过双向几何一致性机制解决遮挡问题,实现加速训练、保持时间连贯性和减少动态伪影。

Comments Accepted by ACM MM 2026. Code is available at https://github.com/nguyentthong/eulerian_motion_guidance

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01581 2026-07-14 cs.CV 版本更新

Satellite-Free Training for Drone-View Geo-Localization

无需卫星的无人机视角地理定位

Tao Liu, Yingzhi Zhang, Kan Ren, Xiaoqi Zhao

机构 * Nanjing University of Science and Technology(南京理工大学) University of Tsukuba(筑波大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出无需卫星数据的训练框架,通过三维场景重建、伪正射影像生成和特征聚合,提升无人机在无GPS环境下的地理定位性能。

Comments Withdrawn by the authors to allow for substantial revision in light of valuable reviewer feedback. A thoroughly revised version may be submitted in the future

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10504 2026-07-14 cs.CL 版本更新

DR-Arena: an Automated Evaluation Framework for Deep Research Agents

DR-Arena:深度研究智能体的自动化评估框架

Yiwen Gao, Ruochen Zhao, Yang Deng, Wenxuan Zhang

机构 * National University of Singapore(国立新加坡大学) Nanyang Technological University(南洋理工大学) Singapore Management University(新加坡管理学院) Singapore University of Technology and Design(新加坡科技设计大学)

AI总结 针对大语言模型作深度研究智能体时任务性能评估难的问题,提出DR-Arena自动化评估框架,通过动态调查、构建实时信息树、自动考官出题及自适应进化循环提升任务复杂性来评估,实验证明其与人类偏好对齐效果好,可替代人工裁决。

Comments 22 pages, 8 figures. Accepted to ACL 2026 as an oral presentation and selected as an SAC Highlight

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pp. 27130-27152, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22036 2026-07-14 cs.LG cs.MM 版本更新

Hyper-modal Imputation Diffusion Embedding with Dual-Distillation for Federated Multimodal Knowledge Graph Completion

基于双蒸馏的超模态插补扩散嵌入用于联邦多模态知识图谱补全

Ying Zhang, Yu Zhao, Xuhui Sui, Baohang Zhou, Xiangrui Cai, Li Shen, Xiaojie Yuan, Dacheng Tao

机构 * College of Computer Science, VCIP, DISSec, Nankai University(计算机学院、VCIP、DISSec、南开大学) School of Software, Tiangong University(软件学院、天津工业大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院、南洋理工大学)

AI总结 针对多模态知识图谱分散问题,提出FedMKGC任务及MMFeD3-HidE框架,客户端内用超模态插补扩散嵌入模型,客户端间用多模态联邦双蒸馏传输知识,通过FedMKGC基准验证了该框架的有效性、语义一致性和收敛鲁棒性。

Comments Published in IEEE Transactions on Multimedia, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09097 2026-07-13 cs.AI 版本更新

Programming over Thinking: Efficient and Robust Multi-Constraint Planning

编程而非思考:高效且稳健的多约束规划

Derrick Goh Xin Deik, Quanyu Long, Zhengyuan Liu, Nancy F. Chen, Wenya Wang

机构 * Nanyang Technological University(南洋理工大学) Agency for Science, Technology and Research(科技研究局)

AI总结 多约束规划面临挑战,现有大语言模型方法有局限。本文提出SCOPE框架,将特定查询推理与通用代码执行分离,产生一致、可重用的求解器函数,降低成本和延迟,性能达最优。

Comments Accepted at ACL 2026 : Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)

详情

展开后加载摘要…

URL PDF HTML 收藏