arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanyang Technological University(南洋理工大学)

2026-07-24 至 2026-07-24 共收录 11
2607.21595 2026-07-24 cs.CV cs.AI cs.LG 新提交

3D-Aware VLMs with Implicit and Explicit Geometries

具有隐式和显式几何的3D感知视觉语言模型

Wenhao Li, Xueying Jiang, Quanhao Qian, Deli Zhao, Ran Xu, Shijian Lu, Gongjie Zhang

机构 * Nanyang Technological University(南洋理工大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) HuPan Lab(湖畔实验室)

AI总结 研究针对多数2D视觉输入的VLM处理3D任务困难的问题,提出VLM-IE3D框架,通过引入隐式和显式几何令牌及3D感知适配器,融合几何表示与视觉线索,在多种3D任务中表现优异。

Comments Accepted by ECCV 2026, Open Sourced

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21588 2026-07-24 cs.RO 新提交

AXIS: A Growable Community-Driven Data Engine for Scalable Robot Manipulation

AXIS:用于可扩展机器人操作的可增长社区驱动数据引擎

Mengfei Zhao, Dihong Huang, Yikai Tang, Peihao Li, Mingxuan Yan, Ruiqi Zhuang, Yanjia Huang, Jie Wang, Hai Zhai, Tony Zhou, Rui Zhang, Zhexi Luo, Yuchen Huang, Jianfei Yang, Jiachen Li

机构 * Axis Robotics(轴机器人公司) University of California, Berkeley(加州大学伯克利分校) Georgia Institute of Technology(佐治亚理工学院) Texas A&M University(德州农工大学) Johns Hopkins University(约翰·霍普金斯大学) University of Pennsylvania(宾夕法尼亚大学) University of Michigan(密歇根大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

AI总结 研究针对机器人操作策略学习中数据管道难扩展的问题,提出AXIS这一可增长社区驱动数据引擎,它能收集、处理数据并组织成任务快照,通过实验表明其能提升模型性能且随数据量增加有一致扩展性。

Comments Project Website: https://axisaiorg.github.io/AXIS-V1/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21138 2026-07-24 cs.CV 新提交

DTIF: Robust Loop Closure Detection via Delaunay Triangle Topology in Complex Forests

DTIF:通过复杂森林中的德劳内三角拓扑进行稳健的回环检测

Xin Zhao, Jianping Li, Qin Zou, Fuxun Liang, Zhen Dong, Bisheng Yang

机构 * School of Computer Science, Wuhan University(武汉大学计算机科学学院) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) School of Urban Design, Wuhan University(武汉大学城市设计学院) LIESMARS, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室)

AI总结 针对森林环境中合并局部地图的难题,提出DTIF框架。通过提取树干地标、德劳内拓扑编码、统计筛选、一致性验证等步骤构建加权顶点对应,纳入可靠性权重到姿态估计器。实验证明该方法在边缘平台上兼顾鲁棒性、效率与可部署性,实现准确配准。

Comments 19 pages, 6 figures, 4 tables. Submitted to IEEE Transactions on Geoscience and Remote Sensing

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20889 2026-07-24 cs.CV 新提交

Engine-Native Editable 3D World Reconstruction with Objects and Lighting

使用对象和光照进行引擎原生可编辑3D世界重建

Junhao Chen, Xinghao Chen, Henghaofan Zhang, Zihao Qiao, Saining Zhang, Yongzhi Li, Ruqi Huang, Sisi Li, Yimin Sheng, Jianyi Zhu, Hao Zhao

机构 * Tsinghua University(清华大学) Nankai University(南开大学) University of Electronic Science and Technology of China(电子科技大学) Sun Yat-sen University(中山大学) Nanyang Technological University(南洋理工大学)

AI总结 研究旨在实现引擎原生可编辑3D世界重建。核心方法是引入Lumera管道,基于Lumera-2K数据,用Lumera-Box和Lumera-Light解析相关元素并组装。主要贡献是确立参数化灯光目标,揭示多方面剩余瓶颈,且在检测等方面取得一定分数。

Comments 18 pages, 7 figures, Project Page: https://haidilao0328.github.io/Lumera/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20321 2026-07-24 physics.flu-dyn cs.LG 版本更新

Label-Free Finite-Volume-Residual Training of Attention Graph Neural Networks for Coupled Thermo-Fluid Fields

用于耦合热流体场的注意力图神经网络的无标签有限体积残差训练

Tianyu Li, Zhiwei Cao, Qingang Zhang, Ruihang Wang, Binyang Song, Yonggang Wen

机构 * Interdisciplinary Graduate Programme(交叉学科研究生项目) Nanyang Technological University(南洋理工大学) School of Future Technology(未来技术学院) Fuzhou University(福州大学) College of Computing and Data Science(计算与数据科学学院) Yunnan University(云南大学) School of Mechanical and Aerospace Engineering(机械与航空航天工程学院)

AI总结 研究针对耦合热流体场预测,提出通过最小化FVM残差训练注意力图神经网络的方法,无需标记数据。经四种情况评估,该方法在稳态基准上nRMSE达2.3-2.8%,在瞬态情况中准确性超监督基线且免数据生成成本,降低了模型开发成本。

Comments 51 pages, 27 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17521 2026-07-24 cs.RO 版本更新

GeoWorldAD: Geometry World Action Model for Autonomous Driving

GeoWorldAD:用于自动驾驶的几何世界行动模型

Songyan Zhang, Jinyuan Tian, Hanbing Li, Daqi Liu, Hao Chen, Wenhui Huang, Fang Li, Guang Chen, Hangjun Ye, Long Chen, Kuiyuan Yang, Chen Lv

机构 * Nanyang Technological University(南洋理工大学) Xiaomi EV(小米汽车) Zhejiang University(浙江大学) Harvard University(哈佛大学)

AI总结 研究自动驾驶中安全高效规划决策问题,提出GeoWorldAD模型,通过在自我对齐3D空间中规划轨迹、用潜在未来几何标记预测场景演变,并逐步聚合多尺度几何线索,实验证明该模型在自动驾驶方面性能先进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11029 2026-07-24 cs.RO cs.CV 版本更新

Learning to Navigate Efficiently with Only 0.58M Trainable Parameters

仅用58万个可训练参数学习高效导航

Edward Beng Wai Tan, Siew-Kei Lam

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

AI总结 研究视觉导航中单个任务族所需规模及替代结构,提出分解式导航模型,仅用少量可训练参数,在导航任务中接近最先进模型性能,还能用于无目标探索,故障模式可解析纠正。

Comments 6 pages, 4 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12338 2026-07-24 cs.LG 版本更新

Wireless TokenCom: RL-Based Tokenizer Agreement for Multi-User Wireless Token Communications

无线令牌通信:基于强化学习的多用户无线令牌通信中的令牌化协议

Farshad Zeinali, Mahdi Boloursaz Mashhadi, Rahim Tafazolli

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院,南洋理工大学,新加坡)

AI总结 本文提出基于强化学习的混合框架,用于多用户无线TokenCom中的令牌化协议,提升语义质量和资源效率,减少视频传输中的冻结事件。

Comments Submitted to IEEE Journal for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16615 2026-07-24 cs.CV 版本更新

Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers

用于高效扩散变压器的可训练对数线性稀疏注意力

Yifan Zhou, Zeqi Xiao, Tianyi Wei, Shuai Yang, Xingang Pan

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) Wangxuan Institute of Computer Technology, Peking University(北京大学王萱计算机技术研究所)

AI总结 研究针对扩散变压器二次自注意力成本限制长序列扩展问题,提出可训练的对数线性稀疏注意力机制LLSA,通过分层结构降低成本,经实验验证其能加速注意力推理和DiT训练,为高效训练长序列DiTs提供方向。

Comments Code is available at: https://github.com/SingleZombie/LLSA

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12413 2026-07-24 cs.AI cs.HC 版本更新

Understanding Critical Thinking in Generative Artificial Intelligence Use: Development, Validation, and Correlates of the Critical Thinking in AI Use Scale

生成式人工智能使用中的批判性思维:批判性思维在AI使用中的量表开发、验证与关联因素

Gabriel R. Lau, Wei Yan Low, Louis Tay, Ysabel Guevarra, Dragan Gašević, Andree Hartanto

机构 * School of Social Sciences, Nanyang Technological University(南洋理工大学社会科学学院) Interdisciplinary Graduate Programme, Nanyang Technological University(南洋理工大学跨学科研究生项目) College of Health and Human Sciences, Purdue University(普渡大学健康与人类科学学院) School of Social Sciences, Singapore Management University(新加坡管理学院社会科学学院) Faculty of Information Technology, Monash University(墨尔本大学信息技术学院)

AI总结 本研究开发并验证了13项批判性思维在AI使用中的量表,发现其包含验证、动机和反思三个因子,并与开放性、外向性、积极情感和AI使用频率正相关,且能预测更频繁的验证策略和更高的真实性判断准确性。

Journal ref Computers in Human Behavior Reports, 22, 101103 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14854 2026-07-24 eess.SY cs.AI cs.SY 交叉投稿

Through-the-Earth Magnetic Induction Communication and Networking: A Comprehensive Survey

地磁感应通信与网络:全面综述

Honglei Ma, Erwu Liu, Wei Ni, Zhijun Fang, Rui Wang, Yongbin Gao, Dusit Niyato, Ekram Hossain

机构 * School of Electronic and Electrical Engineering, Shanghai University of Engineering Science(上海工程技术大学电子与电气工程学院) College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院) Shanghai Institute of Intelligent Science and Technology, Tongji University(同济大学上海智能科学与技术研究院) School of Engineering, Edith Cowan University(爱德华·牛顿大学工程学院) School of Computer Science and Engineering, The University of New South Wales(新南威尔士大学计算机科学与工程学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

AI总结 本文全面综述地磁感应通信(TTE)MIC,涵盖应用、信道建模等多方面。比较应用突出TTE挑战,回顾建模原理,分解信道功率增益并提出新模型分析快衰落,总结中继技术等,还提出支持TCP/IP和Linux的MIC框架,推动MIC研究发展并指出挑战与新技术。

Comments This work has been accepted by the IEEE Communications Surveys & Tutorials (COMST) for publication. The final published version will be available on IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏