arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanyang Technological University(南洋理工大学)

2026-07-08 至 2026-07-08 共收录 7
2607.06560 2026-07-08 cs.CV 新提交

Vision as Unified Multimodal Generation

视觉作为统一的多模态生成

Xiaoyang Han, Jianhua Li, Kewang Deng, Zukai Chen, Xuanke Shi, Sihan Wang, Boxuan Li, Linyan Wang, Siyi Xie, Xin You, Jinsheng Quan, Zhongang Cai, Haiwen Diao, Ziwei Liu, Lei Yang, Dahua Lin, Quan Wang

机构 * SenseTime Research(商汤科技研究院) Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

AI总结 该研究将计算机视觉表述为统一多模态生成,SenseNova-Vision用自然语言指令等指定任务并生成多种输出。通过转换注释形成语料库训练模型,其涵盖多种视觉任务,实验显示统一模型能匹配专用系统,为集成视觉能力到通用模型提供可扩展途径。

Comments 48 pages,22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06319 2026-07-08 cs.CV 新提交

Synthetic-to-Real Translation for Class-Agnostic Motion Prediction

用于类别无关运动预测的合成到真实翻译

Yizheng Wu, Hongwei Fan, Kewei Wang, Ruibo Li, Xingyi Li, Xiao Song, Zhe Wang, Chenjing Ding, Dongliang Wang, Zhiguo Cao, Guosheng Lin

机构 * Key Laboratory of Image Processing and Intelligent Control, Ministry of Education, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(图像处理与智能控制教育部重点实验室,华中科技大学人工智能与自动化学院) Nanyang Technological University(南洋理工大学) SenseAuto(未知(保留英文))

AI总结 研究针对运动预测中合成到真实翻译的问题,提出将运动知识翻译框架与目标感知运动预测、目标辅助运动增强两个组件集成的方法,还生成了Motion4D数据集,实验证明该方法有效弥合域差距,在真实场景表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06165 2026-07-08 cs.RO 新提交

EAGOR: Embodied Reasoning in Omni-direction

EAGOR:全方位的具身推理

Shriram Damodaran, Soumyaratna Debnath, Yan Wu, Wei-Yun Yau, Addison Lin Wang

机构 * EmPACT Lab, NTU Singapore Institute for Infocomm Research, A*STAR Singapore(EmPACT实验室,南洋理工大学信息与通信研究所,A*STAR新加坡)

AI总结 研究针对现有视觉语言模型在处理360°观测时方向估计不一致的问题,提出无需训练的几何感知框架EAGOR,将方向推理表述为球面上的递归贝叶斯估计,引入球谐信念场,实验证明其性能优于现有方法。

Comments 12 Pages, 7 Figures, 4 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05841 2026-07-08 cs.HC cs.AI 新提交

VisTCP: A Visualization Framework to Construct Knowledge-Graph-Based Representation for Traditional Chinese Painting

VisTCP:一种用于构建基于知识图谱的中国传统绘画表示的可视化框架

Zhiguang Zhou, Fengling Zheng, Miaoxin Hu, Lina You, Jin Wen, Huan Liu, Wei Zhang, Dekun Qian, Yuhua Liu, Wei Chen, Yigang Wang, Yong Wang

机构 * School of Media and Design, Hangzhou Dianzi University(杭州电子科技大学媒体与设计学院) School of Computer Science, Hangzhou Dianzi University(杭州电子科技大学计算机科学学院) State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

AI总结 针对中国传统绘画语义理解难题,提出VisTCP框架,结合智能模型与专家知识,通过构建语义分类法、训练模型、设计可视化视图,实现人在回路的迭代优化,有效支持TCP的结构化表示和语义理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05783 2026-07-08 cs.CV 新提交

Benchmarking the Robustness of Autonomous Driving to Environmental Illusions: A Lane Perception Perspective

从车道感知角度评估自动驾驶对环境错觉的鲁棒性:基准测试

Tianyuan Zhang, Xianglong Liu, Aishan Liu, Lu Wang, Yitong Zhang, Peng Yue, Mingchuan Zhang, Siyuan Liang, Dacheng Tao

机构 * SKLCCSE, the School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院软件安全技术与工程北京市重点实验室) the School of Cyber Science and Technology, Sun Yat-sen University(中山大学网络空间科学与技术学院) Henan University of Science and Technology(河南科技大学) the School of Computing, National University of Singapore(新加坡国立大学计算学院) College of Computing & Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

AI总结 研究自动驾驶对环境错觉的鲁棒性,聚焦传统车道检测和视觉语言模型系统。引入基准LanEvil++并评估,发现错觉严重影响性能,阴影干扰最大。提出多模态错觉防御方法MIDA,有效提升了模型在挑战性条件下的鲁棒性。

Comments Accepted by IEEE TPAMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05780 2026-07-08 cs.RO cs.AI cs.CV 新提交

FORGE: Towards Functional Tool-Use Generalization via Keypoint Trajectory Reasoning

FORGE:通过关键点轨迹推理实现功能工具使用的泛化

Chuhao Zhou, Liquan Wang, Shuxin Cao, Xiangyu Chen, Yuxuan Hu, Boyu Ma, Animesh Garg, Jianfei Yang

机构 * MARS Lab, Nanyang Technological University(南洋理工大学MARS实验室) Georgia Institute of Technology(佐治亚理工学院)

AI总结 研究针对机器人功能工具使用泛化问题,提出FORGE两阶段策略,通过关键点轨迹推理解耦功能推理与动作执行,在七工具击打基准测试中,对未见工具表现优于现有方法,平均成功率显著提升。

Comments 15 pages, 8 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05759 2026-07-08 cs.DS cs.AI cs.DM 新提交

Data-dependent Evaluations for Budgeted Submodular Maximization

带预算约束的次模最大化的数据依赖评估

Lejian Zhang, Xueyan Tang, Jing Tang

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(新加坡南洋理工大学计算与数据科学学院) Data Science and Analytics Thrust, The Hong Kong University of Science and Technology (Guangzhou), China(香港理工大学(广州)数据科学与分析方向)

AI总结 针对带背包约束的次模最大化问题,开发新的数据依赖上界,理论证明其优于最优解,通过真实数据集实验验证其在评估解与最优解接近程度上的优势。

Comments Extended version of a paper that will appear in ESA 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏