arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanyang Technological University(南洋理工大学)

2026-08-04 至 2026-08-04 共收录 12
2608.02358 2026-08-04 cs.CL 新提交

ScrambleToolBench: Agents Search Exhaustively Even When Their Own Map Points to the Next Step

ScrambleToolBench:即使自身的“地图”指向下一步,智能体仍会进行穷尽式搜索

Vernon Toh, Navonil Majumder, Zhengyuan Liu, Nancy F. Chen, Soujanya Poria

机构 * Nanyang Technological University(南洋理工大学) Agency for Science, Technology, and Research (A*STAR)(新加坡科学、技术与研究局)

AI总结 针对现有工具使用基准依赖先验知识的局限,推出ScrambleToolBench交互式终端基准,评估发现当前语言模型面对环境结构变化时难以实现稳健适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02332 2026-08-04 cs.LG cs.AI cs.SY eess.SY 新提交

Diffusion Policy with Behavioral Advantage Correction for Offline Reinforcement Learning

面向离线强化学习的带行为优势修正的扩散策略

Botao Dong, Longyang Huang, Ning Pang, Hongtian Chen

机构 * School of Chemistry, Chemical Engineering and Biotechnology, Nanyang Technological University(南洋理工大学化学、化学工程与生物技术学院)

AI总结 该研究针对离线强化学习中分布偏移导致的Q值估计偏差问题,提出带行为优势修正的扩散策略(DPBAC)算法,结合BAC-PE与扩散模型,在D4RL任务上实现优于SOTA的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02285 2026-08-04 cs.CV 新提交

Sen-Cap: Sensor-Flexible and Noise-Resilient Human Motion Capture via LiDAR-Camera Integration

Sen-Cap:基于激光雷达-相机融合的传感器灵活且抗噪的人体运动捕捉框架

Aoru Xue, Yujing Sun, Yiming Ren, Kwok-Yan Lam, Mao Ye, Yuexin Ma

机构 * ShanghaiTech University(上海科技大学) Digital Trust Centre, Nanyang Technological University(南洋理工大学数字信托中心)

AI总结 Sen-Cap是一种无需传感器间校准的激光雷达-相机融合人体运动捕捉框架,通过跨传感器运动估计器与抗噪轨迹跟踪器实现灵活部署与强鲁棒性,在多数据集上达最优性能,适用于真实场景。

Comments 16 pages, 8 figures, 4 tables. Accepted at ECCV 2026. Aoru Xue and Yujing Sun contributed equally. Yuexin Ma is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02137 2026-08-04 cs.CV 新提交

Two Sides of the Same Coin: Co-Evolving Search for Cross-Task Attacks on Vision-Language Models

同一硬币的两面:面向视觉-语言模型跨任务攻击的协同演化搜索

Xuanhui Lin, Junhao Dong, Mingrong Gong, Yucheng Chen, Xinghua Qu, Yew-Soon Ong

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Center for Frontier AI Research, Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局前沿人工智能研究中心) School of Electrical Engineering and Automation, Fuzhou University(福州大学电气工程与自动化学院) ByteDance(字节跳动)

AI总结 针对视觉-语言模型易受对抗扰动的问题,提出协同演化跨模态攻击框架,联合优化文本与视觉空间,在多任务上展现出强攻击性能与跨任务可迁移性。

Comments 15 pages, 7 figures, and 8 tables; includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02050 2026-08-04 cs.CL cs.AI cs.LG 新提交

TextNCA: Neural Cellular Automata for Language Modeling via Hierarchical Local Attention

TextNCA:通过分层局部注意力实现语言建模的神经细胞自动机

Avni Mittal, Avinash Anand, Ashutosh Kumar, Dikshant Kukreja, Kritarth Prasad, Sushane Dulloo, Erik Cambria, Timothy Liu, Zhengkui Wang, Rajiv Ratn Shah

机构 * Singapore Institute of Technology(新加坡理工学院) IIIT Delhi(德里印度信息技术学院) Nanyang Technological University(南洋理工大学) NVIDIA AI Technology Centre(英伟达人工智能技术中心)

AI总结 本研究提出分层局部注意力的TextNCA模型作为分析探针,发现其性能受从窄到宽的分阶段调度主导,迭代和GRU门控等仅带来小增益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02014 2026-08-04 cs.RO cs.AI 新提交

MANGO-Grasp: Mahalanobis Fields over Geometry-Oriented 3D Gaussians for Cross-Embodiment Dexterous Grasping

MANGO-Grasp:面向几何的三维高斯模型上的马氏场,用于跨 embodiments 的灵巧抓取

Heng Zhang, Kevin Yuchen Ma, Mike Zheng Shou, Weisi Lin, Yan Wu

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) National University of Singapore(新加坡国立大学)

AI总结 MANGO-Grasp是面向几何的三维高斯模型上的马氏场框架,用于跨异构多指手的灵巧抓取,在仿真、零样本迁移及真实实验中均优于现有基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01942 2026-08-04 cs.CV cs.CL cs.MM 新提交

CultureVidBench: Benchmarking Cultural Understanding in Text-to-Video Generation

CultureVidBench:文本到视频生成中的文化理解基准测试

Xianjing Han, Yuhan Su, Yang Deng, Dong Ma, Wee Peng Tay, Bin Zhu

机构 * Nanyang Technological University(南洋理工大学) Centrale Supélec(中央高等电力学院) Singapore Management University(新加坡管理大学) University of Cambridge(剑桥大学)

AI总结 本研究推出CultureVidBench基准,评估7款T2V模型的文化理解能力,发现现有模型难捕捉细粒度文化细节,尤其针对代表性不足的文化区域与线索。

Comments Project page:https://hanxjing.github.io/CultureVidBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01643 2026-08-04 cs.CV cs.AI cs.GR 新提交

StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring

StreamTalk:基于关键姿态锚定的流式伴随语音手势生成

Xiangyue Zhang, Jianfang Li, Jiaxu Zhang, Kaixing Yang, Steven Hoi

机构 * The University of Tokyo(东京大学) Alibaba Group(阿里巴巴集团) Nanyang Technological University(南洋理工大学) Renmin University of China(中国人民大学)

AI总结 StreamTalk是带周期性生成-检索-精调循环的闭环流式伴随语音手势生成框架,通过关键姿态锚定减少长程漂移,在BEAT2数据集上达到最优FGD指标,实时运行帧率达76 FPS。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01638 2026-08-04 cs.CV 新提交

Dynamic Resolution Routing for Efficient Egocentric Grounding

面向高效自我中心 grounding 的动态分辨率路由

Huixin Sun, Wangbo Zhao, Fanyue Wei, Qiuxia Lin, Pengzhan Sun, Angela Yao

机构 * National University of Singapore(新加坡国立大学) The Hong Kong University of Science and Technology(香港科技大学) Nanyang Technological University(南洋理工大学)

AI总结 该研究针对自我中心视觉 grounding 中视觉 token 处理成本过高的问题,提出 SmartRes 框架,通过动态分辨率路由减少视觉 token,在 Ego4D 等数据集上实现 token 缩减与性能提升,代码将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01635 2026-08-04 cs.CV 新提交

Mitigating Visual Degradation in MLLMs via Spatial-Spectral Visual Anchor Learning

通过空间-光谱视觉锚学习缓解多模态大语言模型(MLLMs)中的视觉退化

Qianlong Yang, Bowen Ye, Xianda Guo, Yanlun Peng, Wenke Huang, Hongyuan Zhang, Yulei Jia

机构 * China University of Petroleum (East China)(中国石油大学(华东)) Shanghai Jiao Tong University(上海交通大学) Wuhan University(武汉大学) Great Wall Motor(长城汽车) Nanyang Technological University(南洋理工大学) The University of Hong Kong(香港大学)

AI总结 针对MLLMs推理时的视觉表示退化问题,提出SSVAL方法,通过VAPI及辅助对齐损失实现稳定视觉锚,性能优于现有方法。

Comments This paper has been accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01603 2026-08-04 cs.RO 新提交

AffordTrajDP: Dynamic Affordance-Guided Visuomotor Policy Learning for Robotic Manipulation

AffordTrajDP:用于机器人操纵的动态 affordance 引导视觉运动策略学习

Gaoyuan Wu, Ziyu Shan, Haoyang Du, Yuyao Jiang, Ziwei Wang

机构 * Nanyang Technological University(南洋理工大学)

AI总结 针对静态 affordance 导致的机器人操纵轨迹漂移问题,提出 AffordTrajDP 动态框架,以物体为中心传播锚点 affordance 生成轨迹,在 ManiSkill3 上成功率达70.0%,现实实验验证其鲁棒性与组件有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00605 2026-08-04 cs.AI 新提交

Escaping Confidence Trap: Evolutionary Decoding for Mathematical Reasoning in Diffusion LLMs

逃离置信陷阱:扩散大语言模型数学推理的进化解码

Zhenhong Sun, Hanqing Zhao, Yatao Bian, Rongcheng Tu, Liuyue Xie, Xu Zhang, Jue Wang, Davide Modolo, Daoyi Dong, Dacheng Tao

机构 * Australian National University(澳大利亚国立大学) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学) Amazon(亚马逊) University of Technology Sydney(悉尼科技大学)

AI总结 针对扩散大语言模型数学推理的置信陷阱,提出无训练的进化解码框架,通过逐步选择与分块变异提升LLaDA 2.0的数学推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏