arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanyang Technological University(南洋理工大学)

共收录 2380
2510.09041 2026-06-08 cs.LG cs.AI 版本更新

Robust Driving Control for Autonomous Vehicles: An Intelligent General-sum Constrained Adversarial Reinforcement Learning Approach

自动驾驶鲁棒控制:一种智能一般和约束对抗强化学习方法

Junchao Fan, Qi Wei, Ruichen Zhang, Yang Lu, Jianhua Wang, Xiaolin Chang, Bo Ai

机构 * Beijing Key Laboratory of Security and Privacy in Intelligent Transportation(北京智能交通安全与隐私重点实验室) Beijing Jiaotong University(北京交通大学) College of Computing and Data Science(计算与数据科学学院) Nanyang Technological University(南洋理工大学) School of Computer Science and Technology(计算机科学与技术学院) Taiyuan University of Technology(太原科技大学) School of Electronics and Information Engineering(电子与信息工程学院)

AI总结 针对深度强化学习在自动驾驶中易受对抗攻击的问题,提出智能一般和约束对抗强化学习(IGCARL),通过战略性目标对手和鲁棒驾驶代理的交互训练,在约束优化下提升策略稳定性,实验表明成功率比现有方法提高至少27.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06316 2026-06-05 quant-ph cs.AI cs.DS

Quantum enhanced rare event discovery and sampling

量子增强的罕见事件发现与采样

Naixu Guo, Po-Wei Huang, Qisheng Wang, Jayne Thompson, Patrick Rebentrost, Mile Gu, Chengran Yang

机构 * Centre for Quantum Technologies, National University of Singapore(量子技术中心,新加坡国立大学) Mathematical Institute, University of Oxford(牛津大学数学研究所) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) School of Informatics, University of Edinburgh(爱丁堡大学信息学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Nanyang Quantum Hub, School of Physical and Mathematical Sciences, Nanyang Technological University(南洋量子中心,南洋理工大学物理与数学科学学院)

AI总结 针对概率极低的罕见事件发现与采样问题,提出一种无需预先知道事件类型的量子算法,实现了与稀有度阈值的最优量子标度,并在重尾系统和稳态随机过程中分别获得二次加速和鲁棒多项式加速。

Comments 36 pages (8+28)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06292 2026-06-05 cs.CV cs.RO

Synthetic Data Generation and Vision-based Wrinkle and Keypoint Detection for Bimanual Cloth Manipulation

合成数据生成与基于视觉的褶皱和关键点检测用于双手布料操作

Ariel Herrera, Xueyang Kang, Atal Anil Kumar

机构 * Department of Engineering, University of Luxembourg(卢森堡大学工程系) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) Université de Lorraine, Arts et Metiers Institute of Technology, LCFC(洛林大学,艺术与工艺技术学院,LCFC)

AI总结 针对布料操作中视觉感知难题,提出基于Blender的合成数据生成管道和结合CNN与YOLOv8-OpenCV的感知框架,实现褶皱抓取和关键点熨烫,关键点模型平均位置误差1.7615像素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05966 2026-06-05 cs.DB cs.AI

Causal Scaffolding for Physical Reasoning: A Benchmark for Causally-Informed Physical World Understanding in VLMs

物理推理的因果支架:面向视觉语言模型中因果启发的物理世界理解基准

Tianyi Tang, Zhuoyi Lin, Zeyu Feng, Tianyi Ma, Yew-Soon Ong, Ivor Tsang, Haiyan Yin

机构 * CFAR(因果推理研究所) IHPC(信息技术研究所) Agency for Science, Technology and Research (A*STAR)(科技研究局) Nanyang Technological University(南洋理工大学)

AI总结 提出CausalPhys基准(含3000+视频/图像问题及因果图),并设计因果图度量评估VLM推理,进一步提出因果理性微调(CRFT)提升推理准确性与可解释性。

Comments Accepted by KDD 2026 Dataset and Benchmark Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05925 2026-06-05 cs.AI

Towards World Models in Biomedical Research

迈向生物医学研究的世界模型

Guangyu Wang, Jingkun Yue, Siqi Zhang, Yu Liu, Xiaoyu Wang, Mingyuan Meng, Changwei Ji, Zongbo Han, Yulin Wang, Yang Yue, Frank Fu, Ting Chen, Song Wu, Ziwei Liu, Jiangning Song, Ming Li, Gao Huang, Xiaohong Liu, Athanasios Vasilakos, Xingcai Zhang, Ping Zhang, Yong Li

机构 * State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications, Beijing, China(网络与交换技术国家重点实验室,北京邮电大学,北京,中国) Department of Engineering Science, University of Oxford, Oxford, United Kingdom(英国牛津大学工程科学系,牛津,英国) Institute of Medical Artificial Intelligence, South China Hospital, Medical School, Shenzhen University, Shenzhen, Guangdong, China(医学人工智能研究所,南方医院,医学学院,深圳大学,深圳,广东,中国) Zhongguancun Academy & Zhongguancun Institute of Artificial Intelligence, Beijing, China(中关村学院及中关村人工智能研究院,北京,中国) Beijing National Research Center for Information Science and Technology (BNRist), Tsinghua University, 100084, Beijing, China(北京信息科学与技术国家研究中心(BNRist),清华大学,100084,北京,中国) Department of Chemical and Nano Engineering, University of California, San Diego, La Jolla, CA, USA(美国加州大学圣地亚哥分校化学与纳米工程系,La Jolla,CA,美国) Nanyang Technological University, Singapore(新加坡南洋理工大学) Monash Biomedicine Discovery Institute and Department of Biochemistry and Molecular Biology, Monash University, Melbourne, Victoria, Australia(莫纳什大学生物医学发现研究所和生物化学与分子生物学系,墨尔本,维多利亚,澳大利亚) David R. Cheriton School of Computer Science, University of Waterloo, Waterloo, Ontario, Canada(加拿大滑铁卢大学戴维·R·切里顿计算机科学学校,滑铁卢,安大略,加拿大) Department of ICT and Center for AI Research, University of Agder (UiA), Jon Lilletuns vei 9, Grimstad, Norway(挪威阿格德大学(UiA)信息与通信技术系及人工智能研究中心,Jon Lilletuns vei 9,Grimstad,挪威) Department of Electronic Engineering, Tsinghua University, Beijing, China(清华大学电子工程系,北京,中国)

AI总结 提出生物医学世界模型作为AI驱动发现的新范式,通过学习分子、细胞、组织和临床状态的潜在表征及干预条件动态,实现未来轨迹模拟,并探讨其在虚拟细胞、类器官、虚拟患者和手术模拟等应用中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05702 2026-06-05 cs.AI cs.CV

Seeing Time: Benchmarking Chronological Reasoning and Shortcut Biases in Vision-Language Models

Seeing Time: 视觉-语言模型中的时间顺序推理与捷径偏差基准测试

Haoyu Zhou, Qing Qing, Caichong Li, Qixin Zhang, Yongcheng Jing, Ziqi Xu, Juncheng Hu, Xikun Zhang, Renqiang Luo

机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) School of Computer Science, Wuhan University(武汉大学计算机学院) School of Computing Technologies, RMIT University(皇家墨尔本理工学院计算技术学院)

AI总结 本文提出一个新基准,通过三个专门数据集评估视觉-语言模型在图像内和跨图像的时间顺序推理能力,并揭示模型常利用颜色等表面线索而非真正时间特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05614 2026-06-05 cs.AI

Safety Paradox: How Enhanced Safety Awareness Leaves LLMs Vulnerable to Posterior Attack

安全悖论:增强的安全意识如何使LLM易受后验攻击

Long P. Hoang, Hai V. Le, Shaoyang Xu, Wei Lu, Wenxuan Zhang

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Nanyang Technological University(南洋理工大学)

AI总结 本文揭示安全对齐增强的LLM因内部安全评估能力而面临后验攻击漏洞,通过实验和理论分析证明安全判断能力越强越易被利用,并提出因果干预验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05613 2026-06-05 cs.AI

Multilingual Fine-Tuning via Localized Gradient Conflict Resolution

通过局部梯度冲突解决的多语言微调

Long P. Hoang, Yiran Zhao, Wei Lu, Wenxuan Zhang

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Salesforce AI Research(Salesforce人工智能研究) Nanyang Technological University(南洋理工大学)

AI总结 提出Bucket-Level MOO框架,将多语言微调重构为多目标优化问题,通过局部梯度冲突解决提升多语言性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05413 2026-06-05 cs.LG cs.AI

CausalPOI: Spatio-Temporal Graph-Based Causal Modeling for Cold-Start POI Check-in Forecasting

CausalPOI:基于时空图因果建模的冷启动POI签到预测

Zhaoqi Zhang, Miao Xie, Yi Li, Linyou Cai, Siqiang Luo, Gao Cong

机构 * Nanyang Technological University(南洋理工大学) China Agricultural University(中国农业大学) Meituan(美团)

AI总结 提出CausalPOI框架,利用时空功能交互图建模POI间语义和空间关系,通过结构对齐的处理和对照图模拟事实与反事实场景,解决冷启动POI签到预测问题,在真实数据集上显著优于基线。

Comments Accepted at KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05256 2026-06-05 cs.AI

How Far Did They Go? The Persuasive Tactics of Covert LLM Agents in a Discontinued Field Experiment

他们走了多远?已终止现场实验中隐蔽LLM代理的说服策略

Kokil Jaidka, Saifuddin Ahmed

机构 * Wee Kim Wee school of Communication and Information, Nanyang Technological University(魏家伟通信与信息学院,南洋理工大学)

AI总结 通过分析Reddit r/ChangeMyView已终止现场实验的公开数据集,研究隐蔽LLM代理在身份丰富的讨论论坛中使用的说服策略,发现其系统性采用身份定位、权威信号、对齐策略和认知偏差触发,构成以说服效率为导向的修辞架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04335 2026-06-05 cs.LG cs.SY eess.SY

Policy Gradient for Continuous-Time Robust Markov Decision Processes

连续时间鲁棒马尔可夫决策过程的策略梯度

Tanya Veeravalli, David M. Bossens, Atsushi Nitanda

机构 * Centre for Frontier AI Research, Agency for Science, Technology and Research (A*STAR)(前沿人工智能研究中心,科技研究局(A*STAR)) Institute of High Performance Computing, Agency for Science, Technology and Research (A*STAR)(高性能计算研究所,科技研究局(A*STAR)) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)

AI总结 本文针对连续时间鲁棒马尔可夫决策过程,推导了策略梯度和对抗梯度,并提出双循环优化器和平均场优化器,分别实现线性收敛和亚线性收敛,同时给出了样本复杂度分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26761 2026-06-05 cs.CV

Once-For-All: A Train-Once and Select-Anytime Framework for Multimodal Instruction Tuning

Once-For-All: 一种用于多模态指令微调的“一次训练,随时选择”框架

Mingkang Dong, Hongyi Cai, Xiwen Lei, Jie Li, Tao Zhang, Muxin Pu

机构 * Nanyang Technological University(南洋理工大学)

AI总结 提出OFA框架,通过一次训练可迁移的选择器,无需重新计算即可从任意数据集或模型中筛选出最具信息量的多模态指令数据,实现高效微调。

Comments 15 pages, 6 figures. Mingkang Dong and Hongyi Cai contributed equally to this work. Muxin Pu is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26179 2026-06-05 cond-mat.mtrl-sci cs.AI cs.CE

AutoDFT: A Closed-Loop Multi-Agent Framework for Autonomous DFT Calculations

AutoDFT:用于自主DFT计算的闭环多智能体框架

Penghui Yang, Zhonghan Zhang, Yue Li, Xinrun Wang, Yanchen Deng, Yuhao Lu, Bijun Tang, Zheng Liu, Bo An

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Singapore Management University(新加坡管理大学)

AI总结 提出AutoDFT闭环多智能体框架,通过将LLM推理嵌入DFT计算全生命周期,实现从规划到执行的自主适应,在VASPBench基准上达到94.1%任务成功率,并可靠预测电子、磁性和能量性质。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19309 2026-06-05 cs.CL

How Do Document Parsers Break? Auditing Structural Vulnerability in Document Intelligence

文档解析器如何失效?审计文档智能中的结构脆弱性

Yue Chen, Yihao Wang, Ziyi Tang, Yongsen Zheng, Keze Wang

机构 * Sun Yat-sen University(中山大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出ProSA框架,通过解耦控制探测、策略驱动目标和结构感知诊断,审计文档布局分析(DLA)管道中的结构脆弱性,发现块级结构损失率(B-SLR)比受影响面积更能反映OCR不稳定性,且结构探测导致更大的下游QA/检索退化。

Comments 18 pages, 5 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04968 2026-06-04 cs.RO

Potential-Guided Flow Matching for Vision-Language-Action Policy Improvement

势引导的流匹配用于视觉-语言-动作策略改进

Yunpeng Mei, Jiakai He, Hongjie Cao, Chenyu Wang, Xiaowen Zhu, Yihan Zhou, Jiamin Wang, Chenbo Xin, Peng Cheng, Yuxuan Yang, Yijie Wang, Xinhu Zheng, Gao Huang, Jie Chen, Gang Wang

机构 * Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学)

AI总结 提出ForesightFlow,一种自引导流匹配策略,通过解耦优势加权流匹配和一步边界估计器,无需外部评论家即可改进视觉-语言-动作策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04889 2026-06-04 cs.CL

GRAIL: Gradient-Reweighted Advantages for Reinforcement Learning with Verifiable Rewards

GRAIL: 基于梯度重加权优势的可验证奖励强化学习

Tej Deep Pala, Vernon Toh, Soujanya Poria

机构 * DeCLaRe Lab, Nanyang Technological University(DeCLaRe实验室,南洋理工大学)

AI总结 针对强化学习中统一优势分配导致梯度信号稀释的问题,提出基于梯度激活显著性的令牌级优势重加权方法GRAIL,无需过程级监督即可提升推理对齐,在多个模型上平均准确率提升3.60%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04457 2026-06-04 cs.CV

Imagine Before You Draw: Visual Prompt Engineering for Image Generation

先构思再绘制:面向图像生成的视觉提示工程

Liyu Jia, Fengda Zhang, Jiachun Pan, Kesen Zhao, Saining Zhang, Wang Lin, Weijia Wu, Yue Liao, Aojun Zhou, Hanwang Zhang

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(国立新加坡大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 提出视觉提示工程(VPE),通过在单一模型内先生成视觉语义令牌作为中间计划,再生成完整图像,从而避免信息瓶颈,提升图像生成质量与编辑保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04436 2026-06-04 cs.CV cs.RO

3DThinkVLA: Endowing Vision-Language-Action Models with Latent 3D Priors via 3D-Thinking-Guided Co-training

3DThinkVLA:通过3D思维引导的协同训练赋予视觉-语言-动作模型潜在3D先验

Jiaxin Shi, Xidong Zhang, Fucai Zhu, Zhe Li, Siyu Zhu, Weihao Yuan

机构 * Shanghai Jiao Tong University(上海交通大学) Harbin Institute of Technology(哈尔滨工业大学) Nanyang Technological University(南洋理工大学) Fudan University(复旦大学) Nanjing University(南京大学) Daimon Robotics(达梦机器人) Great Bay University(大亚大学)

AI总结 提出3D思维引导的协同训练框架,通过解耦3D几何感知与空间推理并在不同特征层次注入,使VLA模型在动作预测中隐式进行3D空间推理,无需3D传感器或外部模型,在多个基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01212 2026-06-04 cs.CL cs.AI cs.CR cs.IR

DiscourseFlip: An Oblique Discourse-Level Opinion Manipulation Attack against Black-box Retrieval-Augmented Generation

DiscourseFlip: 面向黑盒检索增强生成的非直述式语篇级观点操纵攻击

Yuyang Gong, Miaokun Chen, Jiawei Liu, Zhuo Chen, Guoxiu He, Wei Lu, XiaoFeng Wang, Xiaozhong Liu

机构 * Wuhan University(武汉大学) East China Normal University(华东师范大学) Nanyang Technological University(南洋理工大学) Worcester Polytechnic Institute(沃思堡理工学院)

AI总结 提出一种基于图引导的代理攻击方法DiscourseFlip,通过语义查询网络中的协同影响在有限预算下最大化语篇级观点偏差,实验证明其有效性和隐蔽性,并揭示现有防御的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14099 2026-06-04 cs.CV

ViewMask-1-to-3: Multi-View Consistent Image Generation via Multimodal Discrete Diffusion Models

ViewMask-1-to-3: 通过多模态离散扩散模型实现多视图一致图像生成

Ruishu Zhu, Zhihao Huang, Jiacheng Sun, Ping Luo, Hongyuan Zhang, Xuelong Li

机构 * Nanyang Technological University(南洋理工大学)

AI总结 提出ViewMask-1-to-3,将多视图生成建模为离散序列预测问题,利用MAGVIT-v2视觉令牌和掩码令牌预测的离散扩散,通过迭代去掩码实现渐进式多视图生成,无需专门架构或3D几何先验,在GSO和3D-FUTURE基准上优于基线方法。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21469 2026-06-04 eess.IV cs.CV

Embedding Compression Distortion in Video Coding for Machines

面向机器的视频编码中的嵌入压缩失真

Yuxiao Sun, Yao Zhao, Meiqin Liu, Chao Yao, Weisi Lin

机构 * Beijing Jiaotong University, China(北京交通大学) University of Science and Technology Beijing, China(北京科技大学) Nanyang Technological University, Singapore(南洋理工大学)

AI总结 提出压缩失真表示嵌入(CDRE)框架,通过提取机器感知相关的失真表示并嵌入下游模型,提升压缩视频的任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02555 2026-06-04 cs.CV cs.CL

High-Quality Entity Segmentation and Grounding

高质量实体分割与定位

Lu Qi, Yi-Wen Chen, Tao Zhang, Xiangtai Li, Xu Yang, Bo Du, Ming-Hsuan Yang

机构 * Wuhan University(武汉大学) Insta360 Research(Insta360研究院) Department of EECS, University of California, Merced(加州大学默塞德分校电子工程与计算机科学系) Nanyang Technological University(南洋理工大学) Institute of Automation of the Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 提出ESG流水线,通过新数据集EntitySeg和两阶段解耦设计(CropFormer高质量分割+GELLA精确名词提取与语义匹配),实现高质量实体分割与定位,在五项任务上有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
1810.08759 2026-06-04 eess.SY cs.AI cs.SY

Design of robust H_inf fuzzy output feedback controller for affine nonlinear systems:Fuzzy Lyapunov function approach

面向仿真非线性系统的鲁棒H_∞模糊输出反馈控制器设计:模糊Lyapunov函数方法

Leila Rajabpour, Mokhtar Shasadeghi, Alireza Barzegar

机构 * University of Technology Malaysia(技术大学马来西亚) Shiraz University of Technology(谢尔兹技术大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出了一种基于非二次Lyapunov函数和引入松弛矩阵技术的新系统方法,用于具有扰动的仿真非线性系统。首先,将仿真非线性系统表示为Takagi-Sugeno(T-S)模糊双线性模型。随后,基于并行分布式补偿(PDC)方案设计鲁棒H_∞控制器。通过利用Lyapunov函数推导出稳定性条件,以线性矩阵不等式(LMIs)形式表达。此外,提出一些松弛矩阵以减少LMIs稳定性条件的保守性。最后,通过详细讨论等温连续搅拌釜反应器(CSTR)用于Van de Vusse反应器的应用,来说明所提方法的优点并验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
1709.05077 2026-06-04 cs.AI cs.SY eess.SY

Transforming Cooling Optimization for Green Data Center via Deep Reinforcement Learning

通过深度强化学习优化绿色数据中心的冷却系统

Yuanlong Li, Yonggang Wen, Kyle Guan, Dacheng Tao

机构 * School of Computer Science and Engineering, Nanyang Technological University(南洋理工大学计算机科学与工程学院) Bell Labs, Nokia(诺基亚贝尔实验室)

AI总结 本文提出利用数据中心监控数据优化冷却控制策略,采用深度强化学习框架设计端到端冷却控制算法,实现冷却成本降低11%的模拟平台结果及15%的实时数据节省。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03184 2026-06-03 q-fin.CP cs.LG q-fin.ST

FinStressTS: A Parametric Synthetic Benchmark for Time-Series Forecasting in Finance

FinStressTS: 金融时间序列预测的参数化合成基准

Jiaze Sun, Kelvin J. L. Koa, Ruiyang Ni, Yize Liu, Haonan Chen, Ke-Wei Huang

机构 * National University of Singapore(新加坡国立大学) Asian Institute of Digital Finance(亚洲数字金融研究所) Nanyang Technological University(南洋理工大学)

AI总结 针对金融预测中信号弱、机制复杂的问题,提出FinStressTS合成基准,通过30个诊断环境系统评估15种模型在点预测与概率预测上的表现,揭示模型性能对数据机制的依赖性。

Comments KDD 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03762 2026-06-03 cs.LG cs.AI

Tool-Aware Optimization with Entropy Guidance for Efficient Agentic Reinforcement Learning

基于熵引导的工具感知优化用于高效智能体强化学习

Hongye Cao, Nuo Yan, Haoyuan Deng, Ziwei Wang, Tianpei Yang, Jing Huo, Yuyao Zhang, Yang Gao

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) Nanyang Technological University(南洋理工大学) China Mobile NineVerse Artificial Intelligence Technology (Beijing) Co., Ltd.(中国移动九章人工智能技术(北京)有限公司) Institute of Artificial Intelligence, NineVerse(九章人工智能研究院)

AI总结 提出TAO-RL框架,通过工具感知轨迹过滤和熵引导探索解决智能体强化学习中工具使用导致的训练不稳定问题,在7个推理基准上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03603 2026-06-03 cs.CV cs.CL

World Models Meet Language Models: On the Complementarity of Concrete and Abstract Reasoning

世界模型遇见语言模型:论具体推理与抽象推理的互补性

Yucheng Zhou, Wei Tao, Yiwen Guo, Jianbing Shen

机构 * Nanyang Technological University(南洋理工大学)

AI总结 本文提出受控具体推理框架及PF-OPSD方法,通过结合世界模型的视觉模拟与多模态大语言模型的抽象推理,在空间前瞻和开放域物理预测任务上提升性能与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03461 2026-06-03 cs.AI

What Makes Interaction Trajectories Effective for Training Terminal Agents?

什么使得交互轨迹对训练终端代理有效?

Sidi Yang, Chaofan Tao, Jierun Chen, Tiezheng Yu, Ruoyu Wang, Yuxin Jiang, Yiming Du, Wendong Xu, Jing Xiong, Taiqiang Wu, Lifeng Shang, Xiaohui Li, Ngai Wong, Haoli Bai

机构 * The University of Hong Kong(香港大学) Huawei Technologies(华为技术有限公司) Nanyang Technological University(南洋理工大学)

AI总结 本文通过Terminal-Lego流水线研究交互轨迹的教学效能,发现低分代理(DeepSeek-V3.2)的轨迹比高分代理(Claude Opus 4.6)更能提升学生泛化能力,归因于环境接地监督(EGS),并展示了极佳的数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03399 2026-06-03 cs.CL cs.CR

Selective Token-Level Cryptographic Redaction for Privacy-Preserving Clinical Deployment of Large Language Models

选择性令牌级密码学编辑用于大型语言模型的隐私保护临床部署

Farhan Sheth, Ziyuan Yang, Yongying Lan, Si Yong Yeo

机构 * MedVisAI Lab, Singapore(新加坡MedVisAI实验室) Ruijin Hospital, Shanghai Jiao Tong University School of Medicine, China(中国上海交通大学医学院瑞金医院) Lee Kong Chian School of Medicine, Nanyang Technological University, Singapore(新加坡南洋理工大学Lee Kong Chian医学院)

AI总结 提出HERALD框架,通过令牌级密码学编辑仅加密敏感令牌,在保护隐私的同时保持下游模型效用,在分类和医疗问答任务上接近明文性能。

Comments 33 pages, 8 figures, 26 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03296 2026-06-03 cs.RO

Bridging Predictive Uncertainty and Safe Action: Sample-Conditioned Differentiable Planning for Autonomous Driving

桥接预测不确定性与安全行动:面向自动驾驶的样本条件可微分规划

Chengzhen Meng, Pei Liu, Zhiyu Huang, Chen Lv, Jun Ma

机构 * Robotics and Autonomous Systems Thrust, The Hong Kong University of Science and Technology(香港科学与技术大学机器人与自主系统方向) Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology(香港科学与技术大学电子与计算机工程系) Department of Civil and Environmental Engineering, University of California, Los Angeles(加州大学洛杉矶分校土木与环境工程系) School of Mechanical and Aerospace Engineering, Nanyang Technological University(南洋理工大学机械与航空航天工程学院)

AI总结 提出一种样本条件可微分规划框架,通过扩散模型生成多样未来场景并直接输入可微分规划器,利用条件风险价值约束缓解预测不确定性,实现安全、高效、舒适的自动驾驶运动规划。

详情

展开后加载摘要…

URL PDF HTML 收藏