arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

2026-08-14 至 2026-08-14 共收录 2 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 模型式强化学习 2 篇

2608.12334 2026-08-14 cs.CL cs.AI 新提交 50%

Steering the Language Axis: From Linear Decodability to Causal Control

操控语言轴:从线性可解码到因果控制

Arnav Srivastav

机构 * University of California, Santa Cruz(加利福尼亚大学圣克鲁兹分校)

专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.AI

AI总结 本研究探究大语言模型的语言身份是否可通过紧凑激活方向因果控制,在Qwen、Llama等模型的126万次生成上证实,分离的PCA导出语言轴可可靠操控语言切换,且语言选择具层特异性与语言对依赖性。

Comments 22 pages, 14 figures, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19612 2026-08-14 cs.LG cs.AI cs.RO 版本更新 50%

Safe Exploration via Policy Priors

通过策略先验进行安全探索

Manuel Wendl, Yarden As, Manish Prajapat, Anton Pollak, Stelian Coros, Andreas Krause

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 模型式强化学习 :分类 cs.AI、cs.LG、cs.RO;dynamics model(abstract)

AI总结 提出SOOPER方法,利用次优但保守的策略先验,结合概率动力学模型进行乐观探索和悲观回退,在保证安全的同时收敛到最优策略。

详情

展开后加载摘要…

URL PDF HTML 收藏