arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Johns Hopkins University(约翰斯·霍普金斯大学)

2026-08-20 至 2026-08-20 共收录 6
2608.18404 2026-08-20 cs.LG cs.AI cs.SC 新提交

Vector Symbolic Policy Gradient

向量符号策略梯度

Ryozo Masukawa, Sanggeon Yun, SungHeon Jeong, Hyunwoo Oh, Raheeb Hassan, Pietro Mercati, Nathaniel D. Bastian, Mahdi Imani, Mohsen Imani

机构 * University of California, Irvine(加州大学欧文分校) Intel Corporation(英特尔公司) Johns Hopkins University(约翰斯·霍普金斯大学) Northeastern University(东北大学)

AI总结 该研究提出VSPG算法,以单位范数超向量表示离散动作,通过优势加权超向量捆绑更新动作,可实现样本高效学习且推理内存不增加,还证明其动作选择在随机比特翻转下稳定,连接了三类方法并提供鲁棒性保证。

Comments Code available in this https URL (https://github.com/BiasLabProjects/VSPG)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18399 2026-08-20 cs.CV 新提交

What Does Attention Transfer Transfer? Attention Structure and Robustness in Vision Transformers

注意力迁移迁移了什么?视觉Transformer中的注意力结构与鲁棒性

Jesse Ponnock

机构 * Johns Hopkins University(约翰斯·霍普金斯大学)

AI总结 该研究通过分析视觉Transformer的注意力结构,发现注意力迁移的差距源于特征而非注意力结构,且鲁棒性成熟晚于准确率,早停规则会对鲁棒性采样不足。

Comments 28 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17253 2026-08-20 cs.LG cs.AI cs.CV 版本更新

Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL

Co-RL:多智能体强化学习中多样群体涌现的无监督推理

Yunhao Yang, Yuexin Bian, Yunjie Tian, Di Fu, Tianjin Huang, Yuanyuan Shi, Ziang Xiao, Nuno Vasconcelos, Yijiang Li

机构 * University of Exeter(埃克塞特大学) ByteDance(字节跳动) Johns Hopkins University(约翰斯·霍普金斯大学) UC San Diego(加州大学圣迭戈分校)

AI总结 本研究提出Co-RL框架,通过参数不共享的多智能体协作训练,利用同伴奖励减少对真实标注的依赖,提升纯文本及多模态任务的推理性能,缓解训练崩溃与响应同质化问题。

Comments 30 pages, 5 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16794 2026-08-20 cs.RO cs.AI cs.CL 版本更新

Neurosymbolic Embodied Agents

神经符号具身智能体

Mohammad Albinhassan, Yuming Feng, Alessandra Russo, Pranava Madhyastha

机构 * Imperial College London(帝国理工学院) Johns Hopkins University(约翰斯·霍普金斯大学) City, University of London(伦敦城市大学)

AI总结 该研究提出一种神经符号具身智能体,将长周期家庭任务分解为视觉探索与符号规划,在VirtualHome、ALFWorld基准测试中表现优异,约束与搜索结合可大幅提升任务解决率,且无需专门训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26902 2026-08-20 cs.IR cs.AI 版本更新

ICICLE: Expanding Retrieval with In-Context Documents

ICICLE: 利用上下文文档扩展检索

Yu-Chen Den, Yung-Yu Shih, Zhi Rui Tam, Kuan-Yu Chen, Pu-Jen Cheng, Yun-Nung Chen, Eugene Yang

机构 * National Taiwan University(台湾大学) Johns Hopkins University(约翰霍普金斯大学)

AI总结 提出ICICLE框架,通过上下文文档的docid生成实现增量式生成检索,避免重新训练和灾难性遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02196 2026-08-20 cs.AI cs.LG math.ST stat.ML 版本更新

Conformal Policy Control

符合性策略控制

Drew Prinster, Clara Fannjiang, Ji Won Park, Kyunghyun Cho, Anqi Liu, Suchi Saria, Samuel Stanton

机构 * Johns Hopkins University(约翰霍普金斯大学) New York University(纽约大学)

AI总结 本文提出一种基于安全参考策略的符合性校准方法,用于在不违反安全约束的前提下,使优化但未测试的策略能够安全地进行探索,并在有限样本下提供理论保证。

Comments International Conference on Machine Learning (ICML), 2026. v4: Revised CPC theory to (a) show enforced smoothness for likelihood-ratio control parameter and (b) for general control parameter, assume smoothness only of constrained policy $π_t^{(β)}$ w.r.t. $β$ (rather than of $(l_i - α)\cdotπ_t^{(β)}$ or of conformal weights)

详情

展开后加载摘要…

URL PDF HTML 收藏