arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Stanford University(斯坦福大学)

2026-07-31 至 2026-07-31 共收录 6
2607.27905 2026-07-31 cs.LG cs.AI 新提交

Class-Aware Reinforcement Learning for Counterfactual Explanation Generation

用于反事实解释生成的类别感知强化学习

Muhammad Adil Saleem, Syed Ali Raza, Mary-Anne Williams

机构 * Institute of Business Administration Karachi(卡拉奇工商管理学院) Commonwealth Bank of Australia(澳大利亚联邦银行) Stanford University(斯坦福大学) University of New South Wales(新南威尔士大学)

AI总结 本研究提出类别感知强化学习方法,将实例预测类别纳入RL状态表示,经7个不同领域数据集对比实验,该方法收敛更快、奖励优化更好、有效反事实解释更多,凸显类别感知的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27549 2026-07-31 cs.RO cs.AI cs.CV cs.LG 新提交

Cross-Embodiment Transfer via Behavior-Aligned Representations

基于行为对齐表征的跨具身迁移

Ajay Sridhar, Jensen Gao, Jonathan Yang, Jean Mercat, Suneel Belkhale, Dorsa Sadigh

机构 * Stanford University(斯坦福大学) Toyota Research Institute(丰田研究所)

AI总结 本研究提出在视觉-语言-动作模型中采用行为对齐表征,开发仿真基准验证其可提升跨具身迁移,使真实机器人任务完成进度提升28%。

Comments Project page: https://ajaysridhar.com/barx/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27422 2026-07-31 cs.LG 新提交

Good Rankers, Bad Objectives: Bilinear Contrastive Critics under Expressive Policy Search

好的排序器,差的目标:表达性策略搜索下的双线性对比评判器

Ayushman Singh, Siddharth Aphale

机构 * Stanford University(斯坦福大学) Sesame AI(芝麻AI公司)

AI总结 该研究发现双线性对比评判器的排序能力与其优化安全性不匹配,其存在范数漂移等问题,在多任务中无法可靠排序动作,需结合价值校准标量用于动作选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27420 2026-07-31 cs.AI cs.CL 新提交

Dimensionality and Measurement Precision in HLE's Multiple-Choice Subset

HLE多项选择子集的维度与测量精度

Mayank Sharma, Savira Nadela, Tyler Matteson

机构 * Stanford University(斯坦福大学)

AI总结 本研究评估29个LLM在HLE多项选择子集上的表现,发现HLE仅测量单一一般推理因素,其领域子分数不具区分能力,且对前沿模型的区分能力有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27415 2026-07-31 cs.AI 新提交

Bridging Inference-Time Scaling and Episodic Memory with Action-Centric Graphs

基于动作中心图的推理时缩放与情景记忆的衔接

Xu Zheng, Chaohao Lin, Zhuomin Chen, Weijieying Ren, Haifeng Chen, Wei Cheng, Dongsheng Luo

机构 * Florida International University(佛罗里达国际大学) Stanford University(斯坦福大学) NEC Laboratories America(美国NEC实验室) Singapore Management University(新加坡管理大学)

AI总结 本文提出GAMER框架,通过动作中心图衔接推理缩放与情景记忆,采用双流时间差分学习优化决策,在多基准上较普通基线提升了20.81%的成功率与6.17%的进度率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27501 2026-07-31 cs.LG hep-ph 新提交

A Lightweight Foundation Model for Collider Physics with Multi-Domain Adaptation

面向对撞机物理的轻量级基础模型:多领域适配

Liangyu Wu, Qibin Liu, Alexander Yue, Julia Gonski

机构 * Stanford University(斯坦福大学) SLAC National Accelerator Laboratory(SLAC国家加速器实验室)

AI总结 该研究提出轻量级基础模型NEXUS,以300万参数的全连接自编码器为架构,通过对撞机数据预训练实现多领域适配,在下游任务中提升准确率且计算复杂度低于同规模Transformer。

Comments 18 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏