arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Stanford University(斯坦福大学)

2026-05-19 至 2026-05-19 共收录 28
2605.18747 2026-05-19 cs.CL cs.AI

Code as Agent Harness

代码作为代理工具

Xuying Ning, Katherine Tieu, Dongqi Fu, Tianxin Wei, Zihao Li, Yuanchen Bei, Jiaru Zou, Mengting Ai, Zhining Liu, Ting-Wei Li, Lingjie Chen, Yanjun Zhao, Ke Yang, Bingxuan Li, Cheng Qian, Gaotang Li, Xiao Lin, Zhichen Zeng, Ruizhong Qiu, Sirui Chen, Yifan Sun, Xiyuan Yang, Ruida Wang, Rui Pan, Chenyuan Yang, Dylan Zhang, Liri Fang, Zikun Cui, Yang Cao, Pan Chen, Dorothy Sun, Ren Chen, Mahesh Srinivasan, Nipun Mathur, Yinglong Xia, Hong Li, Hong Yan, Pan Lu, Lingming Zhang, Tong Zhang, Hanghang Tong, Jingrui He

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Meta Stanford University(斯坦福大学)

AI总结 本文探讨了代码在代理系统中的作用,提出了一种统一的视角,将代码视为代理基础设施的基础,并讨论了代理工具接口、机制以及扩展到多代理系统的挑战。

Comments GitHub: https://github.com/YennNing/Awesome-Code-as-Agent-Harness-Papers

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18365 2026-05-19 cs.CV

GeoFlow: Enforcing Implicit Geometric Consistency in Video Generation

GeoFlow: 在视频生成中强制隐式几何一致性

Jan Ackermann, Shengqu Cai, Boyang Deng, Zhengfei Kuang, Songyou Peng, Gordon Wetzstein

机构 * Stanford University(斯坦福大学) Google DeepMind(谷歌DeepMind)

AI总结 本文提出GeoFlow,一种通过强化学习微调来增强视频生成中几何一致性的方法,通过引入几何一致性奖励,有效减少时间上的几何伪影,同时保持感知质量。

Comments Project Page: https://geometryflow.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15960 2026-05-19 cs.AI cs.LG

Imperfect World Models are Exploitable

不完美的世界模型是可利用的

Logan Mondal Bhamidipaty, Esmeralda S. Whitammer, David Abel, Mykel J. Kochenderfer, Subramanian Ramamoorthy

机构 * University of Edinburgh(爱丁堡大学) Stanford University(斯坦福大学)

AI总结 本文提出了一种新的强化学习中模型利用的定义,指出世界模型如果暗示某种策略应严格优于另一种策略,而真实环境转移模型却暗示相反,那么该模型就是可利用的。研究通过发展奖励黑客和模型利用的一般理论,证明在大规模策略集上利用本质上是不可避免的,并揭示了安全规划在世界模型中的局限性。

Comments 17 pages, 3 figures, 2 tables; modified (fixed metadata)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12970 2026-05-19 cs.CL

Leveraging Speech to Identify Signatures of Insight and Transfer in Problem Solving

利用语音识别洞察和迁移的特征

Linas Nasvytis, Judith E. Fan

机构 * Department of Psychology, Stanford University(斯坦福大学心理学系) Graduate School of Education, Stanford University(斯坦福大学教育研究生院) Department of Computer Science, Stanford University(斯坦福大学计算机科学系)

AI总结 研究通过语音分析探讨解决问题过程中洞察力的表现形式及其对后续问题解决的影响,发现可迁移的洞察力更容易被口头描述。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10930 2026-05-19 cs.CL cs.AI

Evaluating Language Models' Evaluations of Games

评估语言模型对游戏的评估

Katherine M. Collins, Cedegao E. Zhang, Graham Todd, Lance Ying, Mauricio Barba da Costa, Ryan Liu, Prafull Sharma, Adrian Weller, Ionatan Kuperwajs, Lionel Wong, Joshua B. Tenenbaum, Thomas L. Griffiths

机构 * University of Cambridge(剑桥大学) MIT(麻省理工学院) Princeton University(普林斯顿大学) NYU(纽约大学) Harvard University(哈佛大学) Stanford University(斯坦福大学)

AI总结 本文研究了语言模型对游戏评估的能力,通过比较现代语言模型和人类及符号计算代理的评估结果,发现推理模型在游戏评估上更接近人类,但随着模型接近博弈最优,其与人类数据的匹配度会减弱,且在评估趣味性时表现出更大的波动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.13059 2026-05-19 cs.CY cs.AI cs.ET

Prioritizing High-Consequence Biological Capabilities in Evaluations of Artificial Intelligence Models

在评估人工智能模型时优先考虑高后果生物能力

Jaspreet Pannu, Doni Bloomfield, Alex Zhu, Robert MacKnight, Gabe Gomes, Anita Cicero, Thomas V. Inglesby

机构 * Center for Health Security, Bloomberg School of Public Health, Johns Hopkins University(健康安全中心,公共卫生学院,约翰霍普金斯大学) Department of Health Policy, Stanford School of Medicine, Stanford University(健康政策系,斯坦福医学院,斯坦福大学) Department of Chemical Engineering, Carnegie Mellon University(化学工程系,卡内基梅隆大学) Department of Chemistry, Carnegie Mellon University(化学系,卡内基梅隆大学) Wilton E. Scott Institute for Energy Innovation, Carnegie Mellon University(威尔顿·E·斯科特能源创新研究所,卡内基梅隆大学)

AI总结 本文基于人工智能模型的安全性、安全性和伦理问题,提出在评估人工智能模型时应优先考虑高后果风险,如大规模公众危害(如大流行病),并应在部署前进行评估,以建立针对性的AI安全评估方法,确保工具的安全性和防止潜在危害。

Comments 9 pages, 1 figure, 3 tables, 1 box

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17912 2026-05-19 cs.RO cs.CV

WorldArena 2.0: Extending Embodied World Model Benchmarking on Modality, Functionality and Platform

WorldArena 2.0: 扩展模态、功能和平台的具身世界模型基准测试

Yu Shang, Yinzhou Tang, Yiding Ma, Zhuohang Li, Lei Jin, Weikang Su, Xin Jin, Zhaolu Wang, Ziyou Wang, Xin Zhang, Haisheng Su, Weizhen He, Wei Wu, Haoyi Duan, Gordon Wetzstein, Xihui Liu, Dhruv Shah, Zhaoxiang Zhang, Zhibo Chen, Jun Zhu, Yonghong Tian, Tat-Seng Chua, Wenwu Zhu, Chen Gao, Yong Li

机构 * Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Stanford University(斯坦福大学) The University of Hong Kong(香港大学) Princeton University(普林斯顿大学) Chinese Academy of Sciences(中国科学院) University of Science and Technology of China(中国科学技术大学) Peking University(北京大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出WorldArena 2.0,扩展了具身世界模型的评估,涵盖模态、功能和平台三个维度,提供全面的测试平台以评估具身世界模型的进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17854 2026-05-19 cs.LG

Learning over Positive and Negative Edges with Contrastive Message Passing

通过对比信息传递学习正负边

Peter Pao-Huang, Charilaos I. Kanatsoulis, Michael Bereket, Jure Leskovec

机构 * Department of Computer Science(计算机科学系) Stanford University(斯坦福大学)

AI总结 本文研究了在低标签率、高同质性和高边密度设置下,负边信息对图表示学习的价值,并提出对比信息传递机制以同时利用正负边信息提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17850 2026-05-19 stat.ML cs.CV cs.LG cs.NA math.NA math.PR

Simple Approximation and Derivative Free Inference-Time Scaling for Diffusion Models via Sequential Monte Carlo on Path Measures

通过路径测度的序列蒙特卡洛实现扩散模型的简单近似与无导数推理时间缩放

Chenyang Wang, Weizhong Wang, Yinuo Ren, Jose Blanchet, Yiping Lu

机构 * School of Mathematical Sciences, Peking University, Beijing, China School of Mathematical Sciences, Fudan University, Shanghai, China Department of Industrial Engineering \& Management Sciences, Northwestern University, Evanston, IL, United States Institute for Computational \& Mathematical Engineering, Stanford University, Stanford, CA, United States Management Science \& Engineering, Stanford University, Stanford, CA, United States

AI总结 本文提出URGE算法,一种无需梯度的推理时间缩放方法,通过路径重要性重加权提升扩散模型样本质量,同时在合成测试和扩散模型基准中表现出色,且实现简单且无梯度依赖。

Comments accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17829 2026-05-19 cs.AI

Interactive Evaluation Requires a Design Science

交互评估需要一种设计科学

Keyang Xuan, Peiyang Song, Pan Lu, Pengrui Han, Wenkai Li, Zhenyu Zhang, Zexue He, Wenyue Hua, Manling Li, Jiaxuan You, Adrian Weller, Yizhong Wang, Jiaxin Pei

机构 * University of Texas Austin(德克萨斯大学奥斯汀分校) California Institute of Technology(加州理工学院) Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Microsoft Research(微软研究院) Northwestern University(西北大学) University of Cambridge(剑桥大学)

AI总结 本文探讨了交互评估应被视为一种原则性的评估范式,而非仅仅是新的智能体基准。通过定义评估为证据到判断的自主映射,文章展示了交互评估如何改变这一映射的两方面,并提出双轴分类法,制定设计原则和报告标准,分析了长期评估挑战在轨迹层面的再现。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17792 2026-05-19 cs.LG physics.geo-ph

HydroAgent: Closing the Gap Between Frontier LLMs and Human Experts in Hydrologic Model Calibration via Simulator-Grounded RL

HydroAgent: 通过模拟器引导的强化学习缩小前沿大语言模型与人类专家在水文模型校准之间的差距

Zhi Li, Songkun Yan, Jie Cao, Mofan Zhang, Anjiang Wei, Jinwoong Yoo, Yang Hong

机构 * Civil, Environmental, and Architectural Engineering, University of Colorado Boulder(科罗拉多大学波尔德分校土木、环境与建筑工程系) Civil Engineering and Environmental Sciences, University of Oklahoma(俄克拉荷马大学土木工程与环境科学系) Department of Computer Science, University of Oklahoma(俄克拉荷马大学计算机科学系) Civil and Environmental Engineering, Stanford University(斯坦福大学土木与环境工程系) Department of Computer Science, Stanford University(斯坦福大学计算机科学系) NASA Goddard Space Flight Center(美国国家航空航天局戈达德空间飞行中心)

AI总结 本文研究如何利用前沿大语言模型(LLM)代理替代人类水文模型师进行水文模型校准,提出HydroAgent方法,通过模拟器引导的强化学习(RLSF)进行微调,以提高模型在不同流域中的适应性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17379 2026-05-19 cs.CL cs.AI

Learning Faster with Better Tokens: Parameter-Efficient Vocabulary Adaptation for Specialized Text Summarization

通过更好的令牌学习:用于专业文本摘要的参数高效词汇适应

Gunjan Balde, Soumyadeep Roy, Mainack Mondal, Niloy Ganguly

机构 * Dept. of Computer Science and Engg., IIT Kharagpur(印度Kharagpur理工学院计算机科学与工程系) Dept. of Medicine (Biomedical Informatics), Stanford University(斯坦福大学医学院(生物医学信息学))

AI总结 本文提出了一种参数高效的领域适应方法,通过结合词汇适应和预训练,提升大型语言模型在专业领域文本摘要任务中的性能,同时减少训练时间和参数数量。

Comments 16 pages. Accepted in the 64th Annual Meeting of the Association for Computational Linguistics [ACL (Main) 2026] as a long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14133 2026-05-19 cs.AI

ClawForge: Generating Executable Interactive Benchmarks for Command-Line Agents

ClawForge: 为命令行代理生成可执行的交互式基准测试

Yuxiang Lai, Peng Xia, Haonian Ji, Kaiwen Xiong, Kaide Zeng, Jiaqi Liu, Fang Wu, Jike Zhong, Zeyu Zheng, Cihang Xie, Huaxiu Yao

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学切里波因特分校) Stanford University(斯坦福大学) University of California, Berkeley(加州大学伯克利分校) University of Southern California(南加州大学) University of California, Santa Cruz(加州大学圣克鲁兹分校)

AI总结 ClawForge通过生成可执行的交互式基准测试,解决了可扩展性与真实工作流评估之间的矛盾,通过系统测试代理在存在状态冲突时的处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01099 2026-05-19 cs.CV cs.AI cs.LG cs.RO

Geometry-aware 4D Video Generation for Robot Manipulation

面向机器人操作的几何感知4D视频生成

Zeyi Liu, Shuang Li, Eric Cousineau, Siyuan Feng, Benjamin Burchfiel, Shuran Song

机构 * Stanford University(斯坦福大学) Toyota Research Institute(丰田研究院)

AI总结 本文提出了一种几何感知的4D视频生成模型,通过跨视角点图对齐进行训练,以确保生成视频在多视角下的3D一致性,从而在单个RGB-D图像输入下生成时空一致的未来视频序列,并在不依赖相机姿态的情况下实现稳定的视觉和空间对齐预测。

Comments ICLR 2026; Project website: https://robot4dgen.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00409 2026-05-19 eess.AS cs.AI cs.LG

Perceptual implications of automatic anonymization in pathological speech

病态语音中自动匿名化的人感知影响

Soroosh Tayebi Arasteh, Saba Afza, Tri-Thien Nguyen, Lukas Buess, Maryam Parvin, Tomas Arias-Vergara, Paula Andrea Perez-Toro, Hiu Ching Hung, Mahshad Lotfinia, Thomas Gorges, Elmar Noeth, Maria Schuster, Seung Hee Yang, Andreas Maier

机构 * Pattern Recognition Lab, Friedrich-Alexander-Universit\"at Erlangen-N\"urnberg, Erlangen, Germany. Department of Urology, Stanford University, Stanford, CA, USA. Department of Radiology, Stanford University, Stanford, CA, USA. Lab for AI in Medicine, RWTH Aachen University, Aachen, Germany. Department of Diagnostic Interventional Radiology, University Hospital RWTH Aachen, Aachen, Germany. Institute of Radiology, University Hospital Erlangen, Erlangen, Germany. Department of Foreign Language Education, Friedrich-Alexander-Universität Erlangen-Nürnberg, Erlangen, Germany. Department of Otorhinolaryngology, Head Neck Surgery, Ludwig-Maximilians-Universität München, Munich, Germany. Speech \& Language Processing Lab, Friedrich-Alexander-Universität Erlangen-Nürnberg, Erlangen, Germany.

AI总结 本研究通过结构化协议评估自动匿名化病态语音的人感知影响,发现匿名化在不同疾病中存在显著差异,且感知质量下降,但临床严重程度评分保持稳定,同时发现感知结果与计算隐私指标脱钩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17271 2026-05-19 math.OC cs.LG

Scalable Bi-causal Optimal Transport via KL Relaxation and Policy Gradients

基于KL松弛和策略梯度的可扩展双因果最优传输

Haoyang Cao, Jesse Hoekstra, Renyuan Xu, Yumin Xu, Ruixun Zhang

机构 * Department of Applied Mathematics and Statistics, Data Science and AI Institute, and Mathematical Institute for Data Science, Johns Hopkins University(应用数学与统计学系、数据科学与人工智能学院以及数据科学数学研究所,约翰霍普金斯大学) Department of Statistics, Oxford-Man Institute of Quantitative Finance, and Nuffield College, University of Oxford(统计系、牛津-曼定量金融研究所以及牛津大学努尔菲尔德学院) Management Science & Engineering Department, Stanford University(管理科学与工程系,斯坦福大学) School of Mathematical Sciences, Peking University(北京大学数学科学学院)

AI总结 本文提出了一种基于KL松弛和策略梯度的可扩展双因果最优传输方法,通过引入KL惩罚项将硬约束转化为可处理的散度惩罚,从而解决连续分布和长时域下双因果耦合约束的计算难题,展示了在稳健子对冲和时间序列统计降缩等应用中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17198 2026-05-19 q-bio.NC cs.CV

MIRAGE: Robust multi-modal architectures translate fMRI-to-image models from vision to mental imagery

MIRAGE:鲁棒的多模态架构将fMRI到图像模型从视觉扩展到心理意象

Reese Kneeland, Cesar Kadir Torrico Villanueva, Jordyn Ojeda, Shuhb Khanna, Jonathan Xu, Paul S. Scotti, Thomas Naselaris

机构 * University of Minnesota(明尼苏达大学) Medical AI Research Center (MedARC)(医学人工智能研究中心 (MedARC)) University of Sydney(悉尼大学) Stanford University(斯坦福大学) Alljoined Sophont Princeton Neuroscience Institute(普林斯顿神经科学研究所)

AI总结 本文提出MIRAGE方法,通过多模态文本和图像特征训练,实现从脑活动解码心理意象,展示了在NSD-Imagery基准上SOTA的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17176 2026-05-19 cs.AI

CAREBench: Evaluating LLMs' Emotion Understanding by Assessing Cognitive Appraisal Reasoning

CAREBench: 通过评估认知评价推理来评估LLMs的情感理解

Zhaoyue Sun, Hainiu Xu, Andero Uusberg, James J. Gross, Petr Slovak, Yulan He

机构 * Department of Informatics(信息学院) King’s College London(伦敦国王学院) Institute of Psychology(心理学研究所) University of Tartu(塔尔图大学) Department of Psychology(心理学系) Stanford University(斯坦福大学) The Alan Turing Institute(艾伦·图灵研究所)

AI总结 本文提出CAREBench,首个全面标注认知评价推理、评价评分和多标签情感标注的基准,通过系统实验发现更强模型在某些任务上匹配或超越人类,但在评价推理和积极情绪识别上表现不足,揭示了当前模型未能内部化捕捉人类主观异质性的机制。

Comments 27 pages,18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02028 2026-05-19 cs.CL

Language models fail at extended rule following

语言模型在扩展规则遵循中表现不佳

Tianxiang Dai, Jonathan Fan

机构 * Department of Electrical Engineering, Stanford University(斯坦福大学电气工程系)

AI总结 研究发现语言模型在重复应用规则时无法保持精确状态,即使增加模型规模和计算资源也无法克服这一缺陷,表明需要新的模型架构来实现可靠的规则遵循。

Comments for accessing the data and code for reproduction of the study, see https://txdai.github.io/counting-reliability/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12243 2026-05-19 cs.RO

HandelBot: Real-World Piano Playing via Fast Adaptation of Dexterous Robot Policies

HandelBot:通过快速适应灵巧机器人策略实现真实世界钢琴演奏

Amber Xie, Haozhi Qi, Dorsa Sadigh

机构 * Stanford University(斯坦福大学) Amazon FAR (Frontier AI & Robotics)(亚马逊前沿人工智能与机器人实验室)

AI总结 本文提出HandelBot框架,结合仿真策略和快速适应,通过两阶段流程实现高精度双手钢琴演奏,实验表明其在真实环境中的表现优于直接仿真部署。

Comments Website: https://amberxie88.github.io/handelbot

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23986 2026-05-19 cs.AI

TusoAI: Agentic Optimization for Scientific Methods

TusoAI: 科学方法的代理优化

Alistair Turcan, Kexin Huang, Lei Li, Martin Jinye Zhang

机构 * Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学) Phylo

AI总结 TusoAI通过整合领域知识和迭代优化,提升科学任务中计算方法的性能,优于现有专家方法和科学AI代理,在单细胞RNA测序数据去噪和卫星地球监测等任务中表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20981 2026-05-19 cs.CL cs.AI cs.SI

Patients Speak, AI Listens: LLM-based Analysis of Online Reviews Uncovers Key Drivers for Urgent Care Satisfaction

患者发声,AI倾听:基于大语言模型的在线评论分析揭示了紧急护理满意度的关键驱动因素

Xiaoran Xu, Zhaoqian Xue, Chi Zhang, Jhonatan Medri, Junjie Xiong, Jiayan Zhou, Jin Jin, Yongfeng Zhang, Siyuan Ma, Lingyao Li

机构 * Electrical Engineering department, University of South Florida(佛罗里达州立大学电气工程系) Department of Biostatistics, Epidemiology and Bioinformatics, University of Pennsylvania(宾夕法尼亚大学生物统计学、流行病学与生物信息学系) Computer Science and Engineering department, University of South Florida(佛罗里达州立大学计算机科学与工程系) Mathematics & Statistics, University of South Florida(佛罗里达州立大学数学与统计学系) Department of Computer Science and Engineering, University of Missouri Science and Technology(密苏里科技大学计算机科学与工程系) School of Medicine, Stanford University(斯坦福大学医学院) Department of Computer Science, Rutgers University(罗格斯大学计算机科学系) Department of Biostatistics, Vanderbilt University(范德比尔特大学生物统计学系)

AI总结 本文利用大语言模型分析在线评论,揭示紧急护理满意度的关键因素,发现人际因素和运营效率是主要决定因素,其他因素在调整后无显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16604 2026-05-19 cs.LG

R2V Agent: Teaching SLMs When to Ask for Help

R2V Agent:教SLMs何时请求帮助

Raghu Vamshi Hemadri, Humaira Firdowse Mohammed, Rishabh Maheshwary, Srivatsava Daruru, Sagar Davasam, Vikas Yadav, Srinivas Sunkara, Sai Rajeswar

机构 * New York University Tandon School of Engineering(纽约大学Tandon工程学院) University of California, San Diego(加州大学圣地亚哥分校) Stanford University(斯坦福大学) ServiceNow Research(ServiceNow研究) Mila - Quebec AI Institute(魁北克AI研究院) Université de Montréal(蒙特利尔大学)

AI总结 R2V-Agent通过风险校准的SLM-LLM路由框架提升交互代理的可靠性,结合小型语言模型策略、更强的教师LLM、轻量级过程验证器和校准的步骤路由器,在多个基准测试中显著提升性能与成本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16527 2026-05-19 cs.LG cs.AI

Hypergraph Pattern Machine: Compositional Tokenization for Higher-Order Interactions

超图模式机:用于高阶交互的组合分词

Kyrie Zhao, Zehong Wang, Tianyi Ma, Fang Wu, Xiangru Tang, Pietro Lio, Sheng Wang, Yanfang Ye

机构 * University of Notre Dame(内布拉斯加大学) Stanford University(斯坦福大学) Yale University(耶鲁大学) University of Cambridge(剑桥大学) University of Washington(华盛顿大学)

AI总结 本文提出超图模式机,通过学习子集的组合模式,改进高阶交互的建模,从而在超图基准和真实案例中取得更好效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16341 2026-05-19 cs.LG

Orth-Dion: Eliminating Geometric Mismatch in Distributed Low-Rank Spectral Optimization

Orth-Dion:消除分布式低秩谱优化中的几何不匹配

Tatsuhiro Nakamori, Laura Gomezjurado Gonzalez, Ganesh Talluri, Ansh Tiwari, Hideyuki Kawashima, Ioannis Mitliagkas, Guillaume Rabusseau, Hiroki Naganuma

机构 * Keio University(庆应大学) Stanford University(斯坦福大学) Midwestern University(中西部大学) California Institute of Technology(加州理工学院) Mila Université de Montréal(蒙特利尔大学)

AI总结 Orth-Dion通过替换列归一化为右因子的QR正交化,解决分布式低秩谱优化中的几何不匹配问题,实现与Dion相同通信成本下的最优收敛率。

Comments 24 pages, 3 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16303 2026-05-19 cs.CY cs.AI cs.CL

From Demographics to Survey Anchors: Evaluating LLM Agents for Modeling Retirement Attitudes

从人口统计学到调查锚点:评估LLM代理在建模退休态度中的表现

Rubén Garzón, Pauline Baron, Vincent Grari, Jonne Kamphorst, Michael Bernstein, Marcin Detyniecki

机构 * AI Research(AI研究) AXA Group Operations(AXA集团运营) CDSP & CEE(CDSP与CEE) Sciences Po(社会科学高等学院) Computer Science Department(计算机科学系) Stanford University(斯坦福大学)

AI总结 本文比较了基于人口统计学的LLM代理与基于调查数据的代理在预测退休态度调查中的准确性,发现仅依赖人口统计学的代理存在偏差且不够准确,而基于调查锚点的代理能更好地捕捉复杂的人类响应模式。

Comments 50 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14009 2026-05-19 cs.RO

GRaD-Nav++: Vision-Language Model Enabled Visual Drone Navigation with Gaussian Radiance Fields and Differentiable Dynamics

GRaD-Nav++: 基于视觉-语言模型的视觉无人机导航:高斯辐射场与可微动力学

Qianzhong Chen, Naixiang Gao, Suning Huang, JunEn Low, Timothy Chen, Jiankai Sun, Mac Schwager

机构 * Department of Mechanical Engineering, Stanford University(斯坦福大学机械工程系) Department of Aeronautics and Astronautics, Stanford University(斯坦福大学航空航天工程系)

AI总结 GRaD-Nav++提出一种轻量级视觉-语言-动作框架,通过可微强化学习在3D高斯点云模拟器中训练,实现基于自然语言指令的实时无人机导航,展示在多任务和多环境下的高效导航能力。

Comments Published in: IEEE Robotics and Automation Letters ( Volume: 11, Issue: 2, February 2026)

Journal ref Chen, Qianzhong, et al. "Grad-nav++: Vision-language model enabled visual drone navigation with gaussian radiance fields and differentiable dynamics." IEEE Robotics and Automation Letters 11.2 (2025): 1418-1425

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12648 2026-05-19 math.OC cs.LG

Glocal Smoothness: Line search and adaptive step sizes can help in theory too!

全球局部平滑性:线搜索和自适应步长在理论上也能有所帮助!

Curtis Fox, Aaron Mishkin, Sharan Vaswani, Mark Schmidt

机构 * Stanford University(斯坦福大学)

AI总结 本文提出全球局部平滑性概念,通过函数属性定义,允许用迭代无关常数界迭代复杂度,展示线搜索优于固定步长,且在某些情况下梯度下降比加速方法更优。

详情

展开后加载摘要…

URL PDF HTML 收藏