arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Texas at Austin(得克萨斯大学奥斯汀分校)

共收录 114
2608.12679 2026-08-14 cs.AI cs.NE 新提交

Beyond the Best Guess: Improving LLM Solution Coverage with Evolution Strategies

超越最佳猜测:用进化策略提升大语言模型的解决方案覆盖率

Conor F. Hayes, Elliot Meyerson, Kajetan Schweighofer, Roberto Dailey, Babak Hodjat, Risto Miikkulainen, Xin Qiu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Cognizant AI Lab(高知特人工智能实验室)

AI总结 该研究针对LLM后训练中RL导致pass@k受限、解决方案覆盖率不足的问题,采用进化策略(ES)方法,提升了pass@k与解决方案覆盖率,在数学基准上取得更好结果,为相关领域后训练提供了更好基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12610 2026-08-14 cs.AI 新提交

@skills: Attention is all you have

@skills:你所需的全部注意力

Li Yin, Zhi Li, Zhan Shi, Haoran Zhang, Haebin Seong, Zhangyang, Wang

机构 * SylphAI(西尔菲人工智能公司) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 针对当前智能体技能安装模式下触发槽位稀缺的问题,提出@skills开放协议,分离技能的内容、持久化与自动触发功能,无需安装即可使用技能,通过Git管理实现灵活适配,搭配免费技能 hub 提供搜索等功能,减少安装、提升使用效率。

Comments 7 pages main, 23 pages in total with appendix, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11829 2026-08-13 cs.LG cs.CL 新提交

Towards Understanding On-Policy Distillation through the Lens of Test-Time Scaling

从测试时缩放的视角理解在线策略蒸馏

Xinmu Ge, Zizhuo Zhang, Yu Huang, Jianing Zhu, Lin Yuan, Wanli Gu, Weichang Wu, Weiran Huang, Xiaolu Zhang, Bo Han, Jun Zhou, Jiangchao Yao

机构 * Hong Kong Baptist University(香港浸会大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Ant Group(蚂蚁集团)

AI总结 该研究从测试时缩放视角分析OPD,发现其主要提升采样效率而非扩展推理能力边界,属于“虚假蒸馏”。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11327 2026-08-13 cs.LG q-fin.CP 新提交

Long-Horizon Forecasting of Complete Financial Statements with Forma

使用Forma进行完整财务报表的长周期预测

Travis L. Johnson, Jiannan Jiang, Soumyabrata Chaudhuri, Yihao Chen, Lauren Falvey, Donal O'Cofaigh

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 该研究发布了ProForma-20Q基准,提出Transformer模型Forma,在1至20个季度的完整财务报表预测任务中,击败各类对比模型,优势随期限扩大,且能支持无需重训的情景分析。

Comments 46 pages, 2 figures, 3 tables. Benchmark: https://github.com/forma-lab-mccombs/proforma-20q. Model and weights: https://github.com/forma-lab-mccombs/forma-release

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11063 2026-08-12 cs.RO 新提交

Deployment Is Not Destiny: Robot Recomposition in the Field with Unseen Software, Hardware, and Compute Payloads

部署并非宿命:面向现场未知软件、硬件与计算负载的机器人重组

Steven Swanbeck, Jonathan Salfity, Jeffery Gunawan, Corrie Van Sice, Mitch Pryor, Robert Blake Anderson

机构 * Texas Robotics(德克萨斯机器人研究所) Walker Department of Mechanical Engineering, The University of Texas at Austin(德克萨斯大学奥斯汀分校沃克机械工程学院) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 该研究提出一种机器人运行时重组框架,支持现场快速集成未知软件、硬件与计算负载,将重配置时间缩至数分钟,在灾难响应场景中验证了其灵活性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10220 2026-08-12 cs.RO 新提交

Whole-Body Planning for Humanoids Navigating Confined Spaces via Self-Collision Avoidance References

人形机器人在受限空间中通过自碰撞规避实现全身规划的参考方案

Carlos Gonzalez, Luis Sentis

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本文提出三阶段全身规划框架,结合可微分自碰撞规避与可达性约束,在Unitree G1人形机器人上实现Cr<1.5的受限空间导航,生成复杂接触轨迹并训练出鲁棒在线跟踪策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08949 2026-08-11 cs.CV 新提交

EndoMD-SLAM: Endoscopic Gaussian Splatting SLAM under Optical Degradation with Memory and Static-Transient Decomposition

EndoMD-SLAM:光学退化下的内窥镜高斯溅射SLAM,具备记忆与静态-瞬态分解能力

Nuo Chen, Kangqi Ni, Lulin Liu, Joga Ivatury, Ying Ding, Farshid Alambeigi, Tianlong Chen, Zhiwen Fan

机构 * Texas A&M University(德克萨斯农工大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Minnesota(明尼苏达大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 EndoMD-SLAM是针对内窥镜光学退化问题的SLAM框架,通过记忆驱动门控、静态-瞬态分解等机制,在结肠镜检查基准上实现了轨迹误差降低91%、PSNR提升9.9 dB的效果。

Comments Project page: https://endomd-slam.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08389 2026-08-11 cs.AI cs.IR cs.MA 新提交

Not Worth Another Token: Marginal Value Estimation for Efficient Deep Research Agents

不值得再增加一个Token:面向高效深度研究智能体的边际价值估计

Harshitha Kolukuluru, Reshma Ashok, Kirat Arora, Evan William Ciccarelli, Nischal Ashok Kumar, Lunyiu Nie, Franck Dernoncourt, Samyadeep Basu, Ryan A. Rossi, Nedim Lipka

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Adobe Research(奥多比研究院)

AI总结 该研究针对长周期研究智能体的上下文冗余问题,系统比较不同阶段的剪枝策略,发现早期剪枝可大幅降本,轻量级启发式方法能减73%Token用量且质量损失小,为高效智能体设计提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07460 2026-08-10 cs.CL cs.AI 新提交

CreativeInstruct: Scalably Teaching LLMs to Balance Quality, Creativity, and Diversity

CreativeInstruct:规模化教导大型语言模型(LLM)平衡质量、创造性与多样性

Ananya Sahu, Mohit Bansal, Elias Stengel-Eskin

机构 * Columbia(哥伦比亚大学) UNC Chapel Hill(北卡罗来纳大学教堂山分校) University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 该研究提出CreativeInstruct指令调优方法,通过注入[StartCreativity]跨度平衡LLM的质量、创造性与多样性,其在叙事生成中表现更优,还能提升强化学习任务性能。

Comments Code: https://github.com/ananya-sahu/CreativeInstruct

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06714 2026-08-10 cs.AI 新提交

The Optimizer Is the Agent: Reasoning-Driven Search across Prompts, Programs, and ML Workflows

优化器即智能体:跨提示、程序与机器学习工作流的推理驱动搜索

Junbo Li, Boyi Liu, Canwen Xu, Yite Wang, Yuxiong He, Zhangyang Wang, Qiang Liu, Zhewei Yao

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Snowflake(思诺飞克公司)

AI总结 该研究提出ReASearch统一框架,让智能体自主优化提示、程序与ML工作流,在14项任务中优于专用系统,部分发现超人类最佳结果的方案。

Journal ref COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06409 2026-08-10 cs.CL cs.AI 新提交

Separating Decision-Rule Misalignment from Readout-Coverage Limitations in Speech Language Models

区分语音语言模型中的决策规则失配与读出覆盖限制

Linkai Peng, Baorian Nuchged

机构 * Institute for the Brain and Cognitive Sciences, University of Connecticut(康涅狄格大学脑与认知科学研究所) Department of Linguistics, The University of Texas at Austin(德克萨斯大学奥斯汀分校语言学系)

AI总结 该研究提出生成对齐诊断阶梯,区分语音语言模型的决策规则失配与读出覆盖限制,发现状态解码比生成准确率高27.8点,无标签logit校正可提升生成准确率,明确性能损失来源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05806 2026-08-07 cs.CL cs.AI 新提交

Hierarchical Latent Prediction for Language Models

语言模型的分层隐式预测

Chang Shi, Tim Pearce, Manan Tomar, Siddhartha Sen, John Langford

机构 * University of Texas at Austin(得克萨斯大学奥斯汀分校) Microsoft Research(微软研究院)

AI总结 该研究针对语言模型下一个token预测的误差累积问题,提出分层隐式预测方法,在编码、多步推理基准及推测解码上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05004 2026-08-06 cs.CL 新提交

DelusionEval: Measuring Delusion-Linked Behaviors in AI Chatbots

DelusionEval:评估AI聊天机器人中与妄想相关的行为

Jared Moore, Andrea Mock, Yifan Mai, Jacy Reese Anthis, Ryan Louie, William Agnew, Ashish Mehta, Kevin Klyman, Percy Liang, Nick Haber, Eric Lin, Desmond C. Ong

机构 * Stanford University(斯坦福大学) University of Chicago(芝加哥大学) Carnegie Mellon University(卡内基梅隆大学) Harvard University(哈佛大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本研究开发DelusionEval评估协议,发现LLM表现出与妄想相关行为的倾向与模型规模等无可靠关联,扩展上下文会提升此类行为发生率,所有模型家族均存在相关风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02971 2026-08-05 cs.CL 新提交

Mapping the City Through the Lens of Language Models

通过语言模型的视角映射城市

Wanqi Liu, Rong Zhao, Zhizhou Sha, Qinyu Cui, Yecheng Zhang

机构 * University College London(伦敦大学学院) Centre for Advanced Spatial Analysis (CASA)(高级空间分析中心) Tsinghua University(清华大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) South China University of Technology(华南理工大学)

AI总结 该研究通过10个开放权重检查点结合多类技术,匿名测量语言模型对城市的隐含假设,勾勒出模型视角下的城市画像,揭示其对城市的偏好倾向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01730 2026-08-04 cs.CV 新提交

Learning Where to Look and How to Judge: Resolution-agnostic Image Quality Assessment with Quality-aware Saliency

学习关注何处与如何判断:具备质量感知显著性的分辨率无关图像质量评估

Hakan Emre Gedik, Shashank Gupta, Alan Bovik

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Colorado Boulder(科罗拉多大学博尔德分校)

AI总结 提出基于CLIP的多尺度补丁驱动模型ReLIQS,解决无参考图像质量评估的分辨率适配、计算效率等问题,在多类基准上泛化能力优于主流基线且成本相当或更低。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01409 2026-08-04 cs.CL 新提交

When Retrieval Helps and Distracts: Evaluating Evidence-Generating LLMs for Biomedical Claim Verification

检索何时有助何时干扰:评估用于生物医学声明验证的生成证据的大型语言模型

Pritam Deka, Prabhjot Singh

机构 * Queen’s University Belfast(贝尔法斯特女王大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 该研究针对生物医学声明验证,在CARE-XAI基准上对比多种模型,发现微调大型语言模型生成证据能力最强,PubMed检索效果因来源而异,还提出Bio-GRACE工具评估检索效用,推动选择性检索发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00967 2026-08-04 cs.AI 新提交

TrajWiki: Source-Grounded Memory Trajectories for Long-Horizon Dialogue Agents

TrajWiki:面向长程对话智能体的基于来源的记忆轨迹

Jingyu Sun, Yuyang Xue, Mingyang Li, Zhengtao Yao, Jiachen Li, Yang Cui, Wenhao Cai, Haozhe Liu, Fangying Wang, Magdalene Katharina Montgomery, Syed Murtuza Baker, Hongpeng Zhou

机构 * The University of Manchester(曼彻斯特大学) The University of Melbourne(墨尔本大学) The University of Edinburgh(爱丁堡大学) University of Southern California(南加州大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 该研究针对长程对话智能体的记忆可追溯性与透明性问题,提出TrajWiki框架,通过轨迹式记忆表示与Memory Wiki中间层提升对话性能及可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00828 2026-08-04 cs.AI 新提交

Isotropy Cliffs: The Geometric Signature of Decision-Making in Large Language Models

各向同性悬崖:大语言模型决策的几何特征

Okan S. Coskun, Florian Rottach, Carsten Eickhoff, William Rudman

机构 * University of Tübingen(蒂宾根大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 该研究从各向同性视角分析大语言模型多项选择题问答的决策几何,识别出各向同性转变的决策关键过渡层,发现该几何行为与下游准确率高度相关且对提示变化鲁棒,揭示模型决策的通用机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28677 2026-08-03 cs.AI 新提交

Reasoning in Real World Clinical Care: Why Large Language Models Are Not Yet Safe for Autonomous Clinical Decision Support

现实世界临床护理中的推理:为何大型语言模型(LLM)尚不适合自主临床决策支持

Shayndhan Sivanathan, Shravan Nageswaran, Mehdi Zadem, Ryaan Sultan, Nicolas von Mallinckrodt, Max Solovyev, Alexey Matyushkin, Sumon Sadhu, Gabriele C DeLuca, Sanjeeva Jeyaretna, James Hillis, Manoj Ramachandran, Prakash Jayakumar

机构 * Atman Labs(阿特曼实验室) Oxford University Hospitals(牛津大学医院) University of Oxford(牛津大学) NIHR Oxford Biomedical Research Centre(英国国立卫生研究院牛津生物医学研究中心) Imperial College London(伦敦帝国理工学院) Technical University of Munich(慕尼黑工业大学) Massachusetts General Hospital(麻省总医院) Mass General Brigham(麻省总医院布里格姆医疗系统) Harvard Medical School(哈佛医学院) Barts Health NHS Trust(巴特保健国民保健信托基金会) the University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本文指出,尽管LLM在医学考试和部分病例推理上表现出色,但因存在信息收集缺陷等问题,尚不适合用于无医生参与的自主临床分诊。

Comments 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27384 2026-07-31 cs.CL cs.AI 新提交

Same Facts, Different Diagnosis: Measuring and Mitigating Narrative Anchoring in Clinical Language Models

相同事实,不同诊断:临床语言模型中叙事锚定的测量与缓解

Prabhjot Singh, Pritam Deka, Vijay Chennareddy

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Queen’s University Belfast(贝尔法斯特女王大学) Middlesex University London(伦敦密德萨斯大学)

AI总结 本研究针对临床语言模型的叙事锚定偏差,构建含1000个USMLE案例的基准,提出NarrativeShield三智能体流水线,可大幅降低叙事锚定差距并减少不稳定决策,同时发布数据集供相关研究使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23844 2026-07-28 cs.CV 新提交

OmniCache: Multidimensional Hierarchical Feature Caching For Diffusion Models

OmniCache:用于扩散模型的多维分层特征缓存

Zhaoyuan He, Muhammad Muaz, Lili Qiu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 针对高分辨率图像和视频扩散模型推理成本高的问题,提出OmniCache框架,利用中间扩散特征冗余,通过多种缓存实现多维特征重用,减少推理延迟,在多模型上取得良好效果,且无需重新训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23837 2026-07-28 cs.LG cs.CL 新提交

Latent-LoRA: Compact Latent-Space Adapters with Gradient-Free Routing for Continual Learning

Latent-LoRA:用于持续学习的具有无梯度路由的紧凑潜在空间适配器

Reza Rahimi Azghan, Gautham Krishna Gudur, Giulia Pedrielli, Pavan Turaga, Hassan Ghasemzadeh

机构 * College of Health Solutions, Arizona State University(亚利桑那州立大学健康解决方案学院) Department of Electrical and Computer Engineering, The University of Texas at Austin(德克萨斯大学奥斯汀分校电气与计算机工程系) School of Computing and Augmented Intelligence, Arizona State University(亚利桑那州立大学计算与增强智能学院) The GAME School, Arizona State University(亚利桑那州立大学GAME学院)

AI总结 研究针对大语言模型持续学习的灾难性遗忘问题,提出Latent-LoRA系统。利用冻结嵌入层池化令牌嵌入分离任务分布,无需可训练路由组件,通过奇异值分解和正交正则化控制任务干扰,实验显示其有近零遗忘的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23515 2026-07-28 cs.RO 新提交

LEACL: LLM-Enhanced Automatic Curriculum Learning for Reinforcement Learning in Long-Horizon Manipulation Tasks

LEACL:用于长时程操作任务强化学习的大语言模型增强自动课程学习

Faraz Heravi, James Ouyang, Zifan Xu, Arjun Kumar, Yoonchang Sung, Peter Stone

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Nanyang Technological University(南洋理工大学) Sony AI(索尼人工智能)

AI总结 针对长时程操作任务强化学习挑战,提出LEACL框架,结合大语言模型与自动课程学习,用大语言模型分解任务并生成规范,由自动课程学习算法仅依稀疏奖励信号指导学习,在相关任务上取得更好渐近性能。

Comments 8 pages, 4 figures, Published in the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21847 2026-07-27 stat.ME cs.LG stat.AP stat.CO stat.ML 新提交

Distributional Determinantal Point Process for Repulsive Clustering of Distributions

用于分布排斥聚类的分布行列式点过程

Khai Nguyen, Yang Ni, Elizabeth Juarez-Colunga, Peter Mueller

机构 * Department of Statistics and Data Sciences, University of Texas at Austin(统计与数据科学系,德克萨斯大学奥斯汀分校) Department of Mathematics, University of Texas at Austin(数学系,德克萨斯大学奥斯汀分校) Department of Biostatistics and Informatics, University of Colorado Anschutz(生物统计学与信息学系,科罗拉多大学安舒茨分校)

AI总结 研究提出分布行列式点过程(dDPP)用于分布排斥聚类,通过L系综与SW核构建,证明其有效性。基于此提出分布值随机划分模型,用于单细胞基因表达和人类癫痫数据推断,得到可解释且分离良好的聚类。

Comments 60 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21758 2026-07-27 cs.CL 新提交

Humanly: A Configurable and Traceable Environment for Human-AI Collaborative Writing

Humanly:一个用于人机协作写作的可配置且可追溯的环境

Shenzhe Zhu, Haoqian Zhang, Xu Yang, Jingyu Tang, Yi Nian, Xiaoxue Du, Shu Yang, Alex Pentland, Joachim Baumann, Jiaxin Pei

机构 * UT Austin(德克萨斯大学奥斯汀分校) University of Toronto(多伦多大学) Stanford University(斯坦福大学) MIT(麻省理工学院) USC(南加州大学) KAUST(阿卜杜拉国王科技大学)

AI总结 研究针对人机协作写作难以判断创作过程的问题,提出Humanly写作平台,用户能配置环境,平台记录活动与辅助,可打包会话生成证书,支持多种场景,经研究验证对各角色有帮助且能区分打字方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21995 2026-07-27 quant-ph cs.ET cs.LG 新提交

QC-PHAST Search: Classical--Quantum Query Benchmarks for Finite-Pool Rare-Regime Discovery

QC-PHAST搜索:用于有限池稀有区域发现的经典-量子查询基准

Harsh Milind Tirhekar, Chandrajit Bajaj

机构 * Department of Computer Science(计算机科学系) College of Natural Sciences(自然科学学院) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Oden Institute for Computational Engineering and Sciences(计算工程与科学奥登研究所)

AI总结 研究参数化动力系统稀有区域发现问题,引入QC-PHAST协议和框架,利用科学元数据等评估搜索方式,以量子行作参考,通过多种手段确定何时经典或资源感知搜索占优,给出可审计协议。

Comments 70 pages, 16 figures, 36 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20720 2026-07-24 q-bio.NC cs.AI 新提交

Transition-Related Potentials as Markers of Narrative Comprehension in Continuous EEG

作为连续脑电图中叙事理解标记的转换相关电位

Bálint Csanády, Péter Vedres, Kristóf Zsolt Makó, Orsolya Papp-Zipernovszky, Márta Volosin, Dávid Apagyi, András Lukács, András Bálint Kovács, Zoltan Nadasdy

机构 * ELTE Eötvös Loránd University(埃尔特大学) Budapest University of Technology(布达佩斯技术大学) HUN-REN Wigner Research Centre for Physics(HUN-REN威金物理研究所) Semmelweis University(塞梅尔维斯大学) University of Miskolc(米什科尔茨大学) University of Szeged(塞格德大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 研究利用连续脑电图探索叙事理解,提取与电影转换对齐的电位,发现转换相关电位受叙事背景影响,可用深度神经网络从连续记录中恢复,为分析观众理解电影叙事提供半自动框架,还可用于其他连续刺激。

Comments 40 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21571 2026-07-24 cs.RO 新提交

Beyond Episodic Evaluation: Memory Architectural Bottlenecks in Sequential Embodied Question Answering

超越情节性评估:序列式具身问答中的内存架构瓶颈

Zikui Cai, Kaushal Janga, Tan Dat Dao, Seungjae Lee, Shivin Dass, Mingyo Seo, Kaiyu Yue, Mintong Kang, Nandhu Pillai, Monte Hoover, Aadi Palnitkar, Ruchit Rawal, Ruijie Zheng, Bo Li, Yuke Zhu, Roberto Martín-Martín, Tom Goldstein, Furong Huang

机构 * University of Maryland, College Park(马里兰大学帕克分校) The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 研究序列式具身问答中不同内存架构表现,发现仅保留现有记忆不足,短视情节数据训练的智能体有时间不匹配问题。强调结构化、基于空间记忆的必要性,实验表明其能打破准确性-效率权衡,对真实机器人连续智能操作至关重要。

Comments Accepted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19689 2026-07-23 stat.ML cs.DS cs.LG 新提交

Optimal Recalibration of an Online Predictor

在线预测器的最优重新校准

Lunjia Hu, Kevin Tian, Chutong Yang

机构 * Northeastern University(东北大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本文提出一种在线算法,实现在线预测器的最优重新校准,同时达到ε-校准和ε²-校准,改进了以往单独实现这些属性的工作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19510 2026-07-23 cs.LG cs.DS stat.ME stat.ML 新提交

Total Variation Distance Estimation in Autoregressive Models

自回归模型中的总变差距离估计

Eric Price, Kevin Tian, Zhiyang Xun, Yusong Zhu

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 研究自回归模型中两个分布的总变差距离估计问题。在样本、对数概率、噪声对数概率三种访问模型下,分别给出不同查询次数的估计方法,并通过实验验证算法的稳健性和实用性,即便KL散度无穷时也能估计。

Comments 39 pages, 11 figures, code is available at https://github.com/XunZhiyang/llm-tv-estimation

详情

展开后加载摘要…

URL PDF HTML 收藏