arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Texas at Austin(得克萨斯大学奥斯汀分校)

2026-08-06 至 2026-08-06 共收录 6
2608.05004 2026-08-06 cs.CL 新提交

DelusionEval: Measuring Delusion-Linked Behaviors in AI Chatbots

DelusionEval:评估AI聊天机器人中与妄想相关的行为

Jared Moore, Andrea Mock, Yifan Mai, Jacy Reese Anthis, Ryan Louie, William Agnew, Ashish Mehta, Kevin Klyman, Percy Liang, Nick Haber, Eric Lin, Desmond C. Ong

机构 * Stanford University(斯坦福大学) University of Chicago(芝加哥大学) Carnegie Mellon University(卡内基梅隆大学) Harvard University(哈佛大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本研究开发DelusionEval评估协议,发现LLM表现出与妄想相关行为的倾向与模型规模等无可靠关联,扩展上下文会提升此类行为发生率,所有模型家族均存在相关风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02870 2026-08-06 cs.LG 版本更新

Maglev: Sliding Recurrent Memory

Maglev:滑动循环记忆

Bo Liu, Qiang Liu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本文提出Maglev,一种带固定记忆的循环Transformer架构,通过耦合模型与记忆一致性损失实现训练可并行性,在验证损失及下游预训练基准上优于基线,参数共享可减少内存。

Comments Neural Architecture Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28276 2026-08-06 cs.RO 版本更新

SimFoundry: Modular and Automated Scene Generation for Policy Learning and Evaluation

SimFoundry: 用于策略学习和评估的模块化自动化场景生成

Nadun Ranawaka, Josiah Wong, Wei-Lin Pai, Wei-Teng Chu, Tianyuan Dai, Masoud Moghani, Hang Yin, Yunfan Jiang, Wesley Durbano, Brandon Huynh, Yu Fang, Danfei Xu, Ruohan Zhang, Li Fei-Fei, Linxi Fan, Bowen Wen, Ajay Mandlekar, Yuke Zhu

机构 * NVIDIA Georgia Institute of Technology(佐治亚理工学院) Stanford University(斯坦福大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Toronto(多伦多大学)

AI总结 提出SimFoundry系统,从视频零样本构建仿真场景,支持对象、场景和任务编辑,生成数字孪生与数字表亲,提升策略在真实世界的泛化能力,实验显示仿真评估与真实性能高度相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17188 2026-08-06 cs.CV cs.CL 版本更新

Not Truly Multilingual: Script Consistency as a Missing Dimension in VLM Evaluation

并非真正的多语言:脚本一致性作为VLM评估中缺失的维度

Prabhjot Singh, Bhushan Pawar, Madhu Reddiboina, Rajvee Sheth

机构 * RediMinds Inc.(RediMinds公司) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Independent Researcher(独立研究员)

AI总结 提出PuMVR基准,评估10个VLM在旁遮普语三种文字上的表现,发现显著的脚本差距,并提出脚本一致性率(SCR)作为必要评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14491 2026-08-06 math.NA cs.LG cs.NA

Artifacts of Numerical Integration in Learning Dynamical Systems

数值积分在学习动力系统中的影响

Bing-Ze Lu, Richard Tsai

机构 * National Chung Cheng University(国立中正大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本文探讨了数值积分方案对学习动力系统结果的影响,指出即使系统拟合数据良好,也可能被误判为反阻尼特性,且提高显式积分器阶数无法解决此问题,隐式中点法能保留守恒或耗散特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09002 2026-08-06 stat.ML cs.LG 版本更新

Convergence and Stability Analysis of Self-Consuming Generative Models with Heterogeneous Human Curation

具有异构人工筛选的自消耗生成模型的收敛性与稳定性分析

Hongru Zhao, Jinwen Fu, Tuan Pham

机构 * School of Statistics, University of Minnesota(明尼苏达大学统计学系) Department of Statistics and Data Sciences, UT Austin(德克萨斯大学奥斯汀分校统计学与数据科学系)

AI总结 本文针对Ferbach等人(2024)提出的自消耗生成模型,研究其异构偏好推广模型的收敛性与稳定性,采用非线性Perron-Frobenius理论等技术,在Banach压缩映射不适用的场景下获得了新的收敛结果。

Comments 42 pages, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏