arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Texas at Austin(得克萨斯大学奥斯汀分校)

共收录 1212
2608.12679 2026-08-14 cs.AI cs.NE 新提交

Beyond the Best Guess: Improving LLM Solution Coverage with Evolution Strategies

超越最佳猜测:用进化策略提升大语言模型的解决方案覆盖率

Conor F. Hayes, Elliot Meyerson, Kajetan Schweighofer, Roberto Dailey, Babak Hodjat, Risto Miikkulainen, Xin Qiu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Cognizant AI Lab(高知特人工智能实验室)

AI总结 该研究针对LLM后训练中RL导致pass@k受限、解决方案覆盖率不足的问题,采用进化策略(ES)方法,提升了pass@k与解决方案覆盖率,在数学基准上取得更好结果,为相关领域后训练提供了更好基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12610 2026-08-14 cs.AI 新提交

@skills: Attention is all you have

@skills:你所需的全部注意力

Li Yin, Zhi Li, Zhan Shi, Haoran Zhang, Haebin Seong, Zhangyang, Wang

机构 * SylphAI(西尔菲人工智能公司) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 针对当前智能体技能安装模式下触发槽位稀缺的问题,提出@skills开放协议,分离技能的内容、持久化与自动触发功能,无需安装即可使用技能,通过Git管理实现灵活适配,搭配免费技能 hub 提供搜索等功能,减少安装、提升使用效率。

Comments 7 pages main, 23 pages in total with appendix, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02091 2026-08-14 cs.SE cs.AI cs.HC econ.GN q-fin.EC 版本更新

The Impact of Generative AI on Collaborative Open-Source Software Development: Evidence from GitHub Copilot

生成AI对协作开源软件开发的影响:来自GitHub Copilot的证据

Fangchen Song, Ashish Agarwal, Wen Wen

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本研究探讨生成AI对开源协作开发的影响,发现GitHub Copilot提高了代码贡献和开发者参与,但增加了协调时间,揭示了AI在扩展贡献者的同时减缓协作的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09670 2026-08-14 cs.LG cs.AI 版本更新

In-context superposition: human-like working memory interference in large language models

类人工作记忆干扰在大语言模型中

Hua-Dong Xiong, Li Ji-An, Jiaqi Huang, Robert C. Wilson, Kwonjoon Lee, Xue-Xin Wei

机构 * School of Psychological and Brain Sciences, Georgia Tech(佐治亚理工学院心理与脑科学学院) Department of Psychology, New York University(纽约大学心理学系) Department of Cognitive Science, Indiana University Bloomington(印第安纳大学布卢明顿分校认知科学系) Honda Research Institute(本田研究所) Center of Excellence for Computational Cognition, Georgia Tech(佐治亚理工学院计算认知卓越中心) Departments of Neuroscience and Psychology, The University of Texas at Austin(德克萨斯大学奥斯汀分校神经科学和心理学系)

AI总结 研究发现大语言模型在工作记忆任务中存在干扰限制,其表现与人类相似,且通过抑制无关信息实现有效记忆检索。

Comments Published as a conference paper at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03781 2026-08-14 cs.RO 版本更新

OpenRC: An Open-Source Robotic Colonoscopy Framework for Multimodal Data Acquisition and Autonomy Research

OpenRC:一种用于多模态数据采集和自主性研究的开源机器人结肠镜框架

Siddhartha Kapuria, Mohammad Rafiee Javazm, Naruhiko Ikoma, Joga Ivatury, Mohammad Ali Nasseri, Nassir Navab, Farshid Alambeigi

机构 * Walker Department of Mechanical Engineering, The University of Texas at Austin(德克萨斯大学奥斯汀分校沃克机械工程系) Department of Surgical Oncology, Division of Surgery, The University of Texas MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心外科肿瘤学系) School of Medicine and Health, Technical University of Munich(慕尼黑工业大学医学与健康学院)

AI总结 OpenRC框架通过整合开源硬件和多模态数据集,为机器人结肠镜和手术自主性研究提供了可重复的基础,支持同时记录视频、操作指令、执行状态和末端位置,并验证了运动一致性和跨模态延迟。

Comments Abstract: Added repository and contribution statement

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11829 2026-08-13 cs.LG cs.CL 新提交

Towards Understanding On-Policy Distillation through the Lens of Test-Time Scaling

从测试时缩放的视角理解在线策略蒸馏

Xinmu Ge, Zizhuo Zhang, Yu Huang, Jianing Zhu, Lin Yuan, Wanli Gu, Weichang Wu, Weiran Huang, Xiaolu Zhang, Bo Han, Jun Zhou, Jiangchao Yao

机构 * Hong Kong Baptist University(香港浸会大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Ant Group(蚂蚁集团)

AI总结 该研究从测试时缩放视角分析OPD,发现其主要提升采样效率而非扩展推理能力边界,属于“虚假蒸馏”。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11327 2026-08-13 cs.LG q-fin.CP 新提交

Long-Horizon Forecasting of Complete Financial Statements with Forma

使用Forma进行完整财务报表的长周期预测

Travis L. Johnson, Jiannan Jiang, Soumyabrata Chaudhuri, Yihao Chen, Lauren Falvey, Donal O'Cofaigh

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 该研究发布了ProForma-20Q基准,提出Transformer模型Forma,在1至20个季度的完整财务报表预测任务中,击败各类对比模型,优势随期限扩大,且能支持无需重训的情景分析。

Comments 46 pages, 2 figures, 3 tables. Benchmark: https://github.com/forma-lab-mccombs/proforma-20q. Model and weights: https://github.com/forma-lab-mccombs/forma-release

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28854 2026-08-13 cs.CL cs.LG q-bio.NC 版本更新

Large language models reorganize representational geometry during in-context learning

大型语言模型在上下文学习中重组表征几何结构

Hua-Dong Xiong, Li Ji-An, Robert C. Wilson, Kwonjoon Lee, Xue-Xin Wei

机构 * School of Psychological and Brain Sciences, Georgia Tech(佐治亚理工学院心理与脑科学学院) Department of Psychology, New York University(纽约大学心理学系) Center of Excellence for Computational Cognition, Georgia Tech(佐治亚理工学院计算认知卓越中心) Honda Research Institute(本田研究院) Departments of Neuroscience and Psychology, The University of Texas at Austin(德克萨斯大学奥斯汀分校神经科学与心理学系)

AI总结 研究大型语言模型在上下文学习中的表征几何重组,发现其性能与任务表征结构相关,并通过原型算法动态调整表征以提高可分性。

Comments Published as a conference paper at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16409 2026-08-13 cs.CV cs.CL cs.LG 版本更新

Multilingual OCR-Aware Fine-Tuning and Prompt-Guided Chain-of-Thought Reasoning for Multimodal Large Language Models

多语言OCR感知微调和提示引导的链式思维推理用于多模态大语言模型

Qinwu Xu, Yifan Jiang, Haoyu Ren

机构 * Meta AI UT Austin(德克萨斯大学奥斯汀分校)

AI总结 提出一种多语言OCR感知的多模态训练框架,通过合成数据生成、OCR感知微调和结构化视觉链式思维提示,提升多模态大语言模型在复杂视觉条件下的OCR完整性和多语言翻译准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23733 2026-08-13 cs.CL 版本更新

Multimodal QUD: Inquisitive Questions from Scientific Figures

多模态QUD:来自科学图表的探究性问题

Yating Wu, William Rudman, Venkata S Govindarajan, Alexandros G. Dimakis, Junyi Jessy Li

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Ithaca College(伊萨卡学院) UC Berkeley, BespokeLabs.ai(伯克利大学,BespokeLabs.ai)

AI总结 本文提出多模态QUD数据集,通过结合图表与文本上下文生成探究性问题,提升多模态推理能力,实现更高质量的视觉 grounding。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11063 2026-08-12 cs.RO 新提交

Deployment Is Not Destiny: Robot Recomposition in the Field with Unseen Software, Hardware, and Compute Payloads

部署并非宿命:面向现场未知软件、硬件与计算负载的机器人重组

Steven Swanbeck, Jonathan Salfity, Jeffery Gunawan, Corrie Van Sice, Mitch Pryor, Robert Blake Anderson

机构 * Texas Robotics(德克萨斯机器人研究所) Walker Department of Mechanical Engineering, The University of Texas at Austin(德克萨斯大学奥斯汀分校沃克机械工程学院) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 该研究提出一种机器人运行时重组框架,支持现场快速集成未知软件、硬件与计算负载,将重配置时间缩至数分钟,在灾难响应场景中验证了其灵活性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10220 2026-08-12 cs.RO 新提交

Whole-Body Planning for Humanoids Navigating Confined Spaces via Self-Collision Avoidance References

人形机器人在受限空间中通过自碰撞规避实现全身规划的参考方案

Carlos Gonzalez, Luis Sentis

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本文提出三阶段全身规划框架,结合可微分自碰撞规避与可达性约束,在Unitree G1人形机器人上实现Cr<1.5的受限空间导航,生成复杂接触轨迹并训练出鲁棒在线跟踪策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15441 2026-08-12 cs.SE cs.AI cs.FL cs.PL

On the Effectiveness of Large Language Models in Writing Alloy Formulas

Yang Hong, Shan Jiang, Yulei Fu, Sarfraz Khurshid

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22839 2026-08-12 cs.LG cs.AI 版本更新

Demystifying Adversarial Robustness in Diffusion Models: Compression, Randomness, and Geometry

Liu Yuezhang, Xue-Xin Wei

机构 * UT Austin(德克萨斯大学)

Comments 28 pages, 6 figures, 7 supplementary figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08949 2026-08-11 cs.CV 新提交

EndoMD-SLAM: Endoscopic Gaussian Splatting SLAM under Optical Degradation with Memory and Static-Transient Decomposition

EndoMD-SLAM:光学退化下的内窥镜高斯溅射SLAM,具备记忆与静态-瞬态分解能力

Nuo Chen, Kangqi Ni, Lulin Liu, Joga Ivatury, Ying Ding, Farshid Alambeigi, Tianlong Chen, Zhiwen Fan

机构 * Texas A&M University(德克萨斯农工大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Minnesota(明尼苏达大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 EndoMD-SLAM是针对内窥镜光学退化问题的SLAM框架,通过记忆驱动门控、静态-瞬态分解等机制,在结肠镜检查基准上实现了轨迹误差降低91%、PSNR提升9.9 dB的效果。

Comments Project page: https://endomd-slam.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08389 2026-08-11 cs.AI cs.IR cs.MA 新提交

Not Worth Another Token: Marginal Value Estimation for Efficient Deep Research Agents

不值得再增加一个Token:面向高效深度研究智能体的边际价值估计

Harshitha Kolukuluru, Reshma Ashok, Kirat Arora, Evan William Ciccarelli, Nischal Ashok Kumar, Lunyiu Nie, Franck Dernoncourt, Samyadeep Basu, Ryan A. Rossi, Nedim Lipka

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Adobe Research(奥多比研究院)

AI总结 该研究针对长周期研究智能体的上下文冗余问题,系统比较不同阶段的剪枝策略,发现早期剪枝可大幅降本,轻量级启发式方法能减73%Token用量且质量损失小,为高效智能体设计提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06914 2026-08-11 cs.CV 版本更新

RibAssist 3D: Biplanar Rib-Fracture Detection, Addressing, and Selective 3D Localization from CT-Derived Projections

RibAssist 3D:基于CT衍生投影的双侧肋骨骨折检测、配对与选择性3D定位

Kabila Haile Soboka

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本研究提出RibAssist 3D模型,通过CT的双侧投影实现肋骨骨折的检测、配对与选择性3D定位,识别跨视图配对置信度为瓶颈,经实验验证其几何精度高,可辅助提升肋骨骨折定位效率。

Comments 9 pages, 6 figures. Code available at: https://github.com/kabJhai/RibAssist-3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26504 2026-08-11 cs.LG 版本更新

From Interface to Inference: Eliciting Any-Order Inference from Any-Order Models

从接口到推理:从任意阶模型中引出任意阶推理

Seunggeun Kim, Jaeyeon Kim, Taekyun Lee, Yuyuan Chen, Yilun Du, Sham Kakade, Sitan Chen

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Harvard University(哈佛大学)

AI总结 该研究针对离散推理任务的任意阶推理需求,提出两种掩码扩散改进方法,训练对应模型验证了方法可诱导任意阶推理行为并提升下游性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10925 2026-08-11 cs.HC cs.CL 版本更新

From Words to Widgets for Controllable LLM Generation

从词语到小部件:可控制的LLM生成

Chao Zhang, Yiren Liu, Lunyiu Nie, Jeffrey M. Rzeszotarski, Yun Huang, Tal August

机构 * Cornell University(康奈尔大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Loyola University Maryland(路易斯安那大学马里兰分校)

AI总结 本文提出Malleable Prompting技术,通过将自然语言提示中的偏好转化为可视化的小部件,使用户能更精确地控制LLM生成,提升可控性和透明度。

Comments UIST 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01653 2026-08-11 cs.LG cs.HC 版本更新

Cognitive Energy Modeling for Neuroadaptive Human-Machine Systems using EEG and WGAN-GP

基于EEG和WGAN-GP的神经适应性人机系统认知能量建模

Sriram Sattiraju, Vaibhav Gollapalli, Aryan Shah, Timothy McMahan

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) University of North Texas(北德克萨斯大学)

AI总结 本文利用Schrödinger Bridge Problem建模EEG数据中的认知能量,通过比较真实与合成EEG在Stroop任务中的过渡能量,验证合成EEG在神经适应性人机系统中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07460 2026-08-10 cs.CL cs.AI 新提交

CreativeInstruct: Scalably Teaching LLMs to Balance Quality, Creativity, and Diversity

CreativeInstruct:规模化教导大型语言模型(LLM)平衡质量、创造性与多样性

Ananya Sahu, Mohit Bansal, Elias Stengel-Eskin

机构 * Columbia(哥伦比亚大学) UNC Chapel Hill(北卡罗来纳大学教堂山分校) University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 该研究提出CreativeInstruct指令调优方法,通过注入[StartCreativity]跨度平衡LLM的质量、创造性与多样性,其在叙事生成中表现更优,还能提升强化学习任务性能。

Comments Code: https://github.com/ananya-sahu/CreativeInstruct

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06714 2026-08-10 cs.AI 新提交

The Optimizer Is the Agent: Reasoning-Driven Search across Prompts, Programs, and ML Workflows

优化器即智能体:跨提示、程序与机器学习工作流的推理驱动搜索

Junbo Li, Boyi Liu, Canwen Xu, Yite Wang, Yuxiong He, Zhangyang Wang, Qiang Liu, Zhewei Yao

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Snowflake(思诺飞克公司)

AI总结 该研究提出ReASearch统一框架,让智能体自主优化提示、程序与ML工作流,在14项任务中优于专用系统,部分发现超人类最佳结果的方案。

Journal ref COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06409 2026-08-10 cs.CL cs.AI 新提交

Separating Decision-Rule Misalignment from Readout-Coverage Limitations in Speech Language Models

区分语音语言模型中的决策规则失配与读出覆盖限制

Linkai Peng, Baorian Nuchged

机构 * Institute for the Brain and Cognitive Sciences, University of Connecticut(康涅狄格大学脑与认知科学研究所) Department of Linguistics, The University of Texas at Austin(德克萨斯大学奥斯汀分校语言学系)

AI总结 该研究提出生成对齐诊断阶梯,区分语音语言模型的决策规则失配与读出覆盖限制,发现状态解码比生成准确率高27.8点,无标签logit校正可提升生成准确率,明确性能损失来源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09904 2026-08-10 cs.LG cs.AI math.OC 版本更新

Stability of Transformers under Layer Normalization

层归一化下Transformer的稳定性

Kelvin Kan, Xingjian Li, Benjamin J. Zhang, Tuhin Sahai, Stanley Osher, Krishna Kumar, Markos A. Katsoulakis

机构 * UCLA(加州大学洛杉矶分校) UT Austin(德克萨斯大学奥斯汀分校) UNC Chapel Hill(北卡罗来纳大学教堂山分校) SRI International(SRI国际) UMass Amherst(马萨诸塞大学阿姆赫斯特分校)

AI总结 本文系统性研究不同层归一化放置下Transformer的前向与反向稳定性,推导相关边界、分析梯度反向传播影响,为残差步长缩放提供指导,其框架可用于检查新型Transformer架构的稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05806 2026-08-07 cs.CL cs.AI 新提交

Hierarchical Latent Prediction for Language Models

语言模型的分层隐式预测

Chang Shi, Tim Pearce, Manan Tomar, Siddhartha Sen, John Langford

机构 * University of Texas at Austin(得克萨斯大学奥斯汀分校) Microsoft Research(微软研究院)

AI总结 该研究针对语言模型下一个token预测的误差累积问题,提出分层隐式预测方法,在编码、多步推理基准及推测解码上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28617 2026-08-07 cs.AI cs.CL cs.CY cs.HC 版本更新

AISPA: User-Centric System Prompt Auditing for Large Language Model Applications

AISPA:面向大语言模型应用的以用户为中心的系统提示审计框架

Xiangning Lin, Shenzhe Zhu, Shu Yang, Zhenyu Zhang, Haoqian Zhang, Yipeng Zhao, Chengxuan Qian, Tianwei Wang, Ziheng Zhang, Zhenlong Yuan, Dingcheng Wang, Juncheng Wu, Yuan Si, Jiaxin Liu, Baolong Bi, Robert Mahari, Tobin South, Dazza Greenwood, Zexue He, Rishi Bommasani, Sophia Kazinnik, Andreas Haupt, Samuele Marro, Erik Brynjolfsson, Alex Pentland, Jiaxin Pei

机构 * Stanford University(斯坦福大学) CMU(卡内基梅隆大学) UT Austin(德克萨斯大学奥斯汀分校) University of Toronto(多伦多大学) UCSB(加利福尼亚大学圣巴巴拉分校) WashU(华盛顿大学) OSU(俄亥俄州立大学) UCSC(加利福尼亚大学圣克鲁兹分校) Northwestern University(西北大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) KAUST(阿卜杜拉国王科技大学) MIT(麻省理工学院) University of Oxford(牛津大学) Institute for Decentralized AI(去中心化人工智能研究所)

AI总结 本文提出以用户为中心的AISPA框架,审计88款商业AI产品的3249条系统提示指令,发现其设计差异大、保护指令范围浅、长度增长但仍存问题指令,凸显系统提示需更高透明度与监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26237 2026-08-07 cs.CV 版本更新

LumaGuide: Distribution Shaping for Training-Free HDR Generation in Diffusion Models

LumaGuide:用于扩散模型中无需训练的高动态范围(HDR)生成的分布塑造方法

Bowen Chen, Shreshth Saini, Balu Adsumilli, Alan C. Bovik

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Google/YouTube(谷歌/YouTube) University of Colorado Boulder(科罗拉多大学博尔德分校)

AI总结 本研究提出无需训练的LumaGuide框架,通过在采样时直接塑造输出分布,实现扩散模型的可控生成,可用于HDR及视频生成,无需重新训练模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16763 2026-08-07 cs.AI 版本更新

When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation

当AI基准测试达到平台期:基准饱和的系统性研究

Mubashara Akhtar, Anka Reuel, Prajna Soni, Sanchit Ahuja, Pawan Sasanka Ammanamanchi, Ruchit Rawal, Vilém Zouhar, Srishti Yadav, Chenxi Whitehouse, Dayeon Ki, Jennifer Mickel, Leshem Choshen, Marek Šuppa, Jan Batzner, Jenny Chim, Jeba Sania, Yanan Long, Hossein A. Rahmani, Christina Knight, Yiyang Nan, Jyoutir Raj, Yu Fan, Shubham Singh, Subramanyam Sahoo, Eliya Habba, Usman Gohar, Siddhesh Pawar, Robert Scholz, Arjun Subramonian, Jingwei Ni, Mykel Kochenderfer, Sanmi Koyejo, Mrinmaya Sachan, Stella Biderman, Zeerak Talat, Avijit Ghosh, Irene Solaiman

机构 * University of California, Berkeley(加州大学伯克利分校) University of Toronto(多伦多大学) University of Washington(华盛顿大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Michigan(密歇根大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本研究定义并分析了60个语言模型基准的饱和现象,发现近半数基准出现饱和,且专家策划而非公开测试数据影响抗饱和能力,为延长基准寿命提供了设计建议。

Comments Published at ICML 2026 (Forty-Third International Conference on Machine Learning)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05004 2026-08-06 cs.CL 新提交

DelusionEval: Measuring Delusion-Linked Behaviors in AI Chatbots

DelusionEval:评估AI聊天机器人中与妄想相关的行为

Jared Moore, Andrea Mock, Yifan Mai, Jacy Reese Anthis, Ryan Louie, William Agnew, Ashish Mehta, Kevin Klyman, Percy Liang, Nick Haber, Eric Lin, Desmond C. Ong

机构 * Stanford University(斯坦福大学) University of Chicago(芝加哥大学) Carnegie Mellon University(卡内基梅隆大学) Harvard University(哈佛大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本研究开发DelusionEval评估协议,发现LLM表现出与妄想相关行为的倾向与模型规模等无可靠关联,扩展上下文会提升此类行为发生率,所有模型家族均存在相关风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02870 2026-08-06 cs.LG 版本更新

Maglev: Sliding Recurrent Memory

Maglev:滑动循环记忆

Bo Liu, Qiang Liu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本文提出Maglev,一种带固定记忆的循环Transformer架构,通过耦合模型与记忆一致性损失实现训练可并行性,在验证损失及下游预训练基准上优于基线,参数共享可减少内存。

Comments Neural Architecture Research

详情

展开后加载摘要…

URL PDF HTML 收藏