arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 266 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 266 篇

2509.24770 2026-07-28 cs.LG 版本更新 70%

Neural Message-Passing on Attention Graphs for Hallucination Detection

基于注意力图的神经消息传递用于幻觉检测

Fabrizio Frasca, Guy Bar-Shalom, Yftah Ziser, Haggai Maron

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究大语言模型幻觉检测问题,提出CHARM方法,将其视为图学习任务,通过在属性图上应用图神经网络解决,实验证明该方法优于其他方法,揭示图结构作用,展现跨数据集转移的零样本性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18672 2026-07-24 cs.LG stat.ML 版本更新 70%

Concept Concentration for Faithful Representation Intervention

用于忠实表示干预的概念集中化

Hongzheng Yang, Yongqiang Chen, Zeyu Qin, Tongliang Liu, Chaowei Xiao, Kun Zhang, Bo Han

机构 * SAIC Centre, USYD(SAIC中心)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究大语言模型表示干预中定位忠实概念的问题,提出概念集中化(COCA)方法,通过重构训练数据简化决策边界,有效降低分布内和分布外越狱成功率,且在常规任务上保持性能。

Comments ICML'26; Hongzheng and Yongqiang contributed equally; project page: https://causalcoat.github.io/coca

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04081 2026-07-23 cs.CL 版本更新 70%

Abstraction Induces the Brain Alignment of Language and Speech Models

抽象诱导语言和语音模型的脑对齐

Emily Cheng, Aditya R. Vaidya, Richard Antonello

机构 * The University of Texas at Austin, USA(德克萨斯大学奥斯汀分校) Zuckerman Mind Brain Behavior Institute, Columbia University, USA(祖克曼心智-大脑-行为研究所,哥伦比亚大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究发现语言和语音模型通过共享的意义抽象与大脑对齐,中间层的高内在维度和语义内容增强了大脑预测性。

Comments ICML 2026 camera-ready version

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12225 2026-07-21 cs.CL 版本更新 70%

On the Interpretability of Whisper Encodings Using Sparse Autoencoders

使用稀疏自编码器解释ASR模型的机制

Dan Pluth, Zachary Nicholas Houghton, Yu Zhou, Vijay K. Gurbani

机构 * Vail Systems, Inc.(瓦尔系统公司) University of Oregon(俄勒冈大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过稀疏自编码器分析Whisper模型,揭示了跨语言和非语言特征的多样性,并展示了其在语音识别中的应用潜力。

Comments 7 pages + references and appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27752 2026-07-21 cs.CL cs.SE 版本更新 70%

Retromorphic Testing with Hierarchical Verification for Hallucination Detection in RAG

基于分层验证的反向测试用于RAG中的幻觉检测

Boxi Yu, Yuzhong Zhang, Liting Lin, Lionel Briand, Emir Muñoz

机构 * Lero, the Research Ireland Centre for Software, University of Limerick(Lero,爱尔兰科学基金会软件研究中心,利默里克大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Ottawa(渥太华大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出RT4CHART框架,通过分层验证提升RAG中上下文忠实度评估的准确性,实现细粒度审计,并在新标注基准上取得最佳检测效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14819 2026-07-01 cs.CV cs.LG 版本更新 70%

Capturing Context-Aware Route Choice Semantics for Trajectory Representation Learning

捕捉上下文感知路径选择语义的轨迹表示学习

Ji Cao, Yu Wang, Tongya Zheng, Jie Song, Qinghong Guo, Zujie Ren, Canghong Jin, Gang Chen, Mingli Song

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Zhejiang Lab(之江实验室) Zhejiang Provincial Engineering Research Center for Real-Time SmartTech in Urban Security Governance, Hangzhou City University(浙大城市学院浙江省城市安全治理实时智能技术工程研究中心) School of Software Technology, Zhejiang University(浙江大学软件学院) Polytechnic Institute of Zhejiang University(浙江大学工程师学院)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出CORE框架,通过多粒度环境感知模块和基于混合专家架构的路径选择编码器,将上下文感知的路径选择语义融入轨迹嵌入,在6个下游任务中平均提升9.20%。

Comments Accepted by IEEE Transactions on Knowledge and Data Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01849 2026-06-26 cs.CL 版本更新 70%

From Guessing to Placeholding: A Cost-Theoretic Framework for Uncertainty-Aware Code Completion

从猜测到占位:一种基于代价理论的不确定性感知代码补全框架

Liang Zhu, Haolin Chen, Lidong Zhao, Xian Wu

机构 * Tencent, Shenzhen, China(腾讯深圳公司)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对硬补全范式在不确定上下文中生成错误代码的问题,提出自适应占位补全框架,在高熵位置输出占位符,理论证明其期望代价低于硬补全,实验显示编辑代价降低19%-50%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01989 2026-06-23 cs.CV cs.AI 版本更新 70%

Attention at Rest Stays at Rest: Breaking Visual Inertia for Cognitive Hallucination Mitigation

静止的注意力保持静止:打破视觉惯性以缓解认知幻觉

Boyang Gong, Yu Zheng, Fanye Kong, Jie Zhou, Jiwen Lu

机构 * Tsinghua University(清华大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出惯性感知视觉激发(IVE)方法,通过建模视觉注意力的动态响应性,打破多模态大模型中的视觉惯性,从而缓解需要对象间关系推理的认知幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24942 2026-06-15 cs.CL q-bio.NC 版本更新 70%

Independent-Component-Based Encoding Models of Brain Activity During Story Comprehension

基于独立成分的故事理解过程中大脑活动的编码模型

Kamya Hari, Taha Binhuraib, Jin Li, Cory Shain, Anna A. Ivanova

机构 * School of Electrical and Computer Engineering, Georgia Institute of Technology(佐治亚理工学院电子与计算机工程学院) School of Psychological and Brain Sciences, Georgia Institute of Technology(佐治亚理工学院心理学与脑科学学院) Department of Linguistics, Stanford University(斯坦福大学语言学系)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出基于独立成分的编码框架,从fMRI数据中分离刺激驱动和噪声信号,利用语言模型预测独立成分时间序列,识别出与听觉和语言相关的认知网络,验证了成分的可解释性和跨个体一致性。

Comments Accepted to CCN 2026 (Proceedings Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04935 2026-06-10 cs.SE cs.AI 版本更新 70%

ASA: Backbone-Training-Free Representation Engineering for Tool-Calling Agents

ASA:无需骨干训练的工具调用智能体表示工程

Youjin Wang, Run Zhou, Yingjie Ma, Rong Fu, Jiani Liang, Shuaishuai Cao, Min Huang, Tao Fang, Liangming Pan

机构 * Renmin University of China(中国人民大学) University of Macau(澳门大学) Central South University(中南大学) Jiangxi Normal University(江西师范大学) Macau Millennium College(澳门 millennium 学院) Peking University(北京大学)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对大语言模型在工具调用中的惰性代理问题,提出一种无需训练、推理时激活干预的方法ASA,通过路由条件混合引导向量和探针引导门控,显著提升工具使用F1并降低误报率。

Comments The manuscript consists of 24 pages formatted in the ACL style. Youjin Wang, Run Zhou, and Yingjie Ma contributed equally to this work. Tao Fang and Liangming Pan are the co-corresponding authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08726 2026-06-10 cs.CL 版本更新 70%

Standard Language Ideology in AI-Generated Language

AI生成语言中的标准语言意识形态

Genevieve Smith, Eve Fleisig, Ishita Rustagi, Xavier Yin

机构 * Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一个分类法,揭示大型语言模型如何强化标准语言意识形态,导致语言变体的边缘化,并讨论其社会影响及应对建议。

Comments To appear in the 2026 ACM Conference on Fairness, Accountability, and Transparency (FAccT '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16173 2026-08-12 cs.RO 版本更新 67%

Vision-Language-Motion Maps: An Open-Vocabulary, Uncertainty-Aware, Queryable Motion Attribute for 3D Scene Maps

视觉-语言-运动地图:用于3D场景地图的开放词汇、不确定性感知、可查询运动属性

Dibyendu Ghosh, Ayushi Shakya

机构 * Rekise Marine(瑞基斯海洋)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn)

AI总结 研究针对开放词汇3D地图无法处理场景元素运动查询的问题,提出视觉-语言-运动地图(VLMM),其元素有融合运动属性及不确定性。通过实验验证模式字段不可替代,在真实数据集上该方法提升精度、减少错误标志且对噪声姿态鲁棒。

Comments 8 pages, 5 figures, 3 tables. v2: corrected Eq. (7) (residual covariance;implementation unaffected), added the persistent-map update rule, the query-parser grammar, and an aggregation-quantile ablation

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00501 2026-08-06 cs.SE 版本更新 67%

CodeChemist: Test-Time Scaling for Low-Resource Code Generation via Functional Knowledge Transfer

CodeChemist:通过测试时扩展实现低资源代码生成的功能知识迁移

Kaixin Wang, Tianlin Li, Xiaoyu Zhang, Aishan Liu, Xianglong Liu, Ziqi Liu, Zhiqiang Zhang, Jun Zhou, and Bin Shi

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract)

AI总结 提出CodeChemist框架,通过合成测试用例将模型功能知识从高资源语言迁移到低资源语言,无需训练,显著提升低资源语言代码生成性能。

Comments This paper is accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26097 2026-08-05 cs.CV 版本更新 67%

Knowledge-guided Disentanglement with Atomic Actions for Action Recognition

面向动作识别的基于原子动作的知识引导解缠

Tianci Wu, Siqi Cao, Guangming Zhu, Jiang Lu, Siyuan Wang, Longfei Zhang, Jincai Huang, Jun Sheng, Liang Zhang

机构 * Xidian University(西安电子科技大学) National University of Defense Technology(国防科技大学) Human Institute of Advanced Technologyy(人类高级技术研究院) Shanghai Road Transport Development Center(上海市道路运输发展中心)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract)

AI总结 本文提出KDA方法,用LLMs分解动作标签为原子动作,经KIM和KDM解缠,在多标签动作识别基准上达SOTA性能,且模块可通用集成。

Comments ACMMM 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02882 2026-08-05 cs.CY 版本更新 67%

Reading Between the Tokens: Improving Preference Predictions through Mechanistic Forecasting

在token之间阅读:通过机制性预测改进偏好预测

Sarah Ball, Simeon Allmendinger, Frauke Kreuter, Niklas Kühl

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract)

AI总结 通过机制性预测方法,利用语言模型内部表示结构提升偏好预测准确性,揭示其在社会科学预测中的应用潜力。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27902 2026-08-04 cs.CV 版本更新 67%

One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting

一个补丁就够:面向基于多模态大语言模型(MLLM)的场景文本定位的强化优化视觉标记接地

Rui Tang, Wentao Yang, Peirong Zhang, Yongxin Shi, Shun Zhang, Huiguo He, Lianwen Jin

机构 * South China University of Technology(华南理工大学) HiThink Research(海思思考研究院)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract)

AI总结 针对现有多补丁场景文本定位范式的冗余噪声与定位歧义问题,提出以视觉为中心的单补丁文本定位框架 SPaTS,通过强化学习优化的单补丁选择等技术实现性能提升,显著优于前沿相关模型。

Comments 15 pages, 11 figures. Accepted to ACM Multimedia 2026

Journal ref Proceedings of the 34th ACM International Conference on Multimedia (MM '26), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12507 2026-07-28 cs.SE 版本更新 67%

ATLAS: Multi-View Code Representation Tool for C and C++ Source Programs

ATLAS: C和C++源代码的多视图代码表示工具

Jaid Monwar Chowdhury, Ahmad Farhan Shahriar Chowdhury, Humayra Binte Monwar, Mahmuda Naznin

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn)

AI总结 提出ATLAS工具,无需完整构建即可为C/C++生成对齐的AST、CFG和DFG,支持部分输入,输出JSON/DOT/PNG,在TheAlgorithms语料上CFG正确率达96.80%(C)和91.67%(C++)。

Comments 5 pages, 4 figures, 2 tables; Video demonstration: https://youtu.be/50DvEbenp14; Tool repository: https://github.com/jaid-monwar/ATLAS-multi-view-code-representation-tool.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19821 2026-07-13 cs.CV 版本更新 67%

LaCoVL-FER: Landmark-Guided Contrastive Learning Network with Vision-Language Enhancement for Facial Expression Recognition

LaCoVL-FER: 一种结合视觉-语言增强的地标引导对比学习网络用于面部表情识别

Jiaxin Wang, Muwei Jian, Hui Yu, Junyu Dong, Yifan Xia

机构 * School of Airspace and Engineering, Shandong University(山东大学航空航天与工程学院) School of Computer Science and Technology, Shandong University of Finance and Economics(山东财经大学计算机科学与技术学院) School of Psychology and Neuroscience, University of Glasgow(格拉斯哥大学心理学与神经科学学院) Faculty of Information Science and Engineering, Ocean University of China(中国海洋大学信息科学与工程学院)

专题命中 知识编辑与模型理解 :language model(abstract);prompting(abstract)

AI总结 本文提出了一种结合视觉-语言增强的地标引导对比学习网络LaCoVL-FER,通过引入面部地标几何先验和视觉-语言模型语义先验,解决野生环境中面部表情识别的挑战,提升识别的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01388 2026-07-10 cs.CV 版本更新 67%

LESV: Language Embedded Sparse Voxel Fusion for Open-Vocabulary 3D Scene Understanding

LESV: 语言嵌入稀疏体素融合用于开放词汇3D场景理解

Fusang Wang, Nathan Piasco, Moussab Bennehar, Luis Roldão, Dzmitry Tsishkou, Fabien Moutarde

机构 * Huawei Noah's Ark Lab(华为诺亚方舟实验室) CAOR, Mines Paris-PSL, France(法国巴黎高科矿业学院CAOR实验室)

专题命中 知识编辑与模型理解 :foundation model(abstract,abstract_cn)

AI总结 本文提出LESV框架,通过稀疏体素 rasterization 解决3D场景理解中空间和语义模糊问题,利用AM-RADIO实现密集对齐,提升细粒度查询性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00705 2026-06-29 cs.CV 版本更新 67%

Training-free Uncertainty Guidance for Complex Visual Tasks with MLLMs

无训练不确定性引导的复杂视觉任务多模态大语言模型

Sanghwan Kim, Rui Xiao, Stephan Alaniz, Yongqin Xian, Zeynep Akata

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Helmholtz Munich(海德堡-慕尼黑亥姆霍兹研究中心) Google(谷歌) LTCI, Télécom Paris, Institut Polytechnique de Paris(巴黎理工大学 LTCI 实验室)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract)

AI总结 提出无需训练的框架,利用MLLM内在不确定性主动引导,通过响应不确定性评分候选视觉输入,使模型自主聚焦关键信息,在视觉搜索、长视频理解等任务中达到与微调系统相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20381 2026-06-26 cs.RO 版本更新 67%

STORM: Slot-based Task-aware Object-centric Representation for robotic Manipulation

STORM:基于槽的任务感知面向对象的机器人操作表示

Alexandre Chapin, Emmanuel Dellandréa, Liming Chen

机构 * Ecole Centrale de Lyon, LIRIS(里尔森中央理工大学,LIRIS实验室)

专题命中 知识编辑与模型理解 :foundation model(abstract);pretraining(abstract)

AI总结 提出STORM模块,通过多阶段训练策略将冻结的视觉基础模型与语义感知槽结合,生成面向对象的任务感知表示,提升机器人操作在视觉干扰下的泛化性和控制性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19255 2026-06-17 cs.CV 版本更新 67%

Advances in 4D Representation: Geometry, Motion, and Interaction

4D表示进展:几何、运动与交互

Mingrui Zhao, Sauradip Nag, Kai Wang, Aditya Vora, Guangda Ji, Peter Chun, Ali Mahdavi-Amiri, Hao Zhang

机构 * Simon Fraser University(西蒙弗雷泽大学) University of Alberta(阿尔伯塔大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract)

AI总结 本文综述了4D生成与重建领域,从几何、运动和交互三个核心支柱出发,分析不同4D表示方法的特性、挑战及适用场景,并探讨了大语言模型和视频基础模型在其中的作用。

Comments CGF'26,21 pages. Project Page: https://mingrui-zhao.github.io/4DRep-GMI/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21249 2026-08-11 cs.AI cs.LG 版本更新 62%

Position: Certifiable State Integrity Should Be Built from Local Validity, Not Global Scale

位置:可信的状态完整性在网络物理系统中——为什么模块主权解决塑性-稳定性悖论

Enzo Nicolás Spotorno, Joao R. Campos, Antônio Augusto Medeiros Fröhlich

机构 * Software/Hardware Integration Lab (LISHA), Department of Statistics and Informatics, UFSC, Florianópolis, Brazil(软件/硬件集成实验室(LISHA)、统计与信息学系,UFSC,弗洛里亚诺波利斯,巴西)

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出模块主权范式,通过冻结领域特定专家和不确定性感知融合,解决网络物理系统中塑性-稳定性悖论,确保状态完整性和可验证性。

Comments v2, 15 pages, (8 main text, 6 references and appendices), 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12952 2026-07-31 cs.LG cs.AI cs.CV 版本更新 62%

Transporting Task Vectors across Different Architectures without Training

在不同架构间传输任务向量而无需训练

Filippo Rinaldi, Aniello Panariello, Giacomo Salici, Angelo Porrello, Simone Calderara

机构 * AImageLab, University of Modena and Reggio Emilia(AImageLab,Modena和雷吉奥艾米利亚大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Theseus方法,通过功能匹配在不同宽度模型间传输任务更新,无需训练或反向传播,展示了在视觉和语言模型上的改进效果。

Comments Accepted at the International Conference on Machine Learning (ICML), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25600 2026-07-30 cs.IR cs.AI cs.CL 版本更新 62%

Beyond Self-Knowledge: Propagating Uncertainty Across Reasoning and Retrieval in LLMs

超越自我认知:在语言模型中跨推理与检索传播不确定性

Chandan Kumar Sah, Li Zhang, Xiaoli Lian

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 研究在知识密集型问答中,利用黑盒语言模型的置信度指导检索路由。核心方法是BeyondUncertainty,先得临时答案和置信度,依阈值决定检索策略。该方法提升了平均词元级F1,减少检索段落,在多数设置中优于随机分配,揭示了证据获取与词元效率的权衡。

Comments 9 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18543 2026-07-23 cs.AI cs.CL cs.SE 版本更新 62%

CEO-Bench: Can Agents Play the Long Game?

CEO-Bench:智能体能否玩转长期博弈?

Haozhe Chen, Karthik Narasimhan, Zhuang Liu

机构 * Princeton University(普林斯顿大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 提出CEO-Bench,通过模拟500天运营初创公司的任务,评估语言模型智能体在长期、不确定、动态环境下的综合决策能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13302 2026-07-21 cs.AI cs.LG 版本更新 62%

Physics-Guided Spatiotemporal Learning for Coastal Wave Peak Period Estimation from Video

物理引导的时空学习用于从视频估计海岸波浪峰值周期

Abubakar Hamisu Kamagata, Dharm Singh Jat, Attlee Munyaradzi Gamundani, Abhishek Srivastava, Paramasivam Saravanakumar

机构 * Namibia University of Science and Technology(纳米比亚科技大学) Indian Institute of Technology Indore(印度理工学院印多尔分校) Namdeb Diamond Corporation(纳米比亚钻石公司)

专题命中 知识编辑与模型理解 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出物理引导的深度时空学习框架,结合自动区域检测、模拟到真实迁移学习和物理信息正则化,从海岸视频直接估计近岸波浪峰值周期,验证了基于Transformer和轻量级循环卷积架构的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17522 2026-07-20 cs.CL cs.LG 版本更新 62%

An expressivity analysis of hierarchical modelling in deep transformers via bounded-depth grammars

深度Transformer中基于有界深度文法的层次建模的表达性分析

Vinoth Nandakumar, Qiang Qu, Pramod Thebe, Sakshi Khachariya, Tongliang Liu

机构 * University of Sydney(悉尼大学) San Francisco State University(旧金山州立大学) IIT Madras(印度理工学院马德拉斯分校)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL、cs.LG

AI总结 通过有界深度上下文无关文法,证明深度Transformer的深度随文法深度线性增长,神经元数随派生树形状和产生式规则数量缩放,支持线性表示假说。

Comments Withdrawing submission to implement major revisions based on journal feedback

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06592 2026-07-15 cs.CL cs.LG 版本更新 62%

Hierarchical Latent Structures in Data Generation Process Unify Mechanistic Phenomena across Scale

数据生成过程中层次化潜在结构在跨尺度的机理现象中统一

Jonas Rohweder, Subhabrata Dutta, Iryna Gurevych

机构 * Ubiquitous Knowledge Processing Lab (UKP Lab) Department of Computer Science, Technical University of Darmstadt and National Research Center for Applied Cybersecurity ATHENE, Germany(通用知识处理实验室(UKP Lab)计算机科学系,达姆施塔特技术大学和应用网络安全国家研究中心ATHENE,德国)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本文通过生成合成语料库研究数据生成过程中层次结构对语言模型中归纳头、功能向量和海德拉效应等现象的统一解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11399 2026-07-09 cs.LG cs.AI cs.RO 版本更新 62%

Can We Really Learn One Representation to Optimize All Rewards?

我们真的能学习一种表示来优化所有奖励吗?

Chongyi Zheng, Royina Karegoudra Jayanth, Benjamin Eysenbach

机构 * Princeton University(普林斯顿大学)

专题命中 知识编辑与模型理解 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究无监督预训练中通过交互的无监督学习,聚焦前向 - 后向表示学习。通过理论分析阐明其表示存在条件及收敛情况,提出更易理解和优化的变体。实验表明该变体误差更小、零样本性能提升,还能为下游任务提供有效初始化。

详情

展开后加载摘要…

URL PDF HTML 收藏