arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-03 至 2026-06-03 共收录 31 信号源:cs.CL, cs.AI, cs.LG

1. 其他LLM 31 篇

2601.09869 2026-06-03 cs.AI cs.HC 92%

A Scoping Review of the Ethical Perspectives on Anthropomorphising Large Language Model-Based Conversational Agents

拟人化大型语言模型对话代理的伦理视角:一项范围综述

Andrea Ferrario, Rasita Vinay, Matteo Casserini, Alessandro Facchini

机构 * Institute of Biomedical Ethics and History of Medicine, University of Zürich(苏黎世大学生物医学伦理与医学史研究所) Dalle Molle Institute for Artificial Intelligence (IDSIA), SUPSI(瑞士SUPSI人工智能研究所) ETH Zürich(苏黎世联邦理工学院) Institute for Implementation Science in Health Care, University of Zürich(苏黎世大学医疗实施科学研究所) Department of Management, Technology and Economics, ETH Zürich(苏黎世联邦理工学院管理、技术与经济系) Dipartimento Tecnologie Innovative, SUPSI(SUPSI创新技术系) Management in Networked and Digital Societies (MINDS) Department, Kozminski University(科兹明斯基大学网络化与数字化社会管理系)

专题命中 其他LLM :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文通过范围综述,系统梳理了拟人化LLM对话代理的伦理挑战与机遇,包括概念基础、伦理问题及方法论,并提出了研究议程与设计治理建议。

Comments 2026 ACM Conference on Fairness, Accountability, and Transparency (FAccT'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17860 2026-06-03 cs.CR 91%

TitanCA: Lessons from Orchestrating LLM Agents to Discover 100+ CVEs

TitanCA:编排LLM代理发现100+个CVE的经验教训

Ting Zhang, Yikun Li, Chengran Yang, Ratnadira Widyasari, Yue Liu, Ngoc Tan Bui, Phuc Thanh Nguyen, Yan Naing Tun, Ivana Clairine Irsan, Huu Hung Nguyen, Huihui Huang, Jinfeng Jiang, Lwin Khin Shar, Eng Lieh Ouh, David Lo, Hong Jin Kang, Yide Yin, Wen Bin Leow

专题命中 其他LLM :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文介绍TitanCA,一种通过编排多个LLM代理进行漏洞发现的流水线,已在开源软件中发现203个零日漏洞并产生118个CVE。

Comments Accepted by IEEE Security & Privacy Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03032 2026-06-03 cs.CL 90%

The Deliberative Illusion: Diagnosing Factual Attrition and Stance Homogenization in Multi-Agent LLM Deliberation

深思幻觉:诊断多智能体LLM讨论中的事实损耗与立场同质化

Herun Wan, Jiaying Wu, Minnan Luo, Fanxiao Li, Ningnan Wang, Nancy F. Chen, Min-Yen Kan

机构 * Xi’an Jiaotong University(西安交通大学) National University of Singapore(新加坡国立大学) Yunnan University(云南大学) Agency for Science, Technology and Research (A*STAR), Singapore(新加坡科技研究局(A*STAR))

专题命中 其他LLM :LLM(title,title_cn);分类 cs.CL

AI总结 本文提出DelibTrace框架,通过分解原子事实并追踪其存留,发现多智能体LLM讨论中高达72%的关键事实丢失,导致立场同质化,揭示了“同意越多、知道越少”的风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02953 2026-06-03 cs.CL 89%

Linguistic Productivity in Large Language Models: Models Coerce, but do not Preempt

大型语言模型中的语言生产力:模型强制但不抢占

Claire Bonial, Claire Benet Post, Laura Michaelis, Harish Tayyar Madabushi

机构 * Georgetown University(乔治城大学) University of Colorado Boulder(科罗拉多大学丹佛分校) University of Bath(巴斯大学)

专题命中 其他LLM :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL

AI总结 通过测试大型语言模型是否受固化(高频使用)和抢占(未观察到结构)两种统计信号影响,发现模型能识别强制情况下的构式生产力,但无法利用负面证据避免过度泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03093 2026-06-03 cs.AI 87%

Decomposing how prompting steers behavior

分解提示如何引导行为

Fan L. Cheng, Nikolaus Kriegeskorte

机构 * Columbia University(哥伦比亚大学)

专题命中 其他LLM :prompting(title,abstract);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出嵌套几何分解框架,通过刺激不变映射分析提示如何重塑表示几何,揭示跨维度线性混合是提示引导行为的关键机制。

Comments 59 pages, 41 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03034 2026-06-03 cs.MA cs.AI 86%

Capability Advertisement as a Market for Lemons: A Trust Layer for Heterogeneous Agent Networks

能力广告作为柠檬市场:异构智能体网络的信任层

Gaurav Naresh Mittal

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 其他LLM :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对LLM智能体网络中的能力虚假声称问题,提出基于柠檬市场理论的信任层,通过概率描述、筛选和声誉机制实现可信委托。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02638 2026-06-03 cs.SD cs.AI eess.AS 86%

SegTune: Structured and Fine-Grained Control for Song Generation

SegTune:歌曲生成的结构化与细粒度控制

Yuejiao Wang, Zihao Ji, Pengfei Cai, Xu Li, Haorui Zheng, Zewen Song, Zhongliang Liu, Chen Zhang, Pengfei Wan

机构 * Kling Team, Kuaishou Technology(快手科技 Kling 团队) University of Science and Technology of China(中国科学技术大学) Peking University(北京大学)

专题命中 其他LLM :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出基于扩散Transformer的SegTune框架,通过用户或LLM指定局部音乐描述实现结构化细粒度控制,并引入LLM时长预测器实现精确歌词-音乐对齐,在音乐性和可控性上超越现有基线。

Comments This paper has been accepted to ACL 2026 as an oral presentation and has been nominated for the Best Paper Award. This work is a revised and extended version of an earlier technical report (arXiv:2510.18416). arXiv admin note: text overlap with arXiv:2510.18416

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08426 2026-06-03 cs.GT cs.AI 86%

Mechanism Design Is Not Enough: Prosocial Agents for Cooperative AI

机制设计是不够的:面向合作AI的亲社会智能体

Xuanqiang Angelo Huang, Charlie Tharas, Samuele Marro, Van Q. Truong, Bernhard Schölkopf, Emanuele La Malfa, Zhijing Jin

机构 * ETH Zürich(苏黎世联邦理工学院) University of Oxford(牛津大学) Institute for Decentralized AI(去中心化人工智能研究所) Jinesis Lab, University of Toronto & Vector Institute(多伦多大学Jinesis实验室及向量研究所) EuroSafeAI University of Pennsylvania(宾夕法尼亚大学) Max Planck Institute for Intelligent Systems, Tübingen, Germany(德国图宾根最大计划智能系统研究所) ELLIS Institute Tübingen(图宾根ELLIS研究所)

专题命中 其他LLM :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文证明仅靠机制设计无法最大化LLM智能体的社会福利,并提出亲社会智能体(兼顾他人福利)能弥补这一差距,实现更优的社会与个体结果。

Comments 42 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03145 2026-06-03 cs.DB 83%

The Case for Text-to-SQL Friendly Logical Database Design

面向文本到SQL的友好逻辑数据库设计

Shi Heng Zhang, Zhengjie Miao, Jiannan Wang

专题命中 其他LLM :LLM(summary_cn,abstract);language model(abstract)

AI总结 本文提出LLM友好的逻辑数据库设计目标,通过三种语义保持的模式变换(抽象、分区、重命名)优化数据库模式,提升文本到SQL的生成准确率,实验显示执行准确率提升高达4.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21731 2026-06-03 cs.CL cs.AI 82%

Identifying Quantum Structure in AI Language: Evidence for Evolutionary Convergence of Human and Artificial Cognition

识别AI语言中的量子结构:人类与人工智能认知进化趋同的证据

Diederik Aerts, Jonito Aerts Arguëlles, Lester Beltran, Suzette Geriente, Roberto Leporini, Massimiliano Sassoli de Bianchi, Sandro Sozzo

机构 * Center Leo Apostel for Interdisciplinary Studies, Vrije Universiteit Brussel (VUB)(利奥·阿波斯泰尔跨学科研究中心,布鲁塞尔自由大学) Department of Economics, University of Bergamo(博洛尼亚大学经济系) Department of Humanities and Cultural Heritage (DIUM) and Centre CQSCS, University of Udine(乌迪内大学人文与文化遗产系及CQSCS中心)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 通过对大型语言模型进行认知测试,发现其概念组合中存在贝尔不等式显著违背和玻色-爱因斯坦统计,表明人类与人工智能在概念-语言领域均涌现非经典量子结构,支持认知进化趋同假说。

Journal ref Entropy 28, 622, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03223 2026-06-03 cs.RO cs.AI 81%

BotDirector: Robot Storytelling Across the Symmetrical Reality with Multi-modal Interactions

BotDirector:跨对称现实的多模态交互机器人讲故事

Zhe Sun, Meng Wang, Lei Wang, Yuxi Wang, Wanxin Li, Yujia Peng, Zhenliang Zhang

机构 * State Key Laboratory of General Artificial Intelligence, BIGAI, Beijing, China(国家一般人工智能重点实验室,BIGAI,北京,中国) Peking University, Beijing, China(北京大学,北京,中国)

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出一个结合具身交互和自然语言交互的机器人讲故事系统,利用LLM代理将儿童创建的叙事转化为自导航群体机器人的运动序列,支持灵活场景和日常物品。

Journal ref 2026 IEEE Conference on Virtual Reality and 3D User Interfaces Abstracts and Workshops (VRW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03078 2026-06-03 cs.CL 81%

G^2C-MT: Graph-Guided Context Selection for Document-Level Machine Translation

G^2C-MT: 面向文档级机器翻译的图引导上下文选择

Baijun Ji, Zixuan Zhou, Xiangyu Duan, Yu Liu, Longbo Sun, Rupu Wei, Bohong Zhao

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Trip.com Group(Trip.com集团)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出G^2C-MT方法,通过构建轻量级篇章图并采用深度偏置随机游走采样上下文路径,以结构化方式为文档级机器翻译选择上下文,提升翻译质量与鲁棒性。

Comments 9 pages, 2 figures; IJCAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02973 2026-06-03 cs.CL 81%

Chatbots Output Meaningful (but Problematic) Language

聊天机器人输出有意义(但有问题)的语言

Matthew Stone, Una Stojnić

机构 * University of Parma(帕尔马大学) University of Cambridge(剑桥大学) University of Pittsburgh(匹兹堡大学) Franklin and Marshall College(弗兰克林与马歇尔学院)

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本文论证大型语言模型(LLM)的输出是有意义的,但无需假设其具有心理状态或意图,并探讨了这一观点对语言理论和AI伦理的影响。

Comments 49 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03780 2026-06-03 cs.CL cs.LG 81%

Expert-Aware Causal Tracing of Factual Recall in Sparse MoE Language Models

专家感知的稀疏MoE语言模型中事实回忆的因果追踪

Yuetian Lu, Ali Modarressi, Yihong Liu, Hinrich Schütze

机构 * Center for Information and Language Processing (CIS)(信息与语言处理中心) Ubiquitous Knowledge Processing Lab (UKP)(无所不在的知识处理实验室) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 其他LLM :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 针对稀疏混合专家语言模型,提出专家感知的因果追踪方法,通过干预专家级更新定位事实回忆的关键专家,发现专家级定位依赖于模型和协议。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02960 2026-06-03 cs.SE 80%

Many a Little Makes a Mickle: A Code-Centric Empirical Study of Data Minimization Principle in Android App Development

积少成多:以代码为中心的Android应用开发中数据最小化原则的实证研究

Dianshu Liao, Shidong Pan, Zhenchang Xing, Xiaoyu Sun

专题命中 其他LLM :LLM(summary_cn,abstract)

AI总结 通过对1114个开源Android应用的实证研究,识别出五个数据处理阶段中的十种数据最小化场景,并基于9875个真实APK的大规模分析提炼出31条可操作的编码指南,同时发现LLM生成的代码会重现数据最小化风险实践,而纳入指南可消除这些问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02651 2026-06-03 cs.PL cs.LO cs.SE 80%

From Rocq to Metal: A Pipeline for Formally Verified Microcontroller Firmware

从Rocq到Metal:形式化验证微控制器固件的流水线

Valentin Bergeron, Karolina Gorna

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出Encore!虚拟机,通过延续传递风格运行Rocq提取的Scheme代码,实现微控制器固件的形式化验证,并利用大语言模型辅助策略合成自动证明固件正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03344 2026-06-03 cs.CR cs.LG 79%

RogueMerge: Robust and Unified Attacks against LLM Model Merging

RogueMerge: 针对大语言模型合并的鲁棒统一攻击

Jinghuai Zhang, Yetian He, Kunlin Cai, Han Zhao, Fnu Suya, Yuan Tian

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 其他LLM :LLM(title,abstract);分类 cs.LG

AI总结 提出RogueMerge框架,通过联合优化、元学习模拟和分布鲁棒优化,解决模型合并中针对自回归生成、未知合并配置和攻击提示泛化的三大挑战,实现鲁棒且统一的攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03612 2026-06-03 cs.LG cs.CC cs.CL cs.FL 79%

Why Are Linear RNNs More Parallelizable?

为什么线性RNN更易于并行化?

William Merrill, Hongjian Jiang, Yanhong Li, Anthony Lin, Ashish Sabharwal

专题命中 其他LLM :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文通过将RNN类型与标准复杂度类紧密关联,揭示了线性RNN(LRNN)因可视为对数深度算术电路而易于并行化,而非线性RNN因能解决L-完全问题而存在并行化障碍。

Comments To appear at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21448 2026-06-03 cs.CL 77%

When Models Refuse: Political Steerability and Feature Richness as Measures of Ideological Depth

当模型拒绝时:政治可操控性与特征丰富度作为意识形态深度的度量

Shariar Kabir

机构 * Bangladesh University of Engineering and Technology(孟加拉工程与技术大学)

专题命中 其他LLM :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出意识形态深度概念,通过可操控性和稀疏自编码器测量的特征丰富度,研究大语言模型拒绝遵循良性指令是否源于能力缺陷而非安全规则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02260 2026-06-03 cs.LG cs.CR 77%

Position: Adversarial ML for LLMs Is Not Making Any Progress

立场:针对LLM的对抗性机器学习并未取得任何进展

Javier Rando, Jie Zhang, Nicholas Carlini, Florian Tramèr

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 其他LLM :LLM(title_cn);language model(abstract);分类 cs.LG

AI总结 本文认为,在大语言模型时代,对抗性机器学习研究的问题定义更模糊、更难解决且更难以评估,可能导致未来十年仍无法取得有意义进展。

Comments Accepted at ICML 2026 Position Paper Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04809 2026-06-03 cs.CR 75%

SEEM: Exploiting Black-Box Text Attacks to Manipulate Tool Selection

SEEM:利用黑盒文本攻击操纵工具选择

Liuji Chen, Hao Gao, Jinghao Zhang, Qiang Liu, Shu Wu, Liang Wang

专题命中 其他LLM :LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出SEEM方法,通过词级和字符级的粗到细扰动,在黑盒条件下增加目标工具被选中的概率,揭示工具选择机制的安全漏洞。

Comments 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03143 2026-06-03 cs.LG cs.CL 73%

FederatedSkill: Federated Learning for Agentic Skill Evolution

FederatedSkill: 面向智能体技能演化的联邦学习

Jingbo Yang, Guanyu Yao, Yang Zhang, Ramana Rao Kompella, Gaowen Liu, Shiyu Chang

机构 * UC Santa Barbara(加州大学圣巴bara分校) MIT-IBM Watson AI Lab(麻省理工-IBM Watson人工智能实验室) Cisco Research(思科研究)

专题命中 其他LLM :LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 提出FederatedSkill框架,通过语义技能差异作为通信单元,在保护隐私的同时实现个性化技能演化,相比自演化基线成功率提升44.4%,计算成本降低37.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20844 2026-06-03 cs.LG cs.AI cs.IR 73%

$\mathbb{R}^{2k}$ is Theoretically Large Enough for Embedding-based Top-$k$ Retrieval

$\mathbb{R}^{2k}$ 理论上足够大,用于基于嵌入的 Top-$k$ 检索

Zihao Wang, Hang Yin, Lihui Liu, Hanghang Tong, Yangqiu Song, Ginny Wong, Simon See

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 其他LLM :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 研究最小可嵌入维度(MED),证明对于内积、欧氏距离和余弦相似度,MED 为 Θ(k),与 m 无关;进一步考虑鲁棒 MED(RMED),推导出可行性上限 ε_⋆(m,k),并通过实验验证理论结果。

Comments v2: fix broken citation. v3: ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03173 2026-06-03 cs.CY cs.LG cs.SI 70%

Auditing Engagement Incentives in the Kidfluencer Ecosystem: A Multimodal Weak Supervision Approach

审计儿童网红生态系统中的参与激励:一种多模态弱监督方法

Zijing Wei, Chao Peter Yang, Xuanjie Chen

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 其他LLM :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本研究采用多模态弱监督方法审计YouTube儿童网红频道,发现剥削信号与观看量显著正相关,且表演性劳动、情感诱饵和隐私侵犯能带来参与度溢价。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30166 2026-06-03 cs.SI cs.LG 70%

SAHG: Sector-Anisotropic Hyperbolic Graph Model for Social Bot Detection

SAHG:用于社交机器人检测的扇区各向异性双曲图模型

Hanning Lu, Yingguang Yang, Jinwei Su, Yang Liu, Zhaoqian Yao, Yaoming Li, Taoran Liang, Ziyi Zhang, Ran Ran, Kefu Xu, Bin Chong

机构 * University of Leeds(利兹大学) University of Science and Technology of China(中国科学技术大学) South China Normal University(华南师范大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) Harbin University of Commerce(哈尔滨商业大学) Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 其他LLM :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出扇区各向异性双曲图模型SAHG,通过方向依赖曲率场和扇区原型解决欧几里得GNN在层次无标度社交图中的失真问题以及异质连接导致的信号污染问题,在三个基准上取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03190 2026-06-03 cs.HC 67%

Focused on the User, Overlooking the Risks: Security and Privacy Understandings, Practices and Challenges of Independent Chinese AI Agent Developers

聚焦用户,忽视风险:中国独立AI代理开发者的安全与隐私理解、实践与挑战

Shuning Zhang, Mingyao Xu, Zhixin Huang, Yutong Jiang, Rongjun Ma, Yuting Yang, Xin Yi, Kanye Ye Wang, Hewu Li

专题命中 其他LLM :LLM(abstract,abstract_cn)

AI总结 通过访谈28名中国独立AI代理开发者,发现他们以用户为中心,关注面向用户的安全风险(如有害内容),但对安全漏洞意识薄弱,依赖临时手动防护和非正式沟通,缺乏正式工具和流程,主要受限于缺乏安全培训、工具和平台指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03764 2026-06-03 cond-mat.mtrl-sci 67%

RamanGPT: Bidirectional Mapping Between Crystal Structures and Raman Spectra with Graph Neural Networks and Generative Transformers

RamanGPT: 基于图神经网络与生成式Transformer的晶体结构与拉曼光谱双向映射

Frank M. Abel, Jaehyung Lee, Charles R. Campbell, Kamal Choudhary

专题命中 其他LLM :large language model(abstract);language model(abstract)

AI总结 提出RamanGPT框架,利用图神经网络(ALIGNN)实现从晶体结构预测拉曼光谱(正向问题),并通过量化低秩适配微调大语言模型实现从拉曼光谱反推晶体结构(逆向问题),在计算数据库和实验数据上验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02332 2026-06-03 cs.AI cs.CL cs.LG 67%

Forget Attention: Importance-Aware Attention Is All You Need

忘记注意力:重要性感知注意力即你所需

Suhyeong Shin, Yeongwook Yang

机构 * Department of Computer Engineering(计算机工程系)

专题命中 其他LLM :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出SISA方法,通过将状态空间模型的重要性信号直接融入注意力分数计算,实现分数级融合,在语言建模中兼顾全局检索与重要性排序。

Comments 20 pages, 6 figures, 25 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03483 2026-06-03 cs.LG cs.AI 62%

Analyzing Stream Collapse in Hyper-Connections: From Diagnosis to Mitigation

分析超连接中的流坍缩:从诊断到缓解

Ekaterina Alimaskina, Gleb Molodtsov, Aleksandr Beznosikov

机构 * MIRAI BRAIn Lab Yandex Research Innopolis University

专题命中 其他LLM :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过细粒度诊断发现超连接中的多流残差连接存在流坍缩现象,即信号集中于主导流,并通过打破初始化对称性缓解该问题以提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03839 2026-06-03 cs.LG 57%

Text-attributed Graph Condensation via Text Selection and Attribute Matching

通过文本选择和属性匹配的文本属性图压缩

Haowei Han, Yuxiang Wang, Guojia Wan, Hao Wang, Shanshan Feng, Hao Huang, Jiawei Jiang, Xiao Yan

机构 * School of Computer Science Wuhan University(武汉大学计算机学院) Institute for Math & AI Wuhan University(武汉大学数学与人工智能研究院)

专题命中 其他LLM :language model(abstract);分类 cs.LG

AI总结 提出TAGSAM方法,通过子图文本选择和属性相似性匹配压缩文本属性图,在保持训练精度的同时显著降低空间和时间消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏