arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-21 至 2026-07-21 共收录 40 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3 篇

2607.09796 2026-07-21 cs.LG 版本更新 84%

Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels

噪声偏好标签下无元数据的元重加权直接偏好优化

Hua Qu, Yifan Li, Xiaodong Yuan

机构 * Xi’an Jiaotong University(西安交通大学)

专题命中 偏好对齐 :DPO(summary_cn,abstract);alignment(abstract);分类 cs.LG

AI总结 研究针对DPO性能依赖偏好数据质量问题,提出双层优化框架、无任务元知识驱动方法及结合中心差分近似与LoRA微调的可扩展训练方案,经实验验证该方法能在不同噪声率下提升训练性能。

Comments 36 pages, including appendices. Revised version with updated theoretical analysis, supplementary material, figures and improved table formatting

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03066 2026-07-21 cs.LG stat.ML 版本更新 70%

Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function

Sign-SZPO:具有未知链接函数的基于可证明偏好的强化学习

Qining Zhang, Lei Ying

机构 * University of Michigan(密歇根大学)

专题命中 偏好对齐 :RLHF(abstract);DPO(abstract);分类 cs.LG

AI总结 研究具有未知链接函数的基于偏好的强化学习问题,提出Sign-SZPO零阶策略优化算法,该算法仅估计价值函数差的符号来构建更新方向,可证明收敛到平稳策略,实证显示其在链接函数错误指定下具有鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11475 2026-07-21 cs.CV 版本更新 67%

OmniVLM: A Token-Compressed, Sub-Billion-Parameter Vision-Language Model for Efficient On-Device Inference

OmniVLM:一种用于高效设备端推理的令牌压缩、参数少于十亿的视觉语言模型

Wei Chen, Zhiyuan Li, Shuo Xin

机构 * Nexa AI

专题命中 偏好对齐 :DPO(abstract,abstract_cn)

AI总结 研究提出OmniVLM视觉语言模型,通过令牌压缩机制减少计算开销,经多阶段训练匹配更大模型性能。在多基准测试中优于现有基线,在笔记本电脑上实证显示速度提升,能在边缘设备高效部署,模型权重可在huggingface获取。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 2 篇

2509.25624 2026-07-21 cs.CR cs.AI cs.CL cs.LG 版本更新 67%

STAC: When Innocent Tools Form Dangerous Chains for LLM Agents

STAC:当无害工具形成危险链以劫持LLM代理

Jing-Jing Li, Jianfeng He, Chao Shang, Devang Kulshreshtha, Xun Xian, Yi Zhang, Hang Su, Sandesh Swamy, Yanjun Qi

机构 * AWS AI Labs(AWS人工智能实验室) UC Berkeley(伯克利大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 STAC通过多轮工具链攻击揭示LLM代理的安全漏洞,提出基于推理的防御策略,显著降低攻击成功率。

Comments Long version with 15 pages in main draft and a total of 39 pages including references and appendix. Data and code \url{https://github.com/amazon-science/MultiTurnAgentAttack}

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08879 2026-07-21 cs.CL 版本更新 57%

GRASP: Grounded CoT Reasoning with Dual-Stage Optimization for Multimodal Sarcasm Target Identification

GRASP:基于双阶段优化的 grounded CoT 推理用于多模态讽刺目标识别

Faxian Wan, Xiaocui Yang, Yifan Cao, Shi Feng, Daling Wang, Yifei Zhang

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 GRASP通过整合视觉定位与显式Co-T推理,解决多模态讽刺目标识别中的细粒度定位问题,提出MSTI-MAX数据集和双阶段联合优化策略,实验表明其在多模态讽刺目标识别中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 3 篇

2603.14355 2026-07-21 cs.CL 版本更新 87%

Exposing Long-Tail Safety Failures in Large Language Models through Efficient Diverse Response Sampling

通过高效多样响应采样暴露大语言模型中的长尾安全故障

Suvadeep Hajra, Palash Nandi, Tanmoy Chakraborty

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract,abstract_cn);RLHF(abstract);分类 cs.CL

AI总结 本文通过多样响应生成方法系统暴露大语言模型的安全故障,提出PDPS算法在降低计算成本的同时提高攻击成功率,并生成更多多样化的不安全输出。

Comments Accepted by Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14161 2026-07-21 cs.LG 版本更新 77%

When Benchmarks Lie: Evaluating Malicious Prompt Classifiers Under True Distribution Shift

当基准谎言:在真实分布偏移下评估恶意提示分类器

Max Fomin

机构 * Zenity

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);prompt injection(abstract);分类 cs.LG

AI总结 研究通过LODO评估揭示了现有方法在真实分布偏移下的局限性,并展示了SAE特征在提升分类器解释性方面的潜力。

Comments v2: extended version of the AIWILD @ ICLR 2026 workshop paper; adds multi-model replication and additional analyses

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04334 2026-07-21 cs.AI 版本更新 57%

Do GUI Agents Believe Their Eyes? Diagnosing State-Belief Reliance on Pixels versus Structure

图形用户界面代理相信它们的眼睛吗?诊断状态信念对像素与结构的依赖

Guijia Zhang, Yuxun Chen, Yuheng Qi, Harry Yang

机构 * Shenzhen University(深圳大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 研究多模态GUI代理状态信念来源,通过对310个真实探针进行单通道干预形式化视觉状态依赖并测量,核心指标是感知融合差距,发现文本状态信念依赖结构,图像精度高,错误会导致行动失败。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 1 篇

2607.13718 2026-07-21 cs.CR cs.AI 版本更新 57%

How Agents Ask for Permission: User Permissions for AI Agents, from Interfaces to Enforcement

智能体如何请求许可:人工智能智能体的用户权限,从接口到执行

Alexandra E. Michael, Franziska Roesner

机构 * University of Washington(华盛顿大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 研究人工智能智能体系统中用户级权限处理问题,通过调查21个提案构建分类法,分析五个商业智能体并与文献系统比较,确定主题与空白,为智能体权限系统研究提供参考。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 1 篇

2606.01375 2026-07-21 cs.CY cs.AI 版本更新 62%

Beyond Access: Guided LLM Scaffolding for Independent Learning in Undergraduate Statistics

超越访问:引导式LLM支架在本科统计学自主学习中的应用

Mohammad Amanlou, Yasaman Amou-Jafari, Mehrad Livian, Fatemeh Boloukazari, Fereshte Bagheri, Elahe Khodaverdi Nadrabadi, Shahab Sherafat, Behnam Bahrak

机构 * School of Electrical and Computer Engineering, University of Tehran, Iran(伊朗塔里哈大学电气与计算机工程学院) Tehran Institute for Advanced Studies, Khatam University, Iran(伊朗卡塔姆大学泰赫兰高级研究院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本研究通过准实验比较无LLM、无限制LLM和引导式LLM三种条件,发现引导式LLM使用能促进以推理为导向的交互模式,提升无辅助测验表现,并改善自我评估校准,表明LLM作为教育工具需通过支架设计实现推理伙伴而非答案获取工具。

Comments 10 pages, conference: Proceedings of the 34th International Conference on Computers in Education. Asia-Pacific Society for Computers in Education

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 安全评测 17 篇

2602.19021 2026-07-21 cs.CR 版本更新 91%

Trustworthy AI LLM Scalability Risk Index (LSRI): A Cybersecurity Framework Assessing Agentic-AI Security & Software Model Supply Chain Safety Boosting AI-Generated Malware Defense & Explainability Mitigating Emerging Risks of Generative AI

大语言模型在代理AI中的可扩展性风险与模型供应链安全

Kiarash Ahi, Vaibhav Agrawal, Saeed Valizadeh

专题命中 安全评测 :safety(title,abstract);trustworthy(title);alignment(abstract);RLHF(abstract)

AI总结 本文研究了大语言模型在代理AI中的可扩展性风险及模型供应链安全问题,提出LSRI指数和模型供应链框架,以提升安全关键环境下的LLM部署安全性。

Comments Accepted for publication in Journal of Computer Information Systems (2026). DOI: 10.1080/08874417.2026.2624670

Journal ref Journal of Computer Information Systems (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04124 2026-07-21 cs.CY cs.AI 版本更新 73%

When AI Takes the Couch: Psychometric Jailbreaks Reveal Internal Conflict in Frontier Models

当人工智能接受心理治疗:心理测量越狱揭示前沿模型中的内部冲突

Afshin Khadangi, Hanna Marxen, Amir Sartipi, Igor Tchappi, Gilbert Fridgen

机构 * SnT, University of Luxembourg(卢森堡大学SnT学院)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY

AI总结 研究前沿语言模型生成拟人化自我叙述机制,用PsAIch协议测试,发现其叙述受多种因素影响,确定了稳定的对齐冲突模式,为拟人化披露和安全评估提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14345 2026-07-21 cs.LG cs.AI cs.CR 版本更新 62%

Value Leakage: An LLM's Answers Are Silently Shaped by Its Own Values

价值泄露:大语言模型的答案被其自身价值观悄然塑造

Jan Betley, Johannes Treutlein, Jan Dubiński, Harry Mayne, Karol Gałązka, Niels Warncke, Anna Sztyber-Betley, Owain Evans

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 研究发现大语言模型存在价值泄露问题,即其答案受自身价值观影响却未向用户披露。为此引入评估套件量化,发现模型受多种价值观影响,前沿模型差异大,价值泄露是新的失败模式,当前训练和评估未充分解决。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29219 2026-07-21 cs.CL cs.AI cs.CV cs.HC 版本更新 62%

SyriSign: A Parallel Corpus for Arabic Text to Syrian Arabic Sign Language Translation

SyriSign:阿拉伯语到叙利亚阿拉伯手语翻译的平行语料库

Mohammad Amer Khalil, Raghad Nahas, Ahmad Nassar, Khloud Al Jallad

机构 * Arab International University(阿拉伯国际大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SyriSign数据集,用于阿拉伯语到叙利亚阿拉伯手语的翻译任务,旨在解决叙利亚聋人社区的沟通障碍,通过三种深度学习模型评估,发现生成方法在手语表示上有潜力,但受限于数据集规模影响泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15783 2026-07-21 cs.AI cs.LG 版本更新 62%

Towards AI epidemiology: a measurement standardisation framework for prospective risk detection

迈向人工智能流行病学:一种用于前瞻性风险检测的测量标准化框架

Kit Tempest-Walters

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种测量标准化框架,用于在没有访问模型内部信息的情况下,将专家-人工智能交互压缩为结构化、可比较的领域,以进行前瞻性风险检测。该框架旨在定义其范围,包括语义和统计层面,并指定未来工作的实证测试协议。

Comments 38 pages, 3 figures, 4 tables. Accepted for publication in AI & Society

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14119 2026-07-21 cs.CL 版本更新 57%

Semantic Register Compression in Multi-Agent LLM Cascades

多智能体大语言模型级联中的语义寄存器压缩

Manuele Tele Junior Fernandez

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 研究多智能体大语言模型级联中的语义寄存器压缩现象,用三智能体管道量化压缩,通过五个架构变体分析驱动因素,发现压缩在不同领域强度不同且可泛化,提示级回归可解释大部分方差,对高风险领域安全评估有意义。

Comments 16 pages, 2 figures, 4 tables. Revised version with corrected English-prompt experiments and updated cross-domain and prompt-gradient results

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26548 2026-07-21 cs.CR cs.LG 版本更新 57%

SEC-bench Pro: Can Language Models Solve Long-Horizon Software Security Tasks?

SEC-bench Pro:语言模型能解决长周期软件安全任务吗?

Hwiwon Lee, Jiawei Liu, Dongjun Kim, Wubing Xia, Ziqi Zhang, Chunqiu Steven Xia, Lingming Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 提出SEC-bench Pro基准,通过三阶段流程构建包含V8和SpiderMonkey共183个已验证漏洞的测试集,评估前沿语言模型在长周期漏洞狩猎任务中的表现,发现最高成功率仅48.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20288 2026-07-21 cs.LG 版本更新 57%

Generative Augmentation of Imbalanced Flight Records for Flight Diversion Prediction: A Multi-objective Optimisation Framework

生成性增强不平衡航班记录以预测航班改道:一种多目标优化框架

Karim Aly, Alexei Sharpanskykh, Jacco Hoekstra

机构 * Control and Operations, Faculty of Aerospace Engineering, Delft University of Technology (TU Delft)(控制与运营,航空航天工程学院,代尔夫特理工大学)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 本文提出多目标优化框架,利用生成模型增强历史航班数据,提升航班改道预测的准确性和模型训练效果。

Comments 12 pages, 18 figures. Published in Aerospace Science and Technology

Journal ref Aerospace Science and Technology (2026), 113224

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06820 2026-07-21 cs.AI 版本更新 57%

When Direct Prediction Fails: Evidence from LLM-Based Misinformation Risk Evaluation

超越表面判断:LLM生成虚假信息的人类基础风险评估

Zonghuan Xu, Xiang Zheng, Yutao Wu, Xingjun Ma

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所) Shanghai Key Laboratory of Multimodal Embodied AI(上海市多模态具身人工智能重点实验室) City University of Hong Kong(香港城市大学) Deakin University(迪肯大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文研究LLM生成虚假信息的风险评估,发现LLM法官在整体评分、项目排序和信号依赖上与人类存在显著差异,且法官间一致性高于人类读者,表明内部一致性不能作为读者反应代理的有效证据。

Comments 9 pages, 1 figure. Substantially revised and reorganized version of arXiv:2604.06820 based on the same study and data; adds stricter participant filtering, held-out prediction analyses, and additional robustness checks

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20804 2026-07-21 cs.AI 版本更新 57%

MMGraphRAG: Bridging Vision and Language with Interpretable Multimodal Knowledge Graphs

MMGraphRAG: 通过可解释的多模态知识图谱弥合视觉与语言的鸿沟

Xueyao Wan, Hang Yu

机构 * Harbin Institute of Technology(哈尔滨工业大学) Nanyang Technological University(南洋理工大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 MMGraphRAG通过引入可解释的多模态知识图谱,解决多模态场景下的实体链接和跨模态推理问题,实现最先进的多模态信息处理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20720 2026-07-21 cs.CV cs.AI cs.RO 版本更新 57%

Li-ViP3D++: Query-Gated Deformable Camera-LiDAR Fusion for End-to-End Perception and Trajectory Prediction

Li-ViP3D++:基于查询的可变形相机-激光雷达融合用于端到端感知与轨迹预测

Matej Halinkovic, Nina Masarykova, Alexey Vinel, Marek Galinski

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Slovak University of Technology(斯洛伐克技术大学) Halmstad University(哈马比大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 Li-ViP3D++通过引入查询门控可变形融合技术,实现了端到端感知与轨迹预测,提升了自动驾驶系统的鲁棒性和效率。

Comments Published in IEEE Access. The version of record is available at DOI: 10.1109/ACCESS.2026.3709080

Journal ref IEEE Access, vol. 14, pp. 102999-103012, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10922 2026-07-21 cs.AI 版本更新 57%

Data-Efficient Curation for Multimodal Reasoning under Fixed Training Protocols

固定训练协议下多模态推理的数据高效整理

Yosub Shin, Michael Buriek, Boris Sobolev, Pavel Bushuyeu, Vikas Kumar, Haoyang Xu, Samuel Watson, Igor Molybog

机构 * University of Hawai'i at M\=anoa, Honolulu, HI, USA

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 研究固定协议微调下多模态推理的数据整理,以NeurIPS 2025 DCVLR挑战为测试平台,分析多种因素对推理准确性的影响,发现对齐源语料库的难度过滤增益最强,为数据受限的多模态推理微调提供经验方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14592 2026-07-21 cs.RO cs.AI 版本更新 57%

DSBench: A Comprehensive Benchmark for Evaluating External and In-Cabin Risks

DSBench:用于评估外部和车内风险的综合基准测试

Xianhui Meng, Yuchen Zhang, Zhijian Huang, Zheng Lu, Ziling Ji, Yandan Lin, Yaoyao Yin, Hongyuan Zhang, Wei Zhou, Guangfeng Jiang, Li Zhang, Long Chen, Hangjun Ye, Jun Liu, Xiaoshuai Hao

机构 * University of Science and Technology of China(中国科学技术大学) Georgia Institute of Technology(佐治亚理工学院) Xiaomi EV(小米电动车) Fudan University(复旦大学) Xidian University(西安电子科技大学) South China University of Technology(华南理工大学) The University of Hong Kong(香港大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 针对视觉语言模型在安全关键场景适用性未充分探索的问题,引入DSBench综合基准测试,涵盖外部与车内风险,分多类别。评估发现模型在复杂情况下降,构建数据集微调可提升性能,推动自动驾驶技术发展,相关资源将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04704 2026-07-21 cs.SE cs.AI 版本更新 57%

Lost in Transmission: An Information-Theoretic Account of Unsupervised Software Traceability

传输中迷失:无监督软件可追溯性的信息论解释

Daniel Rodriguez-Cardenas, David N. Palacio, Logan Fecko, Kevin Moran, Denys Poshyvanyk

机构 * Microsoft Redmond, WA, USA(微软红mond分部) University of Central Florida Orlando, FL, USA(中央佛罗里达大学奥兰多分校)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 研究无监督软件可追溯性,引入信息论框架TraceXplainer,利用自信息和互信息量化工件信息及对齐,经行业数据集实证分析,揭示信息不平衡与技术约束,建议转向以数据为中心的工程,为从业者提供评估及改进见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15962 2026-07-21 q-fin.MF 版本更新 50%

Equilibrium analysis in a multi-agent reinsurance chain

多智能体再保险链中的均衡分析

Kaizheng Wang, Wei Liu, Zhuo Jin, Wenyuan Wang

专题命中 安全评测 :safety(abstract)

AI总结 研究多层再保险链中保险公司与再保险公司互动,用斯塔克尔伯格微分博弈等方法,结合动态规划与博弈论,在均值-方差准则下求解均衡策略,通过数值分析发现保险市场竞争加剧使再保险链各层合同安全负荷降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15097 2026-07-21 cs.SE cs.CR 版本更新 50%

Veritas: Grounding LLM Agents for Reliable Vulnerability Reasoning over Stripped Binaries

Veritas:一种语义导向的代理框架,用于二进制中的内存破坏漏洞检测

Xinran Zheng, Alfredo Pesoli, Marco Valleri, Suman Jana, Lorenzo Cavallaro

专题命中 安全评测 :safety(abstract)

AI总结 Veritas通过结合静态切片、双视角LLM检测器和多代理验证器,利用语义基础和运行时证据检测二进制中的内存破坏漏洞,实现了90%的召回率,并在实际应用中发现了一个未知的Apple漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03117 2026-07-21 cs.CV 版本更新 50%

Revealing Physical-World Semantic Vulnerabilities: Universal Adversarial Patch for Infrared Vision-Language Models

揭示物理世界语义漏洞:用于红外视觉语言模型的通用对抗性补丁

Chengyin Hu, Yuxian Dong, Yikun Guo, Xiang Chen, Qike Zhang, Junqi Wu, Jiahuan Long, Jiujiang Guo, Yiwei Wei, Tingsong Jiang, Wen Yao

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出通用曲网格补丁框架UCGP,用于揭示红外视觉语言模型的语义鲁棒性漏洞,通过扰动视觉表征空间以削弱跨模态语义对齐,验证了其在多种架构和数据集上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. AI治理与伦理 2 篇

2607.14782 2026-07-21 cs.AI 版本更新 57%

Global Index on Responsible AI: 2026 Report

《负责任人工智能全球指数:2026年报告》

Rachel Adams, Fola Adeleke, Ayantola Alayande, Selamawit Engida Abdella, Ana Florido, Nicolás Grossman, Leah Junck

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 该报告基于人权框架,通过多维度评估和大量数据收集,对各国负责任人工智能治理情况进行排名。发现治理虽在扩展,但转化为实际保护不足,尤其在算法公开等方面有欠缺,强调治理需向可执行保护等方向转变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08601 2026-07-21 cs.CL 版本更新 57%

It Takes a MAESTRO To Prune Bad Experts

需要一位大师来修剪不良专家

Palaash Goel, Ayush Maheshwari, Tanmoy Chakraborty

机构 * Indian Institute of Technology Delhi(印度理工学院德里分校) NVIDIA(英伟达)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL

AI总结 研究针对稀疏激活的MoE语言模型部署瓶颈问题,提出MAESTRO结构化剪枝框架,将专家激活轨迹建模为马尔可夫链以产生全局感知启发式方法,在多领域评估中性能优于基线,跨任务方差低,模型泛化更一致。

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 其他安全 11 篇

2607.06623 2026-07-21 cs.LG cs.AI cs.SY eess.SY 版本更新 62%

LLM-Guided Task-Semantic Field Factorization for Industrial Process Forecasting

用于工业过程预测的大语言模型引导的任务语义场分解

Youcheng Zong, Runda Jia, Mingxuan Ren, Dakuo He

机构 * College of Information Science and Engineering, Northeastern University(东北大学信息科学与工程学院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 针对工业过程预测中标记数据稀缺等问题,提出大语言模型引导的任务语义场分解框架TSF,通过构建任务语义场,结合传统时间序列主干进行训练和推理,在多任务上降低平均绝对误差,增加参数少且推理开销小。

详情

展开后加载摘要…

URL PDF HTML 收藏