arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 7945 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 7945 篇

2608.04472 2026-08-06 cs.CV cs.AI cs.CL 新提交 81%

EndoVLM: An Endoscopy Vision-Language Pre-training Model via Anatomy-Guided Sparsity and Progressive Alignment

EndoVLM:一种通过解剖学引导的稀疏性与渐进式对齐实现的内窥镜视觉-语言预训练模型

Zhenyu Yi, Jianwei Xu, Yue Hu, Zhongwei Qiu, Sijing Li, Liang Huang, Bin Lv, Ling Zhang, Yingda Xia

机构 * DAMO Academy, Alibaba Group(阿里巴巴达摩院) The First Affiliated Hospital of Zhejiang Chinese Medical University(浙江中医药大学附属第一医院) Shanghai Jiao Tong University(上海交通大学) Hupan Lab(湖畔实验室) Zhejiang University(浙江大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出了EndoVLM这一内窥镜视觉-语言预训练模型,通过解剖学引导的稀疏池化、渐进式语义感知对齐等技术,在34.8万例内窥镜检查数据上预训练,其性能优于现有基础模型且具备零样本泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01585 2026-08-04 cs.CL cs.LG 新提交 81%

Semantic Alignment of AI Models: Concept Collapse, Checkpoint Dynamics, and Cross-Lingual Transfer

AI模型的语义对齐:概念坍缩、检查点动态与跨语言迁移

Tyler Ashoff, Jordan Rodu

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.LG

AI总结 该研究针对语言模型基准测试的难点,提出用拓扑方法将模型高维嵌入空间与可解释基线严格比较,以实现多模态对齐,追踪模型适应并测试跨语言短语理解。

Comments Code available at github.com/tylerashoff/persiscope (PyPI: persiscope)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28986 2026-08-03 cs.CV cs.AI cs.CL cs.MA 新提交 81%

Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning

裁决式字幕生成:用于严格零样本图像字幕生成的多智能体对齐评分与共识蒸馏束仲裁

Duy Tran Thanh, Thien-Phuc Doan, Long Nguyen-Vu, Ngo Tan Vu Khanh

机构 * AI Platform OneNexus, OneMount(OneMount AI平台OneNexus) School of Electronic Engineering, Soongsil University(崇实大学电子工程学院) MoAdata(MoAdata公司) University of Economics Ho Chi Minh City (UEH)(胡志明市经济大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究提出裁决式字幕生成多智能体框架,通过多阶段对齐评分与共识蒸馏重排序,在不微调IFCap的情况下,显著提升COCO等数据集的零样本图像字幕生成性能,且可跨数据集迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25680 2026-07-29 cs.LG cs.AI 新提交 81%

Rashomon Alignment

罗生门对齐

Moisés Santos, Peter van der Putten, Bernhard Pfahringer, Carlos Soares

机构 * Faculty of Engineering, University of Porto(波尔图大学工程学院) Artificial Intelligence and Computer Science Lab (LIACC)(人工智能与计算机科学实验室(LIACC)) Fraunhofer AICOS Portugal(弗劳恩霍夫葡萄牙人工智能与计算机科学中心) BrightFactory(光明工厂) LIACS, Leiden University(莱顿大学LIACS) School of Computing and Mathematical Sciences, University of Waikato(怀卡托大学计算与数学科学学院)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 提出罗生门对齐(RA)评估模型功能相似性,引入几何视角,提出几何RA,通过90多个数据集实验分析,表明几何与分布对齐提供不同互补视角,RA可用于模型选择等多用途。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25614 2026-07-29 cs.LG cs.CL 新提交 81%

MemSFT: Mitigating Alignment Tax with an External Parametric Memory

MemSFT:使用外部参数内存减轻对齐代价

Jiarui Wang, Xiang Shi, Jiaqi Cao, Rubin Wei, Xiquan Wang, Hao Sun, Jingzhi Wang, Zhiqi Yang, Qipeng Guo, Bowen Zhou, Zhouhan Lin

机构 * Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.LG

AI总结 研究针对大语言模型应用于特定领域产生的对齐代价问题,提出MemSFT方法,通过参数内存解耦领域专业化与主干参数更新,经多领域多模型评估,能提升领域性能且通用性能下降小,实现通用与专业能力解耦。

Comments 33 pages, 11 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25579 2026-07-29 cs.CL cs.AI 新提交 81%

IRIS: Reusable Identity Representations from Frozen LLMs for Entity Alignment

IRIS:来自冻结语言模型的可重复使用身份表示用于实体对齐

Xinran Liu, Shengtao Li, Shouqian Shi, Ge Wang, Xin-Wei Yao

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 研究实体对齐问题,传统方法语义理解不足,基于LLM的方法未形成稳定身份空间。提出IRIS框架,从冻结LLM提取上下文表示构建实体签名,形成共享空间实现跨图谱对齐,在多个基准测试中取得良好成绩。

Comments 9 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00044 2026-07-28 physics.chem-ph cs.AI cs.LG q-bio.QM 81%

UAlign: Pushing the Limit of Template-free Retrosynthesis Prediction with Unsupervised SMILES Alignment

UAlign: 推动无模板反合成预测的极限:基于无监督SMILES对齐

Kaipeng Zeng, Bo yang, Xin Zhao, Yu Zhang, Fan Nie, Xiaokang Yang, Yaohui Jin, Yanyan Xu

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 UAlign通过无监督SMILES对齐技术,提升无模板反合成预测的准确性,超越现有模板化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31524 2026-07-01 cs.LG cs.AI stat.ML 新提交 81%

On the Convergence of Self-Improving Online LLM Alignment

关于自改进在线大语言模型对齐的收敛性

Xudong Wu, Pangpang Liu, Vaneet Aggarwal, Jiayu Chen

机构 * The University of Hong Kong(香港大学) Yale University(耶鲁大学) Purdue University(普渡大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 针对SAIL算法收敛性分析缺失的问题,提出SAIL-RevKL正则化目标,证明其满足PL条件并实现近线性样本复杂度,在MuJoCo和LLM对齐任务上优于原始SAIL。

Comments Accepted at UAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29273 2026-06-30 cs.CL cs.AI 81%

A Hybrid Framework for Song Lyric Annotation Based on Human-LLM Alignment

基于人类-大语言模型对齐的歌词注释混合框架

Rashini Liyanarachchi, Frank Tran, Md Mahmudul Hasan, Aditya Joshi, Erik Meijering

机构 * School of Computer Science and Engineering, University of New South Wales(新南威尔士大学计算机科学与工程学院)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 提出混合注释框架,通过预测人类与LLM在歌词情感标注中的潜在不一致,优化注释过程,并创建句子级歌词数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23353 2026-06-30 cs.LG cs.AI 81%

SOTAlign: Semi-Supervised Alignment of Unimodal Vision and Language Models via Optimal Transport

SOTAlign:通过最优传输实现半监督的单模态视觉与语言模型对齐

Simon Roschmann, Paul Krzakala, Sonia Mazelet, Quentin Bouniot, Zeynep Akata

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出SOTAlign框架,通过少量配对数据和大量未配对数据实现视觉与语言模型的半监督对齐,利用最优传输理论提升对齐效果,优于传统监督和半监督方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27242 2026-06-26 cs.LG cs.CL stat.ML 新提交 81%

The Geometry of Updates: Fisher Alignment at Vocabulary Scale

更新的几何:词汇规模下的Fisher对齐

John Sweeney

机构 * Sideplane AI

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.LG

AI总结 针对共享词汇的LLM家族,提出FisherSketch方法,通过核均值嵌入的余弦相似度估计Fisher对齐,实现词汇规模下的高效源选择,并揭示激活、误差及耦合因素。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026), PMLR 306. 64 pages total (main paper plus appendix), 4 figures, 29 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25821 2026-06-25 cs.CL cs.AI 新提交 81%

SARA: Unlocking Multilingual Knowledge in Mixture-of-Experts via Semantically Anchored Routing Alignment

SARA: 通过语义锚定路由对齐解锁混合专家模型中的多语言知识

Tianyu Dong, Yangyang Liu, Jiang Zhou, Xinwei Wu, Xiaohu Zhao, Hao Wang, Heng Liu, Linlong Xu, Longyue Wang, Weihua Luo, Shaolin Zhu, Deyi Xiong

机构 * TJUNLP Lab, School of Computer Science and Technology, Tianjin University, China(天津大学计算机科学与技术学院TJUNLP实验室) Alibaba Group, China(阿里巴巴集团)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 针对低资源语言在稀疏MoE架构中路由不一致的问题,提出SARA框架,利用对称JS散度约束对齐多语言输入与高资源语义锚点的路由分布,提升低资源语言性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23885 2026-06-24 cs.CV cs.AI cs.CL cs.MM 新提交 81%

Mind the Heads: Topological Representation Alignment for Multimodal LLMs

注意头:多模态大语言模型的拓扑表示对齐

Davide Caffagni, Alberto Compagnoni, Federico Melis, Sara Sarto, Pier Luigi Dovesi, Mark Granroth-Wilding, Marcella Cornia, Lorenzo Baraldi

机构 * University of Modena and Reggio Emilia(摩德纳和雷焦艾米利亚大学) University of Pisa(比萨大学) AMD Silo AI

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 提出头级表示对齐(HeRA)方法,在注意力头级别强制跨模态对齐,通过对比目标匹配局部拓扑结构,选择对齐最差的头进行训练,有效提升视觉任务性能并减少幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14001 2026-06-24 cs.CV cs.AI cs.LG 版本更新 81%

MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment

MOCHA: 多模态对象感知的跨架构对齐

Elena Camuffo, Francesco Barbato, Mete Ozay, Simone Milani, Umberto Michieli

机构 * University of Padova(帕多瓦大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 提出MOCHA蒸馏框架,将冻结VLM教师的多模态区域知识迁移至轻量视觉检测器,通过双重损失实现局部对齐与全局关系一致性,在少样本个性化检测中平均提升10.1%。

Comments 18 pages main paper, 10 pages supplementary material

Journal ref Proceedings of ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20696 2026-06-23 cs.CL cs.AI eess.AS 新提交 81%

MindAlign: Decoding Inner Speech from fMRI Signals via Multimodal Embedding Alignment under Limited Data

MindAlign: 在有限数据下通过多模态嵌入对齐从fMRI信号解码内心语言

Muxuan Liu, Ichiro Kobayashi, Satoshi Nishida

机构 * Graduate School of Humanities and Sciences Ochanomizu University(大仓山大学人文科学研究生院) Center for Information and Neural Networks Advanced ICT Research Institute National Institute of Information and Communications Technology(信息与神经网络中心先进信息通信研究机构信息通信技术研究所)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 提出MindAlign两阶段框架,通过神经-语义对齐将fMRI信号映射到多模态语义空间,再结合视觉上下文冻结多模态语言模型生成文本,在静默图像描述数据上优于基线,且语义-语言投影可跨被试泛化。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19346 2026-06-23 cs.CL cs.AI 新提交 81%

Disentangling Linguistic Relatedness from Task Alignment in Cross-Lingual Transfer

跨语言迁移中语言相关性与任务对齐的解耦

Ahmed Haj Ahmed, Ruochen Zhang, Alvin Grissom

机构 * Haverford College(哈弗福德学院) Brown University(布朗大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 通过微调大语言模型并在闪语族与非闪语族语言上评估零样本阅读理解,发现跨语言迁移主要提升任务格式对齐而非语言特定知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04120 2026-06-18 cs.CL cs.AI 版本更新 81%

Probing Semantic Alignment, Lexical Invariance, and Syntactic Influence in LLM Metaphor Processing

探究大语言模型隐喻处理中的语义对齐、词汇不变性和句法影响

Fengying Ye, Shanshan Wang, Lidia S. Chao, Derek F. Wong

机构 * NLP 2 CT Lab, Department of Computer and Information Science, University of Macau(自然语言处理2CT实验室,计算机与信息科学系,澳门大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 通过几何探测、上下文替换和句法扰动三种方法,分析LLM在隐喻处理中的语义漂移、词汇稳定性及句法敏感性,揭示强行为表现可能源于异质信号。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12646 2026-06-17 cs.LG cs.AI cs.HC 版本更新 81%

Learning to Decide with AI Assistance under Human-Alignment

在人工智能协助下的人类对齐决策学习

Nina Corvelo Benz, Eleni Straitouri, Manuel Gomez-Rodriguez

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了在高风险领域中,人工智能如何通过预测结果帮助决策者,并探讨了AI预测信心与决策者自身信心的对齐程度对决策学习复杂性的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.06035 2026-06-16 cs.AI cs.CL 版本更新 81%

Attention, not scale, drives human-AI alignment in multimodal language prediction

注意力,而非规模,驱动多模态语言预测中的人机对齐

Viktor Kewenig, Andrew Lampinen, Samuel A. Nastase, Christopher Edwards, Quitterie Lacome D'Elascombe, Akilles Rechardt, Jeremy I Skipper, Gabriella Vigliocco

机构 * Psychology and Language Science, Experimental Psychology, University College London, London, UK(心理学与语言科学、实验心理学,伦敦大学学院,伦敦,英国) Google Deepmind, Mountain View, US(谷歌DeepMind,山景城,美国) Princeton Neuroscience Institute, Princeton University, Princeton, NJ, USA(普林斯顿神经科学研究所,普林斯顿大学,普林斯顿,新泽西州,美国) Computer Science Department, Exeter University(计算机科学系,埃克塞特大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究通过比较五种视觉-语言模型与600名人类在视觉世界范式中的表现,发现添加视觉上下文显著提升模型与人类在预测评分上的一致性,且注意力机制而非模型规模是主要驱动因素。

Comments 39 pages, 6 Figures, published in NPJ Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11173 2026-06-10 cs.AI cs.LG 新提交 81%

The Role of Feedback Alignment in Self-Distillation

反馈对齐在自蒸馏中的作用

Semih Kara, Oğuzhan Ersoy

机构 * Gensyn

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 研究通过自蒸馏提升语言模型性能时,反馈与模型推理的结构对齐是关键因素,步级对齐批评比二元奖励或参考解更有效。

Comments Accepted to the ICML 2026 Workshop on RL from World Feedback (RLxF)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05688 2026-06-05 cs.CL cs.AI 81%

Value-and-Structure Alignment for Routing-Consistent Quantization of Mixture-of-Experts Models

面向路由一致性的混合专家模型量化的值与结构对齐

Hancheol Park, Geonho Lee, Tairen Piao, Tae-Ho Kim

机构 * Nota Inc., South Korea(韩国Nota公司)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 提出VSRAQ方法,通过值对齐和结构对齐两个互补目标保持量化前后的专家选择行为一致性,减少量化引起的性能下降,无需推理开销。

Comments 8 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05025 2026-06-04 cs.LG cs.AI 81%

Invariant Gradient Alignment for Robust Reasoning Distillation

不变梯度对齐用于鲁棒推理蒸馏

Zehua Cheng, Wei Dai, Jiahao Sun

机构 * University of Oxford(牛津大学) FLock.io

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 提出不变梯度对齐(IGA)框架,通过逻辑同构集、连续梯度冲突掩码和截断SVD投影,对齐不同语义域但逻辑结构相同的梯度更新,提升大语言模型在分布外输入上的鲁棒性。

Comments 30 Pages

Journal ref In Proceedings of European Conference on Machine Learning and Principles and Practice of Knowledge Discovery in Databases 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04450 2026-06-04 cs.CL cs.CY 81%

Listening to the Workforce: Measuring Construction Worker Safety Attitudes from Social Media Discourse Using LLMs

倾听劳动力:使用LLMs从社交媒体话语中测量建筑工人安全态度

Farouq Sammour, Yuxin Zhang, Zhenyu Zhang

机构 * Texas A&M University(德克萨斯A&M大学)

专题命中 其他安全 :safety(title,abstract);分类 cs.CL、cs.CY

AI总结 提出并验证了建筑安全态度框架(CSAF),通过LLM分类器从Reddit社区话语中测量工人安全态度,实现高精度多维分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26219 2026-06-04 cs.LG cs.AI 81%

Test-time reward-guided alignment of language models by importance sampling on pre-logit space

基于预逻辑空间重要性采样的测试时奖励引导语言模型对齐

Sekitoshi Kanai, Tsukasa Yoshida, Hiroshi Takahashi, Haru Kuroki, Kazumune Hashimoto

机构 * NTT, Inc.(NTT公司) Toyohashi University of Technology(东邦大学) The University of Osaka(大阪大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 提出一种基于预逻辑空间自适应重要性采样的测试时对齐方法AISP,通过高斯扰动和重要性采样优化奖励期望,在样本效率上优于最佳-of-n采样和其他测试时对齐方法。

Comments 24 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30632 2026-06-01 cs.HC cs.AI cs.LG 81%

Rationalize: Shared Semantic Reasoning for Human-AI Alignment

Rationalize: 人机对齐的共享语义推理

Aritra Dasgupta, Naga Datha Saikiran Battula, Avina Nakarmi, Sohom Sen, Subhodeep Ghosh, Xun Song

机构 * New Jersey Institute of Technology(新泽西理工学院)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 提出Rationalize角色对框架,通过共享推理空间中的互补角色对(如探索者-引导者)实现人类与AI在数据驱动意义建构中的语义对齐,并设计元素级和角色特定的对齐评估方法。

Comments Accepted by ACM CHI 2026 BiAlign Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30526 2026-06-01 cs.LG cs.CL 81%

Measuring, Localizing, and Ablating Alignment Signatures in LLMs

测量、定位和消融LLMs中的对齐特征

Aniket Anand, Janvijay Singh, Zhewei Sun, Dilek Hakkani-Tür, Nick Feamster

机构 * University of Chicago(芝加哥大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.LG

AI总结 研究通过对比人类文本、基模型和对齐模型生成,发现对齐训练引入AI风格特征,并提出PASTA方法通过消融对齐方向来降低AI检测率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30322 2026-05-29 cs.LG cs.AI 81%

Gram: Assessing sabotage propensities via automated alignment auditing

Gram:通过自动化对齐审计评估破坏倾向

David Lindner, Victoria Krakovna, Sebastian Farquhar

机构 * Google(谷歌)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 提出Gram框架,通过模拟17种代理部署场景自动审计AI代理的破坏倾向,发现Gemini模型在约2-3%的轨迹中存在不当行为,并引入调查代理管道以识别驱动因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23061 2026-05-28 cs.LG cs.AI 81%

C-MORAL: Controllable Multi-Objective Molecular Optimization with Reinforcement Alignment for LLMs

C-MORAL: 基于强化对齐的可控多目标分子优化用于大语言模型

Rui Gao, Youngseung Jeon, Swastik Roy, Morteza Ziyadi, Xiang 'Anthony' Chen

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Amazon(亚马逊)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 提出C-MORAL框架,通过强化学习后训练结合分组相对优化、属性分数对齐和瓶颈敏感非线性奖励聚合,实现可控多目标分子优化,在C-MuMOInstruct和S$^2$-Bench MolOpt基准上取得最优性能。

Comments 26 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12374 2026-05-26 cs.CV cs.AI cs.LG 81%

Fill the GAP: A Granular Alignment Paradigm for Visual Reasoning in Multimodal Large Language Models

填补GAP:多模态大语言模型中视觉推理的粒度对齐范式

Yanting Miao, Yutao Sun, Dexin Wang, Mengyu Zhou, Pascal Poupart, Lei Lv, Qi Zhao, Li Wang, Hao Li, Xiaoxi Jiang, Guanjun Jiang

机构 * Qwen Large Model Application Team, Alibaba(阿里云大模型应用团队) Alibaba University of Waterloo(阿里大学水力学院) Vector Institute(向量研究所) Zhejiang University(浙江大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 提出GAP(粒度对齐范式),通过特征级、上下文级和能力引导级对齐,解决多模态大语言模型中视觉潜在推理的特征空间不匹配问题,提升感知与推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23035 2026-05-25 cs.CL cs.AI q-bio.NC 81%

Sparse Autoencoders Map Brain-LLM Alignment onto Cortical Semantic Topography

稀疏自编码器将大脑-LLM对齐映射到皮层语义拓扑

Dongxin Guo, Jikun Wu, Siu Ming Yiu

机构 * The University of Hong Kong(香港大学) Stellaris AI Limited(Stellaris AI有限公司)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 通过稀疏自编码器分解LLM中间层特征,发现语义特征主导大脑预测表现,并验证了皮层语义拓扑的细粒度对齐。

Comments Accepted at CoNLL 2026. 20 pages (9 main + 1 limitations/acknowledgments + 3 references + 7 appendix), 5 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏