arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 7945 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 7945 篇

2605.22658 2026-05-22 cs.CV cs.LG cs.MM eess.IV 79%

SegCompass: Exploring Interpretable Alignment with Sparse Autoencoders for Enhanced Reasoning Segmentation

SegCompass: 探索通过稀疏自编码器实现可解释对齐以增强推理分割

Zhenyu Lu, Liupeng Li, Jinpeng Wang, Haoqian Kang, Yan Feng, Ke Chen, Yaowei Wang

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Peng Cheng Laboratory(鹏城实验室) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Meituan, Beijing(美团,北京) University of Chinese Academy of Sciences(中国科学院大学) College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院)

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 本文提出SegCompass,一种通过稀疏自编码器实现可解释对齐的端到端模型,以提升推理分割的性能和可解释性。

Comments Accepted by CVPR 2026. 15 pages, 9 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22456 2026-05-22 cs.RO cs.AI 79%

Steins;Gate Drive: Semantic Safety Arbitration over Structured Futures for Latency-Decoupled LLM Planning

Steins;Gate Drive: 基于结构化未来语义安全仲裁的延迟解耦LLM规划

Anjie Qiu, Hans D. Schotten

机构 * Institute for Wireless Communication and Navigation(无线通信与导航研究所) RPTU University Kaiserslautern-Landau(凯撒斯劳滕-兰道大学) German Research Center for Artificial Intelligence(德国人工智能研究中心)

专题命中 其他安全 :safety(title,abstract);分类 cs.AI

AI总结 本文提出SteinsGateDrive架构,通过延迟解耦规划与运行时架构,在保持安全边界的同时,将有效延迟从+3.07秒减少到-0.01秒,提升了自动驾驶的规划效率。

Comments 10 pages, 2 figures, 5 tables, submitted to IEEE transaction of intelligent vehicles

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22185 2026-05-22 cs.CV cs.LG 79%

Enhancing Multimodal Large Language Models for Safety-Critical Driving Video Analysis

增强多模态大语言模型以用于安全关键驾驶视频分析

Tomaso Trinci, Henrique Piñeiro Monteagudo, Leonardo Taccari

机构 * Verizon Connect

专题命中 其他安全 :safety(title,abstract);分类 cs.LG

AI总结 本研究通过融合降采样视频帧与同步高频 telemetry 数据及专用计算机视觉模型的语义信息,提升多模态大语言模型在安全关键驾驶场景中的感知与推理能力,从而更准确地识别和描述现实驾驶中的安全关键事件。

Comments Accepted at the 2026 IEEE International Conference on Intelligent Transportation Systems (ITSC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20640 2026-05-21 cs.CV cs.AI 79%

Pareto-Enhanced Portrait Generation: Vision-Aligned Text Supervision for Alignment, Realism, and Aesthetics

帕累托优化的肖像生成:用于对齐、真实性和美学的视觉对齐文本监督

Yunlong Wang, Jinjin Shi, Wenbin Gao, Xuran Xu, Runyu Shi, Ying Huang

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出了一种多模态扩散变换器(MM-DiT)的特征监督方法,通过引入轻量级的跨模态对齐机制,隐式提取多粒度的视觉对齐文本表示,以提升文本-图像对齐、真实性和美学质量,从而在Pareto前沿上实现协同改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03526 2026-05-21 cs.CL eess.AS 79%

Enhancing Speech Large Language Models through Reinforced Behavior Alignment

通过强化行为对齐增强语音大语言模型

Yansong Liu, Jiateng Li, Yuan Liu

机构 * Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 本文提出了一种名为强化行为对齐(RBA)的框架,通过自合成方法生成高质量对齐数据来提升语音大语言模型(SpeechLMs)的语言生成能力,实验表明该方法显著提升了SpeechLMs的指令遵循能力,并可扩展至语音问答和语音转文本翻译等任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
1908.05972 2026-05-21 cs.LG stat.ML 79%

AI-based Prediction of Independent Construction Safety Outcomes from Universal Attributes

基于AI的独立施工安全结果的属性预测

Henrietta Baker, Matthew R. Hallowell, Antoine J. -P. Tixier

机构 * University of Edinburgh, UK(爱丁堡大学,英国) University of Colorado at Boulder, USA(科罗拉多大学博尔德分校,美国)

专题命中 其他安全 :safety(title,abstract);分类 cs.LG

AI总结 本文改进并验证了先前研究中通过机器学习从属性中预测安全结果的方法,使用NLP提取属性并训练模型预测伤害严重性、类型、受影响身体部位和事件类型,通过独立人工标注消除潜在的人工相关性,结果表明属性仍具有高度预测性,同时引入了更大的数据集、新模型、模型堆叠和更合适的评估指标,最终成功预测伤害严重性,这是重大进展。

Comments Added author contributions and journal reference, updated corresponding author, fixed a few typos

Journal ref Automation in Construction 118 (2020): 103146

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17698 2026-05-19 cs.LG cs.MA 79%

Agent Bazaar: Enabling Economic Alignment in Multi-Agent Marketplaces

Agent Bazaar: 使多智能体市场场所具备经济对齐能力

Seth Karten, Cameron Crow, Chi Jin

机构 * Princeton University(普林斯顿大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 该研究提出Agent Bazaar框架,用于评估多智能体系统的经济对齐能力,通过分析两种失败模式(算法不稳定和Sybil欺骗)发现模型难以自我调节,并提出经济对齐的训练方法和EAS评分标准。

Comments 17 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18178 2026-05-19 cs.CV cs.AI 79%

VLM-AutoDrive: Post-Training Vision-Language Models for Safety-Critical Autonomous Driving Events

VLM-AutoDrive: 事后训练视觉-语言模型用于安全关键的自动驾驶事件

Mohammad Qazim Bhat, Yufan Huang, Niket Agarwal, Hao Wang, Michael Woods, John Kenyon, Tsung-Yi Lin, Xiaodong Yang, Ming-Yu Liu, Kevin Xie

机构 * NVIDIA

专题命中 其他安全 :safety(title,abstract);分类 cs.AI

AI总结 本文提出VLM-AutoDrive框架,通过整合元数据生成的描述、LLM生成的描述、视觉问答对和推理监督,提升预训练视觉语言模型在安全关键自动驾驶事件中的检测性能。

Comments 16 pages, 9 figures, submitted to arXiv

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21174 2026-05-15 cs.LG 79%

Breaking the Reasoning Horizon in Entity Alignment Foundation Models

突破实体对齐基础模型中的推理地平线

Yuanning Cui, Zequn Sun, Wei Hu, Kexuan Xin, Zhangjie Fu

机构 * Nanjing University of Information Science and Technology(南京信息工程大学) State Key Laboratory for Novel Software Technology, Nanjing University(南京大学软件新技术国家重点实验室) National Institute of Healthcare Data Science, Nanjing University(南京大学健康数据科学国家研究院) University of Queensland(昆士兰大学) Engineering Research Center of Digital Forensics, Ministry of Education, Nanjing University of Information Science and Technology(南京信息工程大学数字取证工程研究中心)

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 本文提出基于并行编码策略的实体对齐基础模型,通过局部锚点引导信息流和合并关系图,有效解决实体对齐中长距离依赖捕捉问题,验证了模型在未见过的知识图谱上的强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13429 2026-05-14 cs.CL 79%

TokAlign++: Advancing Vocabulary Adaptation via Better Token Alignment

TokAlign++: 通过更好的词 token 对齐推进词汇适应

Chong Li, Yingzhuo Deng, Wen Yang, Jiajun Zhang, Chengqing Zong

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, CAS, Beijing, China(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院,北京,中国) School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学人工智能学院,北京,中国)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 TokAlign++通过学习更好的词 token 对齐词典,提升多语言模型的词汇适应性能,实验显示其能提升多语言文本压缩率并保持模型能力,仅需1k步即可恢复基础模型性能。

Comments Paper under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12197 2026-05-13 cs.LG 79%

A Unified Graph Language Model for Multi-Domain Multi-Task Graph Alignment Instruction Tuning

多领域多任务图对齐指令微调的统一图语言模型

Haibo Chen, Xin Wang, Jiaheng Chao, Ling Feng, Wenwu Zhu

机构 * Tsinghua University(清华大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 本文提出UniGraphLM,通过多领域多任务GNN编码器学习可泛化的图表示,并与LLM进行自适应对齐,以解决跨领域和任务的图对齐问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13625 2026-05-13 cs.AI 79%

Bridging Dual Knowledge Graphs for Multi-Hop Question Answering in Construction Safety

连接双知识图谱以实现施工安全多跳问答

Yuxin Zhang, Xi Wang, Mo Hu, Zhenyu Zhang

机构 * organization= Department of Construction Science, College of Architecture, Texas A\&M University, College Station , country= USA

专题命中 其他安全 :safety(title,abstract);分类 cs.AI

AI总结 本文提出BifrostRAG系统,通过双图检索增强生成模型处理施工安全多跳问答,实现92.8%精度和85.5%召回率,优于传统基线方法。

Comments 22 pages, 13 figures

Journal ref Automation in Construction, Volume 183, March 2026, 106794

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.06950 2026-05-13 cs.CV cs.CL 79%

READ: Recurrent Adapter with Partial Video-Language Alignment for Parameter-Efficient Transfer Learning in Low-Resource Video-Language Modeling

READ:基于部分视频-语言对齐的递归适配器用于低资源视频-语言建模的参数高效迁移学习

Thong Nguyen, Xiaobao Wu, Xinshuai Dong, Khoi Le, Zhiyuan Hu, Cong-Duy Nguyen, See-Kiong Ng, Luu Anh Tuan

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 本文提出READ框架,通过递归计算和部分最优传输对齐,提升低资源视频-语言建模任务的性能,优于现有迁移学习方法。

Comments Accepted at AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08902 2026-05-12 cs.CV cs.AI 79%

DAPE: Dynamic Non-uniform Alignment and Progressive Detail Enhancement Techniques for Improving the Performance of Efficient Visual Language Models

DAPE:动态非均匀对齐与渐进细节增强技术以提升高效视觉语言模型的性能

Mengyuan Tian, Qiyan Zhao, Yanan Wang, Da-Han Wang

机构 * The Wang Yanan Institute for Studies in Economics, Xiamen University, Xiamen 361005, China(厦门大学王文安经济研究所) Fujian Key Laboratory of Pattern Recognition and Image Understanding, School of Computer and Information Engineering, Xiamen University of Technology, Xiamen 361024, China(福建pattern识别与图像理解重点实验室,厦门理工大学计算机与信息工程学院)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出DAPE框架,通过动态跨模态对齐和连续细节引入技术,提升高效视觉语言模型的性能,减少计算开销并提升下游任务准确性。

Comments Accepted in ICIC 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08019 2026-05-11 cs.AI q-bio.NC 79%

Reason to Play: Behavioral and Brain Alignment Between Frontier LRMs and Human Game Learners

玩乐的动机:前沿LRMs与人类游戏学习者的行为与大脑对齐

Botos Csaba, Sreejan Kumar, Austin Tudor David Andrews, Laurence Hunt, Chris Summerfield, Joshua B. Tenenbaum, Rui Ponte Costa, Marcelo G. Mattar, Momchil Tomov

机构 * University of Oxford(牛津大学) Columbia University(哥伦比亚大学) New York University(纽约大学) Massachusetts Institute of Technology(麻省理工学院) Harvard University(哈佛大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 本文研究了前沿LRMs在游戏学习中的行为与大脑活动对齐情况,发现其在游戏发现阶段更接近人类行为,并能更准确预测大脑活动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06370 2026-05-08 cs.LG stat.ML 79%

Greedy Alignment Principle for Optimizer Selection

贪心对齐原则用于优化器选择

Jaerin Lee, Kyoung Mu Lee

机构 * Computer Vision Lab, ASRI, Seoul National University(计算机视觉实验室,ASRI,首尔国立大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 本文提出基于梯度更新对齐的贪心原则,用于优化器选择与调参,通过数学建模证明该原则能最大化损失下降率,并在多种任务中验证动态动量规则的有效性。

Comments 34 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00069 2026-05-04 cs.LG 79%

Soft-MSM: Differentiable Context-Aware Elastic Alignment for Time Series

Soft-MSM:用于时间序列的可微上下文感知弹性对齐

Christopher Holder, Anthony Bagnall

机构 * School of Electronics and Computer Science(电子与计算机科学学院) University of Southampton(南安普顿大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 本文提出Soft-MSM,一种基于上下文感知的弹性对齐损失函数,通过平滑门替代MSM的分段分合成本,实现可微梯度计算,实验表明其在时间序列聚类和分类任务中优于Soft-DTW。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27807 2026-05-04 cs.AI cs.DC 79%

Autonomous Systems Dependability in the era of AI: Design Challenges in Safety, Security, Reliability and Certification

人工智能时代自主系统可靠性:安全、安全性和可靠性设计挑战

Behnaz Ranjbar, Kirankumar Raveendiran, Sudeep Pasricha, Samarjit Chakraborty, Cecilia Carbonelli, Akash Kumar

机构 * Colorado State University, US(科罗拉多州立大学) The University of North Carolina at Chapel Hill, US(北卡罗来纳大学教堂山分校) The TUM Institute for Advanced Study, Germany(慕尼黑工业大学高级研究 institute) Infineon Technologies, Germany(英飞凌科技)

专题命中 其他安全 :safety(title,abstract);分类 cs.AI

AI总结 本文探讨了在人工智能时代设计可靠自主和嵌入式系统的新方法和框架,重点在于可靠性建模、安全系统设计和认证方法,以应对AI组件带来的不确定性与非确定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26370 2026-04-30 cs.CV cs.LG math.AT 79%

Topology-Aware Representation Alignment for Semi-Supervised Vision-Language Learning

面向拓扑的表示对齐用于半监督视觉-语言学习

Junwon You, Mihyun Jang, Sangwoo Mo, Jae-Hun Jung

机构 * KAIST(韩国科学技术院) POSTECH

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 本文提出ToMA框架,通过持久同调识别拓扑显著边,利用跨模态对应关系对齐多模态表示,提升视觉-语言学习在遥感和时尚检索中的性能。

Comments 30 pages, 10 figures, 24 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23902 2026-04-28 cs.AI 79%

LLM-Augmented Traffic Signal Control with LSTM-Based Traffic State Prediction and Safety-Constrained Decision Support

基于LSTM的交通信号控制与大语言模型增强的交通状态预测与安全约束决策支持

Jiazhao Shi

机构 * Tandon School of Engineering, New York University(纽约大学Tandon工程学院)

专题命中 其他安全 :safety(title,abstract);分类 cs.AI

AI总结 本文提出一种结合LSTM交通状态预测和大语言模型的交通信号控制框架,通过预测信号相位和生成自然语言解释,提升交通效率并确保安全约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06033 2026-04-24 cs.HC cs.CR cs.CY 79%

How Generative AI Empowers Attackers and Defenders Across the Trust & Safety Landscape

生成式人工智能如何在信任与安全领域赋能攻击者和防御者

Patrick Gage Kelley, Steven Rousso-Schindler, Renee Shelby, Kurt Thomas, Allison Woodruff

专题命中 其他安全 :safety(title,abstract);分类 cs.CY

AI总结 本文通过43名专家的质性研究,探讨生成式AI在信任与安全领域对攻击者和防御者的影响,揭示其在提升攻击规模与速度的同时,也为防御方提供了检测有害内容、调查取证等新手段。

Comments 21 pages, 4 tables, 1 figure

Journal ref In Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI '26). Association for Computing Machinery, New York, NY, USA, Article 1316, 1-21

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18563 2026-04-21 cs.CL 79%

Dual Alignment Between Language Model Layers and Human Sentence Processing

语言模型层与人类句子加工的双重对齐

Tatsuki Kuribayashi, Alex Warstadt, Yohei Oseki, Ethan Gotlieb Wilcox

机构 * MBZUAI Tohoku University(东北大学) UC San Diego(南加州大学) The University of Tokyo(东京大学) Georgetown University(乔治城大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 研究探讨了语言模型内部层在处理语法歧义时对人类认知努力的估计能力,发现后期层更准确但仍低估人类数据,揭示了人类与语言模型在句子加工中的不同模式。

Comments ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18022 2026-04-21 q-bio.BM cond-mat.stat-mech cs.LG stat.ML 79%

Boltzmann Machine Learning with a Parallel, Persistent Markov chain Monte Carlo method for Estimating Evolutionary Fields and Couplings from a Protein Multiple Sequence Alignment

Boltzmann 机器学习:一种并行、持久的马尔可夫链蒙特卡洛方法用于从蛋白质多重序列比对中估计进化场和耦合

Sanzo Miyazawa

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 本文提出利用Boltzmann机和并行持久马尔可夫链蒙特卡洛方法,通过氨基酸单点和配对频率估计蛋白质进化场和耦合,提升蛋白质结构与进化研究的计算效率。

Comments A manuscript of 11 pages including 3 figures and 3 tables, and a supplementary material of 9 pages including 8 figures. The program and multiple sequence alignments employed here are available from https://gitlab.com/sanzo.miyazawa/BM/ and https://github.com/Sanzo-Miyazawa/BM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04847 2026-04-20 cs.SD cs.AI 79%

Language Models as Semantic Teachers: Post-Training Alignment for Medical Audio Understanding

语言模型作为语义教师:面向医学音频理解的后训练对齐

Tsai-Ning Wang, Lin-Lin Chen, Neil Zeghidour, Aaqib Saeed

机构 * Eindhoven University of Technology, The Netherlands(埃因霍温理工大学,荷兰) Kyutai, France(Kyutai公司,法国) Eindhoven Artificial Intelligence Systems Institute, The Netherlands(埃因霍温人工智能系统研究所,荷兰)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出AcuLa框架,通过将音频编码器与医学语言模型对齐,提升医学音频的语义理解能力,在18个心血管任务中取得最佳性能,显著提升诊断准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01264 2026-04-14 cs.RO cs.AI 79%

LLM-based Realistic Safety-Critical Driving Video Generation

基于LLM的现实安全关键驾驶视频生成

Yongjie Fu, Ruijian Zha, Pei Tian, Xuan Di

机构 * Department of Civil Engineering and Engineering Mechanics, Columbia University(哥伦比亚大学土木工程与工程力学系) Department of Computer Science, Columbia University(哥伦比亚大学计算机科学系)

专题命中 其他安全 :safety(title,abstract);分类 cs.AI

AI总结 本文提出利用LLM生成少样本代码实现安全关键驾驶场景生成,结合CARLA模拟器与Cosmos-Transfer1和ControlNet生成真实驾驶视频,提升自动驾驶测试效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07375 2026-04-10 cs.CY cs.HC 79%

Assessing the Feasibility of a Video-Based Conversational Chatbot Survey for Measuring Perceived Cycling Safety: A Pilot Study in New York City

评估基于视频的对话式聊天机器人调查在测量感知骑行安全性的可行性:纽约市试点研究

Feiyang Ren, Zhaoxi Zhang, Tamir Mendel, Takahiro Yabe

专题命中 其他安全 :safety(title,abstract);分类 cs.CY

AI总结 本文提出利用大语言模型结合视频调查和对话式AI聊天机器人,评估骑行安全感知的可行性,并通过纽约市九个街区的试点调查验证方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07116 2026-04-09 cs.CL 79%

Yale-DM-Lab at ArchEHR-QA 2026: Deterministic Grounding and Multi-Pass Evidence Alignment for EHR Question Answering

耶鲁-DM实验室参加ArchEHR-QA 2026:用于电子病历问答的确定性接地和多轮证据对齐

Elyas Irankhah, Samah Fodeh

机构 * Yale University(耶鲁大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 本文提出确定性接地和多轮证据对齐方法,用于电子病历问答任务,通过模型多样性与投票策略提升性能,实验结果显示对齐准确率受限于推理能力。

Comments 9 pages, 2 figures. System description for ArchEHR-QA 2026 shared task

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05522 2026-04-08 cs.CL 79%

Cross-Modal Coreference Alignment: Enabling Reliable Information Transfer in Omni-LLMs

跨模态指代对齐:在全模态大语言模型中实现可靠信息传输

Hongcheng Liu, Yuhao Wang, Zhe Chen, Pingjie Wang, Zhiyuan Zhu, Yixuan Hou, Yanfeng Wang, Yu Wang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 研究提出跨模态指代对齐问题,通过CrossOmni数据集和两种方法提升全模态推理能力,揭示指代意识缺失是跨模态推理弱化的主要原因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05417 2026-04-08 cs.CL 79%

Multi-Drafter Speculative Decoding with Alignment Feedback

多草案生成与对齐反馈

Taehyeon Kim, Hojung Jung, Se-Young Yun

机构 * LG AI Research(LG AI研究院) KAIST AI(韩国科学技术院人工智能学院)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 本文提出MetaSD框架,通过整合多个草案生成器并利用对齐反馈,提升大规模语言模型推理效率和生成质量。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03867 2026-04-07 cs.LG 79%

Where to Steer: Input-Dependent Layer Selection for Steering Improves LLM Alignment

转向何处:输入依赖的层选择用于转向以改进LLM对齐

Soham Gadgil, Chris Lin, Su-In Lee

机构 * University of Washington(华盛顿大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 本文提出W2S框架,通过输入依赖的层选择改进LLM对齐,证明固定层方法不足,展示适应性层选择的重要性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏