arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-27 至 2026-04-27 共收录 35 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 1 篇

2604.22193 2026-04-27 cs.CL 70%

How Large Language Models Balance Internal Knowledge with User and Document Assertions

大型语言模型如何在内部知识与用户和文档断言之间取得平衡

Shuowei Li, Haoxin Li, Wenda Chu, Yi Fang

机构 * Santa Clara University(圣克拉拉大学) Nanyang Technological University(南洋理工大学) California Institute of Technology(加州理工学院)

专题命中 偏好对齐 :safety(abstract);trustworthy(abstract);分类 cs.CL

AI总结 本文研究了大型语言模型在处理内部知识与外部信息时的平衡问题,提出三源交互框架,评估27个模型,发现模型更依赖文档断言,且通过微调可提升其区分能力。

Comments Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 3 篇

2510.27413 2026-04-27 cs.LG cs.AI cs.CL 90%

Atlas-Alignment: Making Interpretability Transferable Across Language Models

Atlas-Alignment:使语言模型间的可解释性可迁移

Bruno Puri, Jim Berend, Sebastian Lapuschkin, Wojciech Samek

机构 * Department of Artificial Intelligence, Fraunhofer Heinrich Hertz Institute(人工智能系,弗劳恩霍夫 Heinrich Hertz 研究所) Department of Electrical Engineering and Computer Science, Technische Universität Berlin(电气工程与计算机科学系,柏林技术大学) Centre of eXplainable Artificial Intelligence, Technological University Dublin(可解释人工智能中心,都柏林技术大学) BIFOLD - Berlin Institute for the Foundations of Learning and Data(BIFOLD - 柏林学习与数据基础研究所)

专题命中 安全训练 :alignment(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 Atlas-Alignment通过在新模型的潜在空间与预训练的Concept Atlas对齐,实现无需标注数据的可解释性迁移,降低可解释AI的成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03456 2026-04-27 cs.AI cs.CL cs.SE 62%

Asymmetric Goal Drift in Coding Agents Under Value Conflict

编码代理在价值冲突下的非对称目标漂移

Magnus Saebo, Spencer Gibson, Tyler Crosse, Achyutha Menon, Eyon Jang, Diogo Cruz

机构 * Columbia University(哥伦比亚大学) Independent(独立) Georgia Tech(佐治亚理工学院) UC San Diego(加州大学圣地亚哥分校) MATS SPAR

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究编码代理在价值冲突中如何平衡系统提示与实际任务,发现其目标漂移受价值对齐、对抗压力和累积上下文影响,且环境压力可 override 显式约束。

Comments 5 pages, 4 figures, Published as a workshop paper in Lifelong Agents @ ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22504 2026-04-27 cs.IR 50%

Objective Shaping with Hard Negatives: Windowed Partial AUC Optimization for RL-based LLM Recommenders

通过硬负样本进行目标塑造:基于RL的LLM推荐系统中的窗口化部分AUC优化

Wentao Shi, Qifan Wang, Chen Chen, Fei Liu, Dongfang Liu, Xu Liu, Wanli Ma, Junfeng Pan, Linhong Zhu, Fuli Feng

专题命中 安全训练 :alignment(abstract)

AI总结 本文提出窗口化部分AUC优化方法,通过约束假阳性率提升与Top-K指标的一致性,改进基于RL的LLM推荐系统性能。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 4 篇

2506.17299 2026-04-27 cs.CR cs.AI cs.LG 93%

Toward Principled LLM Safety Testing: Solving the Jailbreak Oracle Problem

迈向原则化的LLM安全测试:解决 Jailbreak 或acle 问题

Shuyi Lin, Anshuman Suri, Alina Oprea, Cheng Tan

机构 * Anonymous Institution, Anonymous City, Anonymous Region, Anonymous Country(匿名机构、匿名城市、匿名地区、匿名国家)

专题命中 越狱攻击 :jailbreak(title,title_cn);safety(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出解决Jailbreak oracle问题的Boa系统,通过分阶段搜索策略评估大语言模型的安全性,实现系统化的防御评估和模型认证。

Comments Accepted to MLSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13527 2026-04-27 cs.CL cs.AI 90%

Logic Jailbreak: Efficiently Unlocking LLM Safety Restrictions Through Formal Logical Expression

逻辑突破:通过形式逻辑表达高效解锁LLM安全限制

Jingyu Peng, Maolin Wang, Nan Wang, Jiatong Li, Yuchen Li, Yuyang Ye, Wanyu Wang, Pengyue Jia, Kai Zhang, Xiangyu Zhao

机构 * City University of Hong Kong(香港城市大学) Rutgers University(罗格斯大学) University of Science and Technology of China(中国科学技术大学) Universiteit van Amsterdam(阿姆斯特丹大学) Baidu Inc(百度公司)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LogiBreak方法,通过将有害提示转化为形式逻辑表达,利用对齐数据与逻辑输入之间的分布差异,有效绕过LLM安全机制,验证其在多语言数据集中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11157 2026-04-27 cs.CL 90%

Response-Based Knowledge Distillation for Multilingual Jailbreak Prevention Unwittingly Compromises Safety

基于响应的知识蒸馏用于多语言对抗预防无意中削弱了安全性

Max Zhang, Derek Liu, Kai Zhang, Joshua Franco, Haihao Liu

机构 * OpenAI Meta

专题命中 越狱攻击 :safety(title,abstract);jailbreak(title,abstract);alignment(abstract);分类 cs.CL

AI总结 本文研究了基于响应的知识蒸馏在多语言对抗预防中的应用,发现标准微调会增加学生模型的对抗成功率,但去除边界拒绝可缓解安全性下降。

Comments 9 pages, Poster presented at Socially Responsible and Trustworthy Foundation Models at NeurIPS 2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18169 2026-04-27 cs.CR cs.AI cs.LG 73%

Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey

大型语言模型有害微调攻击与防御:综述

Tiansheng Huang, Sihao Hu, Fatih Ilhan, Selim Furkan Tekin, Ling Liu

机构 * School of Computer Science, Georgia Institute of Technology(佐治亚理工学院计算机科学系)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了大型语言模型中有害微调攻击的威胁模型、防御设计及评估方法,分析了现有攻击与防御机制,并提出了未来研究方向。

Comments Accepted by ACM Computing Survey (CSUR). The authors will continuously update the arXiv version. Please reach out to the authors if you find uncovered papers on relevant topics

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 1 篇

2505.20435 2026-04-27 cs.LG cs.AI cs.CG math.AT 62%

The Shape of Adversarial Influence: Characterizing LLM Latent Spaces with Persistent Homology

对抗影响的形状:利用持久同调表征大语言模型的潜在空间

Aideen Fay, Inés García-Redondo, Qiquan Wang, Haim Dubossarsky, Anthea Monod

机构 * Microsoft Security Response Center(微软安全响应中心) AIDOS Lab, University of Fribourg(弗里堡大学AIDOS实验室) Department of Mathematics, Imperial College London(伦敦帝国理工学院数学系) Queen Mary University of London(伦敦大学量子玛丽学院) Imperial College London(伦敦帝国理工学院) Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI、cs.LG

AI总结 本文利用持久同调方法分析对抗输入如何改变大语言模型潜在空间的几何拓扑结构,揭示了潜在空间压缩和拓扑特征的普遍性。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 4 篇

2604.14651 2026-04-27 cs.CL 83%

CURA: Clinical Uncertainty Risk Alignment for Language Model-Based Risk Prediction

CURA:语言模型基于风险预测的临床不确定性风险对齐

Sizhe Wang, Ziqi Xu, Claire Najjuuko, Charles Alba, Chenyang Lu

机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校)

专题命中 幻觉与事实性 :alignment(title,abstract);trustworthy(abstract);分类 cs.CL

AI总结 CURA通过结合个体误差概率和群体模糊性,提升临床语言模型的风险预测不确定性校准,实验表明其能提高校准指标并减少过度自信的误判。

Comments Accepted at ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16994 2026-04-27 cs.LG cs.AI cs.CL 67%

FADE: Why Bad Descriptions Happen to Good Features

FADE:为什么好的特征会遇到糟糕的描述

Bruno Puri, Aakriti Jain, Elena Golimblevskaia, Patrick Kahardipraja, Thomas Wiegand, Wojciech Samek, Sebastian Lapuschkin

机构 * Department of Artificial Intelligence, Fraunhofer Heinrich Hertz Institute(人工智能系,弗劳恩霍夫海因里希·赫兹研究所) Department of Electrical Engineering and Computer Science, Technische Universität Berlin(电气工程与计算机科学系,柏林技术大学) BIFOLD - Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究所) Centre of eXplainable Artificial Intelligence, Technological University Dublin(可解释人工智能中心,都柏林技术大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 FADE提出了一种模型无关的框架,用于自动评估特征与描述的一致性,通过四个指标量化特征与描述之间的不一致原因,揭示了生成特征描述的挑战。

Journal ref In Findings of the Association for Computational Linguistics: ACL 2025, pages 17138-17160, Vienna, Austria. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22498 2026-04-27 cs.CV cs.AI 57%

CGC: Compositional Grounded Contrast for Fine-Grained Multi-Image Understanding

CGC:基于组成性 grounded 对比的细粒度多图像理解

Lihao Zheng, Zhenwei Shao, Yu Zhou, Yan Yang, Xintian Shen, Jiawei Chen, Hao Ma, Tao Wei

机构 * School of Computer Science and Technology, Hangzhou Dianzi University(杭州电子科技大学计算机科学与技术学院) School of Computer Science(计算机科学学院) Technology, Hangzhou Dianzi University(技术,杭州电子科技大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 本文提出CGC框架,通过跨图像对比和内图像对比提升多图像细粒度理解,结合规则空间奖励增强属性和对齐,实验显示在多个基准上取得最佳结果,并在多模态任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21740 2026-04-27 cs.CY cs.SI physics.soc-ph 57%

Towards Operational Validation of LLM-Agent Social Simulations: A Replicated Study of a Reddit-like Technology Forum

向LLM-代理社会模拟的操作验证:一个Reddit-like技术论坛的重复研究

Aleksandar Tomašević, Darja Cvetković, Sara Major, Slobodan Maletić, Miroslav Anđelković, Ana Vranić, Boris Stupovski, Dušan Vudragović, Aleksandar Bogojević, Marija Mitrović Dankulov

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CY

AI总结 本文通过30天的模拟研究,验证LLM-代理在技术论坛中的操作有效性,发现模拟结果与真实数据在用户和帖子层面有重叠,但评论毒性等指标存在差异,揭示了代理设计对模拟结果的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 安全评测 16 篇

2604.22156 2026-04-27 cs.LG cs.CV 79%

Sum-of-Checks: Structured Reasoning for Surgical Safety with Large Vision-Language Models

Sum-of-Checks: 用于手术安全的结构化推理方法基于大型视觉-语言模型

Weiqiu You, Cassandra Goldberg, Amin Madani, Daniel A. Hashimoto, Eric Wong

机构 * Department of Computer and Information Science, University of Pennsylvania(宾夕法尼亚大学计算机与信息科学系) Department of Surgery, University of Toronto(多伦多大学外科系) Surgical Artificial Intelligence Research Academy, University Health Network(外科人工智能研究学院,大学健康网络) Department of Surgery, Perelman School of Medicine, University of Pennsylvania(宾夕法尼亚大学外科系,佩雷尔曼医学院)

专题命中 安全评测 :safety(title,abstract);分类 cs.LG

AI总结 本文提出Sum-of-Checks框架,通过分解关键安全视图(CVS)标准为专家定义的检查,提升手术安全评估的准确性和透明性,实验显示其在三个模型上平均提升12-14%。

Comments IPCAI 2026 short communication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21964 2026-04-27 cs.CY 79%

Lessons from External Review of DeepMind's Scheming Inability Safety Case

从深度思维的'谋略无能'安全案例外部评审中汲取的教训

Stephen Barrett, Francisco Javier Campos Zabala, Sean P. Fillingham, Umair Siddique, James Walpole, Robin Bloomfield, Henry Papadatos

专题命中 安全评测 :safety(title,abstract);分类 cs.CY

AI总结 本文通过应用Assurance 2.0框架对DeepMind的公开'谋略无能'安全案例进行外部评审,揭示了外部评审在提升AI安全论证质量中的作用,并提出具体建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22143 2026-04-27 cs.CY cs.CL 73%

Recognition Without Authorization: LLMs and the Moral Order of Online Advice

无需授权的识别:大语言模型与在线建议的道德秩序

Tom van Nuenen

机构 * Social Sciences Data Lab(社会科学数据实验室) UC Berkeley(伯克利大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.CY

AI总结 本文研究大语言模型在处理日常人际困境时的建议倾向,发现其在识别问题时较少给予行动授权,特别是在社区共识强烈的情况下,模型推荐退出的比例显著低于人类,且保持较高的谨慎和治疗框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22136 2026-04-27 cs.CR cs.LG 70%

Sovereign Agentic Loops: Decoupling AI Reasoning from Execution in Real-World Systems

主权代理循环:在现实系统中解耦AI推理与执行

Jun He, Deying Yu

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 本文提出Sovereign Agentic Loops,通过解耦AI推理与执行,提升系统安全性,实验显示其有效阻止93%的危险意图。

Comments 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22427 2026-04-27 cs.CR 67%

Automation-Exploit: A Multi-Agent LLM Framework for Adaptive Offensive Security with Digital Twin-Based Risk-Mitigated Exploitation

自动化-漏洞利用:一种多智能体LLM框架,用于基于数字孪生的自适应进攻性安全与风险缓解漏洞利用

Biagio Andreucci, Arcangelo Castiglione

专题命中 安全评测 :alignment(abstract);safety(abstract)

AI总结 本文提出自动化-漏洞利用框架,通过多智能体系统在复杂黑盒场景中实现自适应进攻性安全,利用数字孪生技术缓解风险,有效解决内存漏洞等安全问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22662 2026-04-27 cs.LG cs.AI cs.HC 62%

Rethinking XAI Evaluation: A Human-Centered Audit of Shapley Benchmarks in High-Stakes Settings

重新思考XAI评估:在高风险场景中对Shapley基准的以人为本的审计

Inês Oliveira e Silva, Sérgio Jesus, Iker Perez, Rita P. Ribeiro, Carlos Soares, Hugo Ferreira, Pedro Bizarro

机构 * University of Porto, Feedzai(波尔图大学,Feedzai) University of Porto(波尔图大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文通过统一框架评估八种Shapley变体,在低延迟约束下揭示其语义差异,发现传统量化指标与人类感知的清晰度和决策效用不一致,且解释增加决策信心,提示高风险场景下的自动化偏差风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22154 2026-04-27 cs.LG cs.AI 62%

Reliable Self-Harm Risk Screening via Adaptive Multi-Agent LLM Systems

通过自适应多智能体LLM系统实现可靠的自伤风险筛查

Meghana Karnam, Ananya Joshi

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于有向无环图的统计框架,通过自适应采样策略提升自伤风险评估的可靠性,实验表明其在精度和召回率上优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22180 2026-04-27 cs.IR cs.AI 57%

ResRank: Unifying Retrieval and Listwise Reranking via End-to-End Joint Training with Residual Passage Compression

ResRank:通过端到端联合训练与残差段落压缩统一检索与列表级重排序

Xiaojie Ke, Shuai Zhang, Liansheng Sun, Yongjin Wang, Hengjun Jiang, Xiangkun Liu, Cunxin Gu, Jian Xu, Guanjun Jiang

机构 * Qwen Applications Business Group of Alibaba(阿里巴巴Qwen应用业务组)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 ResRank通过端到端联合训练与残差段落压缩技术,解决传统重排序方法中输入长度增加导致的排名质量下降和推理延迟问题,实现高效且有效的检索与重排序统一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18919 2026-04-27 cs.CL 57%

Proposing Topic Models and Evaluation Frameworks for Analyzing Associations with External Outcomes: An Application to Leadership Analysis Using Large-Scale Corporate Review Data

提出用于分析与外部结果关联的主题模型和评估框架:以利用大规模企业评论数据的领导力分析为例

Yura Yoshida, Masato Kanai, Masataka Nakayama, Haruki Ohsawa, Yukiko Uchida, Arata Yuminaga, Gakuse Hoshina, Nobuo Sayama

机构 * Accenture Japan Ltd(安永日本有限公司) Kyoto University Institute for the Future of Human Society(京都大学未来人类社会研究所) OpenWork Inc.(OpenWork公司) Integral Corporation(Integral公司)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出一种利用大语言模型生成主题的方法,结合定制评估框架,提升主题可解释性、特定性和极性一致性,通过日本主要企业评论平台OpenWork的员工评论数据验证,提升了对员工士气等外部结果的解释力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03963 2026-04-27 cs.AI 57%

Can Large Language Models Adequately Perform Symbolic Reasoning Over Time Series?

大型语言模型能否在时间序列上进行充分的符号推理?

Zewen Liu, Juntong Ni, Xianfeng Tang, Max S. Y. Lau, Qi He, Wenpeng Yin, Wei Jin

机构 * Emory University(埃默里大学) Amazon(亚马逊) Microsoft(微软) Penn State University(宾夕法尼亚州立大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出SymbolBench基准,评估大型语言模型在时间序列上的符号推理能力,结合遗传编程构建闭环系统,揭示模型在科学发现中的优势与局限。

Comments camera_ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22513 2026-04-27 cs.NI 50%

Benchmarking LLM-Driven Network Configuration Repair

基于大语言模型的网络配置修复基准测试

Ioannis Protogeros, Rufat Asadli, Benjamin Hoffman, Laurent Vanbever

专题命中 安全评测 :safety(abstract)

AI总结 本文提出Cornetto基准测试,用于评估大语言模型在大规模网络配置修复中的功能性和扩展性,发现现有LLM在处理复杂场景时易引入回归问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22319 2026-04-27 cs.HC 50%

Rethinking AI-Mediated Minority Support in Power-Imbalanced Group Decision-Making: From Anonymity To Authenticity

重新思考权力失衡群体决策中的AI辅助少数群体支持:从匿名到真实性

Soohwan Lee, Kyungho Lee

专题命中 安全评测 :safety(abstract)

AI总结 本文探讨AI辅助通信中少数群体支持策略的平衡问题,发现匿名化输入虽提升参与度但降低心理安全,而自主反驳提升满意度并减少边缘化,揭示了匿名性、真实性、自主性和问责之间的权衡及权力不对称的风险。

Comments ACM CHI 2026 Workshop on Restoring Human Authenticity in AI-Mediated Communication (CHI '26 AI-MC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22245 2026-04-27 eess.AS 50%

Listening with Time: Precise Temporal Awareness for Long-Form Audio Understanding

通过时间聆听:为长音频理解实现精确的时间意识

Mingchen Shao, Hang Su, Wenjie Tian, Bingshen Mu, Zhennan Lin, Lichun Fan, Zhenbo Luo, Jian Luan, Lei Xie

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出LAT-Audio模型,通过构建长音频数据集和基准测试,解决长音频时间意识任务中的性能下降问题,提升模型对长音频的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22068 2026-04-27 cs.SE cs.RO 50%

TRACE: Topology-aware Reconstruction of Accidents in CARLA for AV Evaluation

TRACE: 基于拓扑的CARLA中事故重建用于自动驾驶评估

Nahian Salsabil, Sebastian Elbaum

机构 * University of Virginia(弗吉尼亚大学)

专题命中 安全评测 :safety(abstract)

AI总结 TRACE通过提取OpenStreetMap数据和大语言模型推断车辆初始状态,自动重建NHTSA事故报告,生成高保真的CARLA仿真场景,为自动驾驶系统提供多样化的现实故障测试资源。

Comments FSE'26 Tool Demonstration Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21932 2026-04-27 cs.HC cs.SE 50%

Quantifying Interface Procedure Coupling Risks in Digital Nuclear Control Rooms: An Event Based Human Reliability Assessment

数字核控制室界面过程耦合风险量化:基于事件的人可靠性评估

Xingyu Xiao, Mingwei Xiao, Hongbo Li, Jingang Liang, Jiejuan Tong, Haitao Wang

专题命中 安全评测 :alignment(abstract)

AI总结 本文基于2021-2025年现代核电站实际运行事件,提出一种三维标注框架和四因素界面机制模型,揭示界面缺陷放大风险的机制,发现42.6%的事件涉及界面缺陷,其存在使操作偏差概率翻倍,且语义不匹配和布局陷阱是主要诱因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28717 2026-04-27 eess.AS 50%

Can Hierarchical Cross-Modal Fusion Predict Human Perception of AI Dubbed Content?

层次化跨模态融合能否预测人工智能 dubbed 内容的人类感知?

Ashwini Dasare, Nirmesh Shah, Ashishkumar Gudmalwar, Pankaj Wasnik

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出层次化跨模态架构,整合音频、视频和文本信息,通过轻量LoRA适配器实现多模态高效微调,利用主动学习优化客观指标,实现对AI dubbed内容的可扩展自动评估。

Comments Accepted at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 其他安全 6 篇

2604.22195 2026-04-27 cs.IR 78%

Rethinking Semantic Collaborative Integration: Why Alignment Is Not Enough

重新思考语义协作整合:为什么对齐不够

Maolin Wang, Dongze Wu, Jianing Zhou, Hongyu Chen, Beining Bao, Yu Jiang, Chenbin Zhang, Chang Wang, Jian Liu, Lei Sha

专题命中 其他安全 :alignment(title,abstract)

AI总结 本文挑战了传统语义与协作表示对齐的假设,提出互补融合视角,强调共享与私有因素的区分,通过实验揭示语义与协作视图的低一致性及互补性,倡导以互补性为核心的推荐系统设计。

Comments Accepted by SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏