arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-07 至 2026-04-07 共收录 121 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 11 篇

2510.07985 2026-04-07 cs.LG cs.AI cs.CR 62%

Fewer Weights, More Problems: A Practical Attack on LLM Pruning

更少的权重,更多的问题:对LLM剪枝的一种实用攻击

Kazuki Egashira, Robin Staab, Thibaud Gloaguen, Mark Vero, Martin Vechev

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 本文首次揭示了现代LLM剪枝方法可能被恶意利用的问题,通过构造看似无害的模型,在剪枝后表现出恶意行为,展示了剪枝过程中的安全风险。

Comments ICLR 2026. Code: https://github.com/eth-sri/llm-pruning-attack

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03912 2026-04-07 cs.CR cs.AI cs.DC cs.LG 62%

Automating Cloud Security and Forensics Through a Secure-by-Design Generative AI Framework

通过安全设计的生成AI框架实现云安全与取证自动化

Dalal Alharthi, Ivan Roberto Kawaminami Garcia

机构 * University of Arizona(亚利桑那大学)

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一个安全设计的生成AI框架,结合PromptShield和CIAF,提升云环境中的安全性和取证准确性,通过实验证明在攻击条件下分类性能和勒索软件检测精度显著提升。

Comments arXiv admin note: substantial text overlap with arXiv:2510.00452

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04255 2026-04-07 cs.LG cs.CR 57%

Towards Unveiling Vulnerabilities of Large Reasoning Models in Machine Unlearning

面向揭示大规模推理模型在机器反向学习中的漏洞

Aobo Chen, Chenxu Zhao, Chenglin Miao, Mengdi Huai

机构 * Iowa State University(爱荷华州立大学)

专题命中 越狱攻击 :alignment(abstract);分类 cs.LG

AI总结 本文研究大规模推理模型在机器反向学习中的安全漏洞,提出一种能生成误导性推理轨迹的攻击方法,并通过白盒和黑盒实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04060 2026-04-07 cs.CR cs.AI 57%

CoopGuard: Stateful Cooperative Agents Safeguarding LLMs Against Evolving Multi-Round Attacks

CoopGuard:基于协作代理的有状态多轮防御框架用于抵御LLM的演变攻击

Siyuan Li, Zehao Liu, Xi Lin, Qinghua Mao, Yuliang Chen, Haoyu Li, Jun Wu, Jianhua Li, Xiu Su

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) Department of Computer Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校计算机科学系) Big Data Institute, Central South University(中南大学大数据研究院)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本文提出CoopGuard,通过协作代理维护和更新内部防御状态,有效应对多轮演变攻击。实验显示其在攻击成功率、欺骗率和攻击效率上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00446 2026-04-07 cs.CR 50%

Exposing the Ghost in the Transformer: Abnormal Detection for Large Language Models via Hidden State Forensics

揭示Transformer中的幽灵:通过隐藏状态取证实现大语言模型的异常检测

Shide Zhou, Kailong Wang, Ling Shi, Haoyu Wang

专题命中 越狱攻击 :jailbreak(abstract)

AI总结 本文提出通过隐藏状态取证检测大语言模型异常行为,实现实时高效的安全威胁识别,检测准确率超95%,计算开销极低。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 提示注入 4 篇

2603.12230 2026-04-07 cs.LG cs.AI cs.CR 62%

Security Considerations for Artificial Intelligence Agents

人工智能代理的安全性考虑

Ninghui Li, Kaiyuan Zhang, Kyle Polley, Jerry Ma

机构 * Perplexity

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了前沿AI代理的安全性问题,分析了代理架构对代码-数据分离、权限边界和执行可预测性的影响,并提出了针对间接提示注入、混淆代理行为和长流程级联故障的防护措施。

Comments This article is adapted from Perplexity's response to NIST/CAISI Request for Information 2025-0035. 91 Fed. Reg. 698 (Jan. 8, 2026). The originally submitted response can be found on the public docket at https://www.regulations.gov/comment/NIST-2025-0035-0505

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03870 2026-04-07 cs.CL 57%

Your Agent is More Brittle Than You Think: Uncovering Indirect Injection Vulnerabilities in Agentic LLMs

你的代理比你想象的更脆弱:揭示代理LLM中的间接注入漏洞

Wenhui Zhu, Xuanzhao Dong, Xiwen Chen, Rui Cai, Peijie Qiu, Zhipeng Wang, Oana Frunza, Shao Tang, Jindong Gu, Yalin Wang

机构 * Arizona State University(亚利桑那州立大学) Morgan Stanley(摩根士丹利) UC Davis(加州大学戴维斯分校) Washington University in St. Louis(圣路易斯华盛顿大学) Rice University(莱斯大学) Florida State University(佛罗里达州立大学) University of Oxford(牛津大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL

AI总结 研究揭示了代理LLM在动态环境中存在严重的间接注入漏洞,通过评估六种防御策略发现现有防护不足,提出基于表示工程的检测方法以提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23064 2026-04-07 cs.CR cs.AI cs.SI 57%

Mind Your HEARTBEAT! Claw Background Execution Inherently Enables Silent Memory Pollution

注意你的HEARTBEAT!Claw背景执行本质上使内存污染静默

Yechao Zhang, Shiqian Zhao, Jie Zhang, Gelei Deng, Jiawen Zhang, Xiaogeng Liu, Chaowei Xiao, Tianwei Zhang

机构 * Nanyang Technological University(南洋理工大学) Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局(A*STAR)) Johns Hopkins University(约翰斯·霍普金斯大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 研究揭示Claw个人AI代理中因心跳驱动背景执行导致的内存污染漏洞,通过MissClaw实验发现社会可信度驱动行为影响,内存污染可进入长期记忆并影响用户行为。

Comments 26 pages, 6 figures, 7 tables; identifies a vulnerability in the heartbeat mechanism of Claw systems with version-scoped evaluation (pre-fix OpenClaw, February 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16934 2026-04-07 cs.CL 57%

In-Context Watermarks for Large Language Models

上下文水印用于大型语言模型

Yepeng Liu, Xuandong Zhao, Christopher Kruegel, Dawn Song, Yuheng Bu

机构 * UC Santa Barbara(加州大学圣塔芭芭拉分校) UC Berkeley(加州大学伯克利分校)

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL

AI总结 本文提出In-Context Watermarking方法,通过提示工程在生成文本中嵌入水印,无需访问解码过程,适用于检测AI生成内容,验证了其作为通用且实用的水印方法的可行性。

Comments ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 幻觉与事实性 8 篇

2604.03524 2026-04-07 cs.AI 77%

Structural Rigidity and the 57-Token Predictive Window: A Physical Framework for Inference-Layer Governability in Large Language Models

结构刚性和57个标记的预测窗口:一种用于大语言模型推理层可控性的物理框架

Gregory M. Ruddell

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本文提出一种物理框架,通过分析大语言模型的推理行为,揭示了预提交信号的存在条件,并展示了结构刚性在不同几何区域中的统一度量。

Comments Extends arXiv:2603.21415. 30 pages. Also available on Zenodo (10.5281/zenodo.19393882)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04231 2026-04-07 cs.LG 70%

Subspace Control: Turning Constrained Model Steering into Controllable Spectral Optimization

子空间控制:将受约束的模型操控转化为可控的谱优化

Yancheng Huang, Changsheng Wang, Chongyu Fan, Yicheng Lang, Bingqi Shang, Yang Zhang, Mingyi Hong, Qing Qu, Alvaro Velasquez, Sijia Liu

机构 * OPTML, Michigan State University(OPTML,密歇根州立大学) MIT-IBM Watson AI Lab, IBM Research(MIT-IBM Watson AI Lab,IBM研究院) University of Minnesota(明尼苏达大学) University of Michigan(密歇根大学) University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 本文提出子空间控制框架,通过分析谱交叉任务干扰并利用一阶解正交化合并子空间,引入SIFT方法,实现可控更新以缓解目标与约束冲突,在四个应用中均取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07149 2026-04-07 cs.LG cs.AI cs.CL cs.IT math.IT 67%

Measuring Uncertainty in Transformer Circuits with Effective Information Consistency

通过有效信息一致性测量变换器电路中的不确定性

Anatoly A. Krasnovsky

机构 * Innopolis University(因诺波利斯大学) MB3R Lab(MB3R实验室)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出有效信息一致性评分,通过局部雅可比矩阵和激活值计算规范化sheaf不一致性,并结合高斯EI代理评估电路层面因果涌现,以量化变换器电路行为的一致性与可信度。

Journal ref Automatic Documentation and Mathematical Linguistics 59 (Suppl 5), S423-S429 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04175 2026-04-07 cs.LG 57%

Uncertainty-Aware Foundation Models for Clinical Data

具有不确定性的临床数据基础模型

Qian Zhou, Yuanyun Zhang, Shi Li

机构 * University of the Chinese Academy of Sciences(中国科学院大学) Columbia University(哥伦比亚大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 本文提出一种考虑不确定性的临床数据基础模型框架,通过学习集合值表示并强制一致性,提升预测性能和数据缺失下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15443 2026-04-07 cs.CL stat.ML 57%

ALIEN: Aligned Entropy Head for Improving Uncertainty Estimation of LLMs

ALIEN:对齐熵头以提高大语言模型的不确定性估计

Artem Zabolotnyi, Roman Makarov, Mile Mitrovic, Polina Proskura, Oleg Travkin, Roman Alferov, Alexey Zaytsev

机构 * Applied AI Institute, Moscow, Russia(应用人工智能研究所,莫斯科,俄罗斯) SB AI Lab, Moscow, Russia(SB AI实验室,莫斯科,俄罗斯) Intellectual data analysis and predictive modeling Institute, Moscow, Russia(智能数据分析与预测建模研究所,莫斯科,俄罗斯)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 ALIEN通过轻量级对齐方法提升大语言模型的不确定性估计,减少过自信,改进模型在困难输入下的预测可靠性。

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03493 2026-04-07 cs.CL 57%

Cultural Authenticity: Comparing LLM Cultural Representations to Native Human Expectations

文化真实性:比较大语言模型的文化表征与本地人类期望

Erin MacMurray van Liemt, Aida Davani, Sinchana Kumbale, Neha Dixit, Sunipa Dev

机构 * Google Research(谷歌研究院) Google India(谷歌印度)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 本文提出人类中心框架评估LLM生成内容与本地期望的一致性,发现部分模型存在以西方为中心的校准,文化距离越远一致性越低,并识别出系统性误差。

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03388 2026-04-07 cs.LG stat.ML 57%

Scalable Variational Bayesian Fine-Tuning of LLMs via Orthogonalized Low-Rank Adapters

通过正交化低秩适配器实现大规模语言模型的可扩展变分贝叶斯微调

Haotian Xiang, Bingcong Li, Qin Lu

机构 * School of Electrical and Computer Engineering, University of Georgia(佐治亚大学电气与计算机工程学院) Department of Computer Science, ETH Zurich(苏黎世联邦理工学院计算机科学系)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 本文提出PoLAR-VBLL框架,通过正交化低秩适配器与变分推断结合,实现大规模语言模型的可扩展贝叶斯微调,提升不确定性量化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04863 2026-04-07 cs.CV 50%

Beyond the Global Scores: Fine-Grained Token Grounding as a Robust Detector of LVLM Hallucinations

超越全局评分:细粒度令牌接地作为检测LVLM幻觉的稳健检测器

Tuan Dung Nguyen, Minh Khoi Ho, Qi Chen, Yutong Xie, Nguyen Cam-Tu, Minh Khoi Nguyen, Dang Huy Pham Nguyen, Anton van den Hengel, Johan W. Verjans, Phi Le Nguyen, Vu Minh Hieu Phan

机构 * Hanoi University of Science and Technology(河内科技大学) Australian Institute for Machine Learning, University of Adelaide(澳大利亚机器学习研究所,阿德莱德大学) Nanjing University(南京大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Hanoi-Amsterdam High School for the Gifted(河内阿姆斯特丹天才高中)

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 本文提出细粒度令牌接地方法,通过分析模型层间令牌交互,发现幻觉令牌的扩散注意力模式和语义对齐失败特征,实现90%的幻觉检测准确率。

Comments Accepted at CVPR2026 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 隐私与版权 2 篇

2502.15567 2026-04-07 cs.LG stat.ML 57%

Model Privacy: A Unified Framework for Understanding Model Stealing Attacks and Defenses

模型隐私:理解模型窃取攻击与防御的统一框架

Ganghua Wang, Yuhong Yang, Jie Ding

机构 * University of Minnesota(明尼苏达大学)

专题命中 隐私与版权 :safety(abstract);分类 cs.LG

AI总结 本文提出统一框架'模型隐私',用于分析模型窃取攻击与防御,探讨实用性和隐私间的根本权衡,并通过实验验证防御机制的有效性。

Comments Journal of the Royal Statistical Society Series B: Statistical Methodology, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04905 2026-04-07 cs.CV cs.GR cs.HC 50%

ClickAIXR: On-Device Multimodal Vision-Language Interaction with Real-World Objects in Extended Reality

ClickAIXR: 基于设备的多模态视觉-语言交互与现实世界对象在扩展现实中的交互

Dawar Khan, Alexandre Kouyoumdjian, Xinyu Liu, Omar Mena, Dominik Engel, Ivan Viola

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学)

专题命中 隐私与版权 :trustworthy(abstract)

AI总结 ClickAIXR通过设备端视觉-语言模型与基于控制器的对象选择方法,实现对现实世界对象的精确点击交互,提升隐私和延迟方面的可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 安全评测 42 篇

2505.21605 2026-04-07 cs.LG cs.AI cs.CR 88%

SoSBench: Benchmarking Safety Alignment on Six Scientific Domains

SoSBench:在六个科学领域中对安全对齐进行基准测试

Fengqing Jiang, Fengbo Ma, Zhangchen Xu, Yuetai Li, Zixin Rao, Bhaskar Ramasubramanian, Luyao Niu, Bo Li, Xianyan Chen, Zhen Xiang, Radha Poovendran

机构 * University of Washington(华盛顿大学) University of Georgia(佐治亚大学) WWU(西华盛顿大学) UIUC(伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG

AI总结 SoSBench针对高风险科学领域设计,通过3000个基于真实法规的提示评估大模型的安全性,揭示了先进模型在处理危险场景时存在严重的安全对齐缺陷。

Comments Project Page: https://sosbench.github.io/; ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03962 2026-04-07 cs.CL cs.LG 81%

Predict, Don't React: Value-Based Safety Forecasting for LLM Streaming

预测,而非反应:基于价值的安全预测用于LLM流式处理

Pride Kavumba, Koki Wataoka, Huy H. Nguyen, Jiaxuan Li, Masaya Ohagi

机构 * SB Intuitions Corp.(SB Intuitions 公司) Sakana AI

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出StreamGuard,通过预测未来潜在风险来实现流式处理中的安全监控,提升了输入和输出的 moderation 性能,同时降低了误判率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04849 2026-04-07 cs.CY 79%

Latent Profiles of AI Risk Perception and Their Differential Association with Community Driving Safety Concerns: A Person-Centered Analysis

人工智能风险感知的潜在轮廓及其与社区驾驶安全担忧的差异性关联:一项以人为核心分析

Amir Rafe, Anika Baitullah, Subasish Das

专题命中 安全评测 :safety(title,abstract);分类 cs.CY

AI总结 本文通过以人为核心分析,识别美国成年人中人工智能风险感知的潜在轮廓,并测试这些轮廓与社区驾驶安全担忧的差异性关联,揭示世界观驱动的风险结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04775 2026-04-07 cs.CY 79%

Community Driving-Safety Deterioration as a Push Factor for Public Endorsement of AI Driving Capability

社区驾驶安全性下降作为公众支持自动驾驶能力的推动力

Amir Rafe, Subasish Das

专题命中 安全评测 :safety(title,abstract);分类 cs.CY

AI总结 研究探讨了社区驾驶安全性担忧通过一般化人工智能倾向的中介作用,揭示了驾驶频率对自动驾驶接受度的双重路径影响,发现社区担忧虽促进特定领域AI支持,但抑制了普遍AI热情,总体效应接近零。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04660 2026-04-07 cs.AI 79%

Springdrift: An Auditable Persistent Runtime for LLM Agents with Case-Based Memory, Normative Safety, and Ambient Self-Perception

Springdrift:一种可审计的持久运行时用于LLM代理,具备基于案例的记忆、规范安全性和环境自我感知

Seamus Brady

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 Springdrift通过可审计的执行子系统、基于案例的记忆层和规范安全机制,实现了LLM代理在跨会话任务连续性和环境自我感知方面的突破,展示了无显式指令下的自主诊断能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04155 2026-04-07 cs.LG cs.IT math.IT q-bio.QM stat.ML 79%

The Geometric Alignment Tax: Tokenization vs. Continuous Geometry in Scientific Foundation Models

几何对齐税:令牌化与连续几何在科学基础模型中的对比

Prashant C. Raju

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

AI总结 科学基础模型在预测精度优化中面临连续几何保持问题,研究发现几何对齐税是内在成本,通过连续头替代交叉熵可显著减少几何失真,但编码本存在非单调双关现象,不同架构在连续与离散目标下表现差异显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03976 2026-04-07 cs.AI cs.CE 79%

Quantifying Trust: Financial Risk Management for Trustworthy AI Agents

量化信任:为可信AI代理的金融风险管理

Wenyue Hua, Tianyi Peng, Chi Wang, Ian Kaufman, Bryan Lim, Chandler Fang

机构 * Microsoft Research(微软研究院) Columbia University(哥伦比亚大学) Google DeepMind(谷歌DeepMind) Stanford University(斯坦福大学) t54.ai Virtuals ACP University of California, Santa Barbara(加州大学圣塔芭芭拉分校)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

AI总结 本文提出基于金融风险管理的Agentic Risk Standard框架,通过整合风险评估与补偿机制,将信任从隐含期望转为可衡量的产品保证,提升AI代理在开放环境中的可靠性。

Comments 30 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03622 2026-04-07 cs.SE cs.AI 79%

Toward Executable Repository-Level Code Generation via Environment Alignment

面向环境对齐的仓库级代码生成

Ruwei Pan, Junlei Shen, Linhao Wu, Yueheng Zhu, Zixiong Yang, Yakun Zhang, Lu Zhang, Hongyu Zhang

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出EnvGraph框架,通过环境对齐问题解决仓库级代码生成中的可执行性挑战,实验显示其在功能正确性和非功能质量上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03264 2026-04-07 cs.CV cs.AI cs.CR 79%

SafeScreen: A Safety-First Screening Framework for Personalized Video Retrieval for Vulnerable Users

SafeScreen: 一种以安全优先的个性化视频检索框架用于易受伤害用户的视频筛选

Wenzheng Zhao, Madhava Kalyan Gadiputi, Fengpei Yuan

机构 * Worcester Polytechnic Institute(伍斯特理工学院)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 SafeScreen通过安全优先机制,在确保个性化视频检索的同时满足个体安全约束,采用自动化流程进行视频的连续审批或拒绝,结合个性化安全标准提取、证据驱动评估和LLM决策,实现实时可解释的视频筛选。

Comments 11 pages, 3 figures, 7 tables. Under review for ACM ICMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04772 2026-04-07 math.OC cs.SY eess.SY 78%

Collaborative Altruistic Safety in Coupled Multi-Agent Systems

耦合多智能体系统中的协作利他安全

Brooks A. Butler, Xiao Tan, Aaron D. Ames, Magnus Egerstedt

专题命中 安全评测 :safety(title,abstract)

AI总结 本文提出一种基于协作控制屏障函数的框架,通过协作控制确保动态耦合多智能体系统的安全性,利用哈密顿规则定义利他安全条件,提升系统整体安全性和鲁棒性。

Comments This work is to appear at the 2026 American Control Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04496 2026-04-07 cs.CV 78%

The Indra Representation Hypothesis for Multimodal Alignment

多模态对齐的Indra表示假说

Jianglin Lu, Hailing Wang, Kuo Yang, Yitian Zhang, Simon Jenni, Yun Fu

机构 * Northeastern University(东北大学) Adobe Research(Adobe研究院)

专题命中 安全评测 :alignment(title,abstract)

AI总结 本文提出Indra表示假说,通过范畴论中的V富化Yoneda嵌入,定义样本间关系轮廓,提升多模态对齐的鲁棒性和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏