arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-25 至 2026-06-25 共收录 9 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 9 篇

2606.25821 2026-06-25 cs.CL cs.AI 新提交 81%

SARA: Unlocking Multilingual Knowledge in Mixture-of-Experts via Semantically Anchored Routing Alignment

SARA: 通过语义锚定路由对齐解锁混合专家模型中的多语言知识

Tianyu Dong, Yangyang Liu, Jiang Zhou, Xinwei Wu, Xiaohu Zhao, Hao Wang, Heng Liu, Linlong Xu, Longyue Wang, Weihua Luo, Shaolin Zhu, Deyi Xiong

机构 * TJUNLP Lab, School of Computer Science and Technology, Tianjin University, China(天津大学计算机科学与技术学院TJUNLP实验室) Alibaba Group, China(阿里巴巴集团)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 针对低资源语言在稀疏MoE架构中路由不一致的问题,提出SARA框架,利用对称JS散度约束对齐多语言输入与高资源语义锚点的路由分布,提升低资源语言性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25073 2026-06-25 cs.LG cs.AI cs.MA 新提交 62%

GCT-MARL: Graph-Based Contrastive Transfer for Sample-Efficient Cooperative Multi-Agent Reinforcement Learning

GCT-MARL: 基于图对比迁移的样本高效合作多智能体强化学习

Animesh Animesh, Satheesh K Perepu, Kaushik Dey

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出GCT-MARL框架,利用多视图图对比学习和自适应加权对齐损失,结合两阶段训练协议,实现跨不同规模和组成群体的高效迁移,显著加速目标任务收敛。

Comments Accepted at The Continual RL Workshop, RLC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25705 2026-06-25 cs.AI 新提交 57%

GUI agent: Guided Exploration of User-Sensitive Screens

GUI代理:用户敏感屏幕的引导探索

Aradhana Nayak, Mussadiq Nazeer, Wang Peng, Feng Liu

机构 * Huawei Heisenberg Research Center (Munich)(华为海森堡研究中心(慕尼黑)) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 提出一种探索代理,通过系统性地探索查询空间,识别在GUI环境中执行后会导致用户敏感状态的查询,以提升LLM代理的安全性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25657 2026-06-25 cs.CV cs.AI 新提交 57%

Steering Vision-Language Models with Joint Sparse Autoencoders

用联合稀疏自编码器引导视觉-语言模型

Huizhen Shu, Xuying Li, Hongxu Lin, Wenjie Sun, Hui Li

机构 * yunshanai(云山AI) HKUST(Guangzhou)(香港科技大学(广州)) Zidongtaichu(紫东太初) University of British Columbia(不列颠哥伦比亚大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 提出联合稀疏自编码器(JSAE),通过显式对齐约束联合分解视觉和语言激活,得到可解释的跨模态特征,并在LLaVA等模型上验证了层依赖的干预效果。

Comments 19pages,10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25714 2026-06-25 eess.SP 50%

CSI-CLIP++: A Scalable Channel Foundation Model for Wireless Communication via CIR-CSI Consistency

CSI-CLIP++: 一种通过CIR-CSI一致性实现可扩展的信道基础模型

Jun Jiang, Wenjun Yu, Yunfan Li, Yuan Gao, Shugong Xu

专题命中 其他安全 :alignment(abstract)

AI总结 提出CSI-CLIP++,通过频域CSI与时延域CIR的对比对齐学习可迁移表示,在信道识别、波束预测和定位任务上优于监督基线,波束预测Top-1准确率提升高达19.31个百分点。

Comments Submitted to IEEE Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25865 2026-06-25 q-bio.BM 新提交 50%

Molexar: A Unified Multimodal Molecular Foundation Model for Drug Design

Molexar:用于药物设计的统一多模态分子基础模型

Haoyu Lin, Yiyan Liao, Jinmei Pan, Xinliao Ling, Luhua Lai, Jianfeng Pei

专题命中 其他安全 :safety(abstract)

AI总结 提出Molexar,一种基于Fragment-SELFIES的统一多模态分子基础模型,通过自回归解码和条件注入实现高效分子生成,在多个任务上达到或超越更大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25588 2026-06-25 cs.SE 新提交 50%

IntentTester: Intent-Driven Multi-agent Framework for Cross-Library Test Migration

IntentTester:面向意图驱动的跨库测试迁移多智能体框架

Yi Gao, Ziyuan Zhang, Xing Hu, Xiaohu Yang, Xin Xia

专题命中 其他安全 :alignment(abstract)

AI总结 提出IntentTester多智能体框架,通过将测试抽象为语言无关的测试描述语言(TDL),结合知识图谱对齐语义实体,并利用LLM推理与迭代验证生成可执行测试,实现跨库跨语言测试迁移,在9个开源项目上生成2776个测试,正确率85%,有效性74%,并发现多处隐藏缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25280 2026-06-25 cs.NE cs.GR cs.MA 新提交 50%

EvoFlock: evolved inverse design of multi-agent motion

EvoFlock:多智能体运动的进化逆向设计

Craig Reynolds

专题命中 其他安全 :alignment(abstract)

AI总结 提出一种基于遗传算法的逆向设计方法,通过用户定义的目标函数自动优化多智能体运动模型的参数,实现期望的群体行为。

Comments To appear in the Proceedings of Artificial Life 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12024 2026-06-25 cs.RO 版本更新 50%

Adaptive-Horizon Conflict-Based Search for Closed-Loop Multi-Agent Path Finding

自适应视界冲突搜索用于闭环多智能体路径规划

Jiarui Li, Federico Pecora, Runyu Zhang, Gioele Zardini

机构 * Laboratory for Information and Decision Systems, Massachusetts Institute of Technology(信息与决策系统实验室,麻省理工学院) Schwarzman College of Computing(施瓦茨曼计算学院)

专题命中 其他安全 :safety(abstract)

AI总结 提出ACCBS算法,通过动态调整规划视界和重用约束树,在有限计算预算下快速生成高质量可行解,兼具渐近最优性和扰动适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏