arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-14 至 2026-07-14 共收录 108 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 26 篇

2509.24653 2026-07-14 cs.LG cs.AI 版本更新 62%

Unveiling the Mechanisms of Multi-Hop Reasoning in Transformers via Identity Bridge

通过身份桥揭示Transformer中多跳推理的机制

Pengxiao Lin, Zheng-An Chen, Zhi-Qin John Xu

机构 * School of Mathematical Sciences, Shanghai Jiao Tong University(上海交通大学数学科学学院) Institute of Natural Sciences, MOE-LSC, Shanghai Jiao Tong University(上海交通大学自然科学研究院) Shanghai Seres Information Technology Co., Ltd, Shanghai 200040, China(上海塞瑞斯信息技术有限公司)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 研究大型语言模型多跳推理中两跳推理诅咒现象,引入身份桥进行最小监督,使单层Transformer能实现分布外两跳泛化,通过理论和实证分析揭示其机制及效果,并扩展到主流LLMs的实际设置。

Comments Accepted by COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11257 2026-07-14 cs.CV cs.LG 新提交 57%

LaGuadia: Language-Guided Adaptive Distillation from Pathology Foundation Models

拉瓜迪亚:基于病理学基础模型的语言引导自适应蒸馏

Gangsu Kim, Won-Ki Jeong

机构 * College of Informatics, Korea University(韩国大学信息学院)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 研究针对病理学基础模型计算成本高问题,提出拉瓜迪亚框架,通过多阶段流程,在临床语言指导下整合多模型知识,进行自适应蒸馏。实验表明其87M参数学生模型性能出色,凸显临床语言对构建高效可靠数字病理系统的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11026 2026-07-14 cs.CL 新提交 57%

Dimensionality in Satisfaction Ratings

满意度评级中的维度

Andrew Hong, Jason Potteiger

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 该研究用大语言模型注释消费品公司对话文本,分解客户服务满意度为多轴,验证注释与客户自评的关系,发现轴间相关性及共线性,指出分解价值在于归因和覆盖,能识别对话数据中细微的客户体验驱动因素。

Comments 25 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10590 2026-07-14 cs.CL 新提交 57%

Demographic Prompting at Scale: When More Attributes Hurt LLM--Human Agreement

大规模人口统计学提示:当更多属性损害大语言模型与人类的一致性时

Mahammed Kamruzzaman, Shrabon Kumar Das, Gene Louis Kim

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 研究人口统计学属性作提示线索对LLM预测与人类注释一致性的影响,通过五个开源LLM在五个任务中实验,发现一致性与属性数量有关,受属性可学习性等因素影响,表明人口统计学提示效用依赖上下文。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10291 2026-07-14 cs.SE cs.AI 新提交 57%

Partial Contracts Suffice: Sound, LLM-Inferred Regression Verification

部分契约就足够了:可靠的、由大语言模型推断的回归验证

Yiannis Charalambous, Rafael Menezes, Youcheng Sun, Lucas C. Cordeiro

机构 * The University of Manchester(曼彻斯特大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 研究软件回归验证难题,提出基于契约的工具,探讨部分契约的充分性,通过强化契约、自动推断等方法,实现可靠验证,在多方面取得良好效果,证明安全保留条件等价性。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10165 2026-07-14 cs.CV cs.AI 新提交 57%

EmoStyle: Affective Conditioning of Style-Specialist Experts for Emotional Image Generation

EmoStyle:用于情感图像生成的风格专家情感调节

Dexiang Hong, Yijie Guo, Weidong Chen, Xinyan Liu, Zixuan Zou, Zhendong Mao, Yongdong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 针对情感感知艺术图像生成中训练与测试时属性不一致造成的控制差距问题,提出EmoStyle框架,利用语言模型推理器预测情感线索,编码情感字段指导生成,训练专用LoRA适配器结合风格表达情感,经视觉语言模型引导排序,在挑战赛中获佳绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10074 2026-07-14 cs.LG 新提交 57%

Distance-Preserving Embeddings in Inhomogeneous Random Graphs

非均匀随机图中的距离保持嵌入

My Le, Luana Ruiz, Souvik Dhara

机构 * Johns Hopkins University(约翰斯·霍普金斯大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 研究非均匀随机图中距离保持嵌入,基于地标嵌入分析最短路径近似,扩展失真保证到全局平均并统一分析,引入GNN增强变体,使模型能从小图学习并推广到大型真实网络,保持或超越经典嵌入保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09674 2026-07-14 cs.CY 新提交 57%

From Tools to Teacher-Built Teammates: No-Code Pedagogical Plugin Authoring with LearnAdapt Agentic Studio and PedOS 1.1 Lumina

从工具到教师构建的队友:使用LearnAdapt智能工作室和PedOS 1.1 Lumina进行无代码教学插件创作

Nizam Kadir

专题命中 其他安全 :safety(abstract);分类 cs.CY

AI总结 该研究针对教师和研究人员难以定制教育AI的问题,介绍了基于PedOS 1.1 Lumina的LearnAdapt智能工作室,它能让非编码人员用英语描述学习交互,完成插件创作、安全检查等,展示了从提示到证据捕获的完整生命周期,实现从固定工具到教师构建队友的转变。

Comments 3 pages, 1 figure, Accepted into the 27th International Conference on Artificial Intelligence in Education Interactive Events Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00756 2026-07-14 cond-mat.mtrl-sci cs.LG 57%

A New Workflow for Materials Discovery Bridging the Gap Between Experimental Databases and Graph Neural Networks

一种新的工作流程用于材料发现,弥合实验数据库与图神经网络之间的差距

Brandon Schoener, Yuting Hu, Pasit Wanlapha, Akshay Rengarajan, Ian Moog, Michael Wang, Peihong Zhang, Jinjun Xiong, Hao Zeng

机构 * Department of Physics, University at Buffalo, State University of New York, Buffalo, NY Department of Computer Science \& Engineering, University at Buffalo, State University of New York, Buffalo, NY Institute for Artificial Intelligence Data Science, University at Buffalo, State University of New York, Buffalo, NY

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出了一种新的工作流程,通过将实验数据库与晶体学信息文件对齐,弥补了实验数据与图神经网络之间的差距,提升了材料属性预测的准确性和效率。

Comments 8 pages, 3 figures, 1 table, submitted to Journal of Magnetism and Magnetic Materials

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06896 2026-07-14 eess.AS cs.CL 版本更新 57%

TagSpeech: End-to-End Multi-Speaker ASR and Diarization with Fine-Grained Temporal Grounding

TagSpeech:基于细粒度时间定位的端到端多说话人自动语音识别与说话人分离

Mingyue Huo, Yiwen Shao, Yuheng Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Johns Hopkins University(约翰霍普金斯大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 研究提出TagSpeech框架,利用时间锚点定位技术联合多说话人ASR与说话人分离。通过关键设计解决细粒度对齐挑战,端到端建模“谁在何时说了什么”。实验显示其在DER上优于基线,采用参数高效训练范式,低计算成本获强性能。

Comments Accepted to ACL2026 Main Oral; v2: added overlap analysis in Section 5.2

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11196 2026-07-14 cs.CV 新提交 50%

Slot-RAE: Streamlining Object-Centric Learning via Direct Representation Auto-Encoders

Slot-RAE:通过直接表示自动编码器简化以对象为中心的学习

Alexandre Chapin, Emmanuel Dellandrea, Liming Chen

机构 * LIRIS(里昂图像与信息系统实验室) Ecole Centrale de Lyon(里昂中央理工学院)

专题命中 其他安全 :alignment(abstract)

AI总结 研究针对以对象为中心的模型部署问题,提出Slot-RAE框架,直接在视觉基础模型特征空间运行,采用特征空间扩散过程及独特训练方式,在COCO数据集实验中取得领先成果,实现高效无监督对象发现等,速度和计算效率更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11106 2026-07-14 cs.CV 新提交 50%

Beyond the Eye: Efficient Multimodal Reasoning via Self-Regulated Implicit Visual Tools

超越视觉:通过自我调节的隐式视觉工具实现高效多模态推理

Xiuwei Chen, Quanlin Chen, Wentao Hu, Zisheng Chen, Kun Xiang, Zehua Ma, Mingyang Zhang, Jianhua Han, Hanhui Li, Hang Xu, Xiaodan Liang

机构 * Sun Yat-sen University(中山大学) The Hong Kong Polytechnic University(香港理工大学) Yinwang Intelligent Technology Co., Ltd.(银望智能科技有限公司)

专题命中 其他安全 :alignment(abstract)

AI总结 研究针对多模态大语言模型推理效率问题,提出超越视觉(BEE)的隐式视觉工具范式,通过将视觉工具调用行为纳入训练目标,经两阶段训练,包括形式化思维链监督微调与自我调节奖励驱动对齐,提升了模型在细粒度视觉感知任务中的性能和推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10986 2026-07-14 eess.SY cs.SY 新提交 50%

Capture, Shield, or Neutralize: Engagement-Aware Pursuit-Evasion

捕获、防护或中和:基于交战感知的追逃

Ananya Acharya, Trenton Goyette, Masoud Ataei, Adrian Stoica, Vikas Dhiman, Mohammad Javad Khojasteh

专题命中 其他安全 :safety(abstract)

AI总结 研究多智能体对抗环境下的追逃问题,提出分层控制架构,将战略规划与安全保证解耦。通过零和滚动时域博弈及MPC求解,利用横向速度惩罚和CBF保证安全。模拟实验表明该框架能灵活切换策略,不同规则下性能稳健且控制逻辑不变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10953 2026-07-14 cs.CV 新提交 50%

Learning Anatomy-Grounded CT Vision-Language Representations with Organ-Hierarchical Report Knowledge

利用器官分层报告知识学习基于解剖学的CT视觉语言表征

Guoliang You, Hongming Li, Yuanwang Zhang, Yong Fan

机构 * Department of Radiology, Perelman School of Medicine, University of Pennsylvania(放射科,佩尔曼医学院,宾夕法尼亚大学)

专题命中 其他安全 :alignment(abstract)

AI总结 研究利用CT图像与放射学报告进行医学视觉语言预训练,提出OKA-CT框架,通过转化报告为器官条件知识,分阶段学习,在数据集上实现零样本异常诊断高AUROC,优于基线,提升报告-图像对齐。

Comments 9 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10851 2026-07-14 cs.CV 新提交 50%

Learning To Focus: Anatomy-Guided Attention Regularization for Medical Image Classification

学习聚焦:用于医学图像分类的解剖学引导注意力正则化

Tonmoy Hossain, Atiqur Rahman, Farhana Hossain Swarnali, Miaomiao Zhang

机构 * University of Virginia(弗吉尼亚大学) Ahsanullah University of Science and Technology(阿山努拉科技大学) University of Utah(犹他大学)

专题命中 其他安全 :alignment(abstract)

AI总结 针对医学图像分类中标准分类损失缺乏空间监督的问题,提出Locus框架,利用预训练分割基础模型引导分类器关注诊断相关解剖结构,引入正则化项平衡注意力,在多数据集上验证,提升了分类性能和解剖学注意力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10598 2026-07-14 cs.CV 新提交 50%

Anomalous Frame Detection by Grouping Frame Similarities between Two Videos Computed by Vision-Language Model to Extract Expert Workers' Unique Actions

通过对视觉语言模型计算的两个视频之间的帧相似性进行分组来检测异常帧,以提取专家工人的独特动作

Ryo Sakai, Yongpeng Cao, Nobutaka Kimura

专题命中 其他安全 :safety(abstract)

AI总结 针对熟练维护工人减少的问题,提出通过比较两个视频帧相似性检测异常帧来提取专家独特动作的方法,在模拟实验中对特定动作类型提取率达66.9%,比传统技术提高50个百分点,有助于技能转移和劳动力发展。

Comments 11 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10205 2026-07-14 math.OC 新提交 50%

Exploiting Structure with Anisotropic Consensus-Based Optimization

基于各向异性共识的优化方法利用结构

Sabrina Bonandin, Konstantin Riedl, Sara Veneruso

专题命中 其他安全 :alignment(abstract)

AI总结 研究基于各向异性共识的优化方法(CBO),该方法能利用高维目标函数可加分离结构减轻维度诅咒。证明其计算复杂度仅指数依赖内在维度\(\mathbf{d}\),数值实验验证理论结果,突出相关因素对算法性能和复杂度的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12721 2026-07-14 cs.CR 版本更新 50%

Robust hardware Trojan detection leveraging dual-domain features and stacked ensemble learning

利用双域特征和堆叠集成学习进行鲁棒的硬件木马检测

Sefatun-Noor Puspa, Abyad Enan, Reek Majumdar, M Sabbir Salek, Gurcan Comert, Mashrur Chowdhury

专题命中 其他安全 :safety(abstract)

AI总结 研究硬件木马检测问题,核心方法是结合时域和频域特征,评估六种人工智能模型并通过堆叠集成分类器集成,主要贡献是提出的框架能准确鲁棒检测硬件木马,无需可信参考IC,宏平均ROC-AUC达0.987。

Comments This version supersedes the original arXiv submission and reflects the peer-reviewed journal publication under a new title, 21 pages, 10 figures. Revised and peer-reviewed version. Published in Cybersecurity. Previously posted under the title "An AI-Enabled Side Channel Power Analysis Based Hardware Trojan Detection Method for Securing the Integrated Circuits in Cyber-Physical Systems"

Journal ref Cybersecurity, Vol. 9, Article 111 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏