arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-21 至 2026-07-21 共收录 74 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 6 篇

2607.17946 2026-07-21 cs.LG cs.AI 新提交 85%

A Geometric Perspective on Stabilizing Value Conflict Resolution

稳定价值冲突解决的几何视角

Saket Reddy, Andy Liu

机构 * University of Illinois - Urbana-Champaign(伊利诺伊大学厄巴纳 - 香槟分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 偏好对齐 :RLHF(summary_cn,abstract);alignment(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型在RLHF训练中应对价值冲突的问题,核心方法是利用思维链推理,通过几何视角分析其作用,创建新的以价值冲突为重点的CoT设计,提升了道德推理性能,为改进模型处理复杂价值冲突请求的性能提供新途径。

Comments Accepted to ICML Workshop on High-Dimensional Learning Dynamics

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16263 2026-07-21 cs.LG cs.CE q-bio.QM 新提交 84%

Preference-based Antibody Expression Ranking: Scaling with Large-scale Weak Supervision

基于偏好的抗体表达排序:大规模弱监督下的扩展

Josh Qixuan Sun, Morteza Babaie, Wenyang Hou, Mark Crowley, David Young

专题命中 偏好对齐 :DPO(summary_cn,abstract);alignment(abstract);分类 cs.LG

AI总结 研究针对抗体表达排序中标记数据稀缺问题,提出基于偏好的学习框架,结合定量表达与弱监督,通过改进DPO适用于蛋白质语言模型,在多样数据集上评估,该方法优于基线,为抗体可表达性优化提供可扩展方案。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18091 2026-07-21 cs.CV cs.GR cs.LG 新提交 81%

SciForma: Structure-Faithful Generation of Scientific Diagrams

SciForma:科学图表的结构忠实生成

Yuxuan Luo, Peng Zhang, Xinjie Zhang, Xun Guo, Zhouhui Lian, Yan Lu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机技术研究所) State Key Lab of CAD & CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) Microsoft Research Asia(微软亚洲研究院)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.LG

AI总结 研究针对科学图表结构保真度问题,提出SciForma框架,分解图表质量为三个结构轴,用M-DPO优化,策划训练和评估数据,实现迭代编辑,使SciForma-9B超越开源基线和GPT-Image-1.5,提升科学图表生成的结构保真度。

Comments 30 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18163 2026-07-21 cs.LG cs.AI 新提交 73%

OR Else: A Differentiable Trust Region for Policy Optimization

OR 否则:用于策略优化的可微信赖域

Chinmay Rane, Kanishka Tyagi, Michael Manry

机构 * Quantiphi Inc(昆蒂菲公司) Self Machines Inc(自机器公司) The University of Texas at Arlington(德克萨斯大学阿灵顿分校)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 研究 PPO 和 GRPO 中裁剪代理目标导数突变问题,提出用输出重置(OR)规则优化。通过对比实验,在广义优势估计下 PPO-OR 有更高奖励模型得分,组相对优势下 GRPO-OR 虽平均得分未升但差异更小,OR 改变了优化行为但奖励效果有别。

Comments 22 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16903 2026-07-21 cs.CY cs.AI cs.CL cs.LG 新提交 70%

A Method for Learning Value Systems in Generative AI

一种在生成式人工智能中学习价值系统的方法

Andrés Holgado-Sánchez, Holger Billhardt, Sascha Ossowski

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究生成式人工智能中价值系统学习问题,提出将先前验证的方法用于此场景,基于成对偏好数据同时学习价值基础实现与价值系统表示,算法动态排序,评估显示其性能优、权衡小且可解释性强。

Comments Full version of a to be published paper in proceedings of the 9th AAAI/ACM conference in AI, Ethics and Society (AIES 2026). Includes supplementary material. 20 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16431 2026-07-21 cs.CL 新提交 57%

RIMS: Preference Optimization via Smoothed Multi-pair Aggregation for Small-Scale LLM Retrieval-Augmented Generation

RIMS:通过平滑多对聚合进行偏好优化以实现小规模语言模型检索增强生成

Pei Tian, Zihan Dong, Tianci Liu, Linjun Zhang, Haoyu Wang

机构 * Columbia University(哥伦比亚大学) Rutgers University(罗格斯大学) Purdue University(普渡大学) SUNY Albany(纽约州立大学奥尔巴尼分校)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 研究针对小规模语言模型检索增强生成中对噪声证据敏感的问题,提出RIMS框架,通过合成偏好数据、软聚合机制及偏好优化,实现更好性能,在多基准测试中优于现有方法

Journal ref COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 10 篇

2607.16242 2026-07-21 cs.LG cs.AI cs.CR 新提交 84%

TRACE: Trajectory-Based Safety Patch Learning for LLM Post-Training Realignment

TRACE:基于轨迹的安全补丁学习用于大语言模型训练后调整

Changyue Li, Jiaming He, Youliang Yuan, Jialin Wu, Boxi Yu, Zhicong Huang, Pinjia He

机构 * LERo

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.LG

AI总结 研究针对FTaaS平台削弱模型安全对齐的问题,提出TRACE框架,通过模拟有害轨迹生成损坏状态,优化插件补丁,在保持效用的同时恢复模型安全,在多基准测试和模型上占据安全 - 效用前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16247 2026-07-21 cs.LG cs.CV 新提交 79%

Self-Evolving Just-In-Time Memory for Proactive Embodied Safety

用于主动具身安全的自进化即时记忆

Bingrui Sima, Lizhong Wang, Xiaoya Lu, Kun He, Xiao Yang

机构 * Huazhong University of Science and Technology(华中科技大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 研究视觉语言模型在闭环交互中应对动态危险的问题,提出自进化即时记忆框架,含RSG、事实记忆和经验记忆,并通过自动测试-验证-写入循环完善元技能,实验证明该框架大幅提升安全成功率且不阻碍任务进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17780 2026-07-21 cs.PL cs.AI cs.LG cs.MA 新提交 62%

ETAS: An Effect-Typed Language for Agent Systems

ETAS:一种用于智能体系统的效果类型化语言

Huiri Tan, Yikun Wang, Puyang Zhang, Shangyu Li, Jiasi Shen

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究针对智能体系统设计ETAS语言,核心方法是通过规范一致性分配类型并用行为索引跟踪计算,主要贡献是为智能体执行相关推理提供编程语言基础,涵盖授权、非确定性等方面,还实现了该语言并形式化相关性质。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17281 2026-07-21 cs.LG cs.AI 新提交 62%

AIGB-R1: Self-Evolving Generative Auto-Bidding via Hierarchical Planner-Executor Optimization

AIGB-R1:通过分层规划器-执行器优化实现自我进化的生成式自动出价

Yuejia Dou, Hesong Wang, Xinyu Zhang, Tianyu Wang, Zhilin Zhang, Chuan Yu, Jian Xu, Bo Zheng, Qi Qi

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Alibaba Group(阿里巴巴集团)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 研究针对AIGB范式在自动出价中存在的问题,提出AIGB-R1框架,利用大语言模型推理能力,通过分层规划器与执行器模块、经验驱动循环、两阶段训练及新优化方法,经实验验证该框架在自动出价任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17247 2026-07-21 cs.LG cs.AI 新提交 62%

Distilled Reinforcement Learning for LLM Post-training

用于大语言模型训练后处理的蒸馏强化学习

Chen Wang, Zhaochun Li, Jionghao Bai, Yining Zhang, Hexuan Deng, Ge Lan, Yue Wang

机构 * College of Elite Engineers, Nankai University(南开大学精英工程师学院) Zhongguancun Academy(中关村学院) Beijing Institute of Technology(北京理工大学) Zhejiang University(浙江大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Harbin Institute of Technology(哈尔滨工业大学) College of Software, Nankai University(南开大学软件学院)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型训练后处理问题,提出蒸馏强化学习方法,集成教师监督到RL目标,含反向重要性采样等三个组件,能有效转移知识,在家族内和跨家族蒸馏实验中性能大幅优于标准RL和OPD。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18069 2026-07-21 cs.AR cs.LG 新提交 57%

Hardware Mechanisms to Dynamically Throttle AI Performance

动态限制人工智能性能的硬件机制

Haiyue Ma, Lauren Malek, Joseph Forzani, David Wentzlaff

机构 * Princeton University(普林斯顿大学) Princeton University Electrical(普林斯顿大学电子与计算机工程)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 研究在人工智能模型集成到关键系统时缺乏意图控制的问题,提出用微架构旋钮动态控制硬件资源限制AI性能,评估候选旋钮并构建机制,展示其高性能敏感度等优势及多旋钮组合效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17575 2026-07-21 cs.AI 新提交 57%

A Dual-Hypothesis Reasoning Framework for LLM Guardrails

一种用于大语言模型护栏的双假设推理框架

Md Asiful Islam, Mihai Surdeanu

机构 * University of Arizona(亚利桑那大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 该研究提出ARBITER大语言模型护栏框架,采用双假设推理和多组件监督微调方法,用成本效益高的策略生成推理痕迹及基于LoRA微调,性能超现有方法,还能为不安全决策提供解释,在安全审核基准实验中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17225 2026-07-21 cs.SE cs.AI 新提交 57%

Specifying the Delegated-Autonomy Boundary: Requirements Engineering for Agentic AI

指定委托自治边界:智能体人工智能的需求工程

Chetan Arora, Andreas Vogelsang, Abbi Sharma

机构 * Faculty of IT, Monash University(莫纳什大学信息科技学院) University of Duisburg-Essen(杜伊斯堡-埃森大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 研究智能体人工智能系统带来的需求工程问题,提出机构理由记录和智能体委托策略两个互补工件,通过分级建模权限,以医院出院协调智能体和自动代码审查智能体为例阐释框架,解决委托自治边界相关需求工程问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16806 2026-07-21 cs.RO 新提交 50%

Token-Wise Latent Streaming from Slow Reasoners to Fast Planners for Dynamic Vision Language Navigation

用于动态视觉语言导航的从慢速推理器到快速规划器的逐令牌潜在流

Tianshuai Hu, Yangyi Zhong, Zeying Gong, Lingdong Kong, Xiaodong Mei, Guoyang Zhao, Xiaolu Liu, Song Wang, Rong Li, Junwei Liang

机构 * The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学)

专题命中 安全训练 :safety(abstract)

AI总结 针对动态视觉语言导航中语言推理慢与规划需即时的矛盾,提出SPARK-VLN双系统框架,通过三个模块将慢速VLM推理器知识流到快速规划器,引入新基准套件,提高了导航成功率、社会合规性及推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16630 2026-07-21 cs.RO 新提交 50%

AI-Augmented Model Predictive Control for Safe and Adaptive Rendezvous and Proximity Operations

用于安全和自适应交会及接近操作的人工智能增强模型预测控制

Luca Sportelli, Tyler Barr, Cagri Kilic, Di Wu

机构 * Embry–Riddle Aeronautical University(安柏瑞德航空航天大学)

专题命中 安全训练 :safety(abstract)

AI总结 研究多智能体对抗场景下航天器自主交会及接近操作问题,提出结合约束滚动时域MPC与数据驱动监督调整层的框架,经蒙特卡罗模拟评估,该框架相比固定参数MPC有更好性能,为自适应航天器RPO提供模块化、可解释基础。

Comments 34 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 1 篇

2607.17152 2026-07-21 cs.CR cs.CL 新提交 91%

How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions

越狱攻击如何为安全对齐提供信息:以防御者为中心、基于Shapley值的越狱贡献评估

Yukai Zhou, Feiyang Lu, Xiaokai Mao, Jinfei Liu, Wenjie Wang

机构 * ShanghaiTech University(上海科技大学) Zhejiang University(浙江大学)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(title,abstract);alignment(title);分类 cs.CL

AI总结 研究以防御者为中心评估越狱攻击,提出A - MESS框架,通过AttackSHAP估计攻击效用,在不同场景下实验发现攻击成功率排名与防御者效用弱对齐,有限查询能准确估计,直接优化子集安全效用更强,建议将越狱攻击视为安全改进资源。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 2 篇

2607.16199 2026-07-21 cs.AI 新提交 83%

PlanFlip: Attacking Multi-Agent LLM Systems via Planning-Phase Prompt Injection

PlanFlip:通过规划阶段提示注入攻击多智能体大语言模型系统

Yuhang Wang

机构 * Fudan University(复旦大学)

专题命中 提示注入 :prompt injection(title,abstract);alignment(abstract);分类 cs.AI

AI总结 研究针对多智能体大语言模型系统规划阶段的攻击,提出PlanFlip框架包含四种攻击,通过对九个模型的3479次测试发现能力放大漏洞、同类管道盲点及推理增强模型的抗性等结果,并提出检测方法,强调异构模型多样性对系统安全的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17535 2026-07-21 cs.CR cs.CL 新提交 57%

Salience Induction against Multi-Hop RAG Agents: Threat and Defense

针对多跳检索增强生成智能体的显著性诱导:威胁与防御

Xingfu Zhou, Pengfei Wang, Yuan Zhou, Wei Xie, Xu Zhou

机构 * National University of Defense Technology(国防科技大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL

AI总结 研究多跳检索增强生成智能体面临的新攻击面——显著性通道,提出显著性诱导方法并定义操作符类,构建管道,引入基准。通过实验评估多种模型和架构,展示该方法有效性,强调智能体RAG需防御显著性 - 相关性解耦。

Comments 18 pages, 4 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 8 篇

2607.18086 2026-07-21 cs.AI 新提交 79%

Judge-dependent safety gains and model-specific helpfulness costs of evidence-sufficiency prompting in clinical LLMs

临床大语言模型中证据充分性提示的依赖判断的安全增益和特定模型的有用性成本

Koyar Afrasyab

专题命中 幻觉与事实性 :safety(title,abstract);分类 cs.AI

AI总结 研究临床大语言模型中证据充分性提示的安全增益及有用性成本,通过在公共数据基准中让四个模型用标准提示和包装器回答问题,发现安全增益有方向和幅度差异且依赖评判者,同时存在模型特定的有用性成本。

Comments https://github.com/KAVentures/clinical-evidence-sufficiency-llm

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16412 2026-07-21 cs.AI 新提交 79%

Interactive Task Alignment as a POMDP

作为部分可观测马尔可夫决策过程的交互式任务对齐

Andy Dai, Zexue He, Zhenyu Zhang, Alex Pentland, Jiaxin Pei

机构 * Stanford University(斯坦福大学)

专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.AI

AI总结 研究语言模型在面对模糊用户任务时的任务对齐问题,引入基于部分可观测马尔可夫决策过程的框架,通过用户研究验证,发现模型任务对齐困难,训练能改善但仍落后于人类,揭示其缺乏关键交互能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16591 2026-07-21 cs.LG cs.AI 新提交 79%

Learning from World Feedback: Why Model Uncertainty Fails as a Risk Signal in Model-Based RL

从世界反馈中学习:为何模型不确定性在基于模型的强化学习中无法作为风险信号

Zhaohui Wang

专题命中 幻觉与事实性 :alignment(abstract);RLHF(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨 RLxF 中学习信号应源于世界反馈,在安全模型控制中实例化并提炼原则。通过实验表明基于动力学的不确定性惩罚会增加碰撞率,用世界反馈信号可降低碰撞率,提取原则并指出其适用于多种相关方法。

Comments Accepted at the ICML 2026 Workshop on Reinforcement Learning from X Feedback (RLxF). 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17883 2026-07-21 cs.CL cs.AI 新提交 76%

Zero Hallucination, by Construction: Hallucination-Aware Layered Oversight for Trustworthy Enterprise AI

通过构建实现零幻觉:用于可信企业人工智能的幻觉感知分层监督

Bogdan Raduta, Horia Velicu, Alexandru Preda, Serban Chiricescu

专题命中 幻觉与事实性 :trustworthy(title);分类 cs.CL、cs.AI

AI总结 研究企业AI因幻觉难以被信任的问题时,提出HALO架构,通过六层防御将幻觉视为可控制故障模式,详细介绍各层并关注基于证据的置信度,以实现可信企业AI,在索赔提取工作负载上进行了架构说明。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17758 2026-07-21 cs.LG 新提交 57%

Towards Reliable Zero-Shot Crowd Forecasting: Evaluating Time Series Foundation Models for Special Event Pedestrian Forecasting

迈向可靠的零样本人群预测:评估用于特殊活动行人预测的时间序列基础模型

Ziteng Li, Yanan Xin, Tina Comes, Serge Hoogendoorn

机构 * Delft University of Technology (TU Delft)(代尔夫特理工大学) German Aerospace Center (DLR)(德国航空航天中心)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 研究特殊活动行人预测问题,采用预训练时间序列基础模型进行零样本概率预测,以SAIL2025事件为案例评估两个模型,为人群管理者明确零样本预测可靠的时机,助力特殊活动人群管理的运营决策。

Comments 9 pages, 7 figures, 5 tables. Accepted for presentation at IEEE ITSC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16597 2026-07-21 cs.AI math.OC math.PR 新提交 57%

FST.ai 2.5: Explainable and Uncertainty-Aware AI for Olympic and Para-Taekwondo Decision Support, Athlete Digital Twins, and Federation-Scale Analytics

FST.ai 2.5:用于奥运会和跆拳道决策支持、运动员数字孪生及联合会规模分析的可解释且具有不确定性感知的人工智能

Keivan Shariatmadar, Ahmad Osman, Ramin Rey

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI

AI总结 针对精英运动数字化中现有方案零散问题,提出FST.ai 2.5框架,通过整合多源数据,实现战术诊断、运动员监测等功能,其原型部署可行,方法广泛适用于搏击等体育环境中的可解释AI、数字孪生及可靠决策支持。

Comments 14 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16580 2026-07-21 stat.AP cs.CE cs.SE 新提交 50%

Automating structural reliability analysis with a multi-agent large language model framework

使用多智能体大语言模型框架实现结构可靠性分析自动化

Jaehwan Jeon, Chang Hee Lee, Taeyong Kim

专题命中 幻觉与事实性 :safety(abstract)

AI总结 研究提出多智能体大语言模型框架,通过专门智能体处理结构可靠性分析流程,用QLoRA微调方法规划器,由确定性求解器计算结果,降低专业知识壁垒,保持计算可信度,实现结构可靠性分析自动化。

Comments 41 pages, 10 figures. Submitted to Automation in Construction

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16841 2026-07-21 cs.CV cs.MM 新提交 50%

Look Clearly Before Answering: Mitigating Hallucinations in LVLMs via Saliency-Driven Perceptual Realignment

回答前看清楚:通过显著性驱动的感知重新对齐减轻LVLMs中的幻觉

Pengxu Chen, Yao Zhu, Guangming Zhu, Jun Sheng, Jincai Huang, Xiangyang Ji, Liang Zhang

机构 * Xidian University(西安电子科技大学) Tsinghua University(清华大学) Shanghai Road Transport Development Center(上海市道路运输发展中心) Hunan Institute of Advanced Technology(湖南先进技术研究院)

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 研究针对LVLMs易产生幻觉问题,提出无需训练的SDPR框架,通过显著性驱动注意力重新分配、缓存对齐及先验约束对比解码,整体对齐视觉意识,在多基准测试中优于现有方法,无需额外训练且开销小。

Comments Accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 隐私与版权 4 篇

2607.16227 2026-07-21 cs.LG cs.CR 新提交 70%

LLM Unlearning for Cyber Defense: A Survey on Methods, Challenges, and Emerging Threats

用于网络防御的大语言模型遗忘:方法、挑战及新出现威胁的综述

Ruppikha Sree Shankar, Abhishek Bhardwaj, Arnav Doshi, Anusri Nagarajan, Troy Paulus Asia, Saptarshi Sengupta

机构 * Manipal Institute of Technology, Manipal Academy of Higher Education(马尼帕尔理工学院,马尼帕尔高等教育学院) San José State University(圣何塞州立大学)

专题命中 隐私与版权 :safety(abstract);jailbreak(abstract);分类 cs.LG

AI总结 综述聚焦于网络防御中LLM遗忘问题,探讨其面临风险,核心问题是现有方法能否真的去除知识。主要关注基于梯度的方法,因其与现有训练管道兼容且可扩展,从多方面审视LLM遗忘,为解决相关问题提供参考。

Comments 42 pages, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16660 2026-07-21 cs.SE cs.AI cs.CR cs.IR cs.LG 新提交 62%

How Do You Choose Your AI Component? An Interview Study of Secure AI Integration in Practice

你如何选择人工智能组件?关于安全人工智能集成实践的访谈研究

Mahzabin Tamanna, Elizabeth Lin, Sparsha Gowda, Laurie Williams, Dominik Wermke

机构 * North Carolina State University(北卡罗来纳州立大学)

专题命中 隐私与版权 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究通过访谈了解从业者选择和集成人工智能组件的决策及安全考量,发现其选模型多受功能标准驱动,安全常被忽视,集成过程缺安全关注,行业重蹈早期软件依赖管理覆辙,为此给出相关建议倡导安全设计方法。

Comments 18 pages, 3 figures/tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18064 2026-07-21 cs.SE cs.AI 新提交 57%

Autoresearch with Coding Agents: Generalizers and Metric-Maximizers on Quran Recitation Data

使用编码智能体进行自动研究:古兰经诵读数据上的泛化器和指标最大化器

Nursultan Askarbekuly, Mohamad Al Mdfaa, Ahmed Helaly, Gonzalo Ferrer, Manuel Mazzara

机构 * Innopolis University(因诺波利斯大学) Skolkovo Institute of Science and Technology(斯克尔科沃科学与技术研究所)

专题命中 隐私与版权 :alignment(abstract);分类 cs.AI

AI总结 研究在古兰经诵读数据任务中智能体自动研究模式,Claude Code和OpenAI Codex从同一起点出发,先发明相同算法后有分歧,添加测试集后情况变化,还提炼出评估自主智能体的五条设计规则,智能体解决方案超越手工管道。

详情

展开后加载摘要…

URL PDF HTML 收藏