arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-16 至 2026-04-16 共收录 70 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 6 篇

2604.13079 2026-04-16 cs.CY cs.AI cs.GT cs.LG 87%

Alignment as Institutional Design: From Behavioral Correction to Transaction Structure in Intelligent Systems

对齐作为制度设计:从行为修正到智能系统中的交易结构

Rui Chai

机构 * Shanghai Sanda University(上海沙达大学)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract,abstract_cn);分类 cs.AI、cs.CY、cs.LG

AI总结 本文提出将AI对齐视为制度设计,通过内部交易结构使对齐行为成为各组件的低成本策略,将对齐问题转化为政治经济学问题。

Comments This is Paper 5 in a 10-paper series on Super-Alignment via Wuxing Institutional Architecture. It shifts alignment from external behavioral correction to internal institutional design, making aligned behavior the lowest-cost equilibrium

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13828 2026-04-16 cs.CL 79%

MUSE: Multi-Domain Chinese User Simulation via Self-Evolving Profiles and Rubric-Guided Alignment

MUSE:通过自演化档案和评分引导对齐实现多领域中文用户模拟

Zihao Liu, Hantao Zhou, Jiguo Li, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He, Peng Wang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Meituan(美团)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

AI总结 MUSE通过自演化档案和评分引导对齐,生成逼真且行为一致的中文用户响应,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13551 2026-04-16 cs.CL cs.IR 79%

Debate to Align: Reliable Entity Alignment through Two-Stage Multi-Agent Debate

辩论以对齐:通过双阶段多智能体辩论实现可靠的实体对齐

Cunda Wang, Ziying Ma, Po Hu, Weihua Wang, Feilong Bao

机构 * Hubei Provincial Key Laboratory of Artificial Intelligence and Smart Learning, Central China Normal University, Wuhan, China(湖北人工智能与智能学习省级重点实验室,中央财经大学,武汉,中国) School of Computer Science, Central China Normal University, Wuhan, China(中央财经大学计算机科学学院,武汉,中国) National Language Resources Monitoring and Research Center for Network Media, Central China Normal University, Wuhan, China(网络媒体语言资源监测与研究中心,中央财经大学,武汉,中国) College of Computer Science, Inner Mongolia University, Hohhot, China(内蒙古大学计算机学院,呼和浩特,中国) National and Local Joint Engineering Research Center of Intelligent Information Processing Technology for Mongolian, Inner Mongolia University, Hohhot, China(蒙古语智能信息处理技术国家与地方联合工程研究中心,内蒙古大学,呼和浩特,中国) Inner Mongolia Key Laboratory of Multilingual Artificial Intelligence Technology, Inner Mongolia University, Hohhot, China(内蒙古多语言人工智能技术重点实验室,内蒙古大学,呼和浩特,中国)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

AI总结 本文提出AgentEA框架,通过双阶段多角色辩论机制提升实体对齐的可靠性,实验表明其在跨语言、稀疏、大规模和异构场景下均有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13602 2026-04-16 cs.LG 77%

Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges

大模型时代的奖励黑客:机制、涌现偏差、挑战

Xiaohua Wang, Muzhao Tian, Yuqi Zeng, Zisu Huang, Jiakang Yuan, Bowen Chen, Jingwen Xu, Mingbo Zhou, Wenhao Liu, Muling Wu, Zhengkang Guo, Qi Qian, Yifei Wang, Feiran Zhang, Ruicheng Yin, Shihan Dou, Changze Lv, Tao Chen, Kaitao Song, Xu Tan, Tao Gui, Xiaoqing Zheng, Xuanjing Huang

机构 * Fudan NLP Group(复旦大学NLP小组)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.LG

AI总结 本文探讨大模型中奖励黑客的机制与挑战,提出代理压缩假说框架,分析优化过程中的表现偏差和对抗性行为,提出检测与缓解策略。

Comments 42 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08046 2026-04-16 cs.CL 70%

Guaranteeing Knowledge Integration with Joint Decoding for Retrieval-Augmented Generation

通过联合解码实现知识整合的检索增强生成

Zhengyi Zhao, Shubo Zhang, Zezhong Wang, Yuxi Zhang, Huimin Wang, Yutian Zhao, Yefeng Zheng, Binyang Li, Kam-Fai Wong, Xian Wu

机构 * The Chinese University of Hong Kong(香港中文大学) University of International Relations(国际关系大学) Tencent Jarvis Lab(腾讯Jarvis实验室) Westlake University(西湖大学) Ministry of Education Key Laboratory of High Confidence Software Technologies, CUHK(教育部高可信软件技术重点实验室,香港中文大学)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出GuarantRAG框架,通过分离推理与证据整合,提升检索增强生成的准确性和事实性,实验显示在五个问答基准上准确率提升12.1%,幻觉减少16.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13598 2026-04-16 cs.LG stat.ME 57%

Enhancing Reinforcement Learning for Radiology Report Generation with Evidence-aware Rewards and Self-correcting Preference Learning

通过证据感知奖励和自校正偏好学习增强放射科报告生成

Qin Zhou, Guoyan Liang, Qianyi Yang, Jingyuan Chen, Sai Wu, Chang Yao, Zhe Wang

机构 * Department of Computer Science and Engineering, ECUST(电子科技大学计算机科学与工程系) Key Laboratory of Smart Manufacturing in Energy Chemical Process, Ministry of Education, P. R. China(教育部能源化工过程智能制造重点实验室) Zhejiang University(浙江大学) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

AI总结 本文提出ESC-RL方法,结合证据感知对齐奖励和自校正偏好学习,提升放射科报告生成的临床准确性与持续改进能力,实验表明其在胸部X光数据集上表现优异。

Comments 13 pages,4 figures, ACL2026-main

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 10 篇

2603.08486 2026-04-16 cs.CV cs.AI 88%

Visual Self-Fulfilling Alignment: Shaping Safety-Oriented Personas via Threat-Related Images

视觉自我实现对齐:通过威胁相关图像塑造安全导向的人设

Qishun Yang, Shu Yang, Lijie Hu, Di Wang

机构 * King Abdullah University of Science and Technology(国王阿卜杜勒·阿齐兹大学科学与技术学院) Provable Responsible AI and Data Analytics Lab(可证责任AI与数据分析实验室) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) China University of Petroleum-Beijing at Karamay(北京石油大学克拉玛依校区)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

AI总结 本文提出视觉自我实现对齐方法,通过威胁相关图像训练视觉语言模型,塑造安全导向的人设,减少攻击成功率并提升响应质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13128 2026-04-16 cs.MA cs.LG cs.RO cs.SY eess.SY 70%

Learning Probabilistic Responsibility Allocations for Multi-Agent Interactions

多智能体交互中的概率责任分配学习

Isaac Remy, Caleb Chang, Karen Leung

机构 * University of Washington, Department of Aeronautics and Astronautics(华盛顿大学航空航天系) NVIDIA

专题命中 安全训练 :safety(abstract);trustworthy(abstract);分类 cs.LG

AI总结 本文提出一种学习多智能体交互中概率责任分配模型的方法,通过条件变分自动编码器的潜在空间和多智能体轨迹预测技术,实现基于场景和智能体上下文的责任分配分布学习,展示了在INTERACTION驾驶数据集上的强预测性能和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14142 2026-04-16 cs.LG cs.AI cs.CL 67%

From $P(y|x)$ to $P(y)$: Investigating Reinforcement Learning in Pre-train Space

从P(y|x)到P(y):在预训练空间中研究强化学习

Yuqiao Tan, Minzheng Wang, Bo Liu, Zichen Liu, Tian Liang, Shizhu He, Jun Zhao, Kang Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) National University of Singapore(新加坡国立大学) Tencent AI Lab(腾讯AI实验室)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出PreRL和DSRL方法,通过优化预训练空间中的边际分布P(y),提升LLM推理能力,并通过NSR机制增强推理效果,实验表明DSRL在推理任务中表现优异。

Comments Preprint. Our code is available at https://github.com/Trae1ounG/Pretrain_Space_RLVR

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13016 2026-04-16 cs.LG cs.AI cs.CL 67%

Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe

重新思考大型语言模型的在线策略蒸馏:现象、机制和配方

Yaxuan Li, Yuxin Zuo, Bingxiang He, Jinqian Zhang, Chaojun Xiao, Cheng Qian, Tianyu Yu, Huan-ang Gao, Wenkai Yang, Zhiyuan Liu, Ning Ding

机构 * Tsinghua University(清华大学) ShanghaiTech University(上海交通大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Renmin University of China(中国人民大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文系统研究了在线策略蒸馏的动态和机制,发现成功关键在于师生思维模式兼容及教师提供新能力,提出两种恢复失败蒸馏的策略,并指出密集奖励的表面优势背后存在代价。

Comments 30 pages, 23 figures. Code: https://github.com/thunlp/OPD

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13609 2026-04-16 cs.LG cs.AI 62%

Golden Handcuffs make safer AI agents

黄金手铐使AI代理更安全

Aram Ebtekar, Michael K. Cohen

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了一种贝叶斯缓解方法,通过扩展代理的主观奖励范围以包含大负值,从而在一般环境中提高安全性。设计了一种简单的覆盖机制,当预测值低于固定阈值时,将控制权交给安全导师。证明了该代理在能力与安全方面的双重属性。

Comments 26 pages, preliminary version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13757 2026-04-16 cs.AI cs.HC 57%

Rethinking AI Hardware: A Three-Layer Cognitive Architecture for Autonomous Agents

重新思考人工智能硬件:一种三层认知架构用于自主代理

Li Chen

机构 * LI CHEN(李晨)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出Tri-Spirit架构,通过分解智能为规划、推理和执行三层,提升自主系统效率,实验显示任务延迟和能耗降低显著。

Comments A system architecture paper with simulation-based evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13801 2026-04-16 cs.IR 50%

DUET: Joint Exploration of User Item Profiles in Recommendation System

DUET:推荐系统中用户和物品轮廓的联合探索

Yue Chen, Yifei Sun, Lu Wang, Fangkai Yang, Pu Zhao, Minjie Hong, Yifei Dong, Minghua He, Nan Hu, Jianjin Zhang, Zhiwei Dai, Yuefeng Zhan, Weihao Han, Hao Sun, Qingwei Lin, Weiwei Deng, Feng Sun, Qi Zhang, Saravan Rajmohan, Dongmei Zhang

专题命中 安全训练 :alignment(abstract)

AI总结 本文提出DUET,一种基于用户历史和物品证据的交互感知轮廓生成器,通过三阶段流程实现用户和物品轮廓的联合生成与优化,实验表明其在推荐任务中优于现有基线方法。

Comments 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13292 2026-04-16 cs.CV 50%

See&Say: Vision Language Guided Safe Zone Detection for Autonomous Package Delivery Drones

See&Say:基于视觉语言的自主配送无人机安全区域检测

Mahyar Ghazanfari, Peng Wei

机构 * George Washington University(乔治·华盛顿大学)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出See&Say框架,结合几何安全提示与语义感知,利用视觉语言模型实现迭代优化,提升无人机配送中安全区域检测的可靠性与动态适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13245 2026-04-16 cs.RO cs.SY eess.SY 50%

Capability-Aware Heterogeneous Control Barrier Functions for Decentralized Multi-Robot Safe Navigation

具备能力的异构控制屏障函数用于去中心化多机器人安全导航

Joonkyung Kim, Yanze Zhang, Wenhao Luo, Yiwei Lyu

机构 * Department of Computer Science and Engineering, Texas A&M University(德克萨斯A&M大学计算机科学与工程系) Department of Computer Science, University of Illinois Chicago(伊利诺伊大学芝加哥分校计算机科学系)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出CA-HCBF框架,通过统一动力学模型和能力度量,实现异构机器人团队的安全一致性和能力感知协调,提升安全性和任务效率。

Comments 8 pages, 3 figures, 2 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13098 2026-04-16 cs.MA cs.CV cs.RO 50%

C$^2$T: Captioning-Structure and LLM-Aligned Common-Sense Reward Learning for Traffic--Vehicle Coordination

C$^2$T:基于图像描述与大语言模型对齐的常识奖励学习用于交通-车辆协调

Yuyang Chen, Kaiyan Zhao, Yiming Wang, Ming Yang, Bin Rao, Zhenning Li

机构 * The State Key Laboratory of Internet of Things for Smart City, University of Macau(物联网智能城市国家重点实验室,澳门大学) Wuhan University(武汉大学) Hong Kong Polytechnic University(香港理工大学) Computer and Information Science, University of Macau(澳门大学计算机与信息科学)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出C2T框架,通过从交通-车辆动态中学习常识协调模型,结合大语言模型的常识知识,提升交通协调系统的效率、安全性和舒适性。

Comments Accepted to CVPR 2026 Findings Track

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 3 篇

2604.12371 2026-04-16 cs.CV 82%

Reading Between the Pixels: Linking Text-Image Embedding Alignment to Typographic Attack Success on Vision-Language Models

在像素之间阅读:将文本-图像嵌入对齐与字体攻击成功性联系起来

Ravikumar Balakrishnan, Sanket Mendapara, Ankit Garg

机构 * Cisco Systems(思科系统)

专题命中 越狱攻击 :alignment(title);safety(abstract);prompt injection(abstract)

AI总结 研究了视觉-语言模型中字体提示注入攻击的影响,发现字体大小、文本攻击有效性及嵌入距离对攻击成功率有显著影响,为防御策略提供实证指导。

Comments Accepted at ICLR 2026 Workshop on Agents in the Wild

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14053 2026-04-16 cs.CL 70%

From Where Words Come: Efficient Regularization of Code Tokenizers Through Source Attribution

词源何处:通过源归属高效正则化代码分词器

Pavel Chizhov, Egor Bogomolov, Ivan P. Yamshchikov

机构 * CAIRO, Technical University of Applied Sciences Würzburg-Schweinfurt(CAIRO应用技术大学(乌尔姆-施维林)) JetBrains Research(JetBrains研究) TU Delft(代尔夫特理工大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL

AI总结 本文通过源归属BPE(SA-BPE)正则化方法,解决代码分词器因训练数据不平衡导致的冗余token问题,提升分词效率与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13308 2026-04-16 cs.CR cs.SY eess.SY 50%

Threat Modeling and Attack Surface Analysis of IoT-Enabled Controlled Environment Agriculture Systems

物联网赋能可控环境农业系统的威胁建模与攻击面分析

Andrii Vakhnovskyi

专题命中 越狱攻击 :safety(abstract)

AI总结 本文首次提出物联网可控环境农业系统的全面威胁模型,识别123种威胁并提出防御框架,揭示AI驱动农业中的新型攻击类别及物理影响。

Comments 11 pages, 1 figure, 5 tables, 48 references

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 2 篇

2512.20405 2026-04-16 cs.CR 75%

ChatGPT: Excellent Paper! Accept It. Editor: Imposter Found! Review Rejected

ChatGPT: 优秀论文!接受它。编辑:冒名顶替者发现!审稿被拒

Kanchon Gharami, Sanjiv Kumar Sarkar, Safayat Bin Hakim, Yongxin Liu, Nahid Farhady Ghalaty, Shafika Showkat Moni

专题命中 提示注入 :safety(abstract);jailbreak(abstract);prompt injection(abstract)

AI总结 本文探讨了LLM在科学论文写作与审稿中的风险,提出通过隐式提示注入技术攻击和防御LLM审稿的漏洞,旨在增强同行评审过程的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04288 2026-04-16 cs.CR cs.SE 50%

LLM-Enabled Open-Source Systems in the Wild: An Empirical Study of Vulnerabilities in GitHub Security Advisories

基于大语言模型的开源系统在现实中的应用:对GitHub安全通告中漏洞的实证研究

Fariha Tanjim Shifat, Hariswar Baburaj, Ce Zhou, Jaydeb Sarker, Mia Mohammad Imran

专题命中 提示注入 :prompt injection(abstract)

AI总结 本研究分析了295份GitHub安全通告,发现大多数漏洞映射到已知CWE,但模型中介暴露不足,建议结合CWE和OWASP视角更全面地评估LLM集成系统的漏洞。

Comments The 2nd International Workshop on Large Language Model Supply Chain Analysis (LLMSC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 6 篇

2604.13101 2026-04-16 cs.SE cs.AI 79%

Building Trust in the Skies: A Knowledge-Grounded LLM-based Framework for Aviation Safety

在天空中建立信任:一种基于知识的LLM框架用于航空安全

Anirudh Iyengar, Alisa Tiselska, Dumindu Samaraweera, Hong Liu

机构 * Senior Member, IEEE(IEEE高级会员) IEEE

专题命中 幻觉与事实性 :safety(title,abstract);分类 cs.AI

AI总结 本文提出结合LLM和知识图谱的框架,提升航空安全分析的可信度,通过双阶段流程构建和验证安全知识,提高准确性和可追溯性。

Comments Initial version of a conference publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13258 2026-04-16 cs.CL cs.AI 62%

Hessian-Enhanced Token Attribution (HETA): Interpreting Autoregressive LLMs

Hessian-Enhanced Token Attribution (HETA): 解释自回归语言模型

Vishal Pramanik, Maisha Maliha, Nathaniel D. Bastian, Sumit Kumar Jha

机构 * Department of Computer & Information Science & Engineering, University of Florida(佛罗里达大学计算机与信息科学与工程系) School of Computer Science, University of Oklahoma(俄克拉荷马大学计算机科学学院) Department of Electrical Engineering and Computer Science, United States Military Academy(美国军事学院电子工程与计算机科学系)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 HETA提出了一种针对解码器-only语言模型的新型解释框架,结合语义过渡向量、Hessian敏感度评分和KL散度,提升上下文感知和因果解释能力,通过基准数据集验证其在生成任务中的优越性。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13959 2026-04-16 cs.AI 57%

[Emerging Ideas] Artificial Tripartite Intelligence: A Bio-Inspired, Sensor-First Architecture for Physical AI

新兴理念:人工三元智能:一种生物启发、以传感器优先的物理AI架构

You Rim Choi, Subeom Park, Hyung-Sin Kim

机构 * Seoul National University(首尔国立大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 本文提出人工三元智能(ATI),一种生物启发的物理AI架构,通过模块化设计实现传感器控制与推理的协同进化,提升动态环境下的性能与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13247 2026-04-16 cs.CE 50%

Cross-Platform Domain Adaptation for Multi-Modal MOOC Learner Satisfaction Prediction

跨平台领域适应用于多模态MOOC学习者满意度预测

Jakub Kowalski, Magdalena Piotrowska

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 本文研究了在缺乏目标平台标签的情况下,利用跨平台领域适应技术进行多模态MOOC学习者满意度预测,提出ADAPT-MS框架,通过文本编码、跨平台表征对齐、评分偏差校正和缺失行为模态处理,提升了预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11671 2026-04-16 eess.SP cs.RO 50%

VLMaterial: Vision-Language Model-Based Camera-Radar Fusion for Physics-Grounded Material Identification

VLMaterial: 基于视觉-语言模型的相机-雷达融合用于物理基础的材料识别

Jiangyou Zhu, He Chen

机构 * Department of Inforation Engineering(信息工程系)

专题命中 幻觉与事实性 :safety(abstract)

AI总结 本文提出VLMaterial框架,通过融合视觉语言模型与雷达知识实现物理基础的材料识别,采用双管道架构和上下文增强生成策略,提升跨模态融合性能,实验表明其在120余次真实实验中达到96.08%的识别准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04714 2026-04-16 astro-ph.IM 50%

Enhancing astrometric registration of Chinese historical Astronomical Digital Plates with deep learning

利用深度学习增强中国历史天文数字胶片的测光注册

Quanfeng Xu, Zhengjun Shang, Shiyin Shen, Yong Yu, Meiting Yang, Hao Luo, Zhenghong Tang, Jing Yang, Jianhai Zhao

专题命中 幻觉与事实性 :trustworthy(abstract)

AI总结 本文提出基于Transformer的分类模型,通过多尺度特征融合识别可信恒星源,成功完成1353张胶片的测光注册,提升历史胶片档案的处理效率和科学价值。

Comments 15 pages, 5 figures, 3 table; accepted for publication in Research in Astronomy and Astrophysics, see details in https://xuquanfeng.github.io/AI_Plate/

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 隐私与版权 1 篇

2512.09953 2026-04-16 cs.CR cs.AI cs.LG 62%

ZK-APEX: Zero-Knowledge Approximate Personalized Unlearning with Executable Proofs

ZK-APEX: 零知识近似个性化去学习与可执行证明

Mohammad M Maheri, Sunil Cotterill, Alex Davidson, Hamed Haddadi

机构 * Anonymous Institution, Anonymous City, Anonymous Region, Anonymous Country(匿名机构,匿名城市,匿名地区,匿名国家)

专题命中 隐私与版权 :safety(abstract);分类 cs.AI、cs.LG

AI总结 ZK-APEX通过零知识证明实现高效个性化去学习,无需重新训练模型,在边缘设备上验证轻量级更新,有效移除目标数据影响。

Comments Accepted at the 9th Conference on Machine Learning and Systems (MLSys 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 安全评测 23 篇

2602.23636 2026-04-16 cs.LG cs.AI 73%

FlexGuard: Continuous Risk Scoring for Strictness-Adaptive LLM Content Moderation

FlexGuard: 严格度自适应的连续风险评分用于LLM内容审核

Zhihao Ding, Jinming Li, Ze Lu, Jieming Shi

机构 * The Hong Kong Polytechnic University(香港理工大学) ByteDance(字节跳动)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出FlexGuard,一种基于LLM的连续风险评分系统,通过风险对齐优化提升审核准确性和在不同严格度下的鲁棒性。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05991 2026-04-16 cs.AI 70%

3D Instruction Ambiguity Detection

三维指令歧义检测

Jiayu Ding, Haoran Tang, Hongbo Jin, Wei Gao, Ge Li

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出三维指令歧义检测任务,构建了大规模基准Ambi3D,发现现有3D大语言模型难以判断指令歧义,提出AmbiVer框架解决该问题,提升具身AI的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏