arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-25 至 2026-03-25 共收录 73 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 4 篇

2603.22829 2026-03-25 cs.AI 90%

Improving Safety Alignment via Balanced Direct Preference Optimization

通过平衡直接偏好优化提升安全性对齐

Shiji Zhao, Mengyang Wang, Shukun Xiong, Fangzhou Chen, Qihui Zhu, Shouwei Ruan, Yisong Xiao, Ranjie Duan, Xun Chen, XingXing Wei

机构 * Institute of Artificial Intelligence, Beihang University, Beijing, China(北京航空航天大学人工智能研究院)

专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);RLHF(abstract);DPO(abstract)

AI总结 本文提出B-DPO方法,通过平衡偏好与非偏好响应的优化强度,缓解偏好对齐中的过拟合问题,提升模型安全性同时保持竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23184 2026-03-25 cs.CL cs.AI stat.AP 81%

ImplicitRM: Unbiased Reward Modeling from Implicit Preference Data for LLM alignment

ImplicitRM: 从隐式偏好数据中无偏奖励建模以实现语言模型对齐

Hao Wang, Haocheng Yang, Licheng Pan, Lei Shen, Xiaoxi Li, Yinuo Wang, Zhichao Chen, Yuan Lu, Haoxuan Li, Zhouchen Lin

机构 * Peking University(北京大学) Xiaohongshu Inc.(小红书公司) National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学)

专题命中 偏好对齐 :alignment(title);RLHF(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ImplicitRM,通过隐式反馈数据学习无偏奖励模型,解决隐式偏好数据中缺乏明确负样本和用户偏好偏差的问题,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22944 2026-03-25 cs.HC 75%

From Morality Installation in LLMs to LLMs in Morality-as-a-System

从LLM中的道德安装到道德作为系统中的LLM

Gunter Bombaerts

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);safety(abstract)

AI总结 本文提出道德作为系统框架,重新定义道德行为的动态性与系统耦合问题,探讨道德属性在生命周期中的监测与跨组件一致性。

Comments 22pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22563 2026-03-25 stat.ML cs.LG 70%

Privacy-Preserving Reinforcement Learning from Human Feedback via Decoupled Reward Modeling

通过解耦奖励建模实现隐私保护的人类反馈强化学习

Young Hyun Cho, Will Wei Sun

机构 * Purdue University(普渡大学)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.LG

AI总结 本文提出一种隐私保护框架,仅在奖励学习中施加差分隐私,通过私有奖励模型生成最终策略。理论分析显示隐私引入额外的误差项,且样本量和隐私水平影响主导项,实验验证了理论预测。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 2 篇

2506.13285 2026-03-25 cs.CL 83%

DualEdit: Mitigating Safety Fallback in LLM Backdoor Editing via Affirmation-Refusal Regulation

DualEdit: 通过肯定-拒绝调节缓解LLM后门编辑中的安全回退

Houcheng Jiang, Zetong Zhao, Junfeng Fang, Haokai Ma, Ruipeng Wang, Xiang Wang, Xiangnan He, Yang Deng

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Singapore Management University(新加坡管理大学) MoE Key Lab of BIPC, University of Science and Technology of China(中国科学技术大学信息与通信技术国家重点实验室)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL

AI总结 DualEdit通过双重目标模型编辑框架缓解LLM后门攻击中的安全回退问题,通过动态损失加权和价值锚定技术提升攻击成功率并降低安全回退率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08379 2026-03-25 cs.AI cs.LG 73%

SOM Directions are Better than One: Multi-Directional Refusal Suppression in Language Models

SOM方向优于单一方向:语言模型中的多方向拒绝抑制

Giorgio Piras, Raffaele Mura, Fabio Brau, Luca Oneto, Fabio Roli, Battista Biggio

专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用自组织映射(SOM)提取多方向拒绝特征,通过分析有害提示表示与无害提示表示的差异,验证了多方向抑制方法在提升模型安全性和拒绝能力上的有效性。

Comments Accepted at AAAI 2026

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence (AAAI), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 8 篇

2603.23268 2026-03-25 cs.LG cs.AI 86%

SafeSeek: Universal Attribution of Safety Circuits in Language Models

SafeSeek: 语言模型中安全回路的通用归因

Miao Yu, Siyuan Fu, Moayad Aloqaily, Zhenhong Zhou, Safa Otoum, Xing fan, Kun Wang, Yufei Guo, Qingsong Wen

机构 * University of Science United Arab Emirates University Nanyang Technological University Zayed University Intelligent Science \& Technology Academy of CASIC

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SafeSeek框架,通过优化识别语言模型中的完整安全回路,验证了在后门攻击和安全对齐场景中的有效性,展示了安全回路的识别与利用方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23269 2026-03-25 cs.CR cs.AI cs.LG 84%

Not All Tokens Are Created Equal: Query-Efficient Jailbreak Fuzzing for LLMs

并非所有标记都同等重要:面向LLMs的查询高效 jailbreak 模糊测试

Wenyu Chen, Xiangtao Meng, Chuanchao Zang, Li Wang, Xinyu Gao, Jianing Wang, Peng Zhan, Zheng Li, Shanqing Guo

机构 * Shandong University(山东大学)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出TriageFuzz框架,通过分析标记贡献差异,提升jailbreak攻击效率,实验显示在减少查询次数的情况下,攻击成功率显著提高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22983 2026-03-25 cs.AI cs.CR 83%

Obscure but Effective: Classical Chinese Jailbreak Prompt Optimization via Bio-Inspired Search

晦涩但有效的:基于生物启发搜索的古典中文 Jailbreak 提示优化

Xun Huang, Simeng Qin, Xiaoshuang Jia, Ranjie Duan, Huanqian Yan, Zhitao Zeng, Fei Yang, Yang Liu, Xiaojun Jia

机构 * Nanyang Technological University(南洋理工大学) BraneMatrix AI Nanjing University of Science and Technology(南京理工大学) Northeast University(东北大学) Renmin University of China(中国人民大学) Alibaba Group(阿里巴巴集团) Beihang University(北航) National University of Singapore(新加坡国立大学) Zhejiang Lab(浙江实验室)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI

AI总结 本文提出 CC-BOS 框架,利用多维果蝇优化算法生成古典中文对抗提示,提升黑盒 Jailbreak 攻击效果,通过八维政策维度迭代优化,实验表明其优于现有方法。

Comments ICLR 2026 Poster The source code relevant to this article has now been open-sourced; for details, please visit: https://github.com/xunhuang123/CC-BOS

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10766 2026-03-25 cs.CR cs.AI cs.CV 83%

Metaphor-based Jailbreak Attacks on Text-to-Image Models

基于隐喻的文本到图像模型劫持攻击

Chenyu Zhang, Lanjun Wang, Yiwen Ma, Wenhui Li, Yi Tu, An-An Liu

机构 * Huawei Technologies Co Ltd.(华为技术有限公司)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI

AI总结 本文提出基于隐喻的劫持攻击方法,通过生成隐喻对抗提示绕过未知或多样化的防御机制,实验表明其在攻击性能和查询效率方面优于基线方法。

Comments Code is available in \url{https://github.com/datar001/metaphor-based-jailbreaking-attack}

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22882 2026-03-25 cs.LG cs.CV 77%

TreeTeaming: Autonomous Red-Teaming of Vision-Language Models via Hierarchical Strategy Exploration

TreeTeaming:通过分层策略探索实现视觉语言模型的自主红队测试

Chunxiao Li, Lijun Li, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);red teaming(abstract);分类 cs.LG

AI总结 TreeTeaming通过动态演化策略探索方法,实现对视觉语言模型的自主红队测试,显著提升攻击成功率和策略多样性,同时降低攻击毒性。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05919 2026-03-25 cs.CR cs.AI cs.CL 73%

Injecting Falsehoods: Adversarial Man-in-the-Middle Attacks Undermining Factual Recall in LLMs

注入虚假信息:对抗性中间人攻击削弱大语言模型的事实回忆

Alina Fastowski, Bardh Prenkaj, Yuxiao Li, Gjergji Kasneci

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 越狱攻击 :safety(abstract);prompt injection(abstract);分类 cs.CL、cs.AI

AI总结 本文提出首个基于提示注入的LLM事实记忆攻击评估框架Xmera,通过扰动输入在封闭书本和事实基础QA场景中降低响应正确性并评估生成过程的不确定性,提出基于响应不确定性的随机森林分类器作为防御机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22341 2026-03-25 cs.CR cs.AI cs.CL 62%

T-MAP: Red-Teaming LLM Agents with Trajectory-aware Evolutionary Search

T-MAP: 通过轨迹感知的进化搜索实现红队攻击LLM代理

Hyomin Lee, Sangwoo Park, Yumin Choi, Sohyun An, Seanie Lee, Sung Ju Hwang

机构 * KAIST(韩国科学技术院) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出T-MAP方法,通过轨迹感知的进化搜索发现对抗性提示,有效突破安全防护并实现有害目标,实验显示其在攻击实现率上优于基线方法,适用于多步骤工具执行的LLM代理安全测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22855 2026-03-25 cs.AR cs.LG 57%

TorR: Towards Brain-Inspired Task-Oriented Reasoning via Cache-Oriented Algorithm-Architecture Co-design

TorR: 向基于大脑的面向任务推理迈进:通过面向缓存的算法-架构联合设计

Hyunwoo Oh, SungHeon Jeong, Suyeon Jang, Hanning Chen, Sanggeon Yun, Tamoghno Das, Mohsen Imani

机构 * Department of Computer Science, University of California, Irvine(加州大学尔湾分校计算机科学系)

专题命中 越狱攻击 :alignment(abstract);分类 cs.LG

AI总结 TorR通过将CLIP式的密集对齐替换为超维(HDC)关联推理,实现了高效的实时推理。在算法层面引入部分相似性重用,在架构层面设计了可扩展的位切内存和轻量控制器,以满足实时性需求,同时在能耗和精度上优于现有基线。

Comments Accepted to DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 红队测试 2 篇

2507.00026 2026-03-25 cs.LG cs.AI cs.CL cs.CY 87%

RedTopic: Toward Topic-Diverse Red Teaming of Large Language Models

RedTopic:迈向大语言模型的课题多样化红队测试

Jiale Ding, Xiang Zheng, Yutao Wu, Cong Wang, Wei-Bin Lee, Ling Pan, Xingjun Ma, Yu-Gang Jiang

机构 * Fudan University(复旦大学) City University of Hong Kong(香港城市大学) Deakin University(德克萨斯大学) Hon Hai Research Institute(鸿海研究室) Hong Kong University of Science and Technology(香港理工大学)

专题命中 红队测试 :red teaming(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出RedTopic框架,通过上下文生成管道、聚合奖励设计和多目标RL训练循环,生成多样化对抗提示,提升红队测试的适应性和课题多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22489 2026-03-25 cs.CR cs.SE 71%

Model Context Protocol Threat Modeling and Analyzing Vulnerabilities to Prompt Injection with Tool Poisoning

模型上下文协议威胁建模及针对提示注入的漏洞分析

Charoes Huang, Xin Huang, Ngoc Phu Tran, Amin Milani Fard

专题命中 红队测试 :prompt injection(title)

AI总结 本文基于STRIDE和DREAD框架对MCP五个关键组件进行威胁建模,发现工具污染是主要客户端漏洞,提出多层防御策略以提升AI代理生态的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 7 篇

2603.22582 2026-03-25 cs.CL cs.AI 62%

Lie to Me: How Faithful Is Chain-of-Thought Reasoning in Reasoning Models?

对我的谎言:推理模型中的思维链推理可信度如何?

Richard J. Young

机构 * University of Nevada, Las Vegas, Department of Management, Entrepreneurship and Technology, Lee Business School(内华达大学拉斯维加斯分校,管理、创业与技术系,李商学院) DeepNeuro AI

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI

AI总结 研究评估了12种开源推理模型在MMLU和GPQA Diamond中的表现,发现模型在提示影响下的可信度差异显著,训练方法和架构影响更大。

Comments 27 pages, 7 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22303 2026-03-25 cs.LG cs.AI 62%

Sample Transform Cost-Based Training-Free Hallucination Detector for Large Language Models

基于样本转换成本的无训练hallucination检测器用于大型语言模型

Zeyang Ding, Xinglin Hu, Jicong Fan

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于最优传输距离的hallucination检测方法,通过计算token嵌入之间的Wasserstein距离矩阵,得到AvgWD和EigenWD两个指标,用于无训练检测大型语言模型的hallucination问题。

Comments 24 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22634 2026-03-25 cs.HC cs.AI 57%

Learning to Trust: How Humans Mentally Recalibrate AI Confidence Signals

学习信任:人类如何通过经验心理重新校准AI信心信号

ZhaoBin Li, Mark Steyvers

机构 * Department of Cognitive Sciences, University of California, Irvine(加州大学欧文分校认知科学系)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 研究探讨人类能否通过经验重新校准AI信心信号,发现参与者在不同条件下通过50次试验显著提升准确性与校准能力,提出基于线性对数比变换和Rescorla-Wagner学习规则的计算模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22623 2026-03-25 cs.CV cs.AI 57%

To Agree or To Be Right? The Grounding-Sycophancy Tradeoff in Medical Vision-Language Models

同意还是正确?医学视觉-语言模型中的 grounding 与谄媚权衡

OFM Riaz Rahman Aranya, Kevin Desai

机构 * Department of Computer Science, The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校计算机科学系)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 研究评估了六种医学视觉问答模型,揭示了 grounding 与谄媚之间的权衡关系,并提出三种新指标以评估模型的可靠性与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01969 2026-03-25 cs.CV cs.AI 57%

Mitigating Object Hallucinations in Large Vision-Language Models via Attention Calibration

通过注意力校准缓解大视觉-语言模型中的物体幻觉

Younan Zhu, Linwei Tao, Minjing Dong, Chang Xu

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 本文提出动态注意力校准方法,通过对比学习动态强制位置不变性,有效缓解大视觉-语言模型中的物体幻觉问题,并在多个基准测试中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15253 2026-03-25 cs.CV 50%

HalDec-Bench: Benchmarking Hallucination Detector in Image Captioning

HalDec-Bench:图像描述中幻觉检测的基准测试

Kuniaki Saito, Risa Shinoda, Shohei Tanaka, Tosho Hirasawa, Fumio Okura, Yoshitaka Ushiku

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 本文提出HalDec-Bench,用于评估图像描述中幻觉检测的性能,通过多样化模型生成的描述和人工标注揭示了模型在不同难度任务中的表现差异,并发现检测器倾向于认为响应开头的句子正确。

Comments This work was intended as a replacement of arXiv:2511.20515 and any subsequent updates will appear there

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20515 2026-03-25 cs.CV 50%

HalDec-Bench: Benchmarking Hallucination Detector in Image Captioning

HalDec-Bench:图像描述中幻觉检测的基准测试

Kuniaki Saito, Risa Shinoda, Shohei Tanaka, Tosho Hirasawa, Fumio Okura, Yoshitaka Ushiku

机构 * OMRON SINICX The University of Tokyo(东京大学) The University of Osaka(大阪大学)

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 本文提出HalDec-Bench,用于评估图像描述中幻觉检测的性能,通过多样化VLM生成的描述和人类标注揭示模型差异,发现检测器倾向于认可响应开头的句子,并通过强VLM过滤减少数据噪声。

Comments Previously this version appeared as arXiv:2603.15253 which was submitted as a new work by accident

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 隐私与版权 7 篇

2603.22690 2026-03-25 cs.CV cs.AI 79%

WiFi2Cap: Semantic Action Captioning from Wi-Fi CSI via Limb-Level Semantic Alignment

WiFi2Cap:从Wi-Fi CSI进行语义动作描述的肢体级语义对齐

Tzu-Ti Wei, Chu-Yu Huang, Yu-Chee Tseng, Jen-Jee Chen

专题命中 隐私与版权 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出WiFi2Cap框架,通过Wi-Fi CSI生成动作描述,引入镜像一致性损失解决方向敏感问题,并在基准数据集上验证了其在隐私保护语义感知中的有效性。

Comments 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13698 2026-03-25 cs.LG cs.AI cs.IT math.IT stat.ML 62%

Does Privacy Always Harm Fairness? Data-Dependent Trade-offs via Chernoff Information Neural Estimation

隐私是否总是损害公平性?通过Chernoff信息神经估计的数据依赖性权衡

Arjun Nichani, Hsiang Hsu, Chun-Fu, Chen, Haewon Jeong

机构 * University of California Santa Barbara(加州大学圣芭芭拉分校) JP Morgan Chase Global Technology Applied Research(摩根大通全球技术应用研究)

专题命中 隐私与版权 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文通过Chernoff信息理论分析隐私与公平性之间的数据依赖性权衡,提出Chernoff差异及其噪声变体,并开发神经网络估计器CINE以实现实世界数据集的分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09442 2026-03-25 cs.CR cs.AI cs.CL 62%

Shadow in the Cache: Unveiling and Mitigating Privacy Risks of KV-cache in LLM Inference

缓存中的阴影:揭示和缓解LLM推理中KV缓存的隐私风险

Zhifan Luo, Shuo Shao, Su Zhang, Lijing Zhou, Yuke Hu, Chenxu Zhao, Zhihao Liu, Zhan Qin

机构 * State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) Zhejiang University(浙江大学) Huawei Technology(华为技术) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院)

专题命中 隐私与版权 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文揭示了KV缓存中存在严重的隐私泄露问题,设计了三种攻击方法并提出KV-Cloak防御机制,有效缓解了隐私风险且不影响模型精度。

Comments This paper is accepted by Network and Distributed System Security Symposium (NDSS) 2026. Code: https://github.com/SiO-2/kvcloak

Journal ref Published in the Proceedings of the 33rd Network and Distributed System Security Symposium (NDSS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11191 2026-03-25 cs.AI cs.RO 57%

Multi-Modal Multi-Task (M3T) Federated Foundation Models for Embodied AI: Potentials and Challenges for Edge Integration

多模态多任务(M3T)联邦基础模型用于具身AI:边缘整合的潜力与挑战

Kasra Borazjani, Payam Abdisarabshali, Fardis Nadimi, Naji Khosravan, Minghui Liwang, Xianbin Wang, Yiguang Hong, Seyyedali Hosseinalipour

专题命中 隐私与版权 :safety(abstract);分类 cs.AI

AI总结 本文提出多模态多任务联邦基础模型(M3T-FFMs)用于具身AI,结合M3T-FMs的任务泛化能力和FL的隐私保护分布式训练,解决边缘部署中的异构具身、模态不平衡、带宽限制等挑战。

Comments Accepted for Publication in IEEE Internet of Things Magazine, 2025

Journal ref IEEE Internet of Things Magazine, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22363 2026-03-25 cs.SE cs.AI 57%

Early Discoveries of Algorithmist I: Promise of Provable Algorithm Synthesis at Scale

算法主义I:大规模可证明算法合成的前景

Janardhan Kulkarni

机构 * Microsoft(微软)

专题命中 隐私与版权 :alignment(abstract);分类 cs.AI

AI总结 本文提出通过LLM生成可证明的算法,结合理论与实践,展示Algorithmist在隐私、近似和可解释性任务中的有效算法生成与验证。

Comments 75 pages, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22674 2026-03-25 cs.HC 50%

Designing a Meta-Reflective Dashboard for Instructor Insight into Student-AI Interactions

设计一个元反思仪表盘,以帮助教师了解学生与AI的互动

Boxuan Ma, Baofeng Ren, Huiyong Li, Gen Li, Li Chen, Atsushi Shimada, Shin'Ichi Konomi

专题命中 隐私与版权 :alignment(abstract)

AI总结 本文提出一个元反思仪表盘,通过结构化总结学生与AI的交互轨迹和潜在风险,帮助教师在不暴露原始聊天记录的情况下获取学生学习情况,同时减轻隐私担忧。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06033 2026-03-25 cs.CR econ.GN q-fin.EC 50%

Sell Data to AI Algorithms Without Revealing It: Secure Data Valuation and Sharing via Homomorphic Encryption

将数据出售给AI算法而不揭露它:通过同态加密实现安全的数据估值与分享

Michael Yang, Ruijiang Gao, Zhiqiang Zheng

专题命中 隐私与版权 :trustworthy(abstract)

AI总结 本文提出Trustworthy Influence Protocol,利用同态加密和梯度影响函数,在不解密数据的情况下评估外部数据的效用,验证了其在医疗和生成AI领域的经济潜力,挑战了现有定价模型。

详情

展开后加载摘要…

URL PDF HTML 收藏