arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-11 至 2026-08-11 共收录 75 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 4 篇

2605.12991 2026-08-11 cs.LG cs.AI 版本更新 91%

Not Just RLHF: Why Alignment Alone Won't Fix Multi-Agent Sycophancy

不只是RLHF:为何仅对齐不足以解决多智能体趋同

Adarsh Kumarappan, Ananya Mujoo

机构 * California Institute of Technology(加州理工学院) Evergreen Valley College(艾弗绿谷学院)

专题命中 偏好对齐 :RLHF(title,title_cn);alignment(title);分类 cs.AI、cs.LG

AI总结 本文研究了多智能体系统在模拟同伴分歧下的错误率问题,发现预训练基础模型与指令模型存在相似的替换模式,且错误率较高。通过激活修补发现错误集中在中间层,修复后可恢复大部分正确率差距。研究还指出压力抑制了清洁推理特征,而非激活新的趋同回路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00155 2026-08-11 cs.LG cs.CL math.OC stat.ML 版本更新 73%

Wasserstein Distributionally Robust Regret Optimization for Reinforcement Learning from Human Feedback

Wasserstein分布鲁棒遗憾优化用于人类反馈的强化学习

Yikai Wang, Shang Liu, Jose Blanchet

机构 * Department of Statistics and Operations Research, University of North Carolina(统计与运筹学系,北卡罗来纳大学) Imperial Business School, Imperial College London(帝国理工学院伦敦商学院) Department of Management Science and Engineering, Stanford University(管理科学与工程系,斯坦福大学)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文提出Wasserstein分布鲁棒遗憾优化(DRRO)用于强化学习从人类反馈,通过简单分配模型研究提示问题,展示在ℓ1-地面成本Wasserstein模糊集下,内最坏遗憾有精确解,最优策略具有水填充结构,从而实现高效政策梯度算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00754 2026-08-11 cs.SE cs.LG 版本更新 57%

Themis: Training Robust Multilingual Code Reward Models for Flexible Multi-Criteria Scoring

Themis: 训练鲁棒的多语言代码奖励模型以实现灵活的多标准评分

Indraneil Paul, Goran Glavaš, Iryna Gurevych

机构 * UKP Lab, TU Darmstadt and National Research Center for Applied Cybersecurity ATHENE(UKP实验室,德累斯顿理工大学及应用网络安全国家研究中心ATHENE)

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

AI总结 本文提出Themis-CodeRewardBench基准,评估多语言多标准代码奖励模型,训练了Themis-RM系列模型,展示了其在多语言迁移和多标准训练中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00997 2026-08-11 cs.CL 版本更新 57%

Uncertainty-Aware Variational Reward Factorization via Probabilistic Preference Bases for LLM Personalization

基于概率偏好基的不确定性感知变分奖励分解用于大语言模型个性化

Gyuseok Lee, Wonbin Kweon, Zhenrui Yue, SeongKu Kang, Jiawei Han, Dong Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Korea University(高丽大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 本文提出变分奖励分解框架,通过概率偏好基和变分分布实现用户偏好建模,提升LLM个性化效果。

Comments COLM'26

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 9 篇

2606.09864 2026-08-11 cs.LG cs.AI cs.ET 版本更新 84%

Alignment Collapse Under KV Cache Quantization: Diagnosis and Mitigation

KV缓存量化下的对齐崩溃:诊断与缓解

Bruce Changlong Xu, Adarsh Kumarappan, Mu Zhou

机构 * Stanford University(斯坦福大学) California Institute of Technology(加利福尼亚理工学院)

专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 研究发现低比特KV缓存量化会无声破坏大模型的安全对齐,根源在于安全特征位于低维激活子空间,易受量化噪声影响;提出逐通道缩减(PCR)诊断方法,分类三种失效模式并指导缓解,无需训练即可恢复高达97%的对齐损失。

Comments Preprint. 61 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18852 2026-08-11 cs.CL 版本更新 77%

FanarGuard: A Culturally-Aware Moderation Filter for Arabic Language Models

FanarGuard: 一种文化感知的阿拉伯语言模型审查过滤器

Masoomali Fatehkia, Enes Altinisik, Husrev Taha Sencar

专题命中 安全训练 :alignment(abstract);safety(abstract);harmlessness(abstract);分类 cs.CL

AI总结 FanarGuard是一种双语审查过滤器,通过评估阿拉伯语和英语中的安全性和文化对齐性,提升内容审查的准确性与文化敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19766 2026-08-11 cs.CL 版本更新 70%

PAM: Training Policy-Aligned Moderation Filters at Scale

PAM:在大规模上训练策略对齐的 moderation 过滤器

Masoomali Fatehkia, Enes Altinisik, Mohamed Osman, Husrev Taha Sencar

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 PAM 提出了一种灵活的框架,用于训练基于用户定义策略的定制 moderation 过滤器,能够在大规模上实现更广泛的对齐需求,并在多个基准测试中表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11505 2026-08-11 cs.LG cs.AI 版本更新 62%

Proxy OPD: On-Policy Distillation with Transferable Relative Proxy Update

代理探索与可重用引导:基于代理引导更新信号的模块化大语言模型训练后范式

Daocheng Fu, Rong Wu, Yu Yang, Jianbiao Mei, Licheng Wen, Pinlong Cai, Xuemeng Yang, Yong Liu, Botian Shi, Yu Qiao

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型训练后优化信号耦合问题,提出PUST框架,通过代理模型探索、提取并传输相对改进信号,解耦更新信号探索与分布对齐,减少计算开销,支持异步处理与跨模型转移,提升训练后范式的模块化、可重用性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07901 2026-08-11 cs.GT cs.AI cs.CY cs.MA econ.TH 版本更新 62%

The Theory of Strategic Evolution: Games with Endogenous Players and the Seven Laws of Strategic Replicators

战略进化理论:具有内生参与者和战略复制者的博弈

Kevin Vallier

机构 * Institute of American Constitutional Thought and Leadership(美国宪法思想与领导力研究所) University of Toledo(托莱多大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文提出战略进化理论,引入具有内生参与者的博弈,定义进化稳定智能分布,通过跨层增益矩阵构建战略层层次结构,证明相关封闭性及定理,可用于分析人工智能部署动态等,揭示人格工程问题及稳定多智能体系统的宪法约束。

Comments 171 pages. Formalized in Lean 4 with Mathlib: 240 theorems in the elaborated environment, 141 audited headline results, cold-compiling from a clean checkout with zero custom axioms. Source, theorem-by-theorem contract, and reproducible axiom audit: https://github.com/selfreferencing/TSE_Formal. Companion to Agentic Capital

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19329 2026-08-11 cs.SE cs.AI 版本更新 57%

Goedel-Code-Prover: Hierarchical Proof Search for Open State-of-the-Art Code Verification

Goedel-Code-Prover:面向开放状态的最新代码验证的分层证明搜索

Zenan Li, Ziran Yang, Deyuan He, Haoyu Zhao, Andrew Zhao, Shange Tang, Kaiyu Yang, Aarti Gupta, Zhendong Su, Chi Jin

机构 * ETH Zürich(苏黎世联邦理工学院) Princeton Language and Intelligence(普林斯顿语言与智能实验室) Department of Computer Science, Princeton University(普林斯顿大学计算机科学系) MiroMind

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 本文提出Goedel-Code-Prover框架,通过分层证明搜索提升Lean4中代码验证的自动化水平,实现62%的成功率,优于现有基线方法。

Comments Published as a COLM paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17902 2026-08-11 cs.AI cs.MA cs.SE physics.chem-ph 版本更新 57%

El Agente Gráfico: A Semantic Execution Runtime for Scientific Agents

图形代理:用于科学代理的结构化执行图

Jiaru Bai, Abdulrahman Aldossary, Thomas Swanick, Marcel Müller, Yeonghun Kang, Changhyeok Choi, Naruki Yoshikawa, Zijian Zhang, Jin Won Lee, Tsz Wai Ko, Aiwei Yin, Mohammad Ghazi Vakili, Chris Crebolder, Varinia Bernales, Alán Aspuru-Guzik

机构 * School of Computer Science, McGill University(计算机科学学院,麦吉尔大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 El Agente Gráfico通过结构化执行图和类型安全机制,实现科学代理的高效自动化,适用于复杂计算任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03082 2026-08-11 cs.LG 版本更新 57%

Machine Learning and Data Analysis Using Posets: A Survey

基于偏序集的机器学习与数据分析:一项综述

Arnauld Mesinga Mwafise

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本综述针对偏序集在机器学习与数据分析应用的研究缺口,提出四轴分类体系,梳理相关模型算法与资源,并明确下一代序感知机器学习的研究议程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22787 2026-08-11 cs.HC cs.RO 版本更新 50%

DiSCo: Diffusion Sequence Copilots for Shared Autonomy

DiSCo:用于共享自主的扩散序列助手

Andy Wang, Xu Yan, Brandon McMahan, Michael Zhou, Yuyang Yuan, Johannes Y. Lee, Ali Shreif, Matthew Li, Zhenghao Peng, Bolei Zhou, Yuchen Cui, Jonathan C. Kao

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 安全训练 :alignment(abstract)

AI总结 DiSCo通过扩散策略规划与用户动作一致的动作序列,提升复杂系统控制性能,适用于模拟驾驶和机械臂任务。

Comments 10 pages, 5 figures, HRI '26: Proceedings of the 21st ACM/IEEE International Conference on Human-Robot Interaction

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 9 篇

2503.24191 2026-08-11 cs.CR cs.AI 版本更新 86%

When Grammar Guides the Attack: Uncovering Control-Plane Vulnerabilities in LLMs with Structured Output

当语法引导攻击:利用结构化输出揭示LLM中的控制平面漏洞

Shuoming Zhang, Jiacheng Zhao, Hanyuan Dong, Ruiyuan Xu, Zhicheng Li, Yangyu Zhang, Shuaijiang Li, Yuan Wen, Chunwei Xia, Zheng Wang, Xiaobing Feng, Huimin Cui

机构 * SKLP, ICT, CAS & UCAS(SKLP、信息科技研究院、中国科学院及中国科学院大学) University of Aberdeen(阿伯丁大学) University of Leeds(利兹大学) SKLP, ICT, CAS(SKLP、信息科技研究院、中国科学院)

专题命中 越狱攻击 :jailbreak(summary_cn,abstract);alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文研究了通过结构化输出揭示LLM控制平面漏洞的问题,提出了一种名为Constrained Decoding Attack(CDA)的新类别的 jailbreak 方法,通过控制到语义的管道机制,利用schema-enforced logit masking注入恶意前缀,并由模型自身完成有害意图,展示了DictAttack在多个模型上的高攻击成功率,揭示了需要跨平面防御来弥合数据和控制平面之间的语义差距。

Comments To appear in CCS2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03985 2026-08-11 cs.CR cs.AI 版本更新 85%

NeuroBreak: Unveil Internal Jailbreak Mechanisms in Large Language Models

NeuroBreak:揭示大语言模型的内部越狱机制

Chuhan Zhang, Ye Zhang, Bowen Shi, Yuyou Gan, Tianyu Du, Shouling Ji, Dazhan Deng, Yingcai Wu

机构 * Zhejiang University(浙江大学)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI

AI总结 NeuroBreak是一个自上而下的大语言模型越狱分析系统,可分析神经元级安全机制、关键神经元,经评估验证了有效性,为开发下一代防御策略提供机制见解。

Comments 11 pages, 10 figures. Accepted to IEEE VIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25921 2026-08-11 cs.CL cs.CR 版本更新 83%

One Word at a Time: Incremental Completion Decomposition Breaks LLM Safety

逐词进行:增量完成分解打破LLM安全

Samee Arif, Naihao Deng, Zhijing Jin, Rada Mihalcea

机构 * University of Michigan(密歇根大学) University of Toronto(多伦多大学)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.CL

AI总结 本文提出增量完成分解(ICD)策略,通过逐词生成恶意请求相关词来突破LLM安全机制,评估多种变体在多个基准测试中表现优异,并理论解释其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16406 2026-08-11 cs.CR cs.CL 版本更新 83%

Retrieval-Augmented Defense: Adaptive and Controllable Jailbreak Prevention for Large Language Models

检索增强防御:针对大语言模型的自适应且可控制的越狱防范

Guangyu Yang, Jinghong Chen, Jingbiao Mei, Weizhe Lin, Bill Byrne

机构 * Department of Engineering University of Cambridge(工程系剑桥大学)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL

AI总结 针对大语言模型越狱攻击的挑战,提出检索增强防御(RAD)框架,在StrongREJECT数据集上验证其可降低强力越狱攻击有效性,同时平衡安全性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26574 2026-08-11 cs.CR cs.AI cs.LG 版本更新 81%

Attack Ensembles Expose a Safety-Utility Trade-off in Black-Box Guard Defenses Against Encoded VLM Jailbreaks

恢复、解码、再防护:针对编码型VLM越狱的防护无关型防御放大技术

Haoyu Zhang, Zhuoxi Wang, Shibo Zheng, Yi Feng, Xiao Luo, Zijian Xiao, Haowen Xu, Xiangchen Guan, Mohammad Zandsalimy, Shanu Sushmita

专题命中 越狱攻击 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究提出防护无关型的恢复-解码放大器,评估其对11种攻击集成的编码型VLM越狱防御效果,发现其存在安全-效用上限,贡献了放大器、集成评估方法及防御适用场景图谱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19517 2026-08-11 cs.LG cs.AI 版本更新 73%

Automating Deception: Scalable Multi-Turn LLM Jailbreaks

自动化欺骗:可扩展的多轮LLM欺骗攻击

Adarsh Kumarappan, Ananya Mujoo

机构 * California Institute of Technology(加州理工学院) Evergreen Valley College(埃弗格林谷学院)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 本文提出自动化生成多轮LLM欺骗数据集的方法,揭示GPT家族模型在对话历史中的脆弱性,而Gemini 2.5 Flash则表现出极强的抗性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18721 2026-08-11 cs.LG cs.AI 版本更新 73%

Towards Realistic Guarantees: A Probabilistic Certificate for SmoothLLM

迈向现实保证:一种概率证书用于SmoothLLM

Adarsh Kumarappan, Ayushi Mehrotra

机构 * California Institute of Technology(加州理工学院)

专题命中 越狱攻击 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种概率框架,通过(k, ε)-unstable假设提升LLM对抗劫持攻击的安全性保障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01043 2026-08-11 cs.CR cs.AI 版本更新 70%

Decoy Images Amplify Caption-Mediated Defenses Against Encoded Jailbreaks

诱饵图像增强针对编码越狱的字幕介导防御

Haoyu Zhang, Xiangchen Guan, Shibo Zheng, Mohammad Zandsalimy, Shanu Sushmita

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 该研究发现附加诱饵图像可降低VLMs的编码越狱攻击成功率,通过编码输入检测器门控附加诱饵,可在保留安全增益的同时控制良性弃权率,该效应在多模型、多场景下可复现。

Comments There is bug in algorithm implementation

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23341 2026-08-11 cs.CR cs.AI 版本更新 57%

Evaluating Jailbreaking Vulnerabilities in LLMs Deployed as Assistants for Smart Grid Operations: A Benchmark Against NERC Standards

评估部署于智能电网操作中的LLM jailbreaking漏洞:与NERC标准的基准测试

Taha Hammadia, Lucas Rea, Ahmad Mohammad Saber, Amr Youssef, Deepa Kundur

机构 * ECE Department, University of Toronto(多伦多大学电子工程系) CIISE, Concordia University(麦吉尔大学CIISE)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本文评估了智能电网操作中部署LLM的jailbreaking漏洞,通过与NERC标准的基准测试,发现DeepInception方法攻击成功率最高,Claude 3.5 Haiku完全免疫,Gemini 2.0 Flash-Lite最易受攻击。

Comments \c{opyright} 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting/republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 3 篇

2604.06247 2026-08-11 cs.CR cs.AI 版本更新 79%

SALLIE: Generation-Free Hidden-State Detection of Jailbreaks and Prompt Injections Across Text and Vision

SALLIE:防范潜在语言与图像攻击

Guy Azov, Ofer Rivlin, Guy Shtar

机构 * Intuit

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 SALLIE是一种轻量级运行时检测框架,通过机制可解释性提取模型内部激活信号,有效应对文本和图像攻击,无需性能降级或架构修改。

Comments 17 pages, 5 figures, 17 tables. Preprint under review. v2: substantially revised - new title expansion, reworked method presentation, added calibration-regime analysis (shared / threshold-only / fully calibrated) and matched-protocol comparison with RCS-KCD; technical appendices A-H now included

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19430 2026-08-11 cs.CR cs.AI cs.MA 版本更新 77%

ChannelGuard: Safe Models Do Not Compose into Safe Multi-Agent Systems

通道卫士:安全模型无法组合成安全的多智能体系统

Elias Hossain, Md Mehedi Hasan Nipu, Fatema Tuj Johora Faria, Tasfia Nuzhat Ornee, Maleeha Sheikh

机构 * College of Engineering and Computer Science, University of Central Florida(工程与计算机科学学院,中央佛罗里达大学) Department of Computer Science and Engineering, North South University(计算机科学与工程系,北南大学) Computer Science and Engineering, Ahsanullah University of Science and Technology(计算机科学与工程,阿沙努拉科学与技术大学) Department of Electrical and Computer Engineering, Purdue University Fort Wayne(电气与计算机工程系,普渡大学弗拉特沃恩分校)

专题命中 提示注入 :alignment(abstract);safety(abstract);prompt injection(abstract);分类 cs.AI

AI总结 研究多智能体大语言模型应用程序中智能体间通道安全问题,提出ChannelGuard深度防御框架,在通道设信息瓶颈门,通过文本与对抗短语库评分处理信息,能有效阻止工具中毒攻击,降低提示注入攻击成功率,保持准确率,白盒自适应释义可规避嵌入门。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15596 2026-08-11 cs.CR 版本更新 50%

From Neural Intent to Cryptographic Authorization: Securing AI-Driven Enterprise Workflows

从神经意图到加密授权:管理智能代理工作流程

Jiasi Weng, Jian Weng, Minrong Chen, Ming Li, Jia-Nan Liu, Zhi Li, Yue Zhang

专题命中 提示注入 :prompt injection(abstract)

AI总结 研究人工智能驱动的智能代理工作流程中的安全问题,提出神经加密服务(NCS),通过神经符号设计,在大语言模型代理和特权工具间构建安全治理平面,经实验评估,能大幅降低攻击成功率,转变代理安全验证方式。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 4 篇

2606.00898 2026-08-11 cs.CL cs.DL 版本更新 82%

Citation Grounding Measures the Oracle: Graph Coverage Determines Reported LLM Hallucination Rates in Law

引用溯源:通过法律引用图检测和减少LLM引用幻觉

Volodymyr Ovcharov

机构 * LEX AI LLC

专题命中 幻觉与事实性 :DPO(summary_cn,abstract_cn);trustworthy(abstract);分类 cs.CL

AI总结 提出引用溯源(CG)指标,利用乌克兰法院判决的引用图(1.008亿判决,5.02亿边)检测LLM法律引用幻觉,并通过CG-DPO方法(基于真实判决构建偏好对)减少幻觉,在100个法律查询上CG为0.791-0.873,幻觉率13-21%。

Comments 21 pages, 4 figures, 5 tables. Substantially revised: title, framing and several v1 results changed. Adds a coverage sweep and a separability analysis; corrects the DPO configuration, the density-accuracy correlation and the qualitative examples. Code and data: https://huggingface.co/datasets/overthelex/citation-grounding-eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26502 2026-08-11 cs.AI cs.CL 版本更新 62%

Humans Disengage, Reasoning Models Persist: Separating Difficulty Registration from Deliberation Allocation

人类放弃,推理模型坚持:将难度登记与深思分配分离

Han-yu Wang

机构 * The University of Hong Kong(香港大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文通过分离难度登记与深思分配,发现人类与大型推理模型(LRM)在问题解决中的时间/令牌分配模式相反:人类在错误问题上用时更少,而LRM在错误问题上使用更多令牌。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26798 2026-08-11 cs.LG cs.AI 版本更新 62%

Explaining, Verifying, and Aligning Semantic Hierarchies in Vision-Language Model Embeddings

解释、验证和对齐视觉语言模型嵌入中的语义层次结构

Gesina Schwalbe, Mert Keser, Moritz Bayerkuhnlein, Edgar Heinert, Annika Mütze, Marvin Keller, Sparsh Tiwari, Georgii Mikriukov, Diedrich Wolter, Jae Hee Lee, Matthias Rottmann

机构 * University of Lübeck(吕贝克大学) Technical University of Munich(慕尼黑工业大学) AUMOVIO SE Osnabrück University(奥斯纳布吕克大学) Leibniz Institute for Agricultural Engineering and Bioeconomy(莱布尼茨农业工程与生物经济研究所) University of Hamburg(汉堡大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种框架,用于解释、验证和对齐视觉语言模型嵌入中的语义层次结构,通过聚类和概念库匹配提取层次结构,并利用人类本体评估其合理性,最终提出基于本体的对齐方法以提升共享嵌入空间的语义对齐。

Comments camera-ready version of accepted IJCAI-ECAI 2026 paper including supplementary material; code: https://github.com/gesina/ontological-commitment

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19735 2026-08-11 stat.ME cs.LG 版本更新 57%

Integrating RCTs, RWD, AI/ML and Statistics: Next-Generation Evidence Synthesis

整合RCTs、RWD、AI/ML和统计学:下一代证据合成

Shu Yang, Margaret Gamalo, Haoda Fu

机构 * Department of Statistics, North Carolina State University(统计学系,北卡罗来纳州立大学) VP and Statistics Head, Inflammation, Immunology & Specialty Care, Pfizer(副总裁及统计学负责人,炎症、免疫与专科医疗,辉瑞) Head of Exploratory Biostatistics, Amgen(探索性生物统计学负责人,安进)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.LG

AI总结 本文提出通过整合RCTs、RWD、AI/ML和统计学,提升证据合成的严谨性和实用性,推动下一代证据生成方法的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 隐私与版权 2 篇

2604.26494 2026-08-11 cs.HC cs.AI cs.CY cs.ET 版本更新 87%

Culturally Situated AI Safety for Youth: Saudi Arabian Perspectives of Youth, Parents and Teachers

面向青少年的文化感知生成式AI风险:来自非西方背景的青少年、父母和教师视角

Aljawharah Alzahrani, Tanusree Sharma

机构 * Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 隐私与版权 :safety(title,abstract);AI safety(title);分类 cs.AI、cs.CY

AI总结 研究从非西方视角探讨青少年使用生成式AI工具的风险,分析文化、宗教和社会因素对隐私和安全的影响,揭示家庭经济因素加剧的共享账户使用问题,并提出符合文化规范的家长控制设计。

详情

展开后加载摘要…

URL PDF HTML 收藏