arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-10 至 2026-07-10 共收录 57 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 5 篇

2606.03238 2026-07-10 cs.LG cs.AI 版本更新 93%

When RLHF Fails: A Mechanistic Taxonomy of Reward Hacking, Collapse, and Evaluator Gaming

当RLHF失败时:奖励黑客、崩溃和评估者博弈的机制分类

Zelalem Abahana, David Evans, Satish Mahadevan Srinivasan, Matjaz Gams

机构 * First Citizens Bank(第一公民银行) Alma Mater Europaea University(欧洲大学)

专题命中 偏好对齐 :RLHF(title,title_cn);DPO(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 本文通过PPO、DPO等方法的对比实验,提出了一种基于奖励和评估者分数方向的机制分类法,将RLHF失败模式分类为可定位、可预测的训练动态。

Comments 20 pages, 8 figures; includes code, artifacts, and live demo

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07856 2026-07-10 cs.AI 版本更新 84%

Dual-Difficulty Curriculum Learning for Direct Preference Optimization

用于直接偏好优化的双难度课程学习

Mengyang Li, Haozhan Geng, Zhong Zhang, Shuang Liu

机构 * Tianjin Key Laboratory of Wireless Mobile Communications and Power Transmission(天津无线移动通信与电力传输重点实验室) Tianjin Normal University(天津师范大学)

专题命中 偏好对齐 :DPO(summary_cn,abstract);alignment(abstract);分类 cs.AI

AI总结 研究针对大语言模型对齐中课程学习依赖一维难度视图的问题,提出将对齐难度重构为二维空间,开发DM-Curri-DPO框架,引入GSP-Curri-DPO分组自定进度学习框架,实验表明该方法提升了数据效率与鲁棒性,为LLM对齐建立新范式。

Comments We found a critical flaw in the prompt complexity metric, which affects the 2D curriculum grid construction and leads to potentially invalid comparisons. Since this undermines our main conclusions, we are withdrawing the paper and will revise the methodology before resubmission

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08034 2026-07-10 cs.CL cs.AI cs.CY 新提交 82%

PLURAL: A Global Dataset for Value Alignment

PLURAL:一个用于价值对齐的全球数据集

Dhruv Agarwal, Anya Shukla, Tanya Goyal, Aditya Vashistha

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究针对大语言模型反映西方价值观问题,引入基于IVS的PLURAL数据集,通过两阶段管道生成偏好三元组,经三种方式评估,结果显示其含价值引导可学习信号,能为多元对齐提供资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19665 2026-07-10 cs.SE cs.AI 版本更新 74%

CriterAlign: Criterion-Centric Rationale Alignment for Code Preference Judging

CriterAlign: 以标准为中心的推理对齐用于代码偏好判断

Zhenyu Li, Aleksandar Cvejic, Zehui Chen, Peter Wonka

机构 * KAUST(卡塔尔人工智能研究 institute) ByteDance(字节跳动)

专题命中 偏好对齐 :alignment(title);分类 cs.AI

AI总结 本文提出CriterAlign,一种以标准为中心的推理对齐框架,通过直接的标准级 pairwise 判断、tie-driven 标准细化、swap-consistency 过滤和最终 pairwise 合成,改进了代码偏好判断的准确性,同时引入Human-Preference-Aligned Guidance (HPAG)来提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08257 2026-07-10 cs.AI 新提交 70%

MentalHospital: A Virtual Environment for Evaluating Psychiatric Clinical Encounters

精神病院:一个用于评估精神科临床问诊的虚拟环境

Yuming Yang, Xiao Sun, Yuanwei Zou, Zhengxiao Wu, Yun Chen, Jiang Zhong, Haoyang Zeng, Jingwang Huang, Kaiwen Wei

机构 * School of Computer Science, Chongqing University(重庆大学计算机科学学院) School of Computer Science, Hunan University(湖南大学计算机科学学院)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.AI

AI总结 研究针对大语言模型在精神科临床问诊评估不足的问题,引入MentalHospital虚拟环境,实例化S.O.A.P.工作流程,用双轨协议评估,开发MentalEval,经测试其具有临床保真度且与专家高度一致,指出大语言模型在精神状态评估上落后临床医生。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 14 篇

2604.03533 2026-07-10 cs.AI 88%

Automated Analysis of Global AI Safety Initiatives: A Taxonomy-Driven LLM Approach

全球人工智能安全举措的自动化分析:基于分类学的LLM方法

Takayuki Semitsu, Naoto Kiribuchi, Kengo Zenitani

机构 * Japan AI Safety Institute(日本人工智能安全研究所)

专题命中 安全训练 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI

AI总结 本文提出一种自动化框架,通过共享活动分类法比较AI安全政策文件,利用活动地图上的活动类别提取并映射相关活动,生成摘要、比较和相似度评分,评估LLM在政策文档中的稳定性与有效性。

Comments 18 pages, 6 figures, 6 tables, to be published in PoliticalNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07766 2026-07-10 cs.AI 新提交 83%

Alignment Plausibility: A New Standard for Assuring AI in Healthcare

对齐合理性:确保医疗保健领域人工智能的新标准

Gwydion Williams, Sara Zannone, Bilal A Mateen

专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.AI

AI总结 研究探讨大语言模型在医疗保健领域的安全问题,提出需在价值规范、训练、监督三层面进行对齐以实现结构安全,进而产生对齐合理性这一监管结构,为论证AI与健康结果的关系提供方式。

Comments 8 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12726 2026-07-10 cs.LG 版本更新 83%

Before the Last Token: Diagnosing Final-Token Safety Probe Failures

在最后的标记之前:诊断最终标记安全探针失败

Shravan Doda

机构 * SafeSwitch HarmBench SorryBench

专题命中 安全训练 :safety(title,abstract);jailbreak(abstract);分类 cs.LG

AI总结 研究最终标记安全探针在预填充阶段的失败模式,发现安全证据分布在早期用户标记中,传统探针无法捕捉,提出基于PCA-HMM的轨迹模型提升诊断能力。

Comments 8 pages, 2 figures, 7 tables. Accepted at the ICML 2026 Mechanistic Interpretability Workshop and the ICML 2026 Failure Modes in Agentic AI Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03075 2026-07-10 cs.RO 版本更新 67%

A Collaborative Reasoning Framework for Anomaly Diagnostics in Underwater Robotics

水下机器人异常诊断的协作推理框架

Markus Buchholz, Niamh Ellis, Rahaf Abu Hara, Ignacio Carlucho, Yvan R. Petillot

机构 * School of Engineering & Physical Sciences, Heriot-Watt University(工程与物理科学学院,赫瑞斯泰大学)

专题命中 安全训练 :safety(abstract);trustworthy(abstract)

AI总结 研究水下机器人异常诊断,提出AURA协作框架,集成大语言模型、数字孪生和人在回路交互,通过两个代理进行异常检测与诊断,经人类验证的诊断转化为训练示例完善模型,建立可信赖、不断改进的人机团队模式。

Comments Paper was submitted for ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08409 2026-07-10 cs.CL cs.AI 新提交 62%

When Synthetic Speech Is All You Have: Better Call GRPO

当你只有合成语音时:最好调用GRPO

Shashi Kumar, Yanis Labrak, Hasindri Watawana, Sergio Burdisso, Esaú Villatoro-Tello, Kadri Hacioğlu, Petr Motlicek, Andreas Stolcke

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究基于大语言模型的ASR在受监管领域因隐私问题受限,转向强化学习,用GRPO方法处理合成语音,相比监督微调,GRPO能大幅降低WER,还分析了GRPO的优势及收益来源,表明合成语音为主时强化学习更优。

Comments Submitted to SLT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08066 2026-07-10 cs.AI cs.LG 新提交 62%

Persuasion Attacks Can Decrease Effectiveness of CoT Monitoring

说服攻击会降低思维链监测的有效性

Jennifer Za, Julija Bainiaksina, Nikita Ostrovsky, Tanush Chopra, Victoria Krakovna

机构 * LASR Labs(LASR实验室) University College London(伦敦大学学院) Google DeepMind(谷歌DeepMind)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究 CoT 监测在对抗性说服攻击下的有效性,设计评估框架发现其单独使用不足以抵御攻击,引入事实核查监测框架,不同模型家族配对可有效减少违反政策行动批准,为 CoT 监测抗攻击提供有力缓解措施。

Comments 25 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08056 2026-07-10 cs.LG cs.AI stat.ML 新提交 62%

Reinforcing the Generation Order of Multimodal Masked Diffusion Models

强化多模态掩码扩散模型的生成顺序

Yidong Ouyang, Zhe Wang, Sourav Bhabesh, Dmitriy Bespalov

机构 * University of California, Los Angeles(加州大学洛杉矶分校) AGI Foundations for AWS(AWS强化人工智能基础)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 研究文本到图像合成及多模态理解中生成顺序的优化,引入经组相对策略优化训练的可学习控制模块,提升了DLMs的文本到图像对齐和多模态理解能力,在相关基准测试中取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08054 2026-07-10 cs.LG cs.AI 新提交 62%

Who Analyses the Analyser? Self-Validating LLM Hazard Analysis with Constitutional Meta-STPA

谁来分析分析器?使用结构化元安全分析过程的自验证大语言模型风险分析

Samuel Tetteh, Udip Shrestha, Joshua R. Waite, Cody Fleming

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型辅助安全分析工具自身缺乏分析的问题,提出结构化元安全分析过程,通过运行元安全分析过程推导治理章程,包含21条工具原则和8条元安全原则,还报告了自推导等四个发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08028 2026-07-10 cs.AI cs.CL cs.SE 新提交 62%

From Prompts to Contracts: Harness Engineering for Auditable Enterprise LLM Agents

从提示到契约:用于可审计企业大语言模型代理的 harness 工程

Joongho Ahn, Moonsoo Kim

机构 * AI Leadership Research Center(人工智能领导力研究中心)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 研究针对企业大语言模型应用从原型到产品化的需求,提出 harness 工程方法,在韩国企业数据切片上实例化并评估三个问题,包括契约保留、模型替换检查及代码执行效果,形成可将原型转为可审计应用的工程模式。

Comments 32 pages, 6 figures, 16 tables. Reference implementation and evaluation artifacts: https://github.com/hammerbaki/enterprise-llm-agent-harness (archived at https://doi.org/10.5281/zenodo.21269426)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02379 2026-07-10 cs.CY cs.AI 版本更新 62%

The Contribution of XAI for the Safe Development and Certification of AI: An Expert-Based Analysis

可解释人工智能对人工智能安全开发与认证的贡献:基于专家的分析

Benjamin Fresz, Vincent Philipp Göbels, Safa Omri, Danilo Brajovic, Andreas Aichele, Janika Kutz, Jens Neuhüttler, Marco F. Huber

专题命中 安全训练 :trustworthy(abstract);分类 cs.AI、cs.CY

AI总结 探讨可解释人工智能(XAI)方法对人工智能安全开发与认证的作用,通过对专家的15次定性访谈发现,XAI方法虽能揭示机器学习模型偏差等问题助力安全开发,但因认证需全面正确信息,其影响有限。

Comments This preprint has not undergone peer review or any post-submission improvements or corrections. The Version of Record of this contribution is published in Artificial Intelligence in HCI (HCII 2026), Lecture Notes in Computer Science, vol. 16745, and is available online at https://doi.org/10.1007/978-3-032-30849-8_13

Journal ref Degen, H., Ntoa, S. (eds) Artificial Intelligence in HCI. HCII 2026. Lecture Notes in Computer Science, vol 16745, pp. 219--242. Springer, Cham (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02966 2026-07-10 cs.CL 新提交 57%

Distill Where the Student Goes: Teacher-Regularized RL for English-Evidence Cross-Lingual RAG

提炼学生的走向:用于英语-证据跨语言检索增强生成的教师正则化强化学习

Haotian Zhou, Weiran Huang, Siqi Liu, Xiting Wang, Xin Zhang, Zhihao Wen

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程系) Ant International, Ant Group(蚂蚁集团蚂蚁国际) Shanghai Innovation Institute(上海创新研究院) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 研究英语证据跨语言检索增强生成中的问题,提出教师正则化强化学习方法TR-RAG,结合奖励优化与策略内蒸馏,引入奖励分解,在多基准测试中提升语言依从性和证据正确性。

Comments 42 pages, 19 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15920 2026-07-10 cs.CV 新提交 50%

OmniOPSD: Rationale-Privileged On-Policy Self-Distillation for Affective Computing

OmniOPSD:面向情感计算的理性特权在线自蒸馏

Zebang Cheng, Shuimu Chen, Boxue Yang, Yuanshen Guan, Jingyi Chen, Zheng Lian, Xiaojiang Peng, Fei Ma, LaiZhong Cui, Qi Tian

机构 * Shenzhen University(深圳大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学) Shenzhen Technology University(深圳技术大学) Tongji University(同济大学) Huawei(华为)

专题命中 安全训练 :safety(abstract)

AI总结 针对多模态大模型在复杂推理任务中奖励稀疏的问题,提出OmniOPSD框架,利用前沿模型生成的理性作为教师特权证据而非学生模仿目标,通过在线自蒸馏提供密集令牌级监督,在MER-UniBench上取得84.19平均分的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11549 2026-07-10 cs.HC 版本更新 50%

UNIPO: Unified Interactive Visual Explanation for RL Fine-Tuning Policy Optimization

UNIPO:统一的交互式可视化用于RL微调策略优化

Aeree Cho, Alexander D. Greenhalgh, Jonathan Bodea, Anthony Peng, Duen Horng Chau

专题命中 安全训练 :alignment(abstract)

AI总结 UNIPO通过统一设计揭示RL微调算法的token级训练动态,提供高阶训练概述、步骤级提示响应检查器和算法对比视图,支持非专家教学和AI从业者算法选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21858 2026-07-10 math.OC 版本更新 50%

When to Match: A Cost-Balancing Principle for Dynamic Markets

何时匹配:动态市场的成本平衡原则

Jie Liu, Hailun Zhang, Jiheng Zhang

专题命中 安全训练 :safety(abstract)

AI总结 研究动态市场中平台何时匹配的问题,提出成本平衡(CB)规则,在无需预测的情况下,能根据等待成本与当前匹配成本比例决定匹配时机,相比行业标准有成本和延迟优势,是简单高效且最坏情况最优策略。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 2 篇

2607.07903 2026-07-10 cs.CR cs.AI 新提交 70%

Mechanistic Interpretability of LLM Jailbreaks via Internal Attribution Graphs

通过内部归因图对大语言模型越狱进行机制性可解释性研究

Anupam Wagle, Ifrat Ikhtear Uddin, Chaowei Zhang, Longwei Wang

机构 * Department of Computer Science, University of South Dakota(南达科他大学计算机科学系) School of Information and Artificial Intelligence, Yangzhou University(扬州大学信息与人工智能学院)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 研究大语言模型越狱漏洞,通过构建内部计算图揭示对抗攻击引发的内部推理转变,提出统一框架实现因果诊断,实验证明计算图偏差与不安全行为相关,干预可提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12497 2026-07-10 cs.CR 版本更新 50%

Demystifying LLM Supply Chain Vulnerabilities in the Wild: Distribution, Root Cause, and Real-World Impact

揭开大语言模型供应链在实际应用中的漏洞:分布、根源及现实世界影响

Shenao Wang, Yanjie Zhao, Zhao Liu, Quanchen Zou, Haoyu Wang

专题命中 越狱攻击 :safety(abstract)

AI总结 该研究首次系统大规模实证分析大语言模型供应链漏洞,分析529个实际漏洞,发现漏洞集中在应用层等,特定漏洞源于独特特征,还研究了现实影响,提炼5条见解,为保障供应链安全提供数据基础与研究方向。

Comments Accepted by Internetware 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 2 篇

2607.08147 2026-07-10 cs.CR cs.AI 新提交 79%

Prismata: Confining Cross-Site Prompt Injection in Web Agents

Prismata:限制Web代理中的跨站提示注入

Corban Villa, Alp Eren Ozdarendeli, Sijun Tan, Raluca Ada Popa

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 研究针对Web代理跨站提示注入问题,提出Prismata防御机制,通过动态信任推导生成权限标签,结合机械限制执行标签,无需开发者注释,能有效降低攻击成功率并保留良性任务效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03378 2026-07-10 cs.CR cs.SE 版本更新 78%

ARGUS: Defending LLM Agents Against Context-Aware Prompt Injection

ARGUS:防御大语言模型智能体免受上下文感知提示注入攻击

Shihao Weng, Yang Feng, Jinrui Zhang, Xiaofei Xie, Jiongchi Yu, Jia Liu

专题命中 提示注入 :prompt injection(title,abstract)

AI总结 研究针对LLM智能体的上下文感知提示注入攻击,提出AgentLure基准测试及ARGUS因果溯源审计器,通过构建溯源图等验证行动因果依据,在AgentLure上降低攻击成功率,提升安全-效用权衡表现。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 2 篇

2607.07760 2026-07-10 cs.AI cs.SI 新提交 57%

Adversarial Social Epistemology for Assemblies of Humans and Large Language Models

人类与大语言模型集合的对抗性社会认识论

Mihnea C. Moldoveanu, Joel A. C. Baum

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI

AI总结 研究人类与大语言模型集合在密集互动交流场景中的信息问题,提出对抗性社会认识论,借助语言、机制及基于认知网络的 machinery 来分析、破坏信任并审计纠正信任违规。

Comments 50 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04728 2026-07-10 cs.HC 50%

A Multi-Agent Framework for Democratizing XR Content Creation in K-12 Classrooms

面向K-12教室的多智能体框架:民主化XR内容创作

Yuan Chang, Zhu Li, Jiaming Qu

专题命中 幻觉与事实性 :safety(abstract)

AI总结 本文提出多智能体XR创作框架,通过四个专业代理解决K-12教育中XR内容创作的技术障碍和生成AI的幻觉风险,实现教育内容的安全生成与教学增强。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 隐私与版权 2 篇

2607.08282 2026-07-10 cs.CR cs.AI cs.MA 新提交 57%

Multi-Agent Firewall Architecture for Privacy Protection of Sensitive Data in Interactions with Language Models

用于在与语言模型交互中保护敏感数据隐私的多智能体防火墙架构

Hugo García Cuesta, Pablo Mateo Torrejón, Alfonso Sánchez-Macián

机构 * Universidad Carlos III de Madrid(卡洛斯三世大学)

专题命中 隐私与版权 :prompt injection(abstract);分类 cs.AI

AI总结 针对大语言模型集成到工作流程中缺乏保障措施的风险,提出开源多智能体防火墙架构,结合浏览器扩展和代理拦截流量,通过混合方法防止数据泄漏,分层架构可跨异构环境部署,最佳配置下F1分数达94.93%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10254 2026-07-10 cs.LG 版本更新 57%

Improving TabPFN's Synthetic Data Generation by Integrating Causal Structure

通过整合因果结构改进TabPFN的合成数据生成

Davide Tugnoli, Andrea De Lorenzo, Marco Virgolin, Giovanni Cinà

机构 * Department of Mathematics, Informatics and Geosciences(数学、信息学与地质科学系) University of Trieste(特里este大学) Department of Engineering and Architecture(工程与建筑系) InSilicoTrials Technologies BV(InSilicoTrials技术公司) Amsterdam UMC Institute for Logic, Language and Computation(阿姆斯特丹大学医学中心逻辑、语言与计算研究所) University of Amsterdam(阿姆斯特丹大学)

专题命中 隐私与版权 :alignment(abstract);分类 cs.LG

AI总结 通过整合因果结构改进TabPFN的合成数据生成,提升合成数据的质量和稳定性

Comments Camera-ready version, accepted at UAI 2026. 9 pages main text, 44 pages total (including supplementary material), 35 figures. Code: https://github.com/DavideTugnoli/tabpfn-causal-synthetic

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 安全评测 18 篇

2607.07859 2026-07-10 cs.AI cs.HC cs.LG 新提交 84%

Feedback Manipulation Regularization: Enabling Offline Agent Alignment for Imitation Learning

反馈操纵正则化:实现用于模仿学习的离线智能体对齐

Benjamin Poole, Minwoo Lee

专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 研究聚焦强化学习智能体行为与人类价值观对齐。提出反馈操纵正则化算法,利用评估反馈校正模仿学习策略。通过改编安全体育馆环境测试,该方法能提升适应性、减少对齐错误,在有限数据下也保持稳健。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08374 2026-07-10 cs.CL cs.AI cs.HC cs.RO cs.SI 新提交 81%

Large-Language-Models-as-a-Judge in Theory-Agnostic Adaptive Metric-Alignment for Prototypical Networks in Personality Recognition

大语言模型作为人格识别中原型网络的理论无关自适应度量对齐的评判器

Jing Jie Tan, Ban-Hoe Kwan, Danny Wee-Kiat Ng, Yan-Chai Hum, Shih-Yu Lo, Po-An Chen, Noriyuki Kawarazaki, Kosuke Takano, Anissa Mokraoui

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究针对人格识别受理论依赖公式限制的问题,提出理论无关的JAM框架,通过注意力池化图原型网络和跨理论协调方法学习结构化表示并统一数据集,还用大语言模型作为评判器机制,提升了跨框架泛化能力和性能。

Journal ref IEEE Transactions on Affective Computing (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08038 2026-07-10 cs.AI 新提交 79%

A safety-oriented hypothetico-deductive framework for AI-assisted differential diagnosis

一种用于人工智能辅助鉴别诊断的面向安全的假设-演绎框架

Fan Ma, Mauro Giuffrè, Donald Wright, Kent McCann, Mark Iscoe, Lingfei Qian, Mingyang Jiang, Chi Wing Ng, Na Hong, Huan He, Cathy Shyr, Qingyu Chen, Lee Schwamm, Lucila Ohno-Machado, Hua Xu

机构 * Yale School of Medicine, Yale University(耶鲁大学医学院,耶鲁大学) Università degli Studi di Trieste(的里雅斯特大学) Vanderbilt University(范德堡大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 研究针对诊断错误威胁,提出AegisDx框架,通过协调LLM组件进行鉴别诊断、筛查危险情况、验证推理等。经多层面评估,该框架在诊断准确率及安全评分等方面表现优于独立LLM,为急性护理提供更优床边决策支持

详情

展开后加载摘要…

URL PDF HTML 收藏