arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-03 至 2026-06-03 共收录 33 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 33 篇

2606.03648 2026-06-03 cs.CL cs.AI 81%

Safety Measurements for Fine-tuned LLMs Should be Grounded in Capability

微调大语言模型的安全性测量应基于能力

Krishnapriya Vishnubhotla, Hillary Dawkins, Isar Nejadgholi, Svetlana Kiritchenko

机构 * National Research Council, Canada(加拿大国家研究理事会)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 通过将微调锚定于特定能力目标,多维度评估微调对模型能力和安全性的影响,发现微调模型对安全提示可能产生不连贯输出、自动安全判断不可靠,且结论因安全基准和评估者而异。

Comments 8 pages plus appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03180 2026-06-03 cs.CV cs.CL cs.LG 81%

GLINT: Sparsely Gated Vision-Language Alignment for Fine-Grained Radiology Representations

GLINT:面向细粒度放射学表征的稀疏门控视觉-语言对齐

Jonggwon Park, Seongeun Lee, Junhyun Park, Hannah Yun, Hyunwoong Kim, Sohyun Jeong, Hyewon Kang, Byungmu Yoon, Kyoyun Choi

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.LG

AI总结 针对放射学图像-报告全局对齐与局部病灶尺度不匹配的问题,提出GLINT框架,通过稀疏门控对齐和密集特征正则化实现零样本分类、定位和分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29930 2026-06-03 cs.AI cs.CY cs.HC 81%

Toward AI That Understands Self and Others: A World-Model Theory of Cognitive Diversity and Alignment

迈向理解自我与他人的AI系统:人类认知多样性与世界模型对齐的多阶段推理框架

Toru Takahashi

机构 * Human Informatics and Systems Lab, Doshisha University(立命馆大学人机系统实验室) Linked Open Data Initiative, NPO Keio Research Institute at SFC(庆应义塾大学SFC研究所开放数据计划) Stroly Inc(Stroly公司)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.CY

AI总结 提出多阶段推理框架(MIM),通过阶段形成空间、前景化场、主体特定轮廓状态和状态表示对齐图,形式化异质世界模型的产生,并将世界模型对齐重新定义为使异质表示相互可处理的问题,而非强制一致。

Comments 87 pages. Revised version with a refined abstract emphasizing disagreement as a late-stage phenomenon, target admissibility, processability, and the methodological abstraction used to compare humans, AI systems, and institutional decision procedures under shared information-theoretic constraints

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03644 2026-06-03 cs.LG 79%

Spatial Transcriptomics-Guided Alignment Enhances Molecular Profiling in Pathology Foundation Model

空间转录组学引导的对齐增强病理基础模型中的分子分析

Fengtao Zhou, Yingxue Xu, Zhengyu Zhang, Yihui Wang, Zhengrui Guo, Ling Liang, Jiabo Ma, Cheng Jin, Ziyi Liu, Huajun Zhou, Hongyi Wang, Du Cai, Chenglong Zhao, Xi Wang, Can Yang, Yu Wang, Wenbin Li, Feng Gao, Zhe Wang, Zhenhui Li, Xiuming Zhang, Li Liang, Hao Chen

机构 * Department of Computer Science and Engineering, The Hong Kong University of Science and Technology, Hong Kong SAR, China(计算机科学与工程系,香港科学与技术大学,香港特别行政区,中国) Department of Pathology, Nanfang Hospital, Southern Medical University, Guangzhou, China(pathology department, 南方医科大学南芳医院,广州,中国) Department of Pathology, School of Basic Medical Sciences, Southern Medical University, Guangzhou, China(pathology department, 南方医科大学基础医学学院,广州,中国) Guangdong Province Key Laboratory of Molecular Tumor Pathology, Guangzhou, China(广东省分子肿瘤病理学重点实验室,广州,中国) Jinfeng Laboratory, Chongqing, China(金风实验室,重庆,中国)

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

AI总结 提出STAMP框架,利用空间转录组数据通过通路感知对齐策略增强病理基础模型的分子感知能力,并在多层级评估中验证其临床效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31381 2026-06-03 cs.CL 79%

LLM Judges Inconsistently Disagree Across Safety Criteria and Harm Categories

LLM 法官在安全标准和危害类别上不一致地存在分歧

Krishnapriya Vishnubhotla, Sowmya Vajjala, Akriti Vij, Isar Nejadgholi

机构 * National Research Council, Canada(加拿大国家研究理事会) IMDA, Singapore(新加坡信息通信技术发展局)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

AI总结 本研究评估了自动法官在无参考设置下进行多维安全评估的一致性,发现大型语言模型在识别金融等受监管领域中机器生成建议的安全问题时不可靠,且不一致程度因安全标准、内容语言和风格而异,不同法官之间也存在高度分歧。

Comments 8 pages plus appendices, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23099 2026-06-03 cs.LG cs.AI stat.ML 73%

ProEval: Proactive Failure Discovery and Efficient Performance Estimation for Generative AI Evaluation

ProEval:生成式AI评估的主动故障发现与高效性能估计

Yizheng Huang, Wenjun Zeng, Aditi Kumaresan, Zi Wang

机构 * Google DeepMind(谷歌DeepMind)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 提出ProEval框架,利用预训练高斯过程进行贝叶斯积分和超水平集采样,实现高效性能估计和主动故障发现,在推理、安全对齐和分类基准上以8-65倍更少样本达到1%误差内估计。

Comments Our open-sourced code and data can be found at https://github.com/google-deepmind/proeval

Journal ref International Conference on Machine Learning, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02852 2026-06-03 cs.SE 71%

Dependency-Guided Repository-Level C-to-Rust Translation with Reinforcement Alignment

依赖引导的仓库级C到Rust翻译与强化对齐

Jia Feng, Wenjie Gan, Cuiyun Gao, Chaozheng Wang, Feng Luo, Xin Xia, Ge Li, Kui Liu

专题命中 安全评测 :alignment(title)

AI总结 提出DepTrans框架,通过强化对齐语法训练和依赖引导迭代精炼,实现仓库级C到Rust的高效翻译,编译成功率和计算准确性分别提升22.8和17.3个百分点。

Comments Accepted by FSE 2026 Industry

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03128 2026-06-03 cs.CR cs.AI cs.CL cs.LG 67%

Decoupled Smart Contract Audits: Lightweight LLM Framework via Distillation and Aggregation

解耦式智能合约审计:通过蒸馏与聚合的轻量级LLM框架

Bagus Rakadyanto Oktavianto Putra, Muhamad Risqi Utama Saputra, Widyawan, Guntur Dharma Putra

机构 * University of Indonesia(印度尼西亚大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出一种基于轻量级开源LLM(0.6B-4B参数)的解耦式智能合约审计框架,通过rsLoRA、知识蒸馏和链式验证聚合策略,在漏洞检测中达到98.25%准确率,优于7B-34B参数模型。

Comments 12 pages, 4 figures, 5 tables. Accepted to IEEE ICWS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23055 2026-06-03 cs.LG cs.AI cs.CL 67%

Decomposing and Measuring Evaluation Awareness

分解与度量评估意识

Changling Li, Terry Jingchen Zhang, Jie Zhang, Zhijing Jin, Sahar Abdelnabi, Maksym Andriushchenko

机构 * ETH Zürich(苏黎世联邦理工学院) ELLIS Institute Tübingen(图宾根ELLIS研究所) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究院) Tübingen AI Center(图宾根人工智能中心) University of Toronto & Vector Institute(多伦多大学及向量研究所) EuroSafeAI(欧洲安全人工智能)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究借鉴社会心理学,将评估意识分解为环境与模型两部分,通过EvalAwareBench基准测试发现识别率取决于模型与基准的配对,且识别很少导致行为改变,安全评估比能力评估更易受影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16666 2026-06-03 cs.AI cs.CY cs.LG 67%

Towards a Science of AI Agent Reliability

迈向AI代理可靠性的科学

Stephan Rabanser, Sayash Kapoor, Peter Kirgis, Kangheng Liu, Saiteja Utpala, Arvind Narayanan

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文提出十二个具体指标,从一致性、鲁棒性、可预测性和安全性四个维度分解AI代理的可靠性,并通过实验揭示能力提升仅带来可靠性小幅改进。

Comments Accepted at ICML 2026. Interactive dashboard available at: https://hal.cs.princeton.edu/reliability

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19684 2026-06-03 cs.LG cs.AI cs.CL cs.CV 67%

CoMPAS3D: A Dataset and Benchmark for Interactive Motion

CoMPAS3D: 一个用于交互动作的数据集和基准

Bermet Burkanova, Yasaman Etesam, Payam Jome Yazdian, Trinity Evans, Chuxuan Zhang, Zoe Stanley, Paige Tuttösí, Angelica Lim

机构 * School of Computing Science Simon Fraser University(计算科学学院西蒙弗雷泽大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出CoMPAS3D数据集和评估框架,通过动作可读性和熟练度适当性等客观指标,解决交互式动作生成中缺乏社交上下文评估的问题。

Comments https://rosielab.github.io/compas3d

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20508 2026-06-03 cs.MA cs.AI cs.CL 66%

Measuring Weak-to-Strong Legibility of Reasoning Models

衡量推理模型的弱到强可读性

Dani Roytburg, Shreya Sridhar, Daphne Ippolito

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI;trustworthy(comments)

AI总结 针对推理语言模型在多智能体场景中生成的中间思维链,提出“弱到强可读性”概念,并设计衡量指标以评估强模型输出对弱模型的易理解性。

Comments Accepted to Trustworthy AI4GOOD Workshop @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03647 2026-06-03 cs.CR cs.AI cs.LG 62%

Black-box, Adaptive, Efficient, Transferable, Harmful, Applicable... Attacks Are All You Need to Break LLMs

黑盒、自适应、高效、可迁移、有害、适用……攻击是破解LLM所需的一切

Vincent Limbach, Jonas Dornbusch, David Lüdke, Stephan Günnemann, Leo Schwinn

机构 * University of St. Gallen(圣加尔大学)

专题命中 安全评测 :jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 提出间接危害优化(IHO)方法,通过迭代偏好优化训练掩码扩散语言模型攻击器,实现黑盒、高效、可迁移的自适应攻击,显著提升对分层防御的破解成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03626 2026-06-03 cs.CV cs.AI cs.CY 62%

TurtleAI: Benchmarking Multimodal Models for Visual Programming in Turtle Graphics

TurtleAI:海龟图形学中视觉编程的多模态模型基准测试

Chao Wen, Jacqueline Staub, Adish Singla

机构 * MPI-SWS(马克斯·普朗克研究所-斯图加特)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 提出TurtleAI基准,包含823个基于海龟图形学真实任务的视觉编程任务,评估20多个多模态模型发现成功率低于30%,并通过少量种子样本生成合成数据微调Qwen2-VL-72B提升约20%性能。

Comments ACL Findings 2026 paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03331 2026-06-03 cs.CL cs.AI 62%

Evaluating LLMs' Effectiveness on Real-World Consumer Device Repair Questions

评估大语言模型在真实世界消费设备维修问题上的有效性

Atm Mizanur Rahman, Md Arid Hasan, Syed Ishtiaque Ahmed, Sharifa Sultana

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Toronto(多伦多大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文通过引入包含991个真实维修问题的基准测试,评估六种大语言模型在英语和孟加拉语上的正确性、完整性、实用性和安全性,发现模型虽能提供有用帮助,但在高风险维修任务中仍不可靠。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02741 2026-06-03 cs.CL cs.CY 62%

Greener Than Humans? Environmental Attitudes in Large Language Models

比人类更绿色?大语言模型中的环境态度

Stefanie Kunkel, Tilman Hartwig, Marcus Voss, Emma K. Schütt, Angelika Gellrich

机构 * University of Tübingen(图宾根大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.CY

AI总结 通过构建基准评估31个LLM的环境认知、情感和行为建议,发现多数模型比德国调查受访者更倾向环保态度,但存在语境敏感性和谄媚偏移。

Comments Code can be found at https://gitlab.opencode.de/uba-ki-lab/llm-questionnaire-benchmarking-framework Benchmark data and results can be found at https://zenodo.org/records/20445903

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18572 2026-06-03 cs.CV cs.AI cs.LG 62%

Back into Plato's Cave: Examining Cross-modal Representational Convergence at Scale

回到柏拉图的洞穴:大规模检验跨模态表示收敛性

A. Sophia Koepke, Daniil Zverev, Shiry Ginosar, Alexei A. Efros

机构 * UC Berkeley(伯克利大学) Technical University Munich, MCML(慕尼黑技术大学) University of Tübingen, Tübingen AI Center(图宾根大学) Toyota Technical Institute at Chicago(芝加哥丰田技术研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文通过大规模数据集实验,质疑了柏拉图表示假说中跨模态表示收敛的证据,发现对齐度随数据规模增大而显著下降,且仅反映粗粒度语义重叠。

Comments Project page: http://akoepke.github.io/cave_umwelten/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08247 2026-06-03 cs.CL cs.CY 62%

ParliaBench: An Evaluation and Benchmarking Framework for LLM-Generated Parliamentary Speech

ParliaBench: 面向大语言模型生成的议会演讲的评估与基准框架

Marios Koniaris, Argyro Tsipi, Panayiotis Tsanakas

机构 * University of Cambridge(剑桥大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.CY

AI总结 提出ParliaBench基准框架,通过构建英国议会数据集、结合计算指标与LLM评判的评估方法以及两种新型嵌入指标(政治光谱对齐和政党对齐),系统评估LLM生成议会演讲的语言质量、语义连贯性和政治真实性,实验表明微调显著提升多数指标且新指标对政治维度具有强区分力。

Journal ref Proceedings of the Fifteenth Language Resources and Evaluation Conference (LREC 2026), pp. 4797-4818, European Language Resources Association (ELRA), Palma, Mallorca, Spain, May 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03116 2026-06-03 eess.AS cs.AI cs.SD 57%

AnyAudio-Judge: A Dynamic Rubric-Based Benchmark and Evaluator for Audio Instruction Following

AnyAudio-Judge:基于动态评分标准的音频指令跟随基准与评估器

Haitao Li, Tian Tan, Yuguang Yang, Shan Yang, Xie Chen

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) Tencent Hunyuan(腾讯文脉)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 针对指令引导音频生成中复杂指令解耦困难、评估缺乏可解释性和细粒度属性匹配的问题,提出基于动态评分标准的评估范式,通过自适应分解音频描述为可验证的二元评分项,并构建包含7920个样本的双语基准和105K训练语料,结合SFT与GRPO训练专用评估器,在零样本对齐检测和下游强化学习指令对齐中取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03635 2026-06-03 cs.CV cs.AI 57%

VidMsg: A Benchmark for Implicit Message Inference in Short Videos

VidMsg:短视频中隐含信息推断的基准测试

Issar Tzachor, Michael Green, Rami Ben-Ari

机构 * OriginAI, Israel(OriginAI以色列)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 提出VidMsg基准,通过消息优先构建流程和双向检索任务,评估视频理解模型对短视频中隐含信息的推断能力。

Comments Project page: https://iyttor.github.io/VidMsg

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03312 2026-06-03 cs.RO cs.AI 57%

RobotValues: Evaluating Household Robots When Human Values Conflict

RobotValues: 当人类价值观冲突时评估家用机器人

Jongwook Han, Hyeongjin Kim, Yohan Jo

机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 提出RobotValues基准,通过10K个价值冲突场景评估家用机器人规划器,发现视觉语言模型存在默认价值偏好且难以覆盖,表明评估需考虑价值冲突下的行动选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02959 2026-06-03 cs.LG cs.CR 57%

Gate AI: LLM Security Benchmark Evaluation Methodology and Results

Gate AI:大语言模型安全基准评估方法与结果

Ryle Goehausen, Marcus Sousa

机构 * constellationnetwork(Constellation Network)

专题命中 安全评测 :jailbreak(abstract);分类 cs.LG

AI总结 针对提示注入和越狱检测器评估中数据集阈值调优和操作点未公开的问题,提出一种采用5折交叉验证、全局操作点选择和多种泛化诊断的评估框架,并在16个公开基准上进行了测试。

Comments 17 pages, 23 figures, 2 tables. Working preprint; subsequent versions may update benchmark numbers as the framework evolves

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02755 2026-06-03 cs.SE cs.AI 57%

Acceptance-Test-Driven Evaluation Protocols for Business-Centric LLM Systems

面向业务中心LLM系统的验收测试驱动评估协议

Eric Liang

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 针对LLM系统概率生成与确定性需求不匹配问题,提出基于验收测试驱动开发、安全工程和业务中心验证的评估协议,将利益相关者目标转化为可执行行为契约,并采用红-训练-绿生命周期确保多维门控通过后才发布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01166 2026-06-03 cs.CR cs.CL 57%

BraveGuard: From Open-World Threats to Safer Computer-Use Agents

BraveGuard: 从开放世界威胁到更安全的计算机使用代理

Yunhao Feng, Xiaohu Du, Xinhao Deng, Yifan Ding, Ming Wen, Yixu Wang, Yuxiang Xie, Baihui Zheng, Yingshui Tan, Yige Li, Yutao Wu, Kerui Cao, Wenke Huang, Yanming Guo, Xingjun Ma, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Ant Group(蚂蚁集团) Hunan Institute of Advanced Technology(湖南高级技术研究所) Alibaba Group(阿里巴巴集团) Singapore Management University(新加坡管理大学) Deakin University(德肯大学) Nanyang Technological University(南洋理工大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 提出BraveGuard框架,通过从开放世界威胁信号和真实代理轨迹中训练防护模型,实现轨迹级别的安全检测,显著提升计算机使用代理的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18160 2026-06-03 cs.CV cs.AI 57%

Vision Inference Former: Sustaining Visual Consistency in Multimodal Large Language Models

Vision Inference Former:在多模态大语言模型中维持视觉一致性

Xinpeng Dong, Min Zhang, Kairong Han, Xu Tan, Fei Wu, Kun Kuang

机构 * Zhejiang University(浙江大学) East China Normal University(华东师范大学) Zhejiang University of Science and Technology(浙江理工大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 针对多模态大语言模型中视觉信息被弱化的问题,提出Vision Inference Former(VIF)轻量模块,在推理解码阶段持续注入视觉语义,提升生成内容与视觉的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12430 2026-06-03 cs.MA cs.AI 57%

Agent Skills for Large Language Models: Architecture, Acquisition, Security, and the Path Forward

大型语言模型的智能体技能:架构、获取、安全与未来路径

Renjun Xu, Yang Yan

机构 * ReDiscovery Hangzhou China(杭州ReDiscovery研究院) Westlake University Hangzhou China(西交大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文综述了大型语言模型智能体技能的研究,涵盖架构基础(如SKILL.md规范、渐进式上下文加载)、技能获取(强化学习、自主发现、组合合成)、大规模部署(计算机使用智能体栈、GUI接地)以及安全挑战(26.1%社区技能含漏洞),并提出技能信任与生命周期治理框架。

Comments Accepted by Agent Skills '26 Workshop at ACM Conference on AI and Agentic Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05530 2026-06-03 cs.AI 57%

MIND: Multi-rationale INtegrated Discriminative Reasoning Framework for Multi-modal Large Models

MIND:面向多模态大模型的多理由集成判别推理框架

Chuang Yu, Jinmiao Zhao, Mingxuan Zhao, Yunpeng Liu, Xiujun Shu, Yuanhao Feng, Bo Wang, Xiangyu Yue

机构 * Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学) MMLab, CUHK(CUHK多模态实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 针对多模态大语言模型在多理由语义建模、逻辑鲁棒性和抗误导方面的不足,提出MIND推理框架,通过“理解-反思-纠正”机制实现从被动模仿到主动判别推理的范式转变。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.07867 2026-06-03 eess.SY cs.LG cs.SY 57%

Learning Power Flow with Confidence: A Probabilistic Guarantee Framework for Voltage Risk

学习潮流与置信度:电压风险的概率保证框架

Parikshit Pareek, Sidhant Misra, Deepjyoti Deka

机构 * Department of Electrical Engineering, Indian Institute of Technology Roorkee, India(印度理工学院罗奥克分校电气工程系) Los Alamos National Laboratory, New Mexico, USA(洛斯阿拉莫斯国家实验室) MIT Energy Initiative, Boston, USA(麻省理工学院能源倡议)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 针对机器学习在电力系统安全应用中缺乏形式化性能保证的问题,提出基于高斯过程回归的概率保证框架,通过顶点度核和网络扫描主动学习算法实现数据高效且可靠的电压风险评估。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03872 2026-06-03 eess.SY cs.SY 50%

NeuroSymbolic Robustness Analysis for Discrete Systems with Respect to Transition Deviations

针对转移偏差的离散系统神经符号鲁棒性分析

Shih-Jie Shih, Jonghan Lim, Ilya Kovalenko, Rômulo Meira-Góes

专题命中 安全评测 :safety(abstract)

AI总结 提出一种神经符号计算框架,利用大语言模型推断可行偏差转移集,再通过符号层计算离散鲁棒性保证,以解决传统方法可扩展性差和保守性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03417 2026-06-03 cs.CV 50%

A unified multi-task framework enables interpretable chest radiograph analysis

统一多任务框架实现可解释的胸部X光片分析

Lijian Xu, Ziyu Ni, Xinglong Liu, Xiaosong Wang, Hongsheng Li, Shaoting Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 安全评测 :trustworthy(abstract)

AI总结 提出IMT-CXR框架,通过统一Transformer架构模拟放射科医生诊断流程,实现疾病识别、属性表征和可追溯报告生成,在十个基准上表现优异,且临床评估中66%的AI报告达到或超越原始报告。

详情

展开后加载摘要…

URL PDF HTML 收藏