arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9311 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9311 篇

2604.23523 2026-04-28 cs.SE cs.AI 79%

Grammar-Constrained Refinement of Safety Operational Rules Using Language in the Loop: What Could Go Wrong

基于语言闭环的安全操作规则语法约束细化:可能发生的问题

Khouloud Gaaloul, Zaid Ghazal, Madhu Latha Pulimi, Sam Emmanuel Kathiravan

机构 * University of Michigan--Dearborn(密歇根大学迪尔伯恩分校)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出结合反事实推理与语法约束循环的框架,用于安全操作规则的细化,通过自主驾驶控制系统案例展示其在解决不一致规则中的有效性,并强调语法约束与语义验证的重要性。

Comments 6 pages, 1 figure, 2 tables. Accepted at SEAMS 2026

Journal ref Proc. 21st International Conference on Software Engineering for Adaptive and Self-Managing Systems (SEAMS 2026), ACM, 2026, 6 pages

详情
URL PDF HTML 收藏
2604.22156 2026-04-27 cs.LG cs.CV 79%

Sum-of-Checks: Structured Reasoning for Surgical Safety with Large Vision-Language Models

Sum-of-Checks: 用于手术安全的结构化推理方法基于大型视觉-语言模型

Weiqiu You, Cassandra Goldberg, Amin Madani, Daniel A. Hashimoto, Eric Wong

机构 * Department of Computer and Information Science, University of Pennsylvania(宾夕法尼亚大学计算机与信息科学系) Department of Surgery, University of Toronto(多伦多大学外科系) Surgical Artificial Intelligence Research Academy, University Health Network(外科人工智能研究学院,大学健康网络) Department of Surgery, Perelman School of Medicine, University of Pennsylvania(宾夕法尼亚大学外科系,佩雷尔曼医学院)

专题命中 安全评测 :safety(title,abstract);分类 cs.LG

AI总结 本文提出Sum-of-Checks框架,通过分解关键安全视图(CVS)标准为专家定义的检查,提升手术安全评估的准确性和透明性,实验显示其在三个模型上平均提升12-14%。

Comments IPCAI 2026 short communication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21964 2026-04-27 cs.CY 79%

Lessons from External Review of DeepMind's Scheming Inability Safety Case

从深度思维的'谋略无能'安全案例外部评审中汲取的教训

Stephen Barrett, Francisco Javier Campos Zabala, Sean P. Fillingham, Umair Siddique, James Walpole, Robin Bloomfield, Henry Papadatos

专题命中 安全评测 :safety(title,abstract);分类 cs.CY

AI总结 本文通过应用Assurance 2.0框架对DeepMind的公开'谋略无能'安全案例进行外部评审,揭示了外部评审在提升AI安全论证质量中的作用,并提出具体建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18757 2026-04-22 cs.CV cs.AI 79%

REVEAL: Multimodal Vision-Language Alignment of Retinal Morphometry and Clinical Risks for Incident AD and Dementia Prediction

REVEAL:多模态视图-语言对齐的视网膜形态学与临床风险预测

Seowung Leem, Lin Gu, Chenyu You, Kuang Gong, Ruogu Fang

机构 * J. Crayton Pruitt Family Department of Biomedical Engineering, University of Florida(佛罗里达大学J. Crayton Pruitt家族生物医学工程系) Research Institute of Electrical Communication, Tohoku University(东北大学电气通信研究所) Department of Applied Mathematics & Statistics, Stony Brook University(石溪大学应用数学与统计学系) Department of Computer Science, Stony Brook University(石溪大学计算机科学系)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 REVEAL通过多模态对齐视网膜形态学与临床风险因素,提前8年预测阿尔茨海默病和痴呆症,优于现有模型。

Comments Accepted for publication a MIDL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00439 2026-04-22 cs.CL 79%

Improving the Distributional Alignment of LLMs using Supervision

通过监督改进大型语言模型的分布对齐

Gauri Kambhatla, Sanjana Gautam, Angela Zhang, Alex Liu, Ravi Srinivasan, Junyi Jessy Li, Matthew Lease

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 本文通过简单监督提升LLM在不同群体上的分布对齐,分析了三个数据集的对齐效果,并为未来研究提供基准。

Comments ACL Main 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18519 2026-04-21 cs.AI 79%

LLM Safety From Within: Detecting Harmful Content with Internal Representations

从内部检测有害内容:利用内部表示进行LLM安全

Difan Jiao, Yilun Liu, Ye Yuan, Zhenwei Tang, Linfeng Du, Haolun Wu, Ashton Anderson

机构 * University of Toronto(多伦多大学) McGill University(麦吉尔大学) LMU Munich(慕尼黑路德维希-马克西米利安大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 SIREN通过利用内部层特征提升有害内容检测性能,相比现有模型更高效且泛化能力强。

Comments 17 pages,10 figures,6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10693 2026-04-21 cs.AI 79%

FACT-E: Causality-Inspired Evaluation for Trustworthy Chain-of-Thought Reasoning

FACT-E:基于因果的可信推理链评估

Yuxi Sun, Aoqi Zuo, Haotian Xie, Wei Gao, Mingming Gong, Jing Ma

机构 * Hong Kong Baptist University(香港 Baptist 大学) The University of Melbourne(墨尔本大学) Singapore Management University(新加坡管理大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

AI总结 FACT-E通过因果方法评估推理链的可信度,结合内部一致性与推理-答案一致性,提升推理轨迹选择质量并增强噪声下的鲁棒性。

Comments Accepted to Association for Computational Linguistics Findings (ACL) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21977 2026-04-20 cs.AI 79%

Distribution Shift Alignment Helps LLMs Simulate Survey Response Distributions

分布偏移对齐有助于LLM模拟调查响应分布

Ji Huang, Mengfei Li, Shuai Shao

机构 * School of Computer Science, University of Science and Technology of China(中国科学技术大学计算机科学学院) School of Management, Fudan University(复旦大学管理学院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出DSA方法,通过两阶段微调对齐输出分布和偏移,提升LLM模拟调查响应的准确性与效率,在五个公开数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.13850 2026-04-20 cs.CY cs.HC 79%

PADTHAI-MM: Principles-based Approach for Designing Trustworthy, Human-centered AI using MAST Methodology

PADTHAI-MM: 基于原则的方法用于使用MAST方法论设计可信、以人类为中心的AI

Myke C. Cohen, Nayoung Kim, Yang Ba, Anna Pan, Shawaiz Bhatti, Pouria Salehi, James Sung, Erik Blasch, Michelle V. Mancenido, Erin K. Chiou

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CY

AI总结 本文提出PADTHAI-MM框架,通过MAST方法论设计可信AI系统,通过READIT平台验证,评估MAST对AI信任的影响,并探讨MAST评分与信任因素的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09363 2026-04-17 cs.AI cs.SY eess.SY 79%

BarrierBench: Evaluating Large Language Models for Safety Verification in Dynamical Systems

BarrierBench: 评估大型语言模型在动态系统安全验证中的性能

Ali Taheri, Alireza Taban, Sadegh Soudjani, Ashutosh Trivedi

机构 * Isfahan University of Technology(伊斯法罕技术大学) Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所) University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出BarrierBench基准,评估大型语言模型在动态系统安全验证中的能力,通过100个动态系统案例测试语言模型在生成安全证书和协调策略中的有效性。

Comments 8th Annual Learning for Dynamics & Control Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14251 2026-04-17 cs.LG 79%

Calibrate-Then-Delegate: Safety Monitoring with Risk and Budget Guarantees via Model Cascades

校准后再委托:通过模型级联实现具有风险和预算保证的安全监控

Edoardo Pona, Milad Kazemi, Mehran Hosseini, Yali Du, David Watson, Osvaldo Simeone, Nicola Paoletti

机构 * King’s College London(伦敦国王学院) University of Manchester(曼彻斯特大学) Northeastern University London(伦敦东北大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.LG

AI总结 本文提出Calibrate-Then-Delegate方法,通过模型级联在保证计算成本的同时实现实例级决策,有效提升安全监控的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12216 2026-04-15 cs.CR cs.CL 79%

TimeMark: A Trustworthy Time Watermarking Framework for Exact Generation-Time Recovery from AIGC

TimeMark: 一种用于从AIGC中精确生成时间恢复的可信时间水印框架

Shangkun Che, Silin Du, Ge Gao

机构 * Economics and Management School, Wuhan University(武汉大学经济管理学院) School of Economics and Management, Tsinghua University(清华大学经济管理学院) School of Business Administration, Southwestern University of Finance and Economics(西南财经大学商学院)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL

AI总结 本文提出TimeMark框架,通过加密技术和监管监督下的时间依赖秘密密钥,实现100%准确的生成时间恢复,防止任意时间戳伪造,解决现有水印技术的可靠性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11174 2026-04-14 cs.RO cs.AI 79%

EmbodiedGovBench: A Benchmark for Governance, Recovery, and Upgrade Safety in Embodied Agent Systems

EmbodiedGovBench: 一种用于具身代理系统治理、恢复和升级安全性的基准

Xue Qin, Simin Luan, John See, Cong Yang, Zhijun Li

机构 * School of Software, Harbin Institute of Technology(哈尔滨工业大学软件学院) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) School of Mathematical and Computer Sciences, Heriot-Watt University, Malaysia Campus(赫瑞-瓦特大学马来西亚校区数学与计算机科学学院) School of Future Science and Engineering, Soochow University(苏州大学未来科学与工程学院)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出EmbodiedGovBench基准,用于评估具身代理系统的治理能力,包括可控性、政策边界、安全恢复和审计完整性等,填补了传统任务成功率指标的不足。

Comments 34 pages, 7 tables. Code: https://github.com/s20sc/embodied-gov-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10286 2026-04-14 cs.AI 79%

STARS: Skill-Triggered Audit for Request-Conditioned Invocation Safety in Agent Systems

STARS:基于技能触发的请求条件调用安全性审计

Guijia Zhang, Shu Yang, Xilin Gong, Di Wang

机构 * Shenzhen University(深圳大学) King Abdullah University of Science & Technology(阿卜杜拉国王科技大学) PRADA Lab(PRADA实验室) University of Georgia(佐治亚大学)

专题命中 安全评测 :safety(title);prompt injection(abstract);分类 cs.AI

AI总结 STARS通过结合静态能力先验、请求条件调用风险模型和校准风险融合策略,提升代理系统调用时的风险评估与优先级排序能力,优于静态筛查和上下文评分方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09682 2026-04-14 cs.NI cs.AI 79%

Decision-Theoretic Safety Assessment of Persona-Driven Multi-Agent Systems in O-RAN

基于决策理论的面向角色驱动的多智能体系统在O-RAN中的安全性评估

Zeinab Nezami, Syed Ali Raza Zaidi, Maryam Hafeez, Louis Powell, Vara Prasad Talari, Mallik Tatipamula

机构 * GSMA(全球移动通信系统协会) University of Leeds(利兹大学) AWS(亚马逊云服务) Ericsson(爱立信)

专题命中 安全评测 :safety(title);alignment(abstract);分类 cs.AI

AI总结 本文提出一种基于角色驱动的多智能体框架,通过角色行为规范影响五个专业智能体,结合决策理论构建三维评估框架,验证486种角色配置在O-RAN优化挑战中的性能与协调效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09606 2026-04-14 cs.AI cs.SE 79%

Evaluating Reliability Gaps in Large Language Model Safety via Repeated Prompt Sampling

通过重复提示采样评估大语言模型安全性的可靠性差距

Keita Broadwater

机构 * Independent Researcher(独立研究员)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出APST框架,通过重复采样相同提示在受控条件下揭示LLM潜在故障模式,量化不同模型和配置下的操作风险,展示浅层基准分数可能掩盖持续使用下的可靠性差异。

Comments 9 pages, 4 figures; accepted at the CCAI 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08987 2026-04-13 cs.AI 79%

PilotBench: A Benchmark for General Aviation Agents with Safety Constraints

PilotBench:一个具有安全约束的一般航空智能体基准

Yalun Wu, Haotian Liu, Zhoujun Li, Boyang Wang

机构 * School of Computing National University of Singapore China School of Informatics Xiamen University China CESS Beihang University China

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 PilotBench通过对比LLM与传统预报器,评估飞行轨迹和姿态预测,揭示了传统方法在精度上的优势与LLM在指令遵循上的优势,指出LLM在高负荷阶段表现下降,推动混合架构的发展。

Comments Accepted at the 2026 IEEE International Joint Conference on Neural Networks (IJCNN 2026). 6 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08217 2026-04-10 cs.CY 79%

Co-design for Trustworthy AI: An Interpretable and Explainable Tool for Type 2 Diabetes Prediction Using Genomic Polygenic Risk Scores

可信AI的协同设计:一种用于2型糖尿病预测的可解释和可解释工具,使用基因组多基因风险评分

Ralf Beuthan, Megan Coffee, Heejin Kim, Na Yeon Kim, Pedro Kringen, Elisabeth Hildt, Haekyung Lee, Seunggeun Lee, Emilie Wiinblad Mathez, Sira Maliphol, Vadim Pak, Yuna Park, Stephan Sonnenberg, Jesmin Jahan Tithi, Magnus Westerlund, Roberto V. Zicari

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CY

AI总结 本文提出eXplainable PRS工具,通过SHAP分解基因组多基因风险评分,提升2型糖尿病预测的可解释性,并结合法律、医疗、伦理和技术鲁棒性进行协同设计,为AI系统提供伦理和法律框架。

Comments 57 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05524 2026-04-10 cs.CL cs.IR 79%

KEO: Knowledge Extraction on OMIn via Knowledge Graphs and RAG for Safety-Critical Aviation Maintenance

KEO:通过知识图谱和RAG进行OMIn的领域知识提取

Kuangshi Ai, Jonathan A. Karr, Meng Jiang, Nitesh V. Chawla, Chaoli Wang

机构 * University of Notre Dame(圣母大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

AI总结 KEO通过知识图谱和RAG框架提升航空安全维护中的领域知识提取与推理,实验显示其在全局理解上优于传统文本块RAG,同时保持对细粒度任务的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05172 2026-04-09 cs.AI 79%

ClawsBench: Evaluating Capability and Safety of LLM Productivity Agents in Simulated Workspaces

ClawsBench: 评估LLM生产力代理在模拟工作区中的能力和安全性

Xiangyi Li, Kyoung Whan Choe, Yimin Liu, Xiaokun Chen, Chujun Tao, Bingran You, Wenbo Chen, Zonglin Di, Jiankai Sun, Shenghan Zheng, Jiajun Bao, Yuanli Wang, Weixiang Yan, Yiyuan Li, Han-chung Lee

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 ClawsBench通过高保真模拟服务和结构化任务评估LLM代理在真实生产力场景中的能力与安全性,揭示了代理在多服务协作和安全关键场景中的表现及潜在风险。

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05171 2026-04-09 eess.SY cs.AI cs.SY 79%

Towards provable probabilistic safety for scalable embodied AI systems

迈向可证明的可扩展具身AI系统的概率安全

Linxuan He, Lingxiang Fan, Qing-Shan Jia, Ang Li, Hongyan Sang, Ling Wang, Guanghui Wen, Jiwen Lu, Tao Zhang, Jie Zhou, Yi Zhang, Yisen Wang, Peng Wei, Zhongyuan Wang, Henry X. Liu, Shuo Feng

机构 * Department of Automation, Tsinghua University(清华大学自动化系) Beijing Academy of Artificial Intelligence(北京人工智能研究院) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) School of Computer, Liaocheng University(聊城大学计算机学院) Department of Automation, Southeast University(东南大学自动化学院) Department of Mechanical and Aerospace Engineering, George Washington University(乔治华盛顿大学机械与航空航天工程系) University of Michigan Transportation Research Institute(密歇根大学交通研究所) Department of Civil and Environmental Engineering, University of Michigan(密歇根大学土木与环境工程系)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出可证明的概率安全范式,旨在解决具身AI系统在复杂环境中安全验证的挑战,通过结合可证明保证与渐进式达成概率安全边界,提升系统可行性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02642 2026-04-09 q-bio.NC cs.ET cs.LG cs.NE 79%

Spike-based alignment learning solves the weight transport problem

基于尖峰的对齐学习解决权重传输问题

Timo Gierlich, Andreas Baumbach, Akos F. Kungl, Kevin Max, Mihai A. Petrovici

机构 * Department of Physiology, Bern University(伯尔尼大学生理学系) Neural Computation Unit, Okinawa Institute of Science and Technology(冲绳科学技术大学院大学神经计算单元)

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

AI总结 本文提出基于尖峰的对齐学习方法,利用尖峰时间统计消除有效互惠连接间的不对称性,提升spiking网络在权重传输问题中的性能。

Comments 28 pages, 15 figures. Updated with a comparison to the STDWI algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04849 2026-04-07 cs.CY 79%

Latent Profiles of AI Risk Perception and Their Differential Association with Community Driving Safety Concerns: A Person-Centered Analysis

人工智能风险感知的潜在轮廓及其与社区驾驶安全担忧的差异性关联:一项以人为核心分析

Amir Rafe, Anika Baitullah, Subasish Das

专题命中 安全评测 :safety(title,abstract);分类 cs.CY

AI总结 本文通过以人为核心分析,识别美国成年人中人工智能风险感知的潜在轮廓,并测试这些轮廓与社区驾驶安全担忧的差异性关联,揭示世界观驱动的风险结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04775 2026-04-07 cs.CY 79%

Community Driving-Safety Deterioration as a Push Factor for Public Endorsement of AI Driving Capability

社区驾驶安全性下降作为公众支持自动驾驶能力的推动力

Amir Rafe, Subasish Das

专题命中 安全评测 :safety(title,abstract);分类 cs.CY

AI总结 研究探讨了社区驾驶安全性担忧通过一般化人工智能倾向的中介作用,揭示了驾驶频率对自动驾驶接受度的双重路径影响,发现社区担忧虽促进特定领域AI支持,但抑制了普遍AI热情,总体效应接近零。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04660 2026-04-07 cs.AI 79%

Springdrift: An Auditable Persistent Runtime for LLM Agents with Case-Based Memory, Normative Safety, and Ambient Self-Perception

Springdrift:一种可审计的持久运行时用于LLM代理,具备基于案例的记忆、规范安全性和环境自我感知

Seamus Brady

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 Springdrift通过可审计的执行子系统、基于案例的记忆层和规范安全机制,实现了LLM代理在跨会话任务连续性和环境自我感知方面的突破,展示了无显式指令下的自主诊断能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04155 2026-04-07 cs.LG cs.IT math.IT q-bio.QM stat.ML 79%

The Geometric Alignment Tax: Tokenization vs. Continuous Geometry in Scientific Foundation Models

几何对齐税:令牌化与连续几何在科学基础模型中的对比

Prashant C. Raju

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

AI总结 科学基础模型在预测精度优化中面临连续几何保持问题,研究发现几何对齐税是内在成本,通过连续头替代交叉熵可显著减少几何失真,但编码本存在非单调双关现象,不同架构在连续与离散目标下表现差异显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03976 2026-04-07 cs.AI cs.CE 79%

Quantifying Trust: Financial Risk Management for Trustworthy AI Agents

量化信任:为可信AI代理的金融风险管理

Wenyue Hua, Tianyi Peng, Chi Wang, Ian Kaufman, Bryan Lim, Chandler Fang

机构 * Microsoft Research(微软研究院) Columbia University(哥伦比亚大学) Google DeepMind(谷歌DeepMind) Stanford University(斯坦福大学) t54.ai Virtuals ACP University of California, Santa Barbara(加州大学圣塔芭芭拉分校)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

AI总结 本文提出基于金融风险管理的Agentic Risk Standard框架,通过整合风险评估与补偿机制,将信任从隐含期望转为可衡量的产品保证,提升AI代理在开放环境中的可靠性。

Comments 30 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03622 2026-04-07 cs.SE cs.AI 79%

Toward Executable Repository-Level Code Generation via Environment Alignment

面向环境对齐的仓库级代码生成

Ruwei Pan, Junlei Shen, Linhao Wu, Yueheng Zhu, Zixiong Yang, Yakun Zhang, Lu Zhang, Hongyu Zhang

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出EnvGraph框架,通过环境对齐问题解决仓库级代码生成中的可执行性挑战,实验显示其在功能正确性和非功能质量上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03264 2026-04-07 cs.CV cs.AI cs.CR 79%

SafeScreen: A Safety-First Screening Framework for Personalized Video Retrieval for Vulnerable Users

SafeScreen: 一种以安全优先的个性化视频检索框架用于易受伤害用户的视频筛选

Wenzheng Zhao, Madhava Kalyan Gadiputi, Fengpei Yuan

机构 * Worcester Polytechnic Institute(伍斯特理工学院)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 SafeScreen通过安全优先机制,在确保个性化视频检索的同时满足个体安全约束,采用自动化流程进行视频的连续审批或拒绝,结合个性化安全标准提取、证据驱动评估和LLM决策,实现实时可解释的视频筛选。

Comments 11 pages, 3 figures, 7 tables. Under review for ACM ICMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07553 2026-04-06 cs.CL 79%

VeriOS: Query-Driven Proactive Human-Agent-GUI Interaction for Trustworthy OS Agents

VeriOS: 基于查询的人机GUI交互以实现可信操作系统代理

Zheng Wu, Heyuan Huang, Xingyu Lou, Xiangmou Qu, Pengzhou Cheng, Zongru Wu, Weiwen Liu, Weinan Zhang, Jun Wang, Zhaoxiang Wang, Zhuosheng Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL

AI总结 VeriOS通过引入查询驱动的人机GUI交互框架,提升操作系统代理在不可信环境中的任务完成能力,实验显示其在不可信场景中性能显著提升,同时保持正常场景下的稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏