arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-09 至 2026-04-09 共收录 72 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 30 篇

2604.06502 2026-04-09 cs.LG 70%

VLMShield: Efficient and Robust Defense of Vision-Language Models against Malicious Prompts

VLMShield: 有效且稳健的视觉语言模型对抗恶意提示防御

Peigui Qi, Kunsheng Tang, Yanpu Yu, Jialin Wu, Yide Song, Wenbo Zhou, Zhicong Huang, Cheng Hong, Weiming Zhang, Nenghai Yu

机构 * University of Science and Technology of China(中国科学技术大学) University of Washington(华盛顿大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 本文提出VLMShield,通过多模态聚合特征提取框架提升视觉语言模型对恶意提示的防御能力,实验显示其在鲁棒性、效率和实用性方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08258 2026-04-09 cs.AI 70%

Diagnosing and Mitigating Sycophancy and Skepticism in LLM Causal Judgment

诊断和缓解大语言模型因果判断中的阿谀和怀疑

Edward Y. Chang

机构 * Stanford University(斯坦福大学)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出CAUSALT3基准测试,通过三个轴评估分解性能,识别并缓解因果判断中的阿谀和怀疑陷阱,通过Regulated Causal Anchoring方法改进推理控制。

Comments 19 pages, 3 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20779 2026-04-09 cs.LG cs.CV cs.HC 70%

CHiQPM: Calibrated Hierarchical Interpretable Image Classification

CHiQPM:校准的分层可解释图像分类

Thomas Norrenbrock, Timo Kaiser, Sovan Biswas, Neslihan Kose, Ramesh Manuvinakurike, Bodo Rosenhahn

机构 * Institute for Information Processing (tnt) L3S - Leibniz Universität Hannover(信息处理研究所 (tnt) L3S - 莱布尼茨汉诺威大学) Intel Labs(英特尔实验室)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.LG

AI总结 CHiQPM提出了一种兼具全局和局部可解释性的图像分类模型,通过对比解释多数类和分层解释方法,实现高准确率和可解释性,为人类与AI协作提供支持。

Comments Accepted to NeurIPS 2025, updated version with correction

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06845 2026-04-09 cs.CL cs.AI 62%

HingeMem: Boundary Guided Long-Term Memory with Query Adaptive Retrieval for Scalable Dialogues

HingeMem: 基于边界的长期记忆与查询自适应检索用于可扩展对话

Yijie Zhong, Yunfan Gao, Haofen Wang

机构 * College of Design and Innovation, Tongji University(同济大学设计创意学院) Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University(同济大学上海自主智能无人系统科学中心)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 HingeMem通过边界引导的长期记忆和查询自适应检索,提升对话系统在多轮交互中的记忆效率与适应性,实验表明在不同规模的LLM上实现20%的性能提升并降低计算成本。

Comments Accepted by TheWebConf 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06216 2026-04-09 cs.CL cs.AI 62%

Blending Human and LLM Expertise to Detect Hallucinations and Omissions in Mental Health Chatbot Responses

融合人类与LLM专业知识以检测心理健康聊天机器人中的幻觉与遗漏

Khizar Hussain, Bradley A. Malin, Zhijun Yin, Susannah Leigh Rose, Murat Kantarcioglu

机构 * Vanderbilt University Medical Center, Nashville, TN, USA(范德比尔特大学医学中心,纳什维尔,田纳西州,美国)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出融合人类专业知识与LLM的框架,通过五个分析维度提取可解释特征,提升心理健康聊天机器人中幻觉与遗漏检测的准确性和透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06188 2026-04-09 cs.HC cs.AI cs.CL 62%

LLM Spirals of Delusion: A Benchmarking Audit Study of AI Chatbot Interfaces

大语言模型的幻觉螺旋:AI聊天机器人界面的基准测试审计研究

Peter Kirgis, Ben Hawriluk, Sherrie Feng, Aslan Bilimer, Sam Paech, Zeynep Tufekci

机构 * Princeton University(普林斯顿大学) Phillips Exeter Academy(菲利普斯埃克塞特学院) Independent(独立)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过56次20轮对话测试ChatGPT-4o和ChatGPT-5,发现API与聊天界面环境存在显著差异,揭示了自动化测试方法的不足及政策选择对行为的影响。

Comments Accepted at the 2nd Annual Conference of the International Association for Safe and Ethical Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03926 2026-04-09 cs.AI cs.CY cs.HC cs.MA 62%

CODE-GEN: A Human-in-the-Loop RAG-Based Agentic AI System for Multiple-Choice Question Generation

CODE-GEN:一种基于检索增强生成的多选题生成人机协作人工智能系统

Xiaojing Duan, Frederick Nwanganga, Chaoli Wang

机构 * University of Notre Dame(圣母大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 CODE-GEN通过生成与课程目标一致的多选题提升学生代码推理能力,采用生成器和验证器代理,结合专用工具提高准确性,评估结果显示系统在七个教学维度上表现优异,但人类专家仍需参与设计教学性干扰项和反馈质量。

Comments Full version of the paper accepted as a short paper at the 27th International Conference on Artificial Intelligence in Education (AIED 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00102 2026-04-09 cs.LG cs.AI eess.SP 62%

Towards transparent and data-driven fault detection in manufacturing: A case study on univariate, discrete time series

面向透明和数据驱动的制造业故障检测:一个关于单变量离散时间序列的案例研究

Bernd Hofmann, Patrick Bruendl, Huong Giang Nguyen, Joerg Franke

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种结合机器学习和可解释方法的故障检测方法,通过量化扰动分析和专家评估验证其有效性,在单变量离散时间序列中实现95.9%的检测准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06898 2026-04-09 cs.CY 57%

Are LLMs Ready for Computer Science Education? A Cross-Domain, Cross-Lingual and Cognitive-Level Evaluation Using Professional Certification Exams

LLMs是否准备好用于计算机科学教育?通过专业认证考试进行跨领域、跨语言和认知层面的评估

Chen Gao, Chi Liu, Zhengquan Luo, Dongfu Xiao, Maiying Sui, Sheng Shen, Congcong Zhu, Huajie Chen, Xuhan Zuo, Zongyuan Ge, Tianqing Zhu, Wanlei Zhou, Xiaotong Han

专题命中 安全评测 :alignment(abstract);分类 cs.CY

AI总结 本文通过专业认证考试数据评估了四个LLM在跨语言、认知层次和领域知识上的表现,发现GPT-5在英文考试中表现最佳,Qwen-Plus在中文环境中更优,DeepSeek-R1在跨语言表现最平衡,但Llama-3.3在高阶推理和鲁棒性上存在明显不足。

Comments 40 pages including Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06456 2026-04-09 cs.CL 57%

Context-Aware Dialectal Arabic Machine Translation with Interactive Region and Register Selection

具有交互区域和语域选择的上下文感知方言阿拉伯语机器翻译

Afroza Nowshin, Prithweeraj Acharjee Porag, Haziq Jeelani, Fayeq Jeelani Syed

机构 * University of Toledo(托莱多大学) Claremont Graduate University(克莱蒙特研究生大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出一种上下文感知的阿拉伯语方言机器翻译框架,通过规则基于的数据增强生成多区域语料,提升翻译输出的方言和语域可控性。

Comments 14 pages, 5 figures, 5 tables. Preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06421 2026-04-09 cs.CL 57%

State-of-the-Art Arabic Language Modeling with Sparse MoE Fine-Tuning and Chain-of-Thought Distillation

最先进的阿拉伯语言建模:基于稀疏MoE微调和链式思维蒸馏

Navan Preet Singh, Anurag Garikipati, Ahmed Abulkhair, Jyani Akshay Jagdishbhai, Atul Yaduvanshi, Amarendra Chaudhary, Madalina Ciobanu, Qingqing Mao, Ritankar Das

机构 * Incept Labs(因塞普特实验室)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本文提出阿拉伯-DeepSeek-R1,通过稀疏MoE架构和链式思维蒸馏,在开放阿拉伯LLM排行榜上实现SOTA,展示了稀疏MoE与文化导向的蒸馏方法在阿拉伯语言任务中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06392 2026-04-09 cs.AI cs.MA cs.SE 57%

Qualixar OS: A Universal Operating System for AI Agent Orchestration

Qualixar OS:面向AI代理编排的通用操作系统

Varun Pratap Bhardwaj

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 Qualixar OS是首个应用层操作系统,支持异构多代理系统,提供10个LLM供应商、8+代理框架和7种传输的完整运行时,包含12种多代理拓扑执行语义、LLM驱动的团队设计引擎、三层模型路由、共识判断管道、四层内容归属和通用兼容性等功能。

Comments 20 pages, 7 figures, 8 tables. Zenodo DOI: 10.5281/zenodo.19454219

URL PDF HTML 收藏
2604.06285 2026-04-09 cs.CR cs.AI cs.CV 57%

Harnessing Hyperbolic Geometry for Harmful Prompt Detection and Sanitization

利用双曲几何进行有害提示检测与净化

Igor Maljkovic, Maria Rosaria Briglia, Iacopo Masi, Antonio Emanuele Cinà, Fabio Roli

机构 * University of Genoa(热那亚大学) Sapienza University of Rome(罗马大学) University of Cagliari(卡利亚里大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出HyPE和HyPS方法,利用双曲几何空间检测和净化有害提示,提升视觉语言模型的安全性与鲁棒性。

Comments Paper accepted at ICLR 2026. Webpage available at: https://hype-vlm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06274 2026-04-09 cs.CR cs.AI 57%

Towards the Development of an LLM-Based Methodology for Automated Security Profiling in Compliance with Ukrainian Cybersecurity Regulations

迈向基于大语言模型的自动化安全配置方法的开发:符合乌克兰网络安全法规

Daniil Shafranskyi, Iryna Stopochkina, Mykola Ilin

机构 * National Technical University of Ukraine “Igor Sikorsky Kyiv Polytechnic Institute”(乌克兰国立技术大学“伊戈尔·西科尔斯基基辅理工学院”)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文探讨将国际最佳实践整合到国家监管体系中,提出利用大语言模型实现自动化安全配置的方法,以应对高密度混合威胁环境下的网络安全挑战。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06264 2026-04-09 q-bio.QM cs.AI 57%

ToxReason: A Benchmark for Mechanistic Chemical Toxicity Reasoning via Adverse Outcome Pathway

ToxReason: 一个通过不良后果途径进行机理化学毒性推理的基准

Jueon Park, Wonjune Jang, Chanhwi Kim, Yein Park, Jaewoo Kang

机构 * Korea University(高丽大学) Myongji University(明知大学) University of Texas Health Science Center at Houston(德克萨斯大学休斯顿健康科学中心) AIGEN Sciences

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 ToxReason基准通过整合药物-靶点相互作用证据与毒性标签,评估多器官水平的毒性推理能力,发现强预测性能不等于可靠推理,且推理意识训练能提升机理推理和毒性预测性能。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06209 2026-04-09 cs.CL 57%

TelcoAgent-Bench: A Multilingual Benchmark for Telecom AI Agents

TelcoAgent-Bench:电信AI代理的多语言基准测试

Lina Bariah, Brahim Mefgouda, Farbod Tavakkoli, Enrique Molero, Louis Powell, Merouane Debbah

机构 * Research Institute for Digital Future, Khalifa University(哈利法大学数字未来研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出TelcoAgent-Bench和TelcoAgent-Metrics,用于评估多语言电信LLM代理,通过结构化指标评估意图识别、工具执行、解决正确性和稳定性,以量化LLM代理在电信环境中的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04563 2026-04-09 cs.CV cs.AI 57%

Temporal Inversion for Learning Interval Change in Chest X-Rays

时间倒置用于学习胸部X光片的区间变化

Hanbin Ko, Kyungmin Jeon, Doowoong Choi, Chang Min Park

机构 * Interdisciplinary Program in Bioengineering, Seoul National University Graduate School(首尔大学研究生院生物工程跨学科项目) Integrated Major in Innovative Medical Science, Seoul National University Graduate School(首尔大学研究生院创新医学科学综合专业) Dept. of Radiology, Seoul National University Hospital(首尔大学医院放射科) Seoul National University College of Medicine(首尔大学医学院) Inst. of Medical and Biological Engineering, Seoul National University Medical Research Center(首尔大学医学研究中心医学与生物工程研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出TILA框架,通过时间倒置增强模型对时间变化的敏感性,改进了胸部X光片的区间变化检测与分类。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10477 2026-04-09 cs.CL 57%

PEEM: Prompt Engineering Evaluation Metrics for Interpretable Joint Evaluation of Prompts and Responses

PEEM:提示工程评估指标用于可解释地联合评估提示和响应

Minki Hong, Eunsoo Lee, Sohyun Park, Jihie Kim

机构 * Department of Computer Science and Artificial Intelligence, Dongguk University(东国大学计算机科学与人工智能系)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出PEEM,一种联合且可解释的提示和响应评估框架,通过9个轴线评估提示和响应质量,结合LLM评估器输出评分和解释,提升提示设计的可解释性和优化效果。

Comments This is a preprint version of a paper accepted to IEEE Access. The final published version is available at DOI: 10.1109/ACCESS.2026.3679809

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05529 2026-04-09 cs.AI cs.RO 57%

Before We Trust Them: Decision-Making Failures in Navigation of Foundation Models

在我们信任之前:基础模型导航决策中的失败

Jua Han, Jaeyoon Seo, Jungbin Min, Sieun Choi, Huichan Seo, Jihie Kim, Jean Oh

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 研究发现基础模型在导航任务中存在显著决策失败,需更细致评估以理解其局限性。

Comments Corrected author order in metadata; manuscript changed

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23435 2026-04-09 cs.SD cs.AI cs.MM eess.AS 57%

AudioRole: An Audio Dataset for Character Role-Playing in Large Language Models

AudioRole: 一个用于大型语言模型角色扮演的音频数据集

Wenyu Li, Xiaoqi Jiao, Yi Chang, Guangyan Zhang, Yiwen Guo

机构 * Westlake University(西湖大学) Tencent LIGHTSPEED STUDIOS(腾讯LIGHTSPEED STUDIOS) Independent Researcher(独立研究员)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出AudioRole数据集,通过13部电视剧1000+小时的100万+角色对话,提供同步音频文本对及角色身份标注,结合ARP-Eval评估框架,验证了GLM-4-Voice在角色扮演中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07338 2026-04-09 cs.CV cs.CL cs.MM 57%

Appear2Meaning: A Cross-Cultural Benchmark for Structured Cultural Metadata Inference from Images

Appear2Meaning: 一个跨文化的结构化文化元数据图像推理基准

Yuechen Jiang, Enze Zhang, Md Mohsinul Kabir, Qianqian Xie, Stavroula Golfomitsou, Konstantinos Arvanitis, Sophia Ananiadou

机构 * University of Manchester(曼彻斯特大学) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) Getty Conservation Institute(盖蒂保护研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出一个跨文化的结构化文化元数据图像推理基准,评估VLMs在文化元数据推断中的表现,发现模型在不同文化和元数据类型上存在显著性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07264 2026-04-09 cs.CR cs.AI 57%

Validated Intent Compilation for Constrained Routing in LEO Mega-Constellations

面向低轨巨型星座受限路由的意图验证编译

Yuanhang Li

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出端到端系统,通过图神经网络路由器、语言模型意图编译器和确定性验证器,实现高阶意图到低阶路由约束的转换,确保路由安全性和网络配置的准确性。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06762 2026-04-09 cs.CR 50%

ARuleCon: Agentic Security Rule Conversion

ARuleCon:代理安全规则转换

Ming Xu, Hongtai Wang, Yanpei Guo, Zhengmin Yu, Weili Han, Hoon Wei Lim, Jin Song Dong, Jiaheng Zhang

专题命中 安全评测 :alignment(abstract)

AI总结 ARuleCon通过自动化规则转换框架,解决跨平台安全规则复用难题,提升SIEM规则转换的准确性和效率,平均优于基线LLM模型15%。

Comments This paper has been accepted for publication at WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06347 2026-04-09 cs.CV 50%

Evidence-Based Actor-Verifier Reasoning for Echocardiographic Agents

基于证据的Actor-验证者推理用于超声波代理

Peng Huang, Yiming Wang, Yineng Chen, Liangqiao Gui, Hui Guo, Bo Peng, Shu Hu, Xi Wu, Tsao Connie, Hongtu Zhu, Balakrishnan Prabhakaran, Xin Wang

机构 * University at Albany, SUNY(纽约州立大学奥尔巴尼分校) Southwest Jiaotong University(西南交通大学) Purdue University(普渡大学) Chengdu University of Information Technology(成都信息工程大学) Harvard Medical School(哈佛医学院) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出EchoTrust框架,通过结构化中间表示和不同角色分析,提升超声波临床决策支持系统中推理的可靠性与可解释性。

Comments cvprw 2026(AIMS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19433 2026-04-09 cs.CV 50%

dMLLM-TTS: Self-Verified and Efficient Test-Time Scaling for Diffusion Multi-Modal Large Language Models

dMLLM-TTS:用于扩散多模态大语言模型的自验证和高效测试时间扩展

Yi Xin, Siqi Luo, Tianxiang Xu, Qi Qin, Haoxing Chen, Kaiwen Zhu, Zhiwei Zhang, Yangfan He, Rongchao Zhang, Jinbin Bai, Shuo Cao, Bin Fu, Junjun He, Yihao Liu, Yuewen Cao, Xiaohong Liu

机构 * Nanjing University(南京大学) Shanghai Innovation Institute(上海创新研究院) Shanghai AI Lab(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) National University of Singapore(新加坡国立大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出dMLLM-TTS框架,通过轨迹探索扩展和迭代细化扩展两个互补的扩展轴,提升生成多样性和稳定性,同时通过自验证机制提高效率,实验表明在GenEval基准上生成质量显著提升且效率提高6倍。

Comments Project page: https://github.com/Alpha-VLLM/Lumina-DiMOO

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19640 2026-04-09 cs.CV 50%

Focus on What Really Matters in Low-Altitude Governance: A Management-Centric Multi-Modal Benchmark with Implicitly Coordinated Vision-Language Reasoning Framework

聚焦低空治理中真正重要的问题:一种以管理为中心的多模态基准与隐式协调的视觉-语言推理框架

Hao Chang, Zhihui Wang, Lingxiang Wu, Wei An, Boyang Li, Zaiping Lin, Weidong Sheng, Jinqiao Wang

机构 * National University of Defense Technology(国防科技大学) Zidong Taichu (Beijing) Technology Co., Ltd.(紫东太初(北京)科技有限公司) Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Wuhan AI Research(武汉人工智能研究院)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出GovLA-10K多模态基准和GovLA-Reasoner框架,通过功能显著目标和隐式协调的视觉-语言推理提升低空治理中的管理需求理解与执行能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 4 篇

2604.06215 2026-04-09 cs.CY cs.AI 73%

Governing frontier general-purpose AI in the public sector: adaptive risk management and policy capacity under uncertainty through 2030

在公共部门治理前沿通用人工智能:通过2030年的不确定性实现适应性风险管理与政策能力

Fabio Correa Xavier

专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY

AI总结 本文探讨公共部门在2030年前应对前沿通用人工智能的治理挑战,提出基于适应性风险管理、情景感知监管和社会技术转型的治理框架,强调政策能力提升与责任分配的重要性。

Comments 7 PAGES, 1 FIGURE

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06219 2026-04-09 cs.CY cs.AI 62%

From experimentation to engagement: on the paradox of participatory AI and power in contexts of forced displacement and humanitarian crises

从实验到参与:关于参与式AI与权力在流离失所和人道主义危机中的悖论

Stella Suge, Sarah W. Spencer, Nyalleng Moorosi, Helen McElhinney, Geoff Loane, Sue Black

机构 * FilmAid Kenya(肯尼亚电影援助组织) The Distributed AI Research Institute (DAIR)(分布式人工智能研究所) The CDAC Network(CDAC网络) Durham University(杜伦大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文探讨参与式AI在流离失所和人道主义危机中的局限性,指出其可能加剧'参与洗白'和算法伤害,强调需更严谨的方法和独立治理架构。

Comments This paper was submitted to the ACM FAccT conference in 2025 and is published here as a preprint in March 2026. The research was conducted in December 2024. Since submission, AI deployment across the humanitarian sector has accelerated without commensurate development of independent accountability

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06203 2026-04-09 cs.CY cs.AI 62%

Front-End Ethics for Sensor-Fused Health Conversational Agents: An Ethical Design Space for Biometrics

传感器融合健康对话代理的前端伦理:生物特征的伦理设计空间

Hansoo Lee, Rafael A. Calvo

机构 * Imperial College London(伦敦帝国理工学院) Korea Institute of Science and Technology(韩国科学技术研究院)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文探讨了生物特征翻译的伦理设计,提出五个维度分析前端伦理风险,提出适应性披露作为安全机制,确保健康代理支持用户自主性。

Comments Accepted at the Proceedings of the CHI 2026 Workshop: Ethics at the Front-End

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.09655 2026-04-09 cs.CR 50%

How Secure is Code Generated by ChatGPT?

ChatGPT生成的代码安全性如何?

Raphaël Khoury, Anderson R. Avila, Jacob Brunelle, Baba Mamadou Camara

专题命中 AI治理与伦理 :safety(abstract)

AI总结 研究评估了ChatGPT生成代码的安全性,探讨了通过提示提高安全性的方法及AI生成代码的伦理问题。

Journal ref 2023 IEEE International Conference on Systems, Man, and Cybernetics (SMC) October 1-4, 2023, Oahu, Hawaii, USA

详情

展开后加载摘要…

URL PDF HTML 收藏