arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-24 至 2026-03-24 共收录 43 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 43 篇

2603.06264 2026-03-24 cs.CL cs.CY 81%

Mind the Gap: Pitfalls of LLM Alignment with Asian Public Opinion

注意鸿沟:LLM对齐与亚洲公众意见的陷阱

Hari Shankar, Vedanta S P, Sriharini Margapuri, Debjani Mazumder, Ponnurangam Kumaraguru, Abhijnan Chakraborty

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.CY

AI总结 本文研究了LLM在多语言多文化环境中的对齐问题,发现其在宗教观点尤其是少数群体方面存在偏差,提出轻量干预无法消除文化鸿沟,强调需系统性地区审计确保公平部署。

Comments 13 pages, including AAAI Paper Checklist. Accepted in Proceedings of the 20th International AAAI Conference on Web and Social Media (ICWSM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21145 2026-03-24 cs.DC cs.AI cs.LG cs.SC 81%

NeSy-Edge: Neuro-Symbolic Trustworthy Self-Healing in the Computing Continuum

NeSy-Edge:神经符号可信自愈在计算连续体中的应用

Peihan Ye, Alfreds Lapkovskis, Alaa Saleh, Qiyang Zhang, Praveen Kumar Donta

机构 * Department of Computer Systems and Sciences(计算机系统与科学系) University of Oulu(奥卢大学) Peking University(北京大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出NeSy-Edge框架,通过边缘优先设计,在资源受限的边缘节点进行本地感知与推理,结合云模型进行最终诊断,实现计算连续体中的可信自愈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20595 2026-03-24 cs.AI cs.MA 79%

Position: Multi-Agent Algorithmic Care Systems Demand Contestability for Trustworthy AI

位置:多智能体算法护理系统需具备可挑战性以实现可信AI

Truong Thanh Hung Nguyen, Hélène Fournier, Piper Jackson, Makoto Itoh, Shannon Freeman, Rene Richard, Hung Cao

机构 * Analytics Everywhere Lab, University of New Brunswick, Canada(安利克斯 everywhere 实验室,新不伦瑞克大学,加拿大) National Research Council Canada, Canada(加拿大国家研究委员会,加拿大) Thompson Rivers University, Canada(汤普森河大学,加拿大) ISB Corporation, Japan(ISB公司,日本) University of Northern British Columbia, Canada(北北加拿大大学,加拿大)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

AI总结 本文探讨了多智能体算法护理系统中可挑战性设计的必要性,提出通过透明性、干预机会和审查机制来增强人机协作的可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23814 2026-03-24 cs.CR 78%

Beyond the TESSERACT:Trustworthy Dataset Curation for Sound Evaluations of Android Malware Classifiers

超越TESSERACT:为Android恶意软件分类器提供可信的数据集编纂

Theo Chow, Mario D'Onghia, Lorenz Linhardt, Zeliang Kan, Daniel Arp, Lorenzo Cavallaro, Fabio Pierazzi

专题命中 安全评测 :trustworthy(title,abstract)

AI总结 本文探讨了Android恶意软件分类器评估中数据集编纂的重要性,识别了五个影响性能差异的新因素,提出了可信数据集编纂的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21104 2026-03-24 cs.RO cs.CV 78%

CounterScene: Counterfactual Causal Reasoning in Generative World Models for Safety-Critical Closed-Loop Evaluation

CounterScene: 生成世界模型中的反事实因果推理用于安全关键闭环评估

Bowen Jing, Ruiyang Hao, Weitao Zhou, Haibao Yu

机构 * Tuojing Intelligence(途京智能) King's College London(伦敦大学国王学院) Tsinghua University(清华大学) The University of Hong Kong(香港大学)

专题命中 安全评测 :safety(title,abstract)

AI总结 CounterScene通过结构化反事实推理生成安全关键驾驶场景,通过因果对抗代理识别和冲突感知交互世界模型,提升长周期碰撞率并保持轨迹真实性。

Comments 28 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20721 2026-03-24 cs.CV 78%

Cross-modal Fuzzy Alignment Network for Text-Aerial Person Retrieval and A Large-scale Benchmark

跨模态模糊对齐网络用于文本-空中人检索及一个大规模基准

Yifei Deng, Chenglong Li, Yuyang Zhang, Guyue Hu, Jin Tang

机构 * State Key Laboratory of Opto-Electronic Information Acquisition and Protection Technology(光电信息采集与防护技术国家重点实验室) School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) School of Artificial Intelligence, Anhui University(安徽大学人工智能学院) The University of Hong Kong(香港大学)

专题命中 安全评测 :alignment(title,abstract)

AI总结 本文提出跨模态模糊对齐网络,通过模糊逻辑量化token级可靠性,结合地面图像作为桥梁代理,提升文本与空中图像的语义对齐鲁棒性,并构建了大规模基准数据集AERI-PEDES。

Comments Accepted by CVPR 2026 main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22097 2026-03-24 cs.AI cs.LG 76%

SpecTM: Spectral Targeted Masking for Trustworthy Foundation Models

SpecTM:用于可信基础模型的频谱定向遮蔽

Syed Usama Imtiaz, Mitra Nasr Azadani, Nasrin Alamdari

机构 * Department of Civil and Environmental Engineering(土木与环境工程系)

专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.LG

AI总结 本文提出SpecTM,一种结合物理约束的遮蔽设计,通过预训练时利用交叉频谱上下文重建目标波段,提升EO领域基础模型的可信度和可解释性。

Comments Accepted to IEEE IGARSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20953 2026-03-24 cs.CR cs.AI 70%

Before the Tool Call: Deterministic Pre-Action Authorization for Autonomous AI Agents

在工具调用之前:自主AI代理的确定性预行动授权

Uchi Uchibeke

机构 * APort Technologies Inc.(APort技术公司)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出Open Agent Passport,通过同步拦截工具调用、评估声明性策略并生成加密审计记录,实现自主AI代理的确定性预授权,提升安全性和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20697 2026-03-24 cs.CV cs.AI 70%

Satellite-to-Street: Synthesizing Post-Disaster Views from Satellite Imagery via Generative Vision Models

卫星到街道:通过生成视觉模型从卫星图像合成灾害后视角

Yifan Yang, Lei Zou, Wendy Jepson

机构 * Department of Geography Texas A\&M University(地理系德克萨斯农工大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出通过生成视觉模型从卫星图像合成灾害后街道视角的方法,对比了基于VLM和MoE的生成策略,揭示了高现实感生成与结构信息保留之间的平衡问题。

Comments Accepted for presentation at IGARSS 2026 (IEEE International Geoscience and Remote Sensing Symposium)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12920 2026-03-24 cs.CL cs.AI cs.CY cs.HC cs.IR 67%

Auditing Google's AI Overviews and Featured Snippets: A Case Study on Baby Care and Pregnancy

对谷歌AI概述和特色摘要的审计:关于婴儿护理和怀孕的案例研究

Desheng Hu, Joachim Baumann, Aleksandra Urman, Elsa Lichtenegger, Robin Forsberg, Aniko Hannak, Christo Wilson

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文通过系统算法审计1508个真实婴儿护理和怀孕相关查询,评估AI概述和特色摘要的信息质量和一致性,发现33%的案例信息不一致,且医疗保障缺失严重。

Comments 18 pages, 10 figures; to appear in AAAI ICWSM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21019 2026-03-24 cs.CR cs.SE 67%

SkillProbe: Security Auditing for Emerging Agent Skill Marketplaces via Multi-Agent Collaboration

SkillProbe:通过多智能体协作实现新兴智能体技能市场places的安全审计

Zihan Guo, Zhiyu Chen, Xiaohang Nie, Jianghao Lin, Yuanjian Zhou, Weinan Zhang

专题命中 安全评测 :alignment(abstract);trustworthy(abstract)

AI总结 针对LLM智能体生态系统中技能市场面临的安全挑战,提出SkillProbe框架,通过多智能体协作实现技能审计,揭示高流行技能的安全性不足及系统性风险。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21010 2026-03-24 cs.CV 67%

SkinCLIP-VL: Consistency-Aware Vision-Language Learning for Multimodal Skin Cancer Diagnosis

SkinCLIP-VL: 一种面向多模态皮肤癌诊断的一致性感知视觉-语言学习框架

Zhixiang Lu, Shijie Xu, Kaicheng Yan, Xuyue Cai, Chong Zhang, Yulong Li, Angelos Stefanidis, Anh Nguyen, Jionglong Su

机构 * Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) University of Liverpool(利物浦大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract)

AI总结 本文提出SkinCLIP-VL,通过冻结感知与自适应推理范式,结合CLIP编码器与轻量量化Qwen2.5-VL,引入一致性聚焦对齐损失,实现高效皮肤癌诊断,优于13B参数基线模型,参数更少且临床信任度更高。

Comments Accepted by 2026 IEEE International Conference on Multimedia and Expo (ICME 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00004 2026-03-24 cs.IR cs.CL cs.DL cs.LG 62%

C$^2$-Cite: Contextual-Aware Citation Generation for Attributed Large Language Models

C$^2$-Cite: 基于上下文感知的引用生成方法用于带属性的大语言模型

Yue Yu, Ting Bai, HengZhi Lan, Li Qian, Li Peng, Jie Wu, Wei Liu, Jian Luan, Chuan Shi

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文提出C$^2$-Cite框架,通过整合引用标记与参考内容的语义关系,提升引用生成质量与响应正确性。

Comments WSDM26

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08713 2026-03-24 cs.CL cs.AI 62%

Automatic Essay Scoring and Feedback Generation in Basque Language Learning

巴斯克语言学习中的自动作文评分与反馈生成

Ekhi Azurmendi, Xabier Arregi, Oier Lopez de Lacalle

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文首次公开了针对巴斯克语C1水平的自动作文评分与反馈生成数据集,通过微调开源模型提升评分与反馈质量,验证了编码器模型的可靠性及监督微调对性能的提升。

Comments Accepted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19299 2026-03-24 cs.LG cs.AI 62%

Open-weight genome language model safeguards: Assessing robustness via adversarial fine-tuning

开放权重基因组语言模型的安全保障:通过对抗性微调评估鲁棒性

James R. M. Black, Moritz S. Hanke, Aaron Maiwald, Tina Hernandez-Boussard, Oliver M. Crook, Jaspreet Pannu

机构 * Center for Health Security(健康安全中心) Johns Hopkins Bloomberg School of Public Health(约翰霍普金斯大学布隆伯格公共卫生学院) Department of Chemistry(化学系) University of Oxford(牛津大学) Stanford University School of Medicine(斯坦福大学医学院) Department of Chemistry & Kavli Institute for Nanoscience Discovery(化学系及卡弗里纳米科学发现研究所)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究评估了开放权重基因组语言模型在对抗性微调下的鲁棒性,发现通过微调有害病毒序列可恢复模型的滥用相关能力,强调了需要安全框架以确保模型安全部署。

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: Biosecurity Safeguards for Generative AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14783 2026-03-24 cs.CL cs.CY 62%

Human or LLM as Standardized Patients? A Comparative Study for Medical Education

人类或大语言模型作为标准化患者?医学教育中的比较研究

Bingquan Zhang, Xiaoxiao Liu, Yuchi Wang, Lei Zhou, Qianqian Xie, Benyou Wang

机构 * School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Freedom AI

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.CY

AI总结 本文提出EasyMED框架和SPBench基准,通过对比实验显示其在医学教育中更接近人类标准化患者行为,尤其在案例一致性与可控披露方面表现更优,且在学习效果和成本效率上具有优势。

Comments 24 pages, 13 figures, 10 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21280 2026-03-24 cs.CY cs.AI 62%

WARBENCH: A Comprehensive Benchmark for Evaluating LLMs in Military Decision-Making

WARBENCH:评估大语言模型在军事决策中的综合基准

Zongjie Li, Chaozheng Wang, Yuchong Xie, Pingchuan Ma, Shuai Wang

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) Chinese University of Hong Kong(香港中文大学) Zhejiang University of Technology(浙江工业大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文提出WARBENCH基准,揭示现有大语言模型在军事决策中存在结构性缺陷,包括战术推理崩溃、法律违规率高、量化降维导致性能下降等问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22279 2026-03-24 cs.CV cs.AI 57%

3D-Layout-R1: Structured Reasoning for Language-Instructed Spatial Editing

3D-Layout-R1: 为语言指导的空间编辑进行结构化推理

Haoyu Zhen, Xiaolong Li, Yilin Zhao, Han Zhang, Sifei Liu, Kaichun Mo, Chuang Gan, Subhashree Radhakrishnan

机构 * NVIDIA UMass Amherst(马萨诸塞大学阿默斯特分校)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出一种结构化推理框架,通过场景图推理实现文本条件下的空间布局编辑,提升空间关系的可解释性和控制性,并在布局编辑基准测试中取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21698 2026-03-24 cs.AI 57%

A Blueprint for Self-Evolving Coding Agents in Vehicle Aerodynamic Drag Prediction

车辆气动阻力预测中自演化编码代理的蓝图

Jinhui Ren, Huaiming Li, Yabin Liu, Tao Li, Zhaokun Liu, Yujia Liang, Zengle Ge, Chufan Wu, Xiaomin Yuan, Danyu Liu, Annan Li, Jianmin Wu

机构 * Famou Agent Team(Famou 代理团队) Baidu AI Cloud(百度AI云) IAT AI Team(IAT人工智能团队)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出一种基于合同的自演化编码代理框架,通过约束优化发现可执行的代理管道,提升车辆阻力系数预测的效率与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21654 2026-03-24 cs.CR cs.AI 57%

Towards Secure Retrieval-Augmented Generation: A Comprehensive Review of Threats, Defenses and Benchmarks

迈向安全的检索增强生成:对威胁、防御和基准的全面综述

Yanming Mu, Hao Hu, Feiyang Li, Qiao Yuan, Jiang Wu, Zichuan Liu, Pengcheng Liu, Mei Wang, Hongwei Zhou, Yuling Liu

机构 * State Key Laboratory of Mathematical Engineering and Advanced Computing(数学工程与先进计算国家重点实验室) Information Engineering University(信息工程大学) Henan Key Laboratory of Information Security(河南省信息安全重点实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文综述了检索增强生成系统中的安全威胁、防御方法及评估基准,系统分析了数据污染、对抗攻击等核心威胁,并提出双视角的防御技术分类,为未来研究提供统一基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02960 2026-03-24 cs.AI 57%

Architecting Trust in Artificial Epistemic Agents

在人工智能认知代理中构建信任

Nahema Marchal, Stephanie Chan, Matija Franklin, Manon Revel, Geoff Keeling, Roberta Fischli, Bilva Chandra, Iason Gabriel

机构 * Google DeepMind(谷歌DeepMind) Google Research(谷歌研究)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文探讨了大规模语言模型作为认知代理的影响,提出通过构建信任、对齐人类认知目标和加强社会认知基础设施,确保AI系统的可靠性与包容性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16523 2026-03-24 cs.CV cs.AI 57%

TTP: Test-Time Padding for Adversarial Detection and Robust Adaptation on Vision-Language Models

TTP: 视觉-语言模型上的对抗检测与鲁棒适应的测试时填充

Zhiwei Li, Yitian Pang, Weining Wang, Zhenan Sun, Qi Li

机构 * NLPR & MAIS, Institute of Automation, Chinese Academy of Sciences(神经网络与模式识别实验室及自动化研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出TTP框架,通过测试时填充实现对抗检测与鲁棒适应,提升视觉-语言模型在对抗攻击下的鲁棒性而不影响清洁准确性。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14977 2026-03-24 cs.RO cs.AI 57%

SVBRD-LLM: Self-Verifying Behavioral Rule Discovery for Autonomous Vehicle Identification

SVBRD-LLM:自主车辆识别的自验证行为规则发现

Xiangyu Li, Tianyi Wang, Junfeng Jiao, Christian Claudel, Zhaomiao Guo

机构 * Fariborz Maseeh Department of Civil, Architectural, and Environmental Engineering, The University of Texas at Austin(德克萨斯大学奥斯汀分校土木、建筑与环境工程学院) School of Architecture, The University of Texas at Austin(德克萨斯大学奥斯汀分校建筑学院)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出SVBRD-LLM框架,通过零样本大语言模型提取可解释的行为规则,用于自主车辆识别,实现了90.0%的准确率和93.3%的F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24358 2026-03-24 cs.SE cs.CL 57%

Automatically Benchmarking LLM Code Agents through Agent-Driven Annotation and Evaluation

通过代理驱动的标注和评估自动评估代码代理

Lingyue Fu, Bolun Zhang, Hao Guan, Yaoming Zhu, Lin Qiu, Weiwen Liu, Xuezhi Cao, Xunliang Cai, Weinan Zhang, Yong Yu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出代理驱动的基准构建流程,引入PRDBench包含50个真实Python项目,通过专门模型提升评估准确性,验证了框架的可扩展性和鲁棒性。

Comments Accepted by AAMAS 2026

Journal ref Proc. of the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026), Paphos, Cyprus, May 25-29, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24302 2026-03-24 cs.LG 57%

LEAF: Language-EEG Aligned Foundation Model for Brain-Computer Interfaces

LEAF:语言-脑电对齐的基础模型用于脑机接口

Muyun Jiang, Shuailei Zhang, Zhenjie Yang, Mengjun Wu, Weibang Jiang, Zhiwei Guo, Wei Zhang, Rui Liu, Shangen Zhang, Yong Li, Yi Ding, Cuntai Guan

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Shanghai Jiao Tong University, China(上海交通大学,中国) University of Science and Technology Beijing, China(北京科技大学,中国) Southeast University, China(东南大学,中国)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 LEAF通过整合语义指导生成结构化的脑电嵌入,提升解码鲁棒性和迁移性,实现语言与脑电信号的对齐,取得12个数据集上的最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05909 2026-03-24 cond-mat.mtrl-sci cs.LG 57%

Learning Magnetic Order Classification from Large-Scale Materials Databases

从大规模材料数据库中学习磁序分类

Ahmed E. Fahmy

机构 * Department of Physics, The Ohio State University(俄亥俄州立大学物理系)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 本文通过训练机器学习分类器,从实验验证的MAGNDATA磁性材料中识别磁序,提出传播向量分类器在92%准确率下优于现有方法,揭示了材料数据库中的铁磁偏见。

Comments Main Text: 10 pages + 10 Figures & 3 Supplementary Tables. (Under Review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12739 2026-03-24 cs.CL 57%

Edu-Values: Towards Evaluating the Chinese Education Values of Large Language Models

Edu-Values:面向评估大型语言模型的中国教育价值观

Peiyi Zhang, Yazhou Zhang, Bo Wang, Lu Rong, Prayag Tiwari, Jing Qin

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出Edu-Values基准,评估大型语言模型的中国教育价值观,包含七个核心价值,通过1418道题测试,发现中文LLM在教育文化差异下表现更优,且利用Edu-Values构建外部知识库可提升对齐效果。

Comments The authors are withdrawing this paper to make substantial revisions and improvements before future submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21447 2026-03-24 cs.CY 57%

Deliberative multi-agent large language models improve clinical reasoning in ophthalmology

协商式多智能体大语言模型提升眼科临床推理

Ehsan Misaghi, Sean T Berkowitz, Bing Yu Chen, Qingyu Chen, Renaud Duval, Pearse A Keane, Danny A Mammo, Ariel Yuhan Ong, Mertcan Sevgi, Sumit Sharma, Sunil K Srivastava, Yih Chung Tham, Fares Antaki

专题命中 安全评测 :safety(abstract);分类 cs.CY

AI总结 本研究比较了多智能体协商系统与单一模型在眼科临床推理中的表现,发现协商系统在准确性和安全性上均优于单一模型,且能减少有害错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21231 2026-03-24 cs.CR cs.AI 57%

When Convenience Becomes Risk: A Semantic View of Under-Specification in Host-Acting Agents

当便利成为风险:主机作用代理中的语义视角下的不足规范

Di Lu, Yongzhi Liao, Xutong Mu, Lele Zheng, Ke Cheng, Xuewen Dong, Yulong Shen, Jianfeng Ma

机构 * School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文探讨主机作用代理中因目标规范不足导致的安全问题,提出语义威胁模型和风险完成模式分类,并通过案例研究分析如何通过明确执行边界来防御风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11721 2026-03-24 cs.AI 57%

When OpenClaw Meets Hospital: Toward an Agentic Operating System for Dynamic Clinical Workflows

当OpenClaw遇见医院:迈向动态临床工作流的智能操作系统

Wenxian Yang, Hanzheng Qiu, Bangqun Zhang, Chengquan Li, Zhiyong Huang, Xiaobin Feng, Rongshan Yu, Jiahong Dong

机构 * Independent Researcher(独立研究者) National Institute for Data Science in Health and Medicine, Xiamen University, Xiamen, China(健康医学数据科学国家研究院,厦门大学,厦门,中国) Yue’erwan Internet Hospital Co., Ltd.(悦尔湾互联网医院有限公司) School of Biomedical Engineering, Tsinghua University, Beijing, China(生物医学工程学院,清华大学,北京,中国) National University of Singapore, Singapore(新加坡国立大学) Yttrium-90 Precision Interventional Radiotherapy Center of Liver Cancer, Beijing Tsinghua Changgung Hospital, School of Clinical Medicine, Tsinghua University, Beijing, China(肝癌钇-90精准介入放射治疗中心,北京清华大学昌平医院,临床医学学院,清华大学,北京,中国) Hepatobiliary and Pancreatic Centre, Beijing Tsinghua Changgung Hospital, School of Clinical Medicine, Tsinghua University, Beijing, China(肝胆胰中心,北京清华大学昌平医院,临床医学学院,清华大学,北京,中国)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出一种适应医院环境的LLM代理架构,通过受限执行环境、文档导向交互模型、分页索引内存架构和可组合医疗技能库,实现临床工作流的协调,保障安全、透明和可审计性。

详情

展开后加载摘要…

URL PDF HTML 收藏