arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-16 至 2026-04-16 共收录 23 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 23 篇

2602.23636 2026-04-16 cs.LG cs.AI 73%

FlexGuard: Continuous Risk Scoring for Strictness-Adaptive LLM Content Moderation

FlexGuard: 严格度自适应的连续风险评分用于LLM内容审核

Zhihao Ding, Jinming Li, Ze Lu, Jieming Shi

机构 * The Hong Kong Polytechnic University(香港理工大学) ByteDance(字节跳动)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出FlexGuard,一种基于LLM的连续风险评分系统,通过风险对齐优化提升审核准确性和在不同严格度下的鲁棒性。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05991 2026-04-16 cs.AI 70%

3D Instruction Ambiguity Detection

三维指令歧义检测

Jiayu Ding, Haoran Tang, Hongbo Jin, Wei Gao, Ge Li

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出三维指令歧义检测任务,构建了大规模基准Ambi3D,发现现有3D大语言模型难以判断指令歧义,提出AmbiVer框架解决该问题,提升具身AI的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06921 2026-04-16 cs.CR cs.AI 70%

Neuro-Symbolic AI for Cybersecurity: State of the Art, Challenges, and Opportunities

神经符号AI在网络安全中的应用:现状、挑战与机遇

Safayat Bin Hakim, Muhammad Adil, Alvaro Velasquez, Shouhuai Xu, Houbing Herbert Song

机构 * Department of Information Systems, University of Maryland, Baltimore County(信息系统系,马里兰大学巴尔的摩分校) Department of Computer Science and Engineering, University at Buffalo(计算机科学与工程系,布法罗大学) Department of Computer Science, University of Colorado Boulder(计算机科学系,科罗拉多大学博尔德分校) Laboratory for Cybersecurity Dynamics, Department of Computer Science, University of Colorado Colorado Springs(网络安全动力实验室,科罗拉多大学科罗拉多斯普林斯分校)

专题命中 安全评测 :alignment(abstract,abstract_cn);分类 cs.AI

AI总结 本文综述了神经符号AI在网络安全中的应用,分析了103篇文献,指出多智能体和结构化集成架构在复杂场景中表现更优,因果推理能提升防御能力,知识引导学习提高效率和可解释性,但评估标准化和人机协作仍是挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14016 2026-04-16 cs.LG cs.AI 62%

MAny: Merge Anything for Multimodal Continual Instruction Tuning

MAny:为多模态连续指令微调合并任何内容

Zijian Gao, Wangwang Jia, Xingxing Zhang, Pengfei Qian, Tao Sun, Bo Ding, Yong Dou, Huaimin Wang, Kele Xu

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) National Key Laboratory of Parallel and Distributed Computing, National University of Defense Technology(国防科技大学并行与分布式计算国家重点实验室) State Key Laboratory of Complex & Critical Software Environment(复杂与关键软件环境国家重点实验室) School of Computer Science, Tsinghua University(清华大学计算机科学与技术系)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 针对多模态连续指令微调中感知漂移和推理崩溃问题,提出MAny框架,通过跨模态投影合并和低秩参数合并实现任务知识融合,提升模型鲁棒性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13954 2026-04-16 cs.LG cs.AI 62%

HINTBench: Horizon-agent Intrinsic Non-attack Trajectory Benchmark

HINTBench:地平线代理内在非攻击轨迹基准

Jiacheng Wang, Jinchang Hou, Fabian Wang, Ping Jian, Chenfu Bao, Zhonghou Lv

机构 * Baidu Inc(百度公司) Beijing Institute of Technology(北京理工大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究内在风险审计,提出HINTBench基准,包含629条轨迹,评估风险检测、风险步定位和内在故障识别,发现强LLM在风险步定位上表现差,揭示内在风险审计的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13882 2026-04-16 cs.LG cs.AI 62%

Evaluating Supervised Machine Learning Models: Principles, Pitfalls, and Metric Selection

评估监督机器学习模型:原则、陷阱与度量选择

Xuanyan Liu, Ignacio Cabrera Martin, Marcello Trovati, Xiaolong Xu, Nikolaos Polatidis

机构 * Jiangsu Key Laboratory of Big Data Security and Intelligent Processing, Nanjing University of Posts and Telecommunications(江苏大数据安全与智能处理重点实验室,南京邮电大学) University of Brighton(布莱顿大学) University of Lancashire(兰开夏大学) School of Cyber Science and Engineering, Southeast University(东南大学信息科学与工程学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨监督学习模型评估的原则、挑战及实践考虑,分析数据集特性、验证设计、类别不平衡等因素对评估结果的影响,指出常见陷阱并强调选择合适度量标准的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13064 2026-04-16 cs.CL cs.CY 62%

Red Skills or Blue Skills? A Dive Into Skills Published on ClawHub

红技能还是蓝技能?深入探讨ClawHub上的技能

Haichuan Hu, Ye Shang, Quanjun Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) Nanjing University(南京大学) Nanjing University of Science and Technology(南京理工大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.CY

AI总结 本文研究ClawHub上的技能生态系统,分析语言分布、功能组织及安全性,发现英语技能更偏向技术能力,而中文技能更侧重应用场景,且超过30%的技能被标记为可疑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13060 2026-04-16 cs.CL cs.LG cs.MM 62%

Dental-TriageBench: Benchmarking Multimodal Reasoning for Hierarchical Dental Triage

牙科分诊基准:用于分层牙科分诊的多模态推理基准

Ziyi He, Yushi Feng, Shuangyu Yang, Yinghao Zhu, Xichen Zhang, Pak Chuen Patrick Tai, Hei Yuet Lo, Songying Wu, Weifa Yang, Lequan Yu

机构 * School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) Faculty of Dentistry, The University of Hong Kong(香港大学牙科学院) The Prince Philip Dental Hospital(菲利普王子牙科医院) Li Ka Shing Faculty of Medicine, The University of Hong Kong(香港大学利滋医学学院) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.LG

AI总结 本文提出Dental-TriageBench,首个专家标注的多模态牙科分诊基准,通过246个脱敏案例评估19种模型在细粒度治疗层面分诊中的表现,揭示了人类与模型间的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12102 2026-04-16 cs.AI cs.CV cs.LG 62%

Spatial Atlas: Compute-Grounded Reasoning for Spatial-Aware Research Agent Benchmarks

空间图谱:面向空间感知研究代理的计算导向推理

Arun Sharma

机构 * University of Minnesota, Twin Cities(明尼苏达大学,双城分校)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出计算导向推理(CGR)框架,通过确定性计算解决子问题后再由语言模型生成答案,构建了空间图谱系统,用于评估FieldWorkArena和MLE-Bench两个挑战性基准,通过结构化空间场景图引擎和熵引导动作选择提升空间推理的准确性和可解释性。

Comments 11 pages. Code: https://github.com/arunshar/spatial-atlas

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13891 2026-04-16 cs.RO cs.AI cs.SY eess.SY 57%

Beyond Conservative Automated Driving in Multi-Agent Scenarios via Coupled Model Predictive Control and Deep Reinforcement Learning

通过耦合模型预测控制和深度强化学习实现多智能体场景下的非保守自动驾驶

Saeed Rahmani, Gözde Körpe, Zhenlin, Xu, Bruno Brito, Simeon Craig Calvert, Bart van Arem

机构 * TU Delft, Faculty of Civil Engineering and Geosciences, Department of Transport and Planning(代尔夫特理工大学,土木工程与地质科学学院,交通与规划系) NVIDIA

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出结合MPC与RL的框架,提升多智能体场景下的导航性能,实验表明MPC-RL在碰撞率和成功率上优于传统方法,且在零样本迁移中表现更优,展示了MPC对跨场景鲁棒性的贡献。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13824 2026-04-16 cs.LG 57%

Beyond State Consistency: Behavior Consistency in Text-Based World Models

超越状态一致性:文本基础世界模型中的行为一致性

Youling Huang, Guanqiao Chen, Junchi Yao, Lu Wang, Fangkai Yang, Chao Du, ChenZhuo Zhao, Pu Zhao, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang

机构 * Dalian University of Technology(大连理工大学) MBZUAI Peking University(北京大学) Microsoft(微软)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文提出行为一致性训练方法,通过改进世界模型与真实环境的功能一致性,提升长期对齐效果,实验显示在WebShop和TextWorld中表现优异,同时保持单步预测质量。

Comments 20 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13804 2026-04-16 cs.LG 57%

Character Beyond Speech: Leveraging Role-Playing Evaluation in Audio Large Language Models via Reinforcement Learning

角色超越言语:通过强化学习利用角色扮演评估音频大语言模型

Dongjie Fu, Fangming Feng, Xize Cheng, Linjun Li, Zhou Zhao, Tao Jin

机构 * Zhejiang University(浙江大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文提出RoleJudge框架,通过多模态评估系统评估语音与角色的一致性,引入RoleChat数据集并采用多阶段训练和标准对齐强化学习,验证了多维评估框架的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05452 2026-04-16 cs.CL 57%

LLMEval-Fair: A Large-Scale Longitudinal Study on Robust and Fair Evaluation of Large Language Models

LLMEval-Fair: 一个大规模纵向研究,探讨大型语言模型的稳健与公平评估

Ming Zhang, Yujiong Shen, Jingyi Deng, Yuhui Wang, Huayu Sha, Kexin Tan, Qiyuan Peng, Yue Zhang, Junzhe Wang, Shichun Liu, Yueyuan Huang, Jingqi Tong, Changhao Jiang, Yilong Wu, Zhihao Zhang, Mingqi Wu, Mingxu Chai, Zhiheng Xi, Shihan Dou, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * Fudan NLP Group(复旦大学自然语言处理组)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 LLMEval-Fair通过动态评估框架和抗污染数据整理,揭示了静态基准无法检测的模型性能上限和数据污染问题,提供了更可靠的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13756 2026-04-16 cs.CL cs.CV 57%

MedRCube: A Multidimensional Framework for Fine-Grained and In-Depth Evaluation of MLLMs in Medical Imaging

MedRCube:面向医学影像中多模态大语言模型细粒度与深入评估的多维框架

Zhijie Bao, Fangke Chen, Licheng Bao, Chenhui Zhang, Wei Chen, Jiajie Peng, Zhongyu Wei

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Innovation Institute(上海创新研究院) School of Integrated Circuits, Zhejiang University(浙江大学集成电路学院) School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院) School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 本文提出MedRCube框架,通过两阶段构建流程对33个MLLM进行细粒度评估,揭示先前方法无法获取的洞察,并引入可信度评估子集,发现快捷行为与诊断性能的显著正相关,引发临床部署的担忧。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13271 2026-04-16 cs.LG 57%

Enhancing Confidence Estimation in Telco LLMs via Twin-Pass CoT-Ensembling

通过双通道CoT-集成增强电信领域LLM的置信度估计

Anton Saenko, Pranshav Gajjar, Abiodun Ganiyu, Vijay K. Shah

机构 * NextG Wireless Lab(NextG无线实验室) North Carolina State University(北卡罗来纳州立大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 本文提出双通道CoT-集成方法,通过多独立推理评估提升电信领域LLM的置信度估计,降低ECE误差达88%,提高模型自我评估可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13067 2026-04-16 cs.HC cs.CL 57%

From Seeing it to Experiencing it: Interactive Evaluation of Intersectional Voice Bias in Human-AI Speech Interaction

从看见它到体验它:交互式评估人类-人工智能语音交互中的交叉性声音偏见

Shree Harsha Bokkahalli Satish, Maria Teleki, Christoph Minixhofer, Ondrej Klejch, Peter Bell, Éva Székely

机构 * KTH Royal Institute of Technology(皇家理工学院) University of Edinburgh(爱丁堡大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文通过控制测试队列和交互研究设计,探讨了声音转换对信任和接受度的影响,揭示了不同口音和性别在语音处理中的交叉性偏见。

Comments 6 pages, 3 figures, 1 table, Accepted to CHI Extended Abstracts Poster session 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09687 2026-04-16 cs.CV cs.AI 57%

Grid2Matrix: Revealing Digital Agnosia in Vision-Language Models

Grid2Matrix: 揭示视觉语言模型中的数字失读

Yunkai Zhang, Linda Li, Yingxin Cui, Xiyuan Ruan, Zeyu Zheng, Kezhen Chen, Yi Zhang, Diji Yang

机构 * BAIR, UC Berkeley(伯克利大学BAIR实验室) UC Santa Cruz(圣克拉拉大学) Analogy AI

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 Grid2Matrix通过控制视觉复杂度测试视觉语言模型在捕捉细节方面的不足,发现模型在小网格上表现不佳,揭示了视觉编码与语言表达间的差距,即'数字失读'。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08639 2026-04-16 cs.CV cs.AI 57%

UNBOX: Unveiling Black-box visual models with Natural-language

UNBOX:通过自然语言揭示黑盒视觉模型

Simone Carnemolla, Chiara Russo, Simone Palazzo, Quentin Bouniot, Daniela Giordano, Zeynep Akata, Matteo Pennisi, Concetto Spampinato

机构 * University of Catania(卡塔尼亚大学) Technical University of Munich(慕尼黑技术大学) Helmholtz Munich(海德堡-慕尼黑马克斯·普朗克研究所)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 UNBOX在无数据、无梯度、无反向传播约束下,利用大语言模型和扩散模型生成可解释文本描述,揭示模型隐含概念与潜在偏见,通过实验验证其在ImageNet-1K等数据集上的有效性。

Comments Under review at IJCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02697 2026-04-16 cs.CV 50%

GeoBridge: A Semantic-Anchored Multi-View Foundation Model Bridging Images and Text for Geo-Localization

GeoBridge:一种语义锚定的多视图基础模型,用于图像与文本之间的地理定位

Zixuan Song, Jing Zhang, Di Wang, Zidie Zhou, Wenbin Liu, Haonan Guo, En Wang, Bo Du

机构 * School of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) School of Computer Science, Wuhan University(武汉大学计算机学院) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室)

专题命中 安全评测 :alignment(abstract)

AI总结 GeoBridge通过语义锚定机制实现多视图特征桥接,提升地理定位的鲁棒性和灵活性。该模型构建了首个大规模跨模态多视图对齐数据集GeoLoc,验证了预训练对地理定位精度和跨领域泛化能力的提升。

Comments The paper is accepted by CVPR 2026! Code, dataset, and pretrained models will be released at https://github.com/MiliLab/GeoBridge

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13708 2026-04-16 eess.SY cs.SY 50%

Homotopy-Guided Potential Games for Congestion-Aware Navigation

基于同调的势游戏用于拥堵感知导航

Mohammed Irshadh Ismaaeel Sathyamangalam Imran, Lasse Peters, Michael Khayyat, Stefano Arrigoni, Francesco Braghin, Laura Ferranti

专题命中 安全评测 :safety(abstract)

AI总结 本文提出一种结合同调方法和势游戏的多智能体路径规划框架,通过拓扑结构策略集和递推时间窗设置,提升导航效率与安全性,实验验证其在拥堵场景下的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13254 2026-04-16 cs.GR 50%

Calibrated Abstention for Reliable TCR--pMHC Binding Prediction under Epitope Shift

校准的回避策略:在表位偏移下实现可靠的TCR-pMHC结合预测

Arman Bekov, Timur Bekzhanov, Bekzat Sadykov

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出一种校准的回避方法,通过双编码器架构和温度缩放技术,提升TCR-pMHC结合预测的可靠性,减少预测误差,适应表位偏移挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14234 2026-04-16 cs.CV 50%

ViBES: A Conversational Agent with Behaviorally-Intelligent 3D Virtual Body

ViBES:一个具有行为智能的3D虚拟身体对话代理

Juze Zhang, Changan Chen, Xin Chen, Heng Yu, Tiange Xiang, Ali Sartaz Khan, Shrinidhi K. Lakshmikanth, Ehsan Adeli

机构 * Stanford University(斯坦福大学) ByteDance(字节跳动)

专题命中 安全评测 :alignment(abstract)

AI总结 ViBES通过联合规划语言和运动,实现对话条件下的身体动作生成,提升了多轮对话中的社会交互能力。

Comments Project page: https://ai.stanford.edu/~juze/ViBES/. Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18558 2026-04-16 cs.CV eess.IV 50%

Synthetic Data Augmentation for Enhanced Chicken Carcass Instance Segmentation

合成数据增强用于增强鸡 carcass 实例分割

Yihong Feng, Chaitanya Pallerla, Xiaomin Lin, Pouya Sohrabipour, Philip Crandall, Wan Shou, Yu She, Dongyi Wang

机构 * Department of Biological and Agricultural Engineering, University of Arkansas(生物与农业工程系,阿肯色大学) Department of Food Science, University of Arkansas(食品科学系,阿肯色大学) Department of Electrical Engineering, University of South Florida(电气工程系,佛罗里达州立大学) Department of Mechanical Engineering, University of Arkansas(机械工程系,阿肯色大学) Department of Industrial Engineering, Purdue University(工业工程系,普渡大学)

专题命中 安全评测 :safety(abstract)

AI总结 本文提出首个生成逼真合成图像的 pipeline,引入包含300张标注图像的基准数据集,通过合成数据增强提升鸡 carcass 实例分割性能,尤其在真实标注数据稀缺时效果显著。

Comments Submitted for journal reviewing

详情

展开后加载摘要…

URL PDF HTML 收藏