arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-10 至 2026-03-10 共收录 96 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 35 篇

2603.07460 2026-03-10 cs.CR cs.AI 57%

Where Do LLM-based Systems Break? A System-Level Security Framework for Risk Assessment and Treatment

LLM-based系统在哪里失效?一个系统级安全框架用于风险评估与处理

Neha Nagaraja, Hayretdin Bahsi

机构 * Northern Arizona University(北亚利桑那大学) Department of Software Science(软件科学系) Tallinn University of Technology(塔林技术大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出了一种系统级安全框架,用于评估和处理LLM系统中的风险,通过结合系统建模与攻击-防御树,分析医疗场景中的多步骤攻击路径,并提供可比较的防御策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07019 2026-03-10 cs.CL 57%

AutoChecklist: Composable Pipelines for Checklist Generation and Scoring with LLM-as-a-Judge

AutoChecklist: 用于检查表生成和评分的可组合流水线

Karen Zhou, Chenhao Tan

机构 * University of Chicago(芝加哥大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 AutoChecklist通过可组合的流水线实现检查表生成与评分,支持多种LLM提供者,并展示了在领域适应中的灵活性。

Comments Website: https://autochecklist.github.io/, Code: https://github.com/ChicagoHAI/AutoChecklist

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06749 2026-03-10 cs.RO cs.AI 57%

Robotic Foundation Models for Industrial Control: A Comprehensive Survey and Readiness Assessment Framework

工业控制中的机器人基础模型:全面调研与可行性评估框架

David Kube, Simon Hadwiger, Tobias Meisen

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文调研了工业控制中机器人基础模型的应用现状,通过系统评估框架分析了其工业适用性,指出工业成熟度有限,需加强安全、实时性、感知与集成等关键因素的系统性考虑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06584 2026-03-10 cs.HC cs.CY cs.SE 57%

AI-Powered Multi-Stakeholder Ecosystems for Global Development: A Design Research Study on the GSI D-Hub Proof-of-Concept Platform

人工智能赋能的多方利益相关者生态系统用于全球发展:对GSI D-Hub概念验证平台的设计研究

Muzakkiruddin Ahmed Mohammed, Adeeba Tarannum, Eileen Devereux Dailey, Marla Johnson, Mert Can Cakmak, John Talburt

专题命中 安全评测 :trustworthy(abstract);分类 cs.CY

AI总结 本文提出GSI D-Hub平台,利用可解释AI促进多方协作,通过设计科学方法验证其在提升透明度和决策信心方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08347 2026-03-10 cs.CV 50%

Local-Global Prompt Learning via Sparse Optimal Transport

通过稀疏最优传输实现局部-全局提示学习

Deniz Kizaroğlu, Ülku Tuncer Küçüktas, Emre Çakmakyurdu, Alptekin Temizel

专题命中 安全评测 :alignment(abstract)

AI总结 SOT-GLP通过稀疏最优传输实现局部-全局提示学习,提升少样本分类和分布外检测性能。

Comments 9 pages, 3 figures, 4 tables. Code available at GitHub

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07966 2026-03-10 cs.CV 50%

Listening with the Eyes: Benchmarking Egocentric Co-Speech Grounding across Space and Time

用眼睛倾听:跨时空的自体视觉共指基准测试

Weijie Zhou, Xuantang Xiong, Zhenlin Hu, Xiaomeng Zhu, Chaoyang Zhao, Honghui Dong, Zhengyou Zhang, Ming Tang, Jinqiao Wang

机构 * Beijing Jiaotong University(北京交通大学) Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences (CASIA)(基础模型研究中心、自动化研究所、中国科学院(CASIA)) Tencent Robotics X(腾讯机器人X) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology (HKUST)(计算机科学与工程系、香港科学与技术大学(HKUST)) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳学院)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出EcoG-Bench,通过严格测试语音-手势绑定,揭示多模态接口可能限制时间对齐线索的可观察性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07769 2026-03-10 cs.CV 50%

MedQ-Deg: A Multidimensional Benchmark for Evaluating MLLMs Across Medical Image Quality Degradations

MedQ-Deg:一个多维基准,用于评估医疗图像质量退化下的多模态大语言模型

Jiyao Liu, Junzhi Ning, Chenglong Ma, Wanying Qu, Jianghan Shen, Siqi Luo, Jinjie Wei, Jin Ye, Pengze Li, Tianbin Li, Jiashi Lin, Hongming Shan, Xinzhe Luo, Xiaohong Liu, Lihao Liu, Junjun He, Ningsheng Xu

机构 * Fudan University(复旦大学) Shanghai AI Lab(上海人工智能实验室) Shanghai Jiaotong University(上海交通大学) Imperial College London(伦敦帝国理工学院)

专题命中 安全评测 :trustworthy(abstract)

AI总结 MedQ-Deg是一个多维基准,用于评估医疗图像质量退化下多模态大语言模型的性能,揭示模型在不同退化类型下的表现差异及置信度校准问题。

Comments 29 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07650 2026-03-10 cs.RO 50%

Multi-Agent Off-World Exploration for Sparse Evidence Discovery via Gaussian Belief Mapping and Dual-Domain Coverage

多智能体非世界探索用于稀疏证据发现的高斯信念映射与双域覆盖

Zhuoran Qiao, Tianxin Hu, Thien-Minh Nguyen, Shenghai Yuan

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) The University of Queensland(昆士兰大学)

专题命中 安全评测 :safety(abstract)

AI总结 本文提出基于高斯信念映射和双域覆盖的多智能体路径规划框架,用于非世界稀疏证据发现,通过平衡信息获取与操作安全,提升探索效率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06839 2026-03-10 cs.DL 50%

From Job Postings to Curriculum Decisions: Using AI to Generate Workforce Intelligence for MSW Program Planning

从职位发布到课程决策:利用AI生成劳动力情报用于MSW课程规划

Barbara S. Hiltz, Bryan G. Victor, Brian E. Perron

专题命中 安全评测 :alignment(abstract)

AI总结 本文利用AI分析职位发布数据,为MSW课程规划提供劳动力情报,揭示了不同实践领域的能力需求及发展趋势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06700 2026-03-10 cs.CV 50%

SIQA: Toward Reliable Scientific Image Quality Assessment

SIQA:迈向可靠的科学图像质量评估

Wenzhe Li, Liang Chen, Junying Wang, Yijing Guo, Ye Shen, Farong Wen, Chunyi Li, Zicheng Zhang, Guangtao Zhai

机构 * TongJi University(同济大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 安全评测 :alignment(abstract)

AI总结 SIQA提出了一种多维框架,通过SIQA-U和SIQA-S评估科学图像的科学正确性和感知清晰度,揭示模型在评分一致性与科学理解上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 6 篇

2603.02420 2026-03-10 cs.CY cs.AI 81%

Slurry-as-a-Service: A Modest Proposal on Scalable Pluralistic Alignment for Nutrient Optimization

泥浆即服务:一种可扩展的多元对齐方案用于营养优化

Rachel Hong, Yael Eiger, Jevan Hutson, Os Keyes, William Agnew

机构 * ValueMulch

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI、cs.CY

AI总结 本文提出ValueMulch框架,通过多元对齐方法提升覆盖模型对社区规范的符合度,探讨伦理与技术对齐的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11662 2026-03-10 cs.AI cs.CL cs.LG cs.MA cs.RO 67%

Let's Think in Two Steps: Mitigating Agreement Bias in MLLMs with Self-Grounded Verification

两步思考:通过自我 grounded 验证缓解 MLLM 的同意偏差

Moises Andrade, Joonhyuk Cha, Brandon Ho, Vriksha Srihari, Karmesh Yadav, Zsolt Kira

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出 SGV 方法,通过自我 grounded 验证缓解 MLLM 的同意偏差,提升验证准确性和任务完成率。

Comments ICLR 2026. Code, models, and data publicly available at https://mshalimay.github.io/agreement-bias-sgv/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07546 2026-03-10 cs.AI cs.LG 62%

COOL-MC: Verifying and Explaining RL Policies for Multi-bridge Network Maintenance

COOL-MC:多桥网络维护的强化学习策略验证与解释

Dennis Gross

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.LG

AI总结 COOL-MC通过概率模型检查和可解释性方法,验证并解释多桥网络维护的强化学习策略,揭示策略的安全性和偏见问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15904 2026-03-10 cs.CL cs.AI 62%

More Women, Same Stereotypes: Unpacking the Gender Bias Paradox in Large Language Models

更多女性,相同刻板印象:解构大型语言模型中的性别偏见悖论

Evan Chen, Run-Jun Zhan, Yan-Bai Lin, Hung-Hsuan Chen

机构 * Computer Science and Information Engineering(计算机科学与信息工程系)

专题命中 AI治理与伦理 :RLHF(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过自由叙事揭示大型语言模型中的性别偏见,发现其在职业性别分布上更接近人类刻板印象,而非现实数据,强调了平衡缓解措施的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06599 2026-03-10 cs.CY cs.AI 62%

Building the ethical AI framework of the future: from philosophy to practice

构建未来的伦理AI框架:从哲学到实践

Jasper Kyle Catapang

机构 * Graduate School of Global Studies(全球研究研究生院) Tokyo University of Foreign Studies(东京外国语大学) AI Product Development Division(人工智能产品开发部门) Money Forward, Inc.(Money Forward公司)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文提出了一种伦理设计控制架构,通过三重闸门机制整合后果论、义务论和美德伦理,为AI生命周期提供可执行的治理方案。

Journal ref AI Ethics 6, 150 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08397 2026-03-10 eess.AS 50%

NLE: Non-autoregressive LLM-based ASR by Transcript Editing

NLE:基于大语言模型的语音识别的非自回归方法通过转录编辑

Avihu Dekel, Samuel Thomas, Takashi Fukada, George Saon

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 NLE通过非自回归方法实现高效语音识别,利用转录编辑技术在保持准确性的同时显著提升处理速度,适用于实时应用场景。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 20 篇

2603.06722 2026-03-10 cs.LG cs.AI 81%

ProtAlign: Contrastive learning paradigm for Sequence and structure alignment

ProtAlign: 用于序列和结构对齐的对比学习范式

Aditya Ranganath, Hasin Us Sami, Kowshik Thopalli, Bhavya Kailkhura, Wesam Sakla

机构 * Center for Applied Scientific Computing, Lawrence Livermore National Laboratory(应用科学计算中心,劳伦斯利弗莫尔国家实验室)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 ProtAlign通过对比学习范式,统一了蛋白质序列与结构的表示,提升跨模态检索和下游预测性能。

Comments 5 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17788 2026-03-10 cs.CV cs.AI 79%

From 2D Alignment to 3D Plausibility: Unifying Heterogeneous 2D Priors and Penetration-Free Diffusion for Occlusion-Robust Two-Hand Reconstruction

从二维对齐到三维合理性:统一异构二维先验和无穿透扩散以实现抗遮挡的双手重建

Gaoge Han, Yongkang Cheng, Zhe Chen, Shaoli Huang, Tongliang Liu

机构 * AgiBot Mohamed bin Zayed University of Artificial Intelligence The University of Sydney La Trobe University

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出统一异构二维先验和无穿透扩散模型,以实现抗遮挡的双手重建,提升交互对齐和穿透抑制性能。

Comments Accepted by CVPR 2026 Main, Project: https://gaogehan.github.io/A2P/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07329 2026-03-10 cs.AI cs.CL cs.CY 67%

The Third Ambition: Artificial Intelligence and the Science of Human Behavior

第三项雄心:人工智能与人类行为的科学

W. Russell Neuman, Chad Coleman

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出利用大型语言模型作为研究人类行为、文化及道德推理的科学工具,探讨其在社会科学中的应用与方法论创新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08425 2026-03-10 cs.AI cs.HC cs.LG cs.MA cs.SY eess.SY 62%

IronEngine: Towards General AI Assistant

IronEngine:迈向通用AI助手

Xi Mo

机构 * NiusRobotLab(尼乌斯机器人实验室)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 IronEngine通过统一编排核心实现通用AI助手,具备多阶段流程、智能工具路由和高效执行能力,适用于个人助手和自动化框架。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10110 2026-03-10 cs.RO cs.AI cs.LG 62%

IMPACT: Intelligent Motion Planning with Acceptable Contact Trajectories via Vision-Language Models

IMPACT: 通过视觉-语言模型实现可接受接触轨迹的智能运动规划

Yiyang Ling, Karan Owalekar, Oluwatobiloba Adesanya, Erdem Bıyık, Daniel Seita

机构 * Thomas Lord Department of Computer Science, Viterbi School of Engineering, University of Southern California(托马斯·劳德计算机科学系,维特里比工程学院,南加州大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 IMPACT通过视觉-语言模型实现高效的接触丰富运动规划,在杂乱环境中优于其他方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08544 2026-03-10 cs.RO cs.LG 57%

The Neural Compass: Probabilistic Relative Feature Fields for Robotic Search

神经罗盘:基于概率相对特征场的机器人搜索

Gabriele Somaschini, Adrian Röfer, Abhinav Valada

机构 * Department of Computer Science, University of Freiburg(弗赖堡大学计算机科学系)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出ProReFF模型,通过概率相对特征场实现机器人搜索任务中的高效物体定位,实验表明其在模拟环境中比基线方法更高效,接近人类水平性能。

Comments 9 pages, 7 figures, 2 tables, submitted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08436 2026-03-10 cs.CV cs.CL 57%

Can Vision-Language Models Solve the Shell Game?

视觉-语言模型能解决贝壳游戏吗?

Tiedong Liu, Wee Sun Lee

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出SGCoT方法,通过生成对象轨迹解决VLMs在视觉跟踪中的根本限制,实现超过90%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05437 2026-03-10 cs.CV cs.AI 57%

SAIL: Similarity-Aware Guidance and Inter-Caption Augmentation-based Learning for Weakly-Supervised Dense Video Captioning

SAIL:基于相似性感知引导和跨字幕增强学习的弱监督密集视频字幕生成

Ye-Chan Kim, SeungJu Cha, Si-Woo Kim, Minju Jeon, Hyungee Kim, Dong-Jin Kim

机构 * Hanyang University(翰阳大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 SAIL通过跨模态对齐和大语言模型增强策略,提升弱监督密集视频字幕生成的准确性和语义感知能力。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08165 2026-03-10 cs.SE cs.AI 57%

An explainable hybrid deep learning-enabled intelligent fault detection and diagnosis approach for automotive software systems validation

一种可解释的混合深度学习智能故障检测与诊断方法用于汽车软件系统验证

Mohammad Abboush, Ehab Ghannoum, Andreas Rausch

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文提出了一种可解释的混合深度学习方法,用于汽车软件系统验证中的故障检测与诊断,通过可解释AI技术提升模型适应性和根本原因分析能力。

Comments 20 pages

Journal ref Knowledge-Based Systems Volume 334, 15 February 2026, 114922

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07335 2026-03-10 cs.AI 57%

VisualScratchpad: Inference-time Visual Concepts Analysis in Vision Language Models

VisualScratchpad: 视觉语言模型推理时的视觉概念分析

Hyesu Lim, Jinho Choi, Taekyung Kim, Byeongho Heo, Jaegul Choo, Dongyoon Han

机构 * KAIST AI(韩国科学技术院人工智能研究所) NAVER AI Lab(NAVER人工智能实验室)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 VisualScratchpad通过交互式界面分析视觉语言模型推理过程中的视觉概念,揭示三种未被充分探索的失败模式,帮助理解模型内部机制并改进调试。

Comments Accetped at ICLR 2026 Turstworthy AI Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07241 2026-03-10 cs.LG cs.IR 57%

Rethinking Deep Research from the Perspective of Web Content Distribution Matching

从网页内容分布匹配视角重新思考深度研究

Zixuan Yu, Zhenheng Tang, Tongliang Liu, Chengqi Zhang, Xiaowen Chu, Bo Han

机构 * School of Computer science and engineering, Sun Yat-sen University(计算机科学与工程学院,中山大学) CSE, The Hong Kong University of Science and Technology(计算机科学与工程系,香港科学与技术大学) Sydney AI Centre, The University of Sydney(悉尼人工智能中心,悉尼大学) Department of Data Science and Artificial Intelligence, The Hong Kong Polytechnic University(数据科学与人工智能系,香港理工大学) DSA Thrust, The Hong Kong University of Science and Technology (GuangZhou)(数据科学与技术 thrust,香港科学与技术大学(广州)) TMLR Group, Department of Computer Science, Hong Kong Baptist University(TMLR 组,计算机科学系,香港 Baptist 大学)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 WeDas通过引入网页内容分布感知机制,改进深度搜索代理的查询-结果对齐能力,提升子目标完成和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16987 2026-03-10 cs.LG 57%

From Model Explanation to Data Misinterpretation: A Cautionary Analysis of Post Hoc Explainers in Business Research

从模型解释到数据误读:对事后解释器在商业研究中使用的警示分析

Tong Wang, Ronilo Ragodos, Lu Feng, Yu, Hu

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文警示事后解释器在商业研究中用于假设检验的不足,指出其作为探索性工具生成而非验证实质性见解的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08611 2026-03-10 cs.CV cs.RO 50%

FOMO-3D: Using Vision Foundation Models for Long-Tailed 3D Object Detection

FOMO-3D:利用视觉基础模型进行长尾3D目标检测

Anqi Joyce Yang, James Tu, Nikita Dvornik, Enxu Li, Raquel Urtasun

机构 * Waabi University of Toronto(多伦多大学)

专题命中 其他安全 :safety(abstract)

AI总结 FOMO-3D通过利用视觉基础模型的丰富先验知识和多模态融合设计,提升长尾3D目标检测的性能。

Comments Published at 9th Annual Conference on Robot Learning (CoRL 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08520 2026-03-10 cs.CR cs.SE 50%

SCAFFOLD-CEGIS: Preventing Latent Security Degradation in LLM-Driven Iterative Code Refinement

SCAFFOLD-CEGIS: 防止由LLM驱动的迭代代码精炼中的潜在安全退化

Yi Chen, Yun Bian, Haiquan Wang, Shihao Li, Zhe Cui

专题命中 其他安全 :safety(abstract)

AI总结 SCAFFOLD-CEGIS通过多智能体协作架构,将安全约束显式化,有效降低LLM驱动迭代代码精炼中的潜在安全退化率至2.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏