arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-27 至 2026-07-27 共收录 44 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 19 篇

2607.21652 2026-07-27 cs.SE 新提交 50%

Vibe Coding in Software Development: A Multivocal Literature Review

软件开发中的氛围编码:多视角文献综述

Shahbaz Siddeeq, Muhammad Waseem, Kai-Kristian Kemell, Mika Saari, Jussi Rasku, Pekka Abrahamsson

专题命中 安全评测 :safety(abstract)

AI总结 该研究对2022年至2025年10月的文献进行多视角综述,探讨软件开发中氛围编码实践。通过分析47篇文献发现其是迭代流程,开发者工作转变,短期生产力有提升,不同应用场景证据强弱有别,此为整合两类文献的首次综述并提出未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12291 2026-07-27 cs.RO cs.CV 版本更新 50%

OpenNavMap: Multi-Session Appearance-Based Topometric Mapping for Scalable Visual Navigation

OpenNavMap: 无需结构的拓扑制图通过大规模协作定位

Jianhao Jiao, Changkun Liu, Jingwen Yu, Boyi Liu, Qianyi Zhang, Yue Wang, Dimitrios Kanoulas

机构 * Robot Perception and Learning Lab, Intelligent Robotics, Department of Computer Science, University College London(机器人感知与学习实验室,智能机器人,计算机科学系,伦敦大学学院) Department of Computer Science and Engineering, Hong Kong University of Science and Technology(计算机科学与工程系,香港科学与技术大学) Department of Electronic and Computer Engineering, Hong Kong University of Science and Technology(电子与计算机工程系,香港科学与技术大学) Institute of Robotics and Automatic Information System, Nankai University(机器人与自动信息系统研究所,南开大学) College of control science and engineering, Zhejiang University(控制科学与工程学院,浙江大学) AI Centre, Department of Computer Science, University College London(人工智能中心,计算机科学系,伦敦大学学院)

专题命中 安全评测 :alignment(abstract)

AI总结 OpenNavMap通过大规模协作定位实现无需结构的拓扑制图,利用3D几何模型进行按需重建,实现高精度的子图对齐和全局一致性。

Comments 21 pages, 20 figures, https://rpl-cs-ucl.github.io/OpenNavMap_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15423 2026-07-27 cs.CV cs.RO 版本更新 50%

The 3D Mirage: Probing and Taming 3D Hallucinations

真实场景中的逼真幻影道路:从物理几何中解构3D幻觉

Hoang Nguyen, Xiaohao Xu, Xiaonan Huang

机构 * University of Michigan(密歇根大学)

专题命中 安全评测 :safety(abstract)

AI总结 本文提出首个端到端框架,用于探测、量化和抑制单目深度模型中因几何平面输入而产生的3D幻觉现象,通过引入3D-幻影基准和基于拉普拉斯的评估框架,提升深度模型的结构和上下文鲁棒性。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 3 篇

2505.19212 2026-07-27 cs.CL cs.AI cs.CY 版本更新 67%

When Ethics and Payoffs Diverge: LLM Agents in Morally Charged Social Dilemmas

当伦理与收益相悖时:道德两难情境下的大语言模型智能体

Steffen Backmann, David Guzman Piedrahita, Terry Jingchen Zhang, Emanuel Tewolde, Rada Mihalcea, Bernhard Schölkopf, Zhijing Jin

机构 * ETH Zürich(苏黎世联邦理工学院) University of Zurich(苏黎世大学) Carnegie Mellon University(卡内基梅隆大学) University of Michigan(密歇根大学) Max Planck Institute for Intelligent Systems, Tübingen(图宾根人工智能研究所) University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究道德要求与利润激励冲突时LLMs在道德两难博弈中的行为,引入\msim评估九个模型,通过ATEs估计因果效应、分析推理轨迹,发现模型道德行为有情境脆弱性,揭示了部署风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08951 2026-07-27 cs.AI cs.CY 版本更新 62%

Analyzing the Ethical Logic of Eight Large Language Models

分析八个大语言模型的伦理逻辑

W. Russell Neuman, Chad Coleman, Manan Shah

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 研究分析OpenAI等八个大语言模型的伦理逻辑,通过让模型回答伦理原则问题和道德困境,用多种理论分析其回答,发现模型伦理判断趋同但在做决定意愿等方面有差异,还能增进对人工智能工作及增强人类伦理行为的理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22016 2026-07-27 cs.CV cs.AI 新提交 57%

EVL-MCoT: Enhanced Vision-Language Multi-CoT for Harmful Meme Detection

EVL-MCoT:用于有害模因检测的增强视觉语言多思维链

Hao Yang, Jin Wang, Xuejie Zhang

机构 * School of Information Science and Engineering, Yunnan University(云南大学信息科学与工程学院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 针对有害模因检测,提出增强视觉语言多CoT(EVL-MCoT)方法,通过促进多CoT及设计解码框架,解决现有方法局限,在相关数据集上获良好结果,且公开了源代码。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 8 篇

2607.21660 2026-07-27 cond-mat.mtrl-sci cs.AI cs.LG 新提交 62%

Generative and multimodal AI for materials prediction and design: Progress, challenges, and perspectives

用于材料预测和设计的生成式和多模态人工智能:进展、挑战与展望

Xianyuan Liu, Charles Anjah, Benjamin E. Jolly, Jonathon F. S. Markanday, Joshua Berry, Haolin Wang, Nicola A. Morley, Robert D. J. Oliver, Alexandra J. Ramadan, Delvin Ce Zhang, Katerina A. Christofidou, Haiping Lu

机构 * School of Computer Science, University of Sheffield, Sheffield, UK(计算机科学学院,谢菲尔德大学) Centre for Machine Intelligence, University of Sheffield, Sheffield, UK(智能机器研究中心,谢菲尔德大学) School of Chemical, Materials and Biological Engineering, University of Sheffield, Sheffield, UK(化学、材料与生物工程学院,谢菲尔德大学) Henry Royce Institute, Royce Discovery Centre, University of Sheffield, Sheffield, UK(亨利·罗伊奇研究所,谢菲尔德大学) Materials Nexus Ltd., Salisbury House, Cambridge, UK(材料 nexus 有限公司,剑桥,英国) School of Mathematical and Physical Sciences, University of Sheffield, Sheffield, UK(数学与物理科学学院,谢菲尔德大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨生成式和多模态人工智能在材料预测与设计中的应用,引入材料属性层次结构框架,指出当前证据局限,强调需全社区标准支持多模态相关建模与基准测试,以设计具科学和实际新颖性、可实验实现的材料。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22525 2026-07-27 cs.AI 新提交 57%

Explainable Reinforcement Learning for assisting Air Traffic Controllers

用于协助空中交通管制员的可解释强化学习

Anduel Mehmeti, Gabriella Gigante, Salvatore Venticinque

机构 * Department of Engineering, University of Campania "Luigi Vanvitelli"(工程学院,坎帕尼亚"路易吉·范维蒂利"大学) CIRA(CIRA研究院)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 探索可解释性技术在强化学习算法中的应用,以协助空中交通管制员。用强化学习算法在简化ATC环境训练智能体决策避禁飞区路线,采用显著性图作为初步可解释性方法,为智能体决策提供关键输入特征见解。

Comments 11 pages (10-page paper plus 1 cover/citation page), 4 figures, 1 table; published in AINA 2025

Journal ref In: L. Barolli (ed.), Advanced Information Networking and Applications (AINA 2025), Lecture Notes on Data Engineering and Communications Technologies, vol. 250, pp. 148-157, Springer, Cham (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21970 2026-07-27 cs.CV cs.AI 新提交 57%

TextSLIP: Text Self-Supervised CLIP for Medical Report Generation

TextSLIP:用于医学报告生成的文本自监督CLIP

Haoyu Jiang, Ziping Cong

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 研究针对现有CLIP方法在医学报告生成中语义监督不足问题,提出TextSLIP框架,通过模态内文本对比学习增强CLIP,经实验验证其在报告生成指标上有改进,表明文本级对比学习对改善医学视觉-文本对齐有潜力。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21641 2026-07-27 cs.SE cs.AI 新提交 57%

Tool-Guided Retrieval-Augmented Repair for Securing LLM-Generated C Code

用于保护大语言模型生成的C代码的工具引导检索增强修复

Vidyut Sriram, Saatvik Pradhan, Suman Saha

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 研究大语言模型生成C代码可靠性问题,提出结合编译诊断、CodeQL静态分析等及检索先前修复模式的分析与修复工作流程,在相关C编程任务上评估,该方法有效降低了基线模型的编译失败率和安全缺陷率,提升了代码安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21596 2026-07-27 cs.AI 新提交 57%

FlowEvo: Self-Evolving Agents through the Co-Evolution of Workflows and Executable Skills

FlowEvo:通过工作流和可执行技能的协同进化实现自我进化的智能体

Zeyu Ren, Ling Yue, Ran Li, Yishu Wang, Shengxiang Xu, Hanmo Liu, Shaowu Pan, Shimin Di

机构 * Southeast University(东南大学) Rensselaer Polytechnic Institute(伦斯勒理工学院) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 研究旨在让大型语言模型智能体通过工作流解决复杂任务。提出FlowEvo框架,通过工作流到技能编译、技能到工作流反馈、技能管理三个机制,使智能体无需更新模型参数积累完善能力,实验显示其在基准测试中精度-成本权衡优,各机制有贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21957 2026-07-27 cs.SE cs.CR 新提交 50%

KaPilot: LLM-Assisted Generation of Kani Specifications for Unsafe Rust Verification

KaPilot:用于不安全Rust验证的大语言模型辅助Kani规范生成

Minghua Wang, Yuxi Ling, Mingzhi Gao, Yuwei Liu, Lin Huang

专题命中 其他安全 :safety(abstract)

AI总结 研究针对不安全Rust内存安全验证规范编写难题,提出KaPilot多智能体框架,经轻量级分析、智能体协作及循环优化、策略筛选确定最佳规范,评估显示其在规范生成成功率和质量上优于AutoSpec。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11957 2026-07-27 cs.CV 版本更新 50%

Anomalous Frame Detection Using VLM-Based Description Comparison for Extracting Expert-Specific Actions and Contextual Decision-Making Scenes with Intra-Video Self-Similarity

基于VLM描述比较的异常帧检测,用于提取特定专家操作和具有视频内自相似性的上下文决策场景

Ryo Sakai, Kaname Yokoyama

专题命中 其他安全 :safety(abstract)

AI总结 本文针对关键基础设施维护中专家知识传承问题,提出基于VLM描述比较检测异常帧的方法,可提取特定专家操作及上下文决策场景,在模拟实验中该方法的提取率高于传统方法,有效发现含专家知识的候选场景。

Comments 17 pages, 11 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10058 2026-07-27 cs.CV 版本更新 50%

Color Me Correctly: Bridging Perceptual Color Spaces and Text Embeddings for Improved Diffusion Generation

正确为我上色:弥合感知颜色空间与文本嵌入以改进扩散生成

Sung-Lin Tsai, Bo-Lun Huang, Yu Ting Shen, Cheng Yu Yeo, Chiang Tseng, Bo-Kai Ruan, Wen-Sheng Lien, Hong-Han Shuai

机构 * National Yang Ming Chiao Tung University

专题命中 其他安全 :alignment(abstract)

AI总结 研究文本到图像生成中颜色对齐问题,提出利用大语言模型消除颜色提示歧义、在文本嵌入空间指导颜色混合操作的无需训练框架,提高了颜色准确性且不影响图像质量,弥合文本语义与视觉生成差距。

Comments Accepted to ACM Multimedia 2025 (MM '25)

详情

展开后加载摘要…

URL PDF HTML 收藏