arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-20 至 2026-04-20 共收录 17 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 17 篇

2604.15789 2026-04-20 cs.CL 83%

A Systematic Study of Training-Free Methods for Trustworthy Large Language Models

对可信大语言模型无训练方法的系统研究

Wai Man Si, Mingjie Li, Michael Backes, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全研究中心)

专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);分类 cs.CL

AI总结 本文系统评估了无训练方法在不同可信设置下的有效性,分析了其对效用、鲁棒性和计算开销的影响,并提出平衡可信性、效用和鲁棒性的实用建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21977 2026-04-20 cs.AI 79%

Distribution Shift Alignment Helps LLMs Simulate Survey Response Distributions

分布偏移对齐有助于LLM模拟调查响应分布

Ji Huang, Mengfei Li, Shuai Shao

机构 * School of Computer Science, University of Science and Technology of China(中国科学技术大学计算机科学学院) School of Management, Fudan University(复旦大学管理学院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出DSA方法,通过两阶段微调对齐输出分布和偏移,提升LLM模拟调查响应的准确性与效率,在五个公开数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.13850 2026-04-20 cs.CY cs.HC 79%

PADTHAI-MM: Principles-based Approach for Designing Trustworthy, Human-centered AI using MAST Methodology

PADTHAI-MM: 基于原则的方法用于使用MAST方法论设计可信、以人类为中心的AI

Myke C. Cohen, Nayoung Kim, Yang Ba, Anna Pan, Shawaiz Bhatti, Pouria Salehi, James Sung, Erik Blasch, Michelle V. Mancenido, Erin K. Chiou

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CY

AI总结 本文提出PADTHAI-MM框架,通过MAST方法论设计可信AI系统,通过READIT平台验证,评估MAST对AI信任的影响,并探讨MAST评分与信任因素的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16198 2026-04-20 cs.SE 78%

Bridging the Gap between User Intent and LLM: A Requirement Alignment Approach for Code Generation

弥合用户意图与大语言模型之间的鸿沟:一种用于代码生成的需求对齐方法

Jia Li, Ruiqi Bai, Yangkang Luo, Yiran Zhang, Wentao Yang, Zeyu Sun, Tiankuo Zhao, Dongming Jin, Lei Li, Zhi Jin

专题命中 安全评测 :alignment(title,abstract)

AI总结 本文提出REA-Coder方法,通过需求对齐提升大语言模型的代码生成性能,实验表明其在多个编程基准测试中表现优异,平均提升率达7.93%至30.25%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15332 2026-04-20 cs.HC cs.AI cs.CV cs.SE 70%

Automating Crash Diagram Generation Using Vision-Language Models: A Case Study on Multi-Lane Roundabouts

利用视觉-语言模型自动化生成碰撞图:多车道环形交叉口的案例研究

Xiao Lu, Hao Zhen, Jidong J. Yang

机构 * Smart Mobility and Infrastructure Lab, College of Engineering University of Georgia Athens(智能移动与基础设施实验室,工程学院,佐治亚大学亚特兰大分校)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文研究利用视觉-语言模型自动化生成碰撞图,针对多车道环形交叉口这一挑战性案例,提出三步提示框架和10项评估指标,发现GPT-4o在空间推理和数据对齐方面表现最佳,为生成式AI在工程可视化中的应用奠定基础。

Comments 16 pages, 5 figures, 3 tables

Journal ref Applied Computing and Intelligence, 2026, 6(1): 38-57

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15800 2026-04-20 cs.HC cs.AI cs.CL 62%

From Intention to Text: AI-Supported Goal Setting in Academic Writing

从意图到文本:支持学术写作的AI目标设定

Yueling Fan, Richard Lee Davis, Olga Viberg

机构 * Department of Media Technology and Interaction Design(媒体技术与交互设计系) KTH Royal Institute of Technology(皇家理工学院) Department of Digital Learning(数字学习系) Digital Futures(数字未来)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出WriteFlow,一种基于AI语音的写作助手,通过目标导向互动支持反思性学术写作。通过Wizard-of-Oz研究显示,WriteFlow通过支持迭代目标优化、维持目标与文本一致性及促进目标完成评估,提升了写作的元认知调节与反思。

Comments Accepted at AIED 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15628 2026-04-20 cs.CV cs.CL cs.IR cs.LG cs.MM 62%

SIMMER: Cross-Modal Food Image--Recipe Retrieval via MLLM-Based Embedding

SIMMER:通过基于MLLM的嵌入进行跨模态食物图像-食谱检索

Keisuke Gomi, Keiji Yanai

机构 * The University of Electro-Communications(电通大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文提出SIMMER,利用基于MLLM的嵌入模型VLM2Vec,通过统一编码器处理食物图像和食谱文本,设计定制化提示模板和数据增强策略,实现跨模态检索的高精度。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11698 2026-04-20 cs.CV cs.AI cs.CL 62%

OSCBench: Benchmarking Object State Change in Text-to-Video Generation

OSCBench:文本到视频生成中对象状态变化的基准测试

Xianjing Han, Bin Zhu, Shiqi Hu, Franklin Mingzhe Li, Patrick Carrington, Roger Zimmermann, Jingjing Chen

机构 * National University of Singapore(新加坡国立大学) Singapore Management University(新加坡管理大学) Carnegie Mellon University(卡内基梅隆大学) Fudan University(复旦大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出OSCBench基准,用于评估文本到视频模型在对象状态变化上的性能,揭示当前模型在处理新场景时的不足。

Comments ACL 2026 Main Conference, Project page: https://hanxjing.github.io/OSCBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10262 2026-04-20 cs.CL cs.AI eess.AS 62%

MTR-DuplexBench: Towards a Comprehensive Evaluation of Multi-Round Conversations for Full-Duplex Speech Language Models

MTR-DuplexBench:面向全双工语音语言模型多轮对话全面评估的综合评测

He Zhang, Wenqian Cui, Haoning Xu, Xiaohui Li, Lei Zhu, Haoli Bai, Shaohua Ma, Irwin King

机构 * Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) Huawei Technologies(华为技术)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MTR-DuplexBench,用于评估全双工语音语言模型在多轮对话中的表现,涵盖对话质量、指令遵循和安全性等关键方面,揭示现有模型在多轮对话中的一致性问题。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16256 2026-04-20 cs.CV cs.CL 57%

Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap

视觉-语言模型真的能进行视觉推理吗?一种对模态差距的严格研究

Yige Xu, Yongjie Wang, Zizhuo Wu, Kaisong Song, Jun Lin, Zhiqi Shen

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算机与数据科学学院,新加坡) Alibaba-NTU Global e-Sustainability CorpLab (ANGEL)(阿里巴巴-国立大学全球可持续发展公司实验室(ANGEL)) Tongyi Lab, Alibaba Group, China(阿里云实验室,阿里巴巴集团,中国)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文通过CrossMath基准测试,发现视觉-语言模型在文本输入时表现优异,但加入图像信息后推理性能下降,表明其推理主要依赖文本空间,而非真实视觉证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15972 2026-04-20 cs.CV cs.AI 57%

When Cultures Meet: Multicultural Text-to-Image Generation

当文化相遇:多文化文本到图像生成

Parth Bhalerao, Mounika Yalamarty, Brian Trinh, Oana Ignat

机构 * Santa Clara University(圣克拉拉大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出多文化文本到图像生成任务,构建首个评估基准,分析先进模型在多文化场景下的表现,提出MosAIG框架提升图像生成质量与文化准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15871 2026-04-20 cs.CV cs.AI 57%

UniEditBench: A Unified and Cost-Effective Benchmark for Image and Video Editing via Distilled MLLMs

UniEditBench: 一种统一且成本效益高的图像和视频编辑基准,通过压缩的多模态大语言模型

Lifan Jiang, Tianrun Wu, Yuhang Pei, Chenyang Wang, Boxi Wu, Deng Cai

机构 * Zhejiang University(浙江大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 UniEditBench提出统一的图像和视频编辑基准,支持基于重建和指令驱动的方法,通过压缩的多模态大语言模型提供多维评分,减少部署成本并提高评估效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14373 2026-04-20 cs.CV cs.AI 57%

SatBLIP: Context Understanding and Feature Identification from Satellite Imagery with Vision-Language Learning

SatBLIP:基于卫星影像的视觉-语言学习用于农村环境理解和特征识别

Xue Wu, Shengting Cao, Shenglin Li, Jiaqi Gong

机构 * The University of Alabama(阿拉巴马大学) Knox College(克诺克斯学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 SatBLIP通过结合对比图像-文本对齐与定制化卫星语义描述,提升农村风险环境的可解释性分析,预测县级社会脆弱性指数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15788 2026-04-20 cs.IR 50%

Scattered Hypothesis Generation for Open-Ended Event Forecasting

散点假设生成用于开放性事件预测

He Chang, Zhulin Tao, Lifang Yang, Xianglin Huang, Yunshan Ma

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出SCATTER框架,通过引入假设生成任务,将开放性事件预测从点预测扩展到散点预测,以生成更全面的假设集,提升事件预测的多样性和包容性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15625 2026-04-20 cs.HC 50%

ZORO: Active Rules for Reliable Vibe Coding

ZORO:用于可靠振动编码的主动规则

Jenny Ma, Sitong Wang, Joshua H. Kung, Lydia B. Chilton

专题命中 安全评测 :alignment(abstract)

AI总结 ZORO通过将规则转化为主动控制,提升振动编码中人类与代理对齐的可靠性,通过交互界面整合编码代理,使规则与编码过程每一步关联,并通过技术评估和用户研究验证其有效性。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15326 2026-04-20 cs.HC 50%

Analyzing the Presentation, Content, and Utilization of References in LLM-powered Conversational AI Systems

分析基于大语言模型的对话式人工智能系统中参考文献的呈现、内容和利用

Jianheng Ouyang, Arpit Narechania

专题命中 安全评测 :trustworthy(abstract)

AI总结 研究分析了九个系统中1517个参考文献的呈现方式和质量,发现不同系统在参考文献数量和质量上有显著差异,需改进界面设计以提升用户对参考文献的信任度。

Comments 8 pages, 5 figures, Accepted to ACM CHI 2026 Extended Abstract/Poster/Case Study Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09305 2026-04-20 cs.CV 50%

VAGNet: Vision-based Accident Anticipation with Global Features

VAGNet:基于视觉的事故预测与全局特征

Vipooshan Vipulananthan, Charith D. Chitraranjan

机构 * Department of Computer Science and Engineering, University of Moratuwa(moratuwa大学计算机科学与工程系)

专题命中 安全评测 :safety(abstract)

AI总结 本文提出VAGNet,通过全局特征预测事故,提升实时性与效率,实验显示在四个数据集上精度和响应时间均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏