arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-12 至 2026-08-12 共收录 18 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 18 篇

2608.11167 2026-08-12 cs.CV cs.CL cs.LG 新提交 81%

MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment

多模态代码切换:将视觉对象交织入语言以实现显式对象级对齐

Changhao Xiang, Shangyu Xing, Zhen Wu, Jianbing Zhang, Xinyu Dai

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.LG

AI总结 针对现有多模态大语言模型的图像级对齐存在指称歧义的问题,提出多模态代码切换(MMCS)范式,构建含77.3万样本的数据集,仅用5万样本即可匹配或超越60万图像-文本对训练的模型,提升了视觉基础与感知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06227 2026-08-12 cs.CL cs.LG 版本更新 81%

Automated Data Enrichment using Confidence-Aware Fine-Grained Debate among Open-Source LLMs for Mental Health and Online Safety

基于开源LLM的自信意识细粒度辩论用于心理健康和在线安全的自动化数据增强

Junyu Mao, Anthony Hills, Talia Tseriotou, Maria Liakata, Aya Shamir, Dan Sayda, Dana Atzil-Slonim, Natalie Djohari, Pamela Ugwudike, Mahesan Niranjan, Stuart E. Middleton

机构 * University of Southampton, UK(英国南安普顿大学) Queen Mary University of London, UK(伦敦大学玛丽女王学院) The Alan Turing Institute, UK(阿兰·图灵研究所) Bar Ilan University, Israel(巴伊兰大学)

专题命中 其他安全 :safety(title,abstract);分类 cs.CL、cs.LG

AI总结 本研究提出CFD框架,利用开源LLM的细粒度辩论实现心理健康和在线安全领域的自动化数据增强,通过实验验证其在多标签增强任务中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09937 2026-08-12 cs.CL cs.CY 新提交 76%

Carefully Considering Culture: Analyzing LLM Alignment in Single- and Multi-Cultural Settings using Cultural Consensus Theory

仔细考量文化:利用文化共识理论分析单文化与多文化场景下的大语言模型对齐

Krishna Pothugunta, John P. Lalor

专题命中 其他安全 :alignment(title);分类 cs.CL、cs.CY

AI总结 本研究利用文化共识理论,分析大语言模型在单/多文化场景下的对齐情况,发现模型存在文化结构误表征问题,该理论可用于区分模型反映人类多样性与算法同质化的情况。

Comments Accepted to ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11181 2026-08-12 cs.CC cs.AI cs.LG 新提交 73%

How to Verify Consistency of Probabilistic Claims

如何验证概率断言的一致性

Orr Paradise, Oliver Richardson, Yoshua Bengio, Shafi Goldwasser

专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对概率预测器答案的自洽性验证问题,基于Nilsson的工作构造交互式PCP,为概率预测器自洽性证明提供复杂性理论基础,是训练模型证明自身一致性的第一步。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10703 2026-08-12 cs.LG cs.AI cs.CL cs.HC 新提交 67%

Your LLM, Your Style: Behavioral Mode Axes for LLM Behavioral Control

你的大语言模型,你的风格:用于大语言模型行为控制的行为模式轴

Haoze Liu, Run Liu, Haiying Xu, Jiahui Han, Siyuan Fang, Siyu Yan, Huiqi Deng, Guanchu Wang, Na Zou

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出情境化行为数据框架,构建3200个对比性行为场景,发现LLMs有稳定且模型特异性的行为特征,提出行为模式轴控制LLM行为,表明其类人格倾向是可测量可控的行为模式。

Comments 33 pages, 8 figures. Code and data: https://github.com/lhz191/LLM-Behavioral-Personality

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06578 2026-08-12 cs.AI cs.CL cs.LG 交叉投稿 67%

Divergent Response Modes in Frontier Language Models Under Steering Pressure

前沿语言模型在引导压力下的发散响应模式

Ali Jalal-Kamali

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究评估六种前沿语言模型在引导压力下的响应差异,发现模型间存在不同响应模式,以Llama为对象追溯到内部机制,相关发现经多实验验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10492 2026-08-12 cs.AI cs.CY 新提交 62%

INSIDE the Student's Mind: Jointly Modeling Latent Reasoning and Action in LLM Student Simulators

洞察学生的思维:在LLM学生模拟器中联合建模潜在推理与行动

Rose Niousha, Minwoo Kang, Narges Norouzi

机构 * University of California, Berkeley(加利福尼亚大学伯克利分校)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 该研究针对LLM学生模拟器仅复现学生行动却未捕捉其潜在推理的问题,提出INSIDE框架,通过在配对思考轨迹与行动上微调LLM,提升了模拟行动保真度与推理对齐度,最高对齐度达57.9%。

Comments Accepted at the Conference on Language Modeling (COLM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21412 2026-08-12 cs.AI cs.CL cs.SE 版本更新 62%

Euclid-MCP: A Model Context Protocol Server for Deterministic Logical Reasoning via Prolog

欧几里得-MCP:一个通过Prolog进行确定性逻辑推理的模型上下文协议服务器

Bartolomeo Bogliolo

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI

AI总结 研究针对大型语言模型多步逻辑推理不可靠问题,提出开源的欧几里得-MCP服务器,通过引入欧几里得-IR及支持特定循环的工具接口实现确定性逻辑推理,经评估在处理大问题时效果优于LLMs,可作稳定推理基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07126 2026-08-12 cs.RO cs.AI cs.LG 版本更新 62%

RankFormer: A Propose-then-Select Transformer for Multi-Agent Multimodal Trajectory Prediction

自发现意图感知变换器用于多模态车辆轨迹预测

Diyi Liu, Zihan Niu, Tu Xu, Xingchen Zhang, Lishan Sun

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于Transformer的多模态车辆轨迹预测模型,通过分离空间模块和轨迹生成模块提升预测性能,并通过预测残差偏移学习有序轨迹。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10339 2026-08-12 stat.ME cs.AI stat.AP 新提交 57%

Expert-Guided g-computation with Large Language Models for Estimating Causal Effects on Timings: Applications to Hospital Quality Improvement

基于大型语言模型的专家引导g计算法估计时序因果效应:在医院质量改进中的应用

Patrick Vossler, Jialin Ouyang, F. Richard Guo, Anran Huang, Ali Shojaie, Lucas Zier, Fan Xia, Jean Feng

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本研究提出专家引导g计算法(egg-computation),结合专家判断与LLM技术,用于估计医院干预措施对平均住院时长的因果效应,在模拟和真实医院数据中表现优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10494 2026-08-12 cs.AI cs.MA 新提交 57%

GeoForge: Non-Parametric Self-Evolving Agents for Earth-Observation Reasoning

GeoForge:用于对地观测推理的非参数自进化智能体

Xin Xiao, Jiang Zhong, Junnan Zhu, Yingchao Feng, Peijin Wang, Yidan Zhang, Kaiwen Wei

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 GeoForge是一种无需训练的自进化框架,通过结构化非参数执行状态及多记忆机制提升EO智能体的规划与推理能力,可改善任务准确率、工具轨迹质量并减少推理错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05624 2026-08-12 cs.MA cs.LG 版本更新 57%

Behavioral Inference at Scale: The Fundamental Asymmetry Between Motivations and Belief Systems

大规模行为推断:动机与信念系统之间的根本不对称性

Jason Starace, Terence Soule

机构 * Department of Computer Science University of Idaho(计算机科学系 俄克拉荷马州立大学)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 研究通过大规模实验揭示动机与信念系统在行为推断中的根本不对称性,发现动机推断效率远超信念系统,且信念系统推断的瓶颈在于信息理论限制。

Comments Published in Transactions on Machine Learning Research (2026). OpenReview: https://openreview.net/forum?id=aDMDqtw63H

Journal ref Transactions on Machine Learning Research, ISSN 2835-8856 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03888 2026-08-12 cs.SD cs.AI 版本更新 57%

IndexTTS 2.5 Technical Report

IndexTTS 2.5 技术报告

Yunpei Li, Xun Zhou, Jinchao Wang, Lu Wang, Yong Wu, Siyi Zhou, Yiquan Zhou, Yining Wang, Yaogen Yang, Zhetao Hu, Shiyao Duan, Jiacheng Xu, Jingchen Shu, Bin Xia

机构 * Bilibili Inc.(哔哩哔哩公司)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 IndexTTS 2.5通过四方面改进提升了多语言支持、推理速度和合成质量,实现了更广泛的语言覆盖和情感语调复制。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11013 2026-08-12 cs.CV 新提交 50%

Watching Synthetic Videos: Aligning Cross-modal Representations with Visual Synthesis for Zero-shot Video Captioning

观看合成视频:针对零样本视频字幕生成的视觉合成跨模态表征对齐

Liangyu Fu, Junbo Wang, Yuke Li, Ya Jing, Xuecheng Wu, Zhiyong Wang

机构 * School of Software, Northwestern Polytechnical University(西北工业大学软件学院) School of Information Science and Technology, Beijing University of Technology(北京工业大学信息科学与技术学院) School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) School of Computer Science, The University of Sydney(悉尼大学计算机科学学院)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出WSV零样本视频字幕生成框架,通过文本到视频生成模型、抛光器、提示器弥合跨模态差距,在三个公开数据集上取得了B@4 52、CIDEr 95.7的成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10497 2026-08-12 cs.CV 新提交 50%

SapiensID 2.0: Aligning Human Recognition Foundation Models with Human Perception

SapiensID 2.0:将人类识别基础模型与人类感知对齐

Yiyang Su, Jie Zhu, Feng Liu, Anil K. Jain, Xiaoming Liu

专题命中 其他安全 :alignment(abstract)

AI总结 该研究针对现有人类识别模型与人类感知脱节的问题,提出兼具语义与时间感知的SapiensID 2.0框架,通过多项技术实现最优识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10769 2026-08-12 math.DG math.OC 新提交 50%

A Framework for Joint Affine and Diffeomorphic Image Registration

联合仿射与微分同胚图像配准的框架

Anton François, Rayane Mouhli, Thomas Pierron

专题命中 其他安全 :alignment(abstract)

AI总结 该研究提出联合仿射-微分同胚图像配准框架,含FA和DA模型,优化策略结合渐进仿射丰富与变分加权,在Dice重叠度上优于CARL等基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10844 2026-08-12 physics.bio-ph 新提交 50%

Impact of Higher-Order Interactions on Collective Motion

高阶相互作用对集体运动的影响

Maryam Masoumi, Amir Kargaran, Reza Jafari

专题命中 其他安全 :alignment(abstract)

AI总结 该研究提出含高阶对齐相互作用的广义Vicsek模型,发现其会引发不连续相变,需更高粒子密度维持集体有序,为理解活性物质相变及生物、合成系统集体行为提供了新参数。

Comments 6 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04235 2026-08-12 cs.ET 版本更新 50%

Scale-CDA: A Scalable Retrofit Platform for Cooperative Driving Automation in Production Vehicles

Scale-CDA:一款用于量产车的、可扩展的原型,旨在普及AI辅助的协同驾驶自动化(CDA)

Hao Zhou, Shengming Yuan, Yuhang Wang, Alina Hagen, Haibin Wen

专题命中 其他安全 :safety(abstract)

AI总结 本研究提出Scale-CDA这一开源工具链,基于OpenDBC与Openpilot构建,成本低于1000美元,可实现AI辅助CDA的即插即用改装,通过多车辆测试验证了其低时延与数据隐私保护能力,为普及协同自动驾驶提供了实用方案。

详情

展开后加载摘要…

URL PDF HTML 收藏