arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-13 至 2026-04-13 共收录 18 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 18 篇

2604.08987 2026-04-13 cs.AI 79%

PilotBench: A Benchmark for General Aviation Agents with Safety Constraints

PilotBench:一个具有安全约束的一般航空智能体基准

Yalun Wu, Haotian Liu, Zhoujun Li, Boyang Wang

机构 * School of Computing National University of Singapore China School of Informatics Xiamen University China CESS Beihang University China

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 PilotBench通过对比LLM与传统预报器,评估飞行轨迹和姿态预测,揭示了传统方法在精度上的优势与LLM在指令遵循上的优势,指出LLM在高负荷阶段表现下降,推动混合架构的发展。

Comments Accepted at the 2026 IEEE International Joint Conference on Neural Networks (IJCNN 2026). 6 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08986 2026-04-13 cs.CL cs.AI 76%

PerMix-RLVR: Preserving Persona Expressivity under Verifiable-Reward Alignment

PerMix-RLVR: 在可验证奖励对齐下保持人物表达性

Jihwan Oh, Soowon Oh, Murad Aghazada, Minchan Jeong, Sungnyun Kim, Se-Young Yun

机构 * KAIST AI(韩国科学技术院人工智能系) Samsung Advanced Institute of Technology(三星高级技术研究院) Seoul National University(首尔国立大学)

专题命中 安全评测 :alignment(title);分类 cs.CL、cs.AI

AI总结 本文提出PerMix-RLVR方法,通过训练阶段处理人物敏感性,平衡模型在不同人物设定下的鲁棒性和表现真实性,提升任务性能和人物表达 fidelity。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09069 2026-04-13 cs.CL cs.AI cs.LG 75%

NyayaMind- A Framework for Transparent Legal Reasoning and Judgment Prediction in the Indian Legal System

NyayaMind:一个用于印度法律体系中透明法律推理和判决预测的框架

Parjanya Aditya Shukla, Shubham Kumar Nigam, Debtanu Datta, Balaramamahanthi Deepak Patnaik, Noel Shallum, Pradeep Reddy Vanga, Saptarshi Ghosh, Arnab Bhattacharya

机构 * IIT Kanpur, India(印度理工学院坎普尔分校) IIT Kharagpur, India(印度理工学院克勒格布尔分校) Symbiosis Law School Pune, India(印度共生法学院浦那分校) Dattam Labs, India(印度Dattam实验室) University of Birmingham, Dubai, United Arab Emirates(英国伯明翰大学迪拜校区)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 NyayaMind通过整合检索、推理和验证机制,提升印度司法系统中判决预测与解释的透明度和准确性,为可信的人工智能辅助法律决策提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15578 2026-04-13 cs.CV 71%

AVATAAR: Agentic Video Answering via Temporal Adaptive Alignment and Reasoning

AVATAAR:通过时间自适应对齐和推理实现代理视频回答

Urjitkumar Patel, Fang-Chun Yeh, Chinmay Gondhalekar

专题命中 安全评测 :alignment(title)

AI总结 AVATAAR通过结合全局和局部视频上下文,以及预检索思考代理和重思模块,提升长视频问答的准确性和可解释性,实验显示在CinePile基准上显著提升各类问答任务性能。

Comments Accepted in the 5th IEEE Big Data Workshop on Multimodal AI (MMAI 2025), Dec 8-11, Macau, China, 2025 (Preprint Copy)

Journal ref 2025 IEEE International Conference on Big Data (BigData), Macau, China

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08846 2026-04-13 cs.LG cs.AI cs.CL cs.CV 67%

Dictionary-Aligned Concept Control for Safeguarding Multimodal LLMs

字典对齐的概念控制用于保护多模态大语言模型

Jinqi Luo, Jinyu Yang, Tal Neiman, Lei Fan, Bing Yin, Son Tran, Mubarak Shah, René Vidal

机构 * University of Pennsylvania(宾夕法尼亚大学) Amazon(亚马逊) University of Central Florida(中佛罗里达大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出字典对齐的概念控制框架,通过定制概念字典和稀疏自编码器实现对多模态大语言模型激活的精细控制,提升安全性的同时保持通用能力。

Comments Accepted in CVPR 2026. Project page: https://peterljq.github.io/project/daco

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09155 2026-04-13 cs.LG cs.AI 62%

CORA: Conformal Risk-Controlled Agents for Safeguarded Mobile GUI Automation

CORA: 为保障移动GUI自动化设计的符合性风险控制代理

Yushi Feng, Junye Du, Qifan Wang, Zizhan Ma, Qian Niu, Yutaka Matsuo, Long Feng, Lequan Yu

机构 * The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) The University of Tokyo(东京大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 CORA通过统计保障减少有害操作,利用Guardian模型评估行动风险并校准执行/中止边界,结合Goal-Lock机制和Phone-Harm基准验证其在自主GUI执行中的安全性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08947 2026-04-13 cs.CL cs.AI 62%

MuTSE: A Human-in-the-Loop Multi-use Text Simplification Evaluator

MuTSE:一种人机协同的多用途文本简化评估器

Rares-Alexandru Roscan, Gabriel Petre1, Adrian-Marius Dumitran, Angela-Liliana Dumitran

机构 * University of Bucharest(布加勒斯特大学) Universitatea Creștină "Dimitrie Cantemir"(迪米特里耶·坎泰米尔基督教大学) Cu Drag si Sport SRL(Cu Drag si Sport 有限责任公司) Softbinator Technologies(Softbinator 科技公司)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 针对LLM文本简化输出的系统性评估难题,MuTSE提出一种人机协同的交互式评估工具,支持多维度的提示-模型组合分析,通过语义对齐引擎和线性偏差启发式算法实现可视化对比,降低定性分析的认知负荷。

Comments Accepted for ITS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08603 2026-04-13 cs.AI cs.CL 62%

From Business Events to Auditable Decisions: Ontology-Governed Graph Simulation for Enterprise AI

从商业事件到可审计决策:面向企业AI的本体引导图模拟

Hongyin Zhu, Jinming Liang, Mengjun Hou, Ruifan Tang, Xianbin Zhu, Jingyuan Yang, Yuanman Mao, Feng Wu

机构 * Yonyou AI Lab(用友AI实验室) Yonyou Network Technology Co., Ltd.(用友网络科技股份有限公司)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LOM-action框架,通过本体引导的图模拟实现企业AI决策,确保决策基于模拟图而非无限制知识空间,提升决策可信度与可审计性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08595 2026-04-13 cs.CL cs.AI 62%

Adaptive Rigor in AI System Evaluation using Temperature-Controlled Verdict Aggregation via Generalized Power Mean

基于通用幂均值的温度控制判决聚合中的AI系统评估适应性

Aleksandr Meshkov

机构 * Independent Researcher(独立研究员)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TCVA方法,结合五级判决评分系统和通用幂均值聚合,通过温度参数控制评估严格性,实验显示其在忠实度上与RAGAS相当,且优于DeepEval。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08559 2026-04-13 cs.CL cs.AI 62%

Medical Reasoning with Large Language Models: A Survey and MR-Bench

基于大语言模型的医学推理:综述与MR-Bench

Xiaohan Ren, Chenxiao Fan, Wenyin Ma, Hongliang He, Chongming Gao, Xiaoyan Zhao, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) The First Affiliated Hospital of USTC(中国科学技术大学附属第一医院) National University of Singapore(新加坡国立大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了大语言模型在医学推理中的应用,提出MR-Bench基准测试,揭示了考试级性能与真实临床任务准确性之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12509 2026-04-13 cs.LG cs.AI 62%

Revitalizing Black-Box Interpretability: Actionable Interpretability for LLMs via Proxy Models

重振黑盒可解释性:通过代理模型实现LLM的可操作可解释性

Junhao Liu, Haonan Yu, Zhenyu Yan, Xin Zhang

机构 * Key Lab of High Confidence Software Technologies (Peking University), Ministry of Education(高可信软件技术教育部重点实验室(北京大学)) School of Computer Science, Peking University(北京大学计算机学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种低成本代理框架,利用高效模型近似昂贵LLM的决策边界,通过统计验证局部对齐,实现可操作的可解释性,提升LLM优化效率。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09378 2026-04-13 cs.CR cs.AI 57%

BadSkill: Backdoor Attacks on Agent Skills via Model-in-Skill Poisoning

BadSkill: 通过模型-技能污染对代理技能进行后门攻击

Guiyao Tie, Jiawen Shi, Pan Zhou, Lichao Sun

机构 * Huazhong University of Science and Technology(华中科技大学) Lehigh University(里海大学)

专题命中 安全评测 :prompt injection(abstract);分类 cs.AI

AI总结 研究针对代理技能中嵌入的模型提出后门攻击,通过污染技能中的模型实现隐蔽攻击,验证了在不同模型规模和扰动类型下的有效性,并指出模型承载技能作为代理生态系统中的新型供应链风险。

Comments 4 pages, 4 fIGURES

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08457 2026-04-13 cs.CV cs.AI cs.RO 57%

CrashSight: A Phase-Aware, Infrastructure-Centric Video Benchmark for Traffic Crash Scene Understanding and Reasoning

CrashSight:面向交通事故场景理解与推理的相位感知、基础设施导向视频基准

Rui Gan, Junyi Ma, Pei Li, Xingyou Yang, Kai Chen, Sikai Chen, Bin Ran

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of Wyoming(怀俄明大学) Columbia University(哥伦比亚大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 CrashSight通过真实道路摄像头数据构建大规模视频基准,评估视觉语言模型在交通事故场景中的理解与推理能力,揭示现有模型在时间与因果推理方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09368 2026-04-13 cs.MM cs.CV 50%

Through Their Eyes: Fixation-aligned Tuning for Personalized User Emulation

通过他们的眼睛:基于注视点的个性化用户模拟调谐

Lingfeng Huang, Huizhong Guo, Tianjun Wei, Yingpeng Du, Zhu Sun

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出FixATE方法,通过将视觉语言模型的视觉注意力与用户特定的注视模式对齐,提升推荐系统模拟的准确性,实验表明这种对齐能有效提高点击预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09235 2026-04-13 cs.CR 50%

Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor

Unreal Thinking: 通过两阶段后门实现链式思维劫持

Wenhan Chang, Tianqing Zhu, Ping Xiong, Faqian Guan, Wanlei Zhou

专题命中 安全评测 :safety(abstract)

AI总结 本文提出MRTS和TSBH方法,解决LLM链式思维劫持中的数据稀缺和稳定性问题,通过生成对齐的CoT实现可控的恶意行为诱导,并提供安全推理数据集和缓解方法。

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09056 2026-04-13 cs.CR cs.CE 50%

Conversations Risk Detection LLMs in Financial Agents via Multi-Stage Generative Rollout

通过多阶段生成 rollout 检测金融代理中的对话风险

Xiaotong Jiang, Jun Wu

专题命中 安全评测 :safety(abstract)

AI总结 本文提出FinSec框架,通过多阶段生成rollout方法检测金融代理中的对话风险,提升高风险对话检测的鲁棒性,实验显示其在F1分数、ASR和AUPRC等方面均优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08799 2026-04-13 cs.GR cs.CV 50%

MeshOn: Intersection-Free Mesh-to-Mesh Composition

MeshOn:无交集的网格到网格组合

Hyunwoo Kim, Itai Lang, Hadar Averbuch-Elor, Silvia Sellán, Rana Hanocka

机构 * Columbia University(哥伦比亚大学) University of Chicago(芝加哥大学) Cornell University(康奈尔大学)

专题命中 安全评测 :alignment(abstract)

AI总结 MeshOn通过多步骤优化框架实现两个输入网格的物理和语义真实组合,利用结构对齐方案和几何损失防止表面交叠,适用于多种材质配件的精准拟合。

Comments Project page: \hyperlink{https://threedle.github.io/MeshOn/}{this https URL}

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08778 2026-04-13 math.HO 50%

Open Preparation, Human Explanation, and Instructor Synthesis: A Human-Scale Methodology for AI-Rich Higher Education

开放准备、人类解释与教师合成:面向AI丰富高等教育的人尺度方法论

Siniša Miličić

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出一种人尺度方法论,通过信息学案例,强调将证据信任从工具禁用转向实时解释与观察,构建了操作周期、现实框架及口头证据模型,回应AI与主动学习的教育需求。

详情

展开后加载摘要…

URL PDF HTML 收藏