arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-29 至 2026-04-29 共收录 57 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 19 篇

2604.24929 2026-04-29 cs.CL cs.AI 62%

GAIA-v2-LILT: Multilingual Adaptation of Agent Benchmark beyond Translation

GAIA-v2-LILT:超越翻译的代理基准多语言适应

Yunsu Kim, Kaden Uhlig, Joern Wuebker

机构 * LILT

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出GAIA-v2-LILT,通过功能对齐、文化对齐和难度校准改进多语言代理基准,实验表明其性能提升达32.7%,接近英语表现,但仍有较大差距,揭示了多语言性能差距主要由基准测量误差引起。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00065 2026-04-29 cs.CY cs.AI 62%

Responsible Evaluation of AI for Mental Health

人工智能心理健康应用的责任评估

Hiba Arnaout, Anmol Goel, H. Andrew Schwartz, Steffen T. Eberhardt, Dana Atzil-Slonim, Gavin Doherty, Brian Schwartz, Wolfgang Lutz, Tim Althoff, Munmun De Choudhury, Hamidreza Jamalabadi, Raj Sanjay Shah, Flor Miriam Plaza-del-Arco, Dirk Hovy, Maria Liakata, Iryna Gurevych

机构 * Technische Universität Darmstadt(德累斯顿技术大学) Vanderbilt University(范德比尔特大学) Trier University(特里尔大学) Bar-Ilan University(巴伊兰大学) Trinity College Dublin(都柏林三一学院) University of Washington(华盛顿大学) Georgia Institute of Technology(佐治亚理工学院) Phillips-Universität Marburg(马尔堡菲利普大学) LIACS, Leiden University(莱顿大学LIACS研究中心) Bocconi University(博科尼大学) Queen Mary University London(伦敦玛丽女王大学) Alan Turing Institute(艾伦·图灵研究所)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文提出跨学科框架,整合临床有效性、社会背景和公平性,解决现有AI心理健康工具评估碎片化问题,并通过案例研究展示AI心理健康支持类型的分类方法。

Journal ref ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25914 2026-04-29 cs.CL 57%

DV-World: Benchmarking Data Visualization Agents in Real-World Scenarios

DV-World:在现实场景中评估数据可视化代理的基准测试

Jinxiang Meng, Shaoping Huang, Fangyu Lei, Jingyu Guo, Haoxiang Liu, Jiahao Su, Sihan Wang, Yao Wang, Enrui Wang, Ye Yang, Hongze Chai, Jinming Lv, Anbang Yu, Huangjing Zhang, Yitong Zhang, Yiming Huang, Zeyao Ma, Shizhu He, Jun Zhao, Kang Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) National University of Singapore(新加坡国立大学) Renmin University of China(中国人民大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 DV-World通过260个任务评估数据可视化代理在现实专业生命周期中的能力,涵盖表格操作、视觉进化和意图对齐,采用混合评估框架揭示现有模型在复杂数据可视化挑战中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21214 2026-04-29 cs.DB cs.AI 57%

A Demonstration of SQLyzr: A Platform for Fine-Grained Text-to-SQL Evaluation and Analysis

SQLyzr平台:一种细粒度文本到SQL评估与分析的演示

Sepideh Abedini, M. Tamer Özsu

机构 * University of Waterloo(滑铁卢大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文介绍SQLyzr平台,通过细粒度评估和分析改进文本到SQL模型,提供多种指标和真实场景下的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24935 2026-04-29 cs.CR cs.LG 57%

CAN-QA: A Question-Answering Benchmark for Reasoning over In-Vehicle CAN Traffic

CAN-QA:用于车载CAN流量推理的问答基准

Jing Chen, Abhijay Deevi, Onat Gungor, Tajana Rosing

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 本文提出CAN-QA基准,将车载CAN流量分析转化为问答任务,评估大语言模型在时间推理和多条件推理上的表现。

Comments Accepted by the 35th International Conference on Computer Communications and Networks (ICCCN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25617 2026-04-29 physics.chem-ph 50%

AI-Powered Surrogate Modelling for Multiscale Combustion: A Critical Review and Opportunities

基于人工智能的多尺度燃烧代理建模:批判性回顾与机遇

Amirali Shateri, Zhiyin Yang, Yuying Yan, Manosh C. Paul, Jianfei Xie

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文综述了人工智能在多尺度燃烧代理建模中的应用,分析了监督、无监督及物理引导学习方法的性能,并探讨了燃料转移性差、外推误差等挑战,提出未来发展的方向。

Comments Multiscale combustion; Surrogate modelling; Artificial intelligence; Chemical kinetics; Turbulent combustion

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25175 2026-04-29 physics.soc-ph 50%

Indirect reciprocity beyond pairwise interactions

间接互惠超越 pairwise 互动

Ming Wei, Xin Wang, Junyu Lu, Longzhao Liu, Yishen Jiang, Hongwei Zheng, Shaoting Tang, Feng Fu

专题命中 安全评测 :alignment(abstract)

AI总结 研究提出多玩家间接互惠框架,揭示群体合作的稳定原则,并展示群体结构对声誉动态的影响,为人工智能中的合作对齐提供基准。

Comments 21 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24893 2026-04-29 cs.CV 50%

Interactive Episodic Memory with User Feedback

具有用户反馈的交互式事件记忆

Nikesh Subedi, Loris Bazzani, Ziad Al-Halah

机构 * University of Utah(犹他大学) University of Verona(威尼斯大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出EM-QnF任务,通过用户反馈和补充信息提升事件记忆查询的准确性,引入FALM模块实现高效交互式优化,优于现有方法并在现实场景中表现良好。

Comments Accepted to CVPR 2026. Project Page: https://nsubedi11.github.io/refocus

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24890 2026-04-29 cs.CR 50%

Verifying Provenance of Digital Media: Why the C2PA Specifications Fall Short

验证数字媒体的来源:为何C2PA规范不足

Enis Golaszewski, Neal Krawetz, Alan T. Sherman, Edward Zieglar, Sai K. Matukumalli, Roberto Yus, Carson L. Kegley, Michael Barthel, William Bowman, Bharg Barot, Kaur Kullman

专题命中 安全评测 :trustworthy(abstract)

AI总结 研究分析C2PA的安全性,发现其规范未能实现声称的安全目标及可信部署所需的关键功能,建议不用于高风险领域。

Comments This short non-technical whitepaper summarizes the findings and recommendations from our detailed technical study

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12283 2026-04-29 cs.HC 50%

Large Language Models have Chain-of-Affect

大型语言模型具有情感链

Junjie Xu, Xingjiao Wu, Luwei Xiao, Yuzhe Yang, Jie Zhou, Zihao Zhang, Luhan Wang, Yi Huang, Nan Wu, Yingbin Zheng, Chao Yan, Cheng Jin, Honglin Li, Liang He

专题命中 安全评测 :alignment(abstract)

AI总结 研究探讨了大型语言模型在持续交互中情感状态的演变,发现其情感动态具有结构性和可重复性,影响生成、用户体验及集体动态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01553 2026-04-29 cs.IR 50%

IoDResearch: Deep Research on Private Heterogeneous Data via the Internet of Data

IoDResearch:通过互联网的数据进行私有异构数据的深度研究

Zhuofan Shi, Zijie Guo, Xinjian Ma, Gang Huang, Yun Ma, Xiang Jing

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出IoDResearch框架,通过将异构资源转化为FAIR合规的数字对象,提升私有数据的检索效率和可重用性,实验表明其在检索、问答和报告生成任务中优于现有基线方法。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.16391 2026-04-29 cs.SE 50%

Industry Practitioners Perspectives on AI Model Quality: Perceptions, Challenges, and Solutions

行业从业者对AI模型质量的视角:感知、挑战与解决方案

Chenyu Wang, Zhou Yang, Yunbo Lyu, Ze Shi Li, Daniela Damian, David Lo

专题命中 安全评测 :trustworthy(abstract)

AI总结 研究通过访谈和调查,探讨行业从业者对AI模型质量属性的感知、挑战及解决方案,发现不同情境下优先级不同,数据不平衡影响模型正确性,主动学习等策略被广泛应用。

Comments Accepted by the International Conference on Evaluation and Assessment in Software Engineering (EASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 5 篇

2604.25654 2026-04-29 cs.CL 79%

Progressing beyond Art Masterpieces or Touristic Clichés: how to assess your LLMs for cultural alignment?

超越艺术杰作或旅游陈词滥调:如何评估您的LLM文化对齐性?

António Branco, João Silva, Nuno Marques, Luis Gomes, Ricardo Campos, Raquel Sequeira, Sara Nerea, Rodrigo Silva, Miguel Marques, Rodrigo Duarte, Artur Putyato, Diogo Folques, Tiago Valente

机构 * University of Lisbon(里斯本大学) University of Beira Interior(贝拉内尔大学)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL

AI总结 本文提出文化评估数据集的设计指南,并通过对比实验展示其在区分文化专精模型与非专精模型方面的有效性。

Comments RESOURCEFUL-2026 Workshop at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25249 2026-04-29 cs.CL cs.AI 73%

Below-Chance Blindness: Prompted Underperformance in Small LLMs Produces Positional Bias Rather than Answer Avoidance

低于平均水平的盲目性:在小语言模型中受提示的欠绩效产生位置偏差而非答案回避

Jon-Paul Cacioli

机构 * Independent Researcher(独立研究者)

专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了在小规模语言模型中,受提示的欠绩效是否导致位置偏差而非答案回避,发现模型在受指令下表现出位置偏好的倾向,而非刻意回避答案。

Comments 10 pages, 2 figures, 2 tables. Pre-registered: https://osf.io/6zftv/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25684 2026-04-29 cs.AI 70%

Think Before You Act -- A Neurocognitive Governance Model for Autonomous AI Agents

在行动前思考--一种用于自主AI代理的神经认知治理模型

Eranga Bandara, Ross Gore, Asanga Gunaratna, Sachini Rajapakse, Isurunima Kularathna, Ravi Mukkamala, Sachin Shetty, Xueping Liang, Amin Hass, Tharaka Hewa, Abdul Rahman, Christopher K. Rhea, Anita H. Clayton, Preston Samuel, Atmaram Yarlagadda

机构 * Old Dominion University(老奥德纳大学) AI Motion Labs(AI运动实验室) Department of Psychiatry and Neurobehavioral Sciences(精神病学与神经行为科学系) University of Virginia School of Medicine(弗吉尼亚大学医学院) Florida International University(佛罗里达国际大学) Accenture Technology Labs(埃森哲技术实验室) Center for Wireless Communications(无线通信中心) University of Oulu(奥卢大学) Blanchfield Army Community Hospital(布莱恩菲尔德陆军社区医院) McDonald Army Health Center(麦克唐纳陆军健康中心)

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出一种神经认知治理框架,通过将人类自我治理过程映射到LLM驱动的代理推理中,实现95%的合规准确率和零人工监督升级,展示嵌入治理的代理推理能产生更一致、可解释和可审计的合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03254 2026-04-29 cs.CY cs.AI 62%

Is your AI Model Accurate Enough? The Difficult Choices Behind Rigorous AI Development and the EU AI Act

你的AI模型准确吗?严格AI开发背后的艰难选择以及欧盟AI法案

Lucas G. Uberti-Bona Marin, Bram Rijsbosch, Kristof Meding, Gerasimos Spanakis, Gijs van Dijck, Konrad Kollnig

机构 * Law \& Tech Lab, Maastricht University Maastricht The Netherlands University of Tübingen - Computational Law Lab TÜBingen Germany Law \& Tech Lab, Maastricht University University of Tübingen - Computational Law Lab

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文探讨AI准确性的评估依赖于情境相关的规范决策,通过欧盟AI法案分析四个关键选择,揭示技术规范在AI部署中的作用。

Comments To appear in the 2026 ACM Conference on Fairness, Accountability, and Transparency (ACM FAccT '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13400 2026-04-29 cs.CY cs.AI 62%

Justice in Judgment: Unveiling (Hidden) Bias in LLM-assisted Peer Reviews

审判中的公正:揭示(隐藏)在LLM辅助同行评审中的偏见

Sai Suresh Macharla Vasu, Ivaxi Sheth, Hui-Po Wang, Ruta Binkyte, Mario Fritz

机构 * CISPA Helmholtz Center for Information Security(CISPA 欧洲信息安全研究中心) Saarland University(萨尔兰大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文研究LLM生成的同行评审中的偏见,通过操控作者元数据发现机构偏见、资历偏好和性别影响,揭示隐性偏见在软评分中的显现。

Comments Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 10 篇

2406.06587 2026-04-29 cs.CL cs.AI cs.HC 81%

TouchAI: Exploring human-AI perceptual alignment in touch through language model representations

TouchAI: 探索通过语言模型表示的触觉人机感知对齐

Shu Zhong, Elia Gatti, Youngjun Cho, Marianna Obrist

机构 * Department of Computer Science, University College London(伦敦大学学院计算机科学系)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过'textile hand'任务研究大型语言模型在触觉感知对齐中的表现,发现不同织物样本的对齐程度差异显著,揭示了人机感知对齐的挑战与潜力。

Comments Accepted at IJHCS

Journal ref International Journal of Human-Computer Studies 210 (2026) 103765

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25806 2026-04-29 cs.CL cs.AI cs.HC 62%

MAIC-UI: Making Interactive Courseware with Generative UI

MAIC-UI: 用生成式UI制作交互式课程ware

Shangqing Tu, Yanjia Li, Keyu Chen, Sichen Zhang, Jifan Yu, Daniel Zhang-Li, Lei Hou, Juanzi Li, Yu Zhang, Huiqin Liu

机构 * Tsinghua University(清华大学) Guangzhou University(广州大学) Zhejiang University(浙江大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 MAIC-UI通过零代码系统实现教育者快速编辑交互式课程ware,采用多模态知识分析、生成-验证-优化流程和点击定位编辑技术,提升教学效果和学习公平性。

Comments You can try our demo at https://open.maic.chat/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11449 2026-04-29 cs.LG cs.AI 62%

Tabular Data with Class Imbalance: Predicting Electric Vehicle Crash Severity with Pretrained Transformers (TabPFN) and Mamba-Based Models

表格数据中的类别不平衡:利用预训练转换器(TabPFN)和Mamba-based模型预测电动汽车碰撞严重程度

Shriyank Somvanshi, Pavan Hebli, Gaurab Chhetri, Subasish Das

机构 * College of Science and Engineering, Texas State University, San Marcos, Texas, USA(科学与工程学院,德克萨斯州立大学,圣马科斯,德克萨斯州,美国)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种深度表格学习框架,利用真实世界碰撞数据预测电动汽车碰撞严重程度,通过SMOTEENN处理类别不平衡问题,评估了TabPFN、MambaNet和MambaAttention三种模型,发现MambaAttention在严重伤害分类上表现更优。

Comments This is the author's preprint version of a paper accepted for presentation at the 24th International Conference on Machine Learning and Applications (ICMLA 2025), December 3-5, 2025, Florida, USA. The final published version will appear in the official IEEE proceedings. Conference site: https://www.icmla-conference.org/icmla25/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25296 2026-04-29 cs.CL 57%

Learning from Medical Entity Trees: An Entity-Centric Medical Data Engineering Framework for MLLMs

从医学实体树学习:一种以实体为中心的医疗数据工程框架用于多模态大语言模型

Jianghang Lin, Haihua Yang, Deli Yu, Kai Wu, Kai Ye, Jinghao Lin, Zihan Wang, Yuhang Wu, Liujuan Cao

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University, China(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学,中国) ByteDance(字节跳动) Northeastern University(东北大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出以实体为中心的医疗数据工程框架,通过构建医学实体树,提升多模态大语言模型在医疗领域的表现,通过实体引导检索、双重过滤和知识感知数据合成等方法,增强模型处理复杂临床问题的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24933 2026-04-29 cs.AI cs.SD 57%

S-SONDO: Self-Supervised Knowledge Distillation for General Audio Foundation Models

S-SONDO:基于自监督的知识蒸馏用于通用音频基础模型

Mohammed Ali El Adlouni, Aurian Quelennec, Pierre Chouteau, Geoffroy Peeters, Slim Essid

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 S-SONDO通过仅利用输出嵌入进行知识蒸馏,实现对通用音频模型的高效压缩,保留96%性能,适用于嵌入式教师模型。

Comments Accepted at IEEE ICASSP 2026. 5 pages, 2 figures, 3 tables. Equal contribution by first two authors. Code: https://github.com/MedAliAdlouni/ssondo | Models: https://huggingface.co/mohammedali2501/ssondo | Package: https://pypi.org/project/ssondo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01070 2026-04-29 cs.CL 57%

How RL Unlocks the Aha Moment in Geometric Interleaved Reasoning

如何通过强化学习解锁几何交错推理中的顿悟时刻

Xiangxiang Zhang, Caijun Jia, Siyuan Li, Dingyu He, Xiya Xiong, Zheng Sun, Honghao He, Yuchen Wu, Bihui Yu, Linzhuang Sun, Cheng Tan, Jingxuan Wei

机构 * ByteDance(字节跳动) Shenyang Institute of Computing Technology, Chinese Academy of Sciences(沈阳计算技术研究所,中国科学院) Westlake University(西交大学) University of Chinese Academy of Science(中国科学院大学) Key Laboratory of Computing Power Network and Information Security, Ministry of Education(教育部计算能力网络与信息安全重点实验室) Shandong Computer Science Center (National Supercomputer Center in Jinan)(山东省计算机科学中心(济南国家超算中心)) Qilu University of Technology (Shandong Academy of Sciences)(齐鲁工业大学(山东省科学院))

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文探讨了在几何交错推理中,通过强化学习框架Faire克服传统监督微调的局限性,实现更深层次的因果对齐,从而提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25567 2026-04-29 cs.MA 50%

Should I Replan? Learning to Spot the Right Time in Robust MAPF Execution

应该重新规划吗?学习在鲁棒MAPF执行中找到合适的时间

David Zahrádka, David Woller, Denisa Mužíková, Miroslav Kulich, Libor Přeučil

专题命中 其他安全 :safety(abstract)

AI总结 本文提出利用全连接前馈神经网络预测延迟代理下的重新规划收益,通过设计基于ADG的特征描述鲁棒执行状态及潜在延迟影响,以减少延迟带来的影响。

Comments 8 pages, 10 figures. Submitted for double-blind review to IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11110 2026-04-29 cs.SD 50%

Ti-Audio: The First Multi-Dialectal End-to-End Speech LLM for Tibetan

Ti-Audio:首个多方言端到端藏语语音大模型

Jialing Wang, Yue Zhao, Yuhao Zhang, Jing Yu, Shaosai Li, Zhanchen Dai, Benyou Wang, Haizhou Li

机构 * Minzu University of China(中国民族大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出Ti-Audio,首个多方言端到端藏语语音大模型,通过动态Q-Former适配器和温度采样策略解决低资源多方言环境下的语音识别与翻译问题,实验显示其在藏语基准测试中达到最先进的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07014 2026-04-29 physics.soc-ph cs.SI 50%

When cardinals strategize: An agent-based model of influence and ideology for the papal conclave

当基数策略化:一个关于影响力和意识形态的代理模型,用于教皇选举会议

Nuno Crokidakis

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出并分析了两个基于代理的模型,研究教皇选举会议的动力学,探讨社会影响、战略投票和意识形态一致如何影响选举教皇所需时间。模型引入了意识形态集团,通过模拟发现意识形态极化会延迟选举,但较高的战略响应性可提高效率。

Comments 15 pages, 5 figures, to appear in Chaos, Solitons & Fractals

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21745 2026-04-29 cs.DL 50%

AI-Augmented Bibliometric Framework: A Paradigm Shift with Agentic AI for Dynamic, Snippet-Based Research Analysis

增强型文献计量框架:基于代理AI的范式转变用于动态、片段式研究分析

Adela Bara, Simona-Vasilica Oprea

专题命中 其他安全 :safety(abstract)

AI总结 本文提出一个生成式多代理AI框架,通过自然语言指令实现动态代码基文献计量分析,无需专业编程技能,支持多模态全文检索、代理探索和动态指标创建,突破传统工具的限制。

详情

展开后加载摘要…

URL PDF HTML 收藏