arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-09 至 2026-03-09 共收录 56 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 16 篇

2603.06570 2026-03-09 cs.CV cs.AI 57%

SUREON: A Benchmark and Vision-Language-Model for Surgical Reasoning

SUREON:一个手术推理的基准和视觉-语言模型

Alejandra Perez, Anita Rau, Lee White, Busisiwe Mlambo, Chinedu Nwoye, Muhammad Abdullah Jamal, Omid Mohareri

机构 * Intuitive Surgical Inc.

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 SUREON通过大规模视频问答数据集和两种模型提升手术推理能力,准确率超过84%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01203 2026-03-09 cs.AI 57%

How Well Does Agent Development Reflect Real-World Work?

代理开发是否能反映现实世界的工作?

Zora Zhiruo Wang, Sanidhya Vijayvargiya, Aspen Chen, Hanmo Zhang, Venu Arvind Arangarajan, Jett Chen, Valerie Chen, Diyi Yang, Daniel Fried, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文研究了代理开发与现实工作分布的匹配程度,揭示了代理开发与人类劳动力分布的不匹配,并提出了三个原则以改进基准设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06222 2026-03-09 cs.CL 57%

SPOT: Span-level Pause-of-Thought for Efficient and Interpretable Latent Reasoning in Large Language Models

SPOT:基于跨度的思考暂停,用于大语言模型中高效且可解释的潜在推理

Yunlong Chu, Minglai Shao, Yuhang Liu, Bing Hao, Yumeng Lin, Jialu Wang, Ruijie Wang

机构 * School of New Media and Communication, Tianjin University(新媒体与传播学院,天津大学) School of Computer Science and Engineering, Beihang University(计算机科学与工程学院,北航大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 SPOT通过压缩显式推理步骤为紧凑的潜在暂停token,提升大语言模型的推理效率和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05832 2026-03-09 cs.HC cs.AI 57%

Lexara: A User-Centered Toolkit for Evaluating Large Language Models for Conversational Visual Analytics

Lexara: 一种以用户为中心的评估工具包,用于评估用于对话式可视化分析的大型语言模型

Srishti Palani, Vidya Setlur

机构 * Tableau Research, Salesforce(Tableau研究机构,Salesforce)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 Lexara是一种以用户为中心的评估工具包,用于评估对话式可视化分析中的大型语言模型,通过多格式输出的可解释指标和交互式工具帮助用户进行模型和提示选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01474 2026-03-09 cs.RO 50%

ROSER: Few-Shot Robotic Sequence Retrieval for Scalable Robot Learning

ROSER:用于可扩展机器人学习的少样本机器人序列检索

Zillur Rahman, Eddison Pham, Alejandro Daniel Noel, Cristian Meo

机构 * University of Nevada, Las Vegas(内华达大学拉斯维加斯分校) University of Toronto(多伦多大学) LatentWorlds AI

专题命中 安全评测 :alignment(abstract)

AI总结 ROSER通过少样本检索框架有效解决机器人序列数据稀缺问题,提升机器人学习的数据可用性。

Comments 2026 ICLR DATA-FM Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06038 2026-03-09 cs.CV cs.GR 50%

FontUse: A Data-Centric Approach to Style- and Use-Case-Conditioned In-Image Typography

FontUse: 一种以数据为中心的方法用于风格和使用场景条件下的图像内字体设计

Xia Xin, Yuki Endo, Yoshihiro Kanamori

机构 * University of Tsukuba(茨口大学)

专题命中 安全评测 :alignment(abstract)

AI总结 FontUse提出了一种以数据为中心的方法,通过构建大规模字体数据集并结合多模态模型,提升文本生成中字体风格和使用场景的控制能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 1 篇

2506.01646 2026-03-09 cs.CL cs.AI cs.LG 67%

ESGenius: Benchmarking LLMs on Environmental, Social, and Governance (ESG) and Sustainability Knowledge

ESGenius:对环境、社会和治理(ESG)及可持续性知识的LLM基准测试

Chaoyue He, Xin Zhou, Yi Wu, Xinjia Yu, Yan Zhang, Lei Zhang, Di Wang, Shengfei Lyu, Hong Xu, Xiaoqiao Wang, Wei Liu, Chunyan Miao

机构 * Alibaba-NTU Global e-Sustainability CorpLab (ANGEL)(阿里巴巴-NTU全球可持续性公司实验室) Alibaba Group(阿里巴巴集团)

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ESGenius是首个针对LLM在ESG及可持续性知识评估的综合问答基准,通过RAG方法显著提升模型性能。

Comments EMNLP'25 Main Oral (42 pages, 10 figures, 11 tables), Nominations for Resource Award & Theme Paper Award

Journal ref In Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025), pages 14612-14653

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 19 篇

2602.17095 2026-03-09 cs.LG cs.AI 81%

FLoRG: Federated Fine-tuning with Low-rank Gram Matrices and Procrustes Alignment

FLoRG: 联邦微调与低秩格拉姆矩阵及普鲁斯特对齐

Chuiyang Meng, Ming Tang, Vincent W. S. Wong

机构 * The University of British Columbia(不列颠哥伦比亚大学) Southern University of Science and Technology(南方科技大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 FLoRG通过使用单一低秩矩阵和普鲁斯特对齐方法,提高联邦微调的效率和准确性,减少通信开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08820 2026-03-09 cs.CL 79%

CAReDiO: Cultural Alignment via Representativeness and Distinctiveness Guided Data Optimization

CAReDiO:通过代表性与独特性引导的数据优化实现文化对齐

Jing Yao, Xiaoyuan Yi, Jindong Wang, Zhicheng Dou, Xing Xie

机构 * Microsoft Research Asia(微软亚洲研究院) Renmin University of China(中国人民大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 CAReDiO通过代表性与独特性引导的数据优化,提升多文化环境下LLM的对齐效果与文化建模精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06077 2026-03-09 cs.IT cs.GT math.IT 78%

Distributed Semantic Alignment over Interference Channels: A Game-Theoretic Approach

分布式语义对齐 over 干扰信道:一种博弈论方法

Giuseppe Di Poce, Mattia Merluzzi, Emilio Calvanese Strinati, Paolo Di Lorenzo

专题命中 其他安全 :alignment(title,abstract)

AI总结 本文提出了一种基于博弈论的分布式语义对齐方法,通过非合作博弈优化MIMO收发器,解决语义匹配和干扰问题,提升AI驱动系统通信效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05762 2026-03-09 eess.SY cs.SY 78%

Combinatorial Safety-Critical Coordination of Multi-Agent Systems via Mixed-Integer Responsibility Allocation and Control Barrier Functions

通过混合整数责任分配和控制屏障函数实现多智能体系统的组合安全关键协调

Johannes Autenrieb, Mark Spiller, Hyo-Sang Shin, Namhoon Cho

专题命中 其他安全 :safety(title,abstract)

AI总结 本文提出通过混合整数规划和控制屏障函数实现多智能体系统的安全关键协调,以提高避障效率和减少计算复杂性。

Comments 6 pages, 4 figures, submitted to the IEEE for possible publication,

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06495 2026-03-09 cs.LG cs.AI cs.CL 67%

COLD-Steer: Steering Large Language Models via In-Context One-step Learning Dynamics

COLD-Steer: 通过上下文一步学习动态引导大型语言模型

Kartik Sharma, Rakshit S. Trivedi

机构 * Georgia Institute of Technology(佐治亚理工学院) Massachusetts Institute of Technology(麻省理工学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 COLD-Steer通过近似学习动态实现无需训练的LLM引导,有效提升引导效果并减少样本需求。

Comments ICLR 2026. Code available at https://github.com/Ksartik/cold-steer

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23136 2026-03-09 cs.CL cs.AI cs.LG 67%

Modality Collapse as Mismatched Decoding: Information-Theoretic Limits of Multimodal LLMs

模态崩溃作为不匹配解码:多模态大语言模型的信息论限制

Jayadev Billa

机构 * Yahoo(雅虎) Nuance BBN

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究揭示多模态大语言模型中模态崩溃现象的信息论限制,指出解码器评分规则决定了可访问信息量,通过LoRA干预验证了训练目标对情绪检测性能的提升作用。

Comments 24 pages, 11 tables, 2 figures. Code: https://github.com/jb1999/modality_collapse_paper, submitted for review COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06225 2026-03-09 cs.CY cs.AI cs.CL 67%

Classroom AI: Large Language Models as Grade-Specific Teachers

教室AI:大型语言模型作为按年级教师

Jio Oh, Steven Euijong Whang, James Evans, Jindong Wang

机构 * KAIST(韩国科学技术院) Microsoft Research Asia(微软亚洲研究院) University of Chicago(芝加哥大学) William & Mary(威廉与玛丽学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本研究提出一种框架,通过微调大型语言模型生成适合不同年级学生的教育内容,显著提升年级匹配度,同时保持响应准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03992 2026-03-09 cs.CY cs.AI 62%

Measuring AI R&D Automation

衡量人工智能研发自动化

Alan Chan, Ranay Padarath, Joe Kwon, Hilary Greaves, Markus Anderljung

机构 * GovAI University of Oxford(牛津大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文提出衡量人工智能研发自动化的指标,以评估其对AI进展和监督的影响,并建议企业和政府采取行动跟踪和管理相关指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06459 2026-03-09 cs.CV cs.AI 57%

Do Foundation Models Know Geometry? Probing Frozen Features for Continuous Physical Measurement

基础模型知道几何吗?通过冻结特征进行连续物理测量

Yakov Pyotr Shkolnikov

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 研究发现视觉-语言模型通过冻结特征可实现连续几何测量,LoRA微调和架构分析揭示了路径训练缺陷及中层注意力头对几何信号的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06024 2026-03-09 cs.CL cs.CV 57%

ViewFusion: Structured Spatial Thinking Chains for Multi-View Reasoning

ViewFusion:多视角推理的结构化空间思维链

Xingjian Tao, Yiwei Wang, Yujun Cai, Yifan Song, Jing Tang

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 ViewFusion通过两阶段框架提升多视角推理准确率,通过空间预对齐与问题驱动推理结合,有效提升复杂场景下的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22289 2026-03-09 q-bio.QM cs.LG q-bio.GN 57%

What Topological and Geometric Structure Do Biological Foundation Models Learn? Evidence from 141 Hypotheses

生物基础模型学习了哪些拓扑和几何结构?来自141个假设的证据

Ihor Kendiukhov

机构 * Department of Computer Science University of Tübingen(计算机科学系图宾根大学)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 生物基础模型通过大规模假设筛选发现,其学习的几何结构具有生物意义,且在不同模型间共享,但基因位置存在差异,同时信号在免疫组织中更显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13350 2026-03-09 cs.LG 57%

Beyond Mapping : Domain-Invariant Representations via Spectral Embedding of Optimal Transport Plans

超越映射:通过最优运输计划的谱嵌入获得领域不变表示

Abdel Djalil Sad Saoud, Fred Maurice Ngolè Mboula, Hanane Slimani

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出通过谱嵌入平滑运输计划来获得领域不变表示,以解决训练与推理数据分布偏移问题,在多个音频和电气检测任务中取得优异性能。

Comments Accepted at The IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03738 2026-03-09 cs.CL 57%

Activation-Space Personality Steering: Hybrid Layer Selection for Stable Trait Control in LLMs

激活空间人格引导:用于LLMs中稳定特质控制的混合层选择

Pranav Bhandari, Nicolas Fay, Sanjeevan Selvaganapathy, Amitava Datta, Usman Naseem, Mehwish Nasim

机构 * Network Analysis and Social Influence Modelling (NASIM) Lab(网络分析与社会影响建模实验室) School of Physics Maths and Computing, The University of Western Australia(西澳大学物理数学与计算学院) School of Psychological Science, The University of Western Australia(西澳大学心理学科学学院) School of Computing, Macquarie University(麦考瑞大学计算机学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出通过混合层选择方法,在LLMs中实现稳定的人格控制,利用Big Five人格特质构建低秩子空间,以提升模型输出的可控性与实用性。

Comments Accepted to EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17859 2026-03-09 eess.SY cs.LG cs.SY 57%

Mixed Monotonicity Reachability Analysis of Neural ODE: A Trade-Off Between Tightness and Efficiency

神经ODE的混合单调性可达性分析:紧致性与效率之间的权衡

Abdelrahman Sayed Sayed, Pierre-Jean Meyer, Mohamed Ghazel

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种基于区间的方法,利用混合单调性技术对神经ODE进行可达性分析,在紧致性和效率之间取得平衡,适用于高维实时安全应用。

Comments 27 pages, 11 figures, Accepted for publication in PMLR proceedings of NeurReps 2025 co-located with NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06265 2026-03-09 cs.CV cs.AI 57%

SPARC: Concept-Aligned Sparse Autoencoders for Cross-Model and Cross-Modal Interpretability

SPARC:概念对齐的稀疏自编码器用于跨模型和跨模态可解释性

Ali Nasiri-Sarvi, Hassan Rivaz, Mahdi S. Hosseini

机构 * Department of Computer Science and Software Engineering (CSSE) Concordia University, Canada(计算机科学与软件工程系(CSSE)康科迪亚大学,加拿大) Department of Electrical and Computer Engineering (ECE) Concordia University, Canada(电气与计算机工程系(ECE)康科迪亚大学,加拿大)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 SPARC通过稀疏自编码器实现跨模型和跨模态的概念对齐,提升概念表示的一致性与可解释性

Comments Accepted at TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06037 2026-03-09 cs.SE 50%

Detecting Semantic Alignments between Textual Specifications and Domain Models

检测文本规范与领域模型之间的语义对齐

Shwetali Shimangaud, Lola Burgueño, Rijul Saini, Jörg Kienzle

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出了一种基于自然语言处理和大型语言模型的方法,用于检测文本规范与领域模型之间的语义对齐,通过分类模型元素的对齐状态并提供相关证据句子,实现高精度的对齐检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05787 2026-03-09 cs.CV 50%

Spectral Probing of Feature Upsamplers in 2D-to-3D Scene Reconstruction

特征上采样器在2D到3D场景重建中的频谱探测

Ling Xiao, Yuliang Xiu, Yue Chen, Guoming Wang, Toshihiko Yamasaki

机构 * Hokkaido University(北海道大学) Westlake University(西湖大学) Zhejiang University(浙江大学) The University of Tokyo(东京大学)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出频谱诊断框架,通过六个指标评估特征上采样器对3D重建的影响,发现频谱一致性比空间细节更关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05546 2026-03-09 cs.RO cs.CV 50%

Digital-Twin Losses for Lane-Compliant Trajectory Prediction at Urban Intersections

面向城市交叉口的数字孪生轨迹预测中的损失函数

Kuo-Yi Chao, Erik Leo Haß, Melina Gegg, Jiajie Zhang, Ralph Raßhofer, Alois Christian Knoll

机构 * Technical University of Munich, Munich, Germany(慕尼黑技术大学)

专题命中 其他安全 :safety(abstract)

AI总结 本文提出基于数字孪生的多损失学习方法,用于提升城市交叉口的V2X轨迹预测安全性与准确性。

Comments 7 pages, 2 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15481 2026-03-09 cs.CV 50%

FunnyNodules: A Customizable Medical Dataset Tailored for Evaluating Explainable AI

FunnyNodules: 一种可定制的医学数据集,用于评估可解释AI

Luisa Gallée, Yiheng Xiong, Meinrad Beer, Michael Götz

机构 * Ulm University Medical Center(乌尔姆大学医学中心) XAIRAD - Cooperation for Artificial Intelligence in Experimental Radiology(XAIRAD——实验放射学人工智能合作) Department of Diagnostic and Interventional Radiology(诊断与介入放射学系)

专题命中 其他安全 :alignment(abstract)

AI总结 FunnyNodules是一种可定制的医学数据集,用于评估可解释AI模型的属性推理能力。

Comments accepted at Medical Imaging with Deep Learning (MIDL) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏