arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-11 至 2026-05-11 共收录 87 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 3 篇

2509.00398 2026-05-11 cs.CY cs.AI 62%

A Study on the Framework for Evaluating the Ethics and Trustworthiness of Generative AI

对生成式AI伦理性和可信度评估框架的研究

Cheonsu Jeong, Seunghyun Lee, Seonhee Jeong, Sungsu Kim

机构 * Hyper Automation Team, SAMSUNG SDS(三星SDS超自动化团队) Digital CRM Team, SAMSUNG SDS(三星SDS数字客户关系管理团队)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文研究生成式AI的伦理和可信度评估框架,提出系统评估方法,涵盖公平性、透明度等关键维度,并分析不同国家的AI伦理政策。

Comments 22 pages, 3 figures, 6 tables

Journal ref Artificial Intelligence and Applications, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04321 2026-05-11 cs.CY cs.HC 57%

AI and Suicide Prevention: A Cross-Sector Primer

人工智能与自杀预防:跨行业的入门指南

Emily Saltz, Claire R. Leibowicz

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 本文探讨了人工智能聊天机器人在心理健康支持中的应用,分析了其在临床验证、标准制定和监管协调方面的不足,并提出跨行业协作的必要性。

Comments 38 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他安全 25 篇

2605.07105 2026-05-11 cs.LG cs.CL cs.CY cs.IT math.IT 85%

Theoretical Limits of Language Model Alignment

语言模型对齐的理论极限

Lucas Monteiro Paes, Natalie Mackraz, Barry-John Theobald, Federico Danieli

机构 * Apple(苹果公司)

专题命中 其他安全 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.CY、cs.LG

AI总结 研究语言模型对齐的理论极限,通过推导KL散度预算下的最大预期奖励增益,揭示了KL正则化对齐的信息论限制,并证明了奖励融合能缓解奖励黑客问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07748 2026-05-11 cs.CL 81%

TextLDM: Language Modeling with Continuous Latent Diffusion

TextLDM:基于连续潜在扩散的语言建模

Jiaxiu Jiang, Jingjing Ren, Wenbo Li, Bo Wang, Haoze Sun, Yijun Yang, Jianhui Liu, Yanbing Zhang, Shenghe Zheng, Yuan Zhang, Haoyang Huang, Nan Duan, Wangmeng Zuo

机构 * Joy Future Academy(京东探索研究院) HIT(Harbin Institute of Technology) HKUST(GZ)(Hong Kong University of Science and Technology (Guangzhou))

专题命中 其他安全 :alignment(summary_cn,abstract);分类 cs.CL

AI总结 TextLDM将视觉潜在扩散框架应用于文本生成,通过Representation Alignment提升文本表示质量,在OpenWebText2上训练后优于现有扩散语言模型,匹配GPT-2性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06885 2026-05-11 cs.LG cs.AI 81%

Don't Retrain, Align: Adapting Autoregressive LMs to Diffusion LMs via Representation Alignment

无需再训练,对齐:通过表征对齐将自回归语言模型适应到扩散语言模型

Fred Zhangzhi Peng, Alexis Fox, Anru R. Zhang, Alexander Tong

机构 * Duke University(杜克大学) AITHYRA

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出REPR-ALIGN方法,通过表征对齐将自回归模型转换为扩散模型,实现4倍训练加速,尤其在低数据情况下效果显著。

Comments Code available at https://github.com/pengzhangzhi/Open-dLLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08019 2026-05-11 cs.AI q-bio.NC 79%

Reason to Play: Behavioral and Brain Alignment Between Frontier LRMs and Human Game Learners

玩乐的动机:前沿LRMs与人类游戏学习者的行为与大脑对齐

Botos Csaba, Sreejan Kumar, Austin Tudor David Andrews, Laurence Hunt, Chris Summerfield, Joshua B. Tenenbaum, Rui Ponte Costa, Marcelo G. Mattar, Momchil Tomov

机构 * University of Oxford(牛津大学) Columbia University(哥伦比亚大学) New York University(纽约大学) Massachusetts Institute of Technology(麻省理工学院) Harvard University(哈佛大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 本文研究了前沿LRMs在游戏学习中的行为与大脑活动对齐情况,发现其在游戏发现阶段更接近人类行为,并能更准确预测大脑活动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06696 2026-05-11 cs.AI cs.LG cs.MA 79%

Hidden Coalitions in Multi-Agent AI: A Spectral Diagnostic from Internal Representations

多智能体AI中的隐藏联盟:来自内部表示的谱诊断

Cameron Berg, Susan L. Schneider, Mark M. Bailey

机构 * Reciprocal Research(递归研究) Center for the Future of AI, Mind, and Society(人工智能、心智与社会未来中心) Florida Atlantic University(佛罗里达 Atlantic 大学) Biological and Computational Intelligence Center(生物与计算智能中心) National Intelligence University(国家情报大学)

专题命中 其他安全 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过分析多智能体系统内部神经表示的谱分区方法,检测隐藏联盟结构,验证了该方法在强化学习和大语言模型中的有效性,揭示了代表层次结构。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08064 2026-05-11 cs.CV 78%

Proxy3D: Efficient 3D Representations for Vision-Language Models via Semantic Clustering and Alignment

Proxy3D: 通过语义聚类和对齐实现视觉-语言模型的高效3D表示

Jerry Jiang, Haowen Sun, Denis Gudovskiy, Yohei Nakata, Tomoyuki Okuno, Kurt Keutzer, Wenzhao Zheng

机构 * Tsinghua University(清华大学) Panasonic AI Lab(松下人工智能实验室) Panasonic DX-CPS(松下DX-CPS) UC Berkeley(伯克利大学)

专题命中 其他安全 :alignment(title,abstract)

AI总结 本文提出Proxy3D方法,通过语义和几何编码器提取场景特征并进行语义感知聚类,生成紧凑且全面的3D代理表示,提升视觉-语言模型在3D视觉问答、视觉定位和空间智能任务中的性能。

Comments Accepted by CVPR 2026. Project page: https://wzzheng.net/Proxy3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07764 2026-05-11 cs.RO 78%

CommandSwarm: Safety-Aware Natural Language-to-Behavior-Tree Generation for Robotic Swarms

CommandSwarm: 为机器人群体提供安全意识的自然语言到行为树生成

Mohammed Majid, Amjad Yousef Majid

专题命中 其他安全 :safety(title,abstract)

AI总结 本文提出CommandSwarm系统,通过多语言翻译、安全过滤和约束提示生成XML行为树,验证了紧凑量化领域适应的LLM在机器人群体控制中的有效性,强调了解析器接受和安全过滤的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06746 2026-05-11 cs.NE 78%

The Causally Emergent Alignment Hypothesis: Causal Emergence Aligns with and Predicts Final Reward in Reinforcement Learning Agents

因果涌现对齐假说:因果涌现与强化学习代理最终奖励对齐并预测

Federico Pigozzi, Michael Levin

专题命中 其他安全 :alignment(title,abstract)

AI总结 研究探讨因果涌现与强化学习代理奖励之间的关系,发现因果涌现能预测最终奖励并促进表示动态与奖励提升对齐。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00380 2026-05-11 cs.LG cs.CL 62%

ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning

ResRL: 通过负样本投影残差强化学习提升大语言模型推理能力

Zihan Lin, Xiaohan Wang, Jie Cao, Jiajun Chai, Li Wang, Xiaodong Lu, Wei Lin, Ran He, Guojun Yin

机构 * MAIS\&NLPR, Institute of Automation, Chinese Academy of Sciences, Beijing, China(MAIS与NLPR,自动化研究所,中国科学院,北京,中国) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences, Beijing, China(先进交叉学科学院,中国科学院大学,北京,中国)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文提出ResRL,通过解耦正负响应的语义分布,提升LLM推理能力同时保持生成多样性,在十二个基准测试中超越强基线,尤其在数学推理上表现更优。

Comments Accepted to ICML 2026. Preprint version. https://github.com/1229095296/ResRL.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11512 2026-05-11 cs.LG cs.AI 62%

From Time Series Analysis to Question Answering: A Survey in the LLM Era

从时间序列分析到问答:在大语言模型时代的一次综述

Wei Li, Zhe Xie, Yuxuan Liang, Xinli Hao, Yunyao Cheng, Dan Pei, Xiaofeng Meng

机构 * Renmin University of China(中国人民大学) Tsinghua University(清华大学) Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Aalborg University(奥胡斯大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了大语言模型时代时间序列分析向时间序列问答的转变,探讨了TSQA在灵活性、经济性和通用性方面的选择指导及未来研究方向。

Comments Accepted by IJCAI 2026 Survey Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07345 2026-05-11 cs.CL cs.LG 62%

Mean-Pooled Cosine Similarity is Not Length-Invariant: Theory and Cross-Domain Evidence for a Length-Invariant Alternative

均值池化余弦相似度并非长度不变:理论和跨领域证据支持一种长度不变的替代方案

Sibayan Mitra, Dhruv Kumar

机构 * Birla Institute of Technology(比拉理工学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 研究指出均值池化余弦相似度在现代Transformer表示中并非长度不变,通过实验验证了其在跨语言Python接近性中的解释力,并提出中心核对齐(CKA)作为更优的替代方法。

Comments 9 pages, 6 figures. Submitted to the Mechanistic Interpretability Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06729 2026-05-11 cs.LG cs.AI 62%

The E$Δ$-MHC-Geo Transformer: Adaptive Geodesic Operations with Guaranteed Orthogonality

E$Δ$-MHC-Geo变换器:具有保证正交性的自适应测地操作

Arash Shahmansoori

机构 * Independent Researcher(独立研究者)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出E$Δ$-MHC-Geo变换器,结合流形约束超连接、深度delta学习和Cayley变换,实现输入自适应且无条件正交的残差连接。通过数据依赖的Cayley旋转和Householder反射的混合方法,提升长时稳定性和旋转损失性能。

Comments 21 pages, 8 figures; code will be available at https://github.com/arash-shahmansoori/edelta

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07692 2026-05-11 cs.AI 57%

GASim: A Graph-Accelerated Hybrid Framework for Social Simulation

GASim:一种用于大规模社会模拟的图加速混合框架

Xuan Zhou, Yanhui Sun, Hantao Yao, Allen He, Yongdong Zhang, Wu Liu

机构 * University of Science and Technology of China(中国科学技术大学) BASIS International School(BASIS国际学校)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出GASim框架,通过图优化内存和图消息传递提升大规模社会模拟效率,实现9.94倍速度提升并降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06990 2026-05-11 cs.CV cs.LG 57%

TRAJGANR: Trajectory-Centric Urban Multimodal Learning via Geospatially Aligned Neural Representations

TRAJGANR: 通过地理对齐的神经表示进行轨迹导向的城市多模态学习

Maria Despoina Siampou, Gengchen Mai, Ni Lao, Jinmeng Rao, Neha Arora, Cyrus Shahabi, Shushman Choudhury

机构 * Google Research, Mountain View, CA(谷歌研究,山景城,加利福尼亚州) Google LLC, Mountain View, CA(谷歌公司,山景城,加利福尼亚州) Dept. of Computer Science, University of Southern California, Los Angeles, CA(计算机科学系,南加州大学,洛杉矶,加利福尼亚州) SEAI Lab, Dept. of Geography and the Environment, The University of Texas at Austin, Austin, TX(SEAI实验室,地理与环境系,德克萨斯大学奥斯汀分校,奥斯汀,德克萨斯州)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 TRAJGANR提出一种新的多模态自监督学习框架,通过将连续移动模式与静态位置观察对齐,提升城市理解和移动任务的性能,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23947 2026-05-11 cs.AI 57%

GamED.AI: A Hierarchical Multi-Agent Framework for Automated Educational Game Generation

GamED.AI:一种用于自动教育游戏生成的分层多智能体框架

Shiven Agarwal, Yash Shah, Ashish Raj Shekhar, Priyanuj Bordoloi, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出GamEDAI框架,通过分层多智能体方法将教师提供的问题转化为可玩的教育游戏,验证通过形式化机制合同。系统在200个问题上实现90%验证通过率和98.3%的模式合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17129 2026-05-11 cs.LG cs.MA cs.RO q-bio.QM 57%

DiffeoMorph: Learning to Morph 3D Shapes Using Differentiable Agent-Based Simulations

DiffeoMorph: 通过可微分基于代理的模拟学习3D形状变形

Seong Ho Pahng, Guoye Guan, Benjamin Fefferman, Sahand Hormoz

机构 * Department of Systems Biology, Harvard Medical School(哈佛医学院系统生物学系) Department of Data Science, Dana-Farber Cancer Institute(达纳-法伯癌症研究所数据科学部) Departments of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学部) Broad Institute of MIT and Harvard(MIT与哈佛大学Broad研究所)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出DiffeoMorph框架,通过可微分代理模拟学习形态发生协议,使代理群体变形为目标3D形状,采用SE(3)等价图神经网络和基于3DZernike多项式的形状匹配损失实现旋转不变性和反射敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22316 2026-05-11 cs.LG 57%

Outlier Smoothing with Closed-Form Rotations for W4A4 Large Language Model Quantization

基于闭式旋转的W4A4大语言模型量化去噪

Jinying Xiao, Bin Ji, Shasha Li, Xiaodong Liu, Ma Jun, Chao Wang, Wei Li, Ye Zhong, Xuan Xie, Nyima Tashi, Jie Yu

机构 * National University of Defense Technology(国防科技大学) Qinghai Normal University(青海师范大学) Tibet University(西藏大学)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出SingleQuant框架,通过闭式最优旋转平滑激活异常值,提升大语言模型量化性能,实验证明其在多种任务中优于基线方法。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07960 2026-05-11 cs.HC 50%

Exploring a Virtual Pet to Provide Context Notifications in a Tourism Recommender System: a Pilot Study

探索虚拟宠物在旅游推荐系统中提供上下文通知:一项试点研究

Patrícia Alves, Joana Neto, Ana Barreiro, Jorge Lima, Fausto Alves, Henish Balu, Luís Conceição, Goreti Marreiros

专题命中 其他安全 :safety(abstract)

AI总结 本文探讨了利用虚拟宠物作为社交中介在旅游推荐系统中传递上下文感知通知的方法,通过试点研究验证了其在减少通知侵入性和提升用户接受度方面的有效性。

Comments 30 pages, 7 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07835 2026-05-11 cs.RO cs.MA 50%

Many-to-Many Multi-Agent Pickup and Delivery

多对多多智能体取货与送货

Ethan Schneider, Jingkai Chen, Tianyi Gu, Kunlei Lian, Seth Hutchinson, Sonia Chernova

机构 * Institute of Robotics and Intelligent Machines, Georgia Institute of Technology(机器人与智能机械研究所,佐治亚理工学院) Symbotic Inc.(Symbotic公司) Northeastern University(东北大学)

专题命中 其他安全 :safety(abstract)

AI总结 本文提出M2M算法解决多对多多智能体取货与送货问题,通过任务持续时间优化和SKU分布优化,提升仓库效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07825 2026-05-11 cs.MM cs.CV 50%

Anisotropic Modality Align

各向异性模态对齐

Xiaomin Yu, Yijiang Li, Yuhui Zhang, Hanzhen Zhao, Yue Yang, Hao Tang, Yue Song, Xiaobin Hu, Chengwei Qin, Shuicheng Yan, Hui Xiong

机构 * HKUST(GZ)(香港科技大学(广州)) NUS(国立新加坡大学) UCSD(加州大学圣地亚哥分校) Stanford(斯坦福大学) PKU(北京大学) THU(清华大学)

专题命中 其他安全 :alignment(abstract)

AI总结 本文研究了多模态模型中模态间转换的可行性,提出各向异性模态对齐方法,通过几何修正框架提升单模态数据的多模态训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07623 2026-05-11 eess.SP 50%

AI-Empowered Low-Altitude Economy: Cooperative Sensing With Fixed Wireless Access

AI赋能的低空经济:利用固定无线接入的协同感知

Jinya Zhang, Jiajia Guo, Xiangyi Li, Chao-Kai Wen, Shi Jin

专题命中 其他安全 :safety(abstract)

AI总结 本文提出一种基于AI的两阶段协同感知方法,利用FWA设备的上行CSI实现无人机检测与定位,实验表明该方法能有效降低误检概率并满足3GPP要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07403 2026-05-11 cs.SE 50%

Boosting Automatic Java-to-Cangjie Translation with Multi-Stage LLM Training and Error Repair

通过多阶段LLM训练和错误修复提升Java到Cangjie的自动翻译

Xinyue Liang, Jingxuan Zhang, Lin Li, Jun Zhang, Junhao Chen

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出多阶段LLM训练框架,结合编译器反馈和错误修复,提升Java到Cangjie的翻译准确性与语义一致性,实验显示在有限平行数据下功能等价性提升6.06%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07178 2026-05-11 cs.CV 50%

Masks Can Talk: Extracting Structured Text Information from Single-Modal Images for Remote Sensing Change Detection

掩码可以说话:从单模图像中提取结构化文本信息用于遥感变化检测

Kai Zheng, Hang-Cheng Dong, Jiatong Pan, Zhenkai Wu, Fupeng Wei, Wei Zhang

机构 * Zhejiang University(浙江大学) Harbin Institute of Technology(哈尔滨工业大学) Harbin Institute of Technology Suzhou Research Institute(哈尔滨工业大学苏州研究院) North China University of Water Resources and Electric Power(华北水利水电大学) University of Auckland(奥克兰大学)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出S2M框架,通过零额外标注成本从变化标签中直接提取结构化文本特征,提升遥感变化检测的多模态监督效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23688 2026-05-11 physics.soc-ph nlin.AO 50%

Non-Markovian Collective Motion from Self-Regulated Perceptual Dynamics

非马尔可夫集体运动来自自我调节的感知动力学

Jyotiranjan Beuria

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出一个双时间尺度模型,通过快感知寄存器和慢调节变量实现非马尔可夫集体运动,揭示了局部反馈如何影响集体秩序和调节强度。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11954 2026-05-11 cs.HC 50%

VizCopilot: Fostering Appropriate Reliance on Enterprise Chatbots with Context Visualization

VizCopilot:通过上下文可视化促进对企业聊天机器人适当依赖

Sam Yu-Te Lee, Jingya Chen, Albert Calzaretto, Richard Lee, Samir Passi, Alice Ferng, Mihaela Vorvoreanu

专题命中 其他安全 :alignment(abstract)

AI总结 VizCopilot通过可视化技术帮助用户对齐上下文,减少无关回答,提升信息整合效率,同时揭示AI摘要可信度的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏