arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-10 至 2026-04-10 共收录 16 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 16 篇

2604.07375 2026-04-10 cs.CY cs.HC 79%

Assessing the Feasibility of a Video-Based Conversational Chatbot Survey for Measuring Perceived Cycling Safety: A Pilot Study in New York City

评估基于视频的对话式聊天机器人调查在测量感知骑行安全性的可行性:纽约市试点研究

Feiyang Ren, Zhaoxi Zhang, Tamir Mendel, Takahiro Yabe

专题命中 其他安全 :safety(title,abstract);分类 cs.CY

AI总结 本文提出利用大语言模型结合视频调查和对话式AI聊天机器人,评估骑行安全感知的可行性,并通过纽约市九个街区的试点调查验证方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07419 2026-04-10 cs.IR 78%

ReAlign: Optimizing the Visual Document Retriever with Reasoning-Guided Fine-Grained Alignment

ReAlign:通过推理引导的细粒度对齐优化视觉文档检索

Hao Yang, Yifan Ji, Zhipeng Xu, Zhenghao Liu, Yukun Yan, Zulong Chen, Shuo Wang, Yu Gu, Ge Yu

专题命中 其他安全 :alignment(title,abstract)

AI总结 本文提出ReAlign方法,利用VLM推理能力生成细粒度视觉描述作为监督信号,提升视觉文档检索性能,实验表明在不同领域数据集上均取得2%的相对提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04833 2026-04-10 econ.GN q-fin.EC 78%

Measuring Geopolitical Alignment and Economic Growth

衡量地缘政治一致性与经济增长

Tianyu Fan

专题命中 其他安全 :alignment(title,abstract)

AI总结 本文提出了一种基于事件的地缘政治一致性的新衡量方法,并证明其影响经济增长。研究发现地缘政治一致性提升可使人均GDP增长约10%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07837 2026-04-10 cs.AI 74%

SPARD: Self-Paced Curriculum for RL Alignment via Integrating Reward Dynamics and Data Utility

SPARD:通过整合奖励动态和数据效用实现强化学习对齐的自适应课程

Xuyang Zhi, Peilun zhou, Chengqiang Lu, Hang Lv, Yiwei Liang, Rongyang Zhang, Yan Gao, YI WU, Yao Hu, Hongchao Gu, Defu Lian, Hao Wang, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) Xiaohongshu Inc.(小红书)

专题命中 其他安全 :alignment(title);分类 cs.AI

AI总结 SPARD通过动态调整多目标奖励权重和数据重要性,提升强化学习对齐效果,实验显示在多个基准上显著增强模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08425 2026-04-10 cs.AI cs.CL 62%

Learning Who Disagrees: Demographic Importance Weighting for Modeling Annotator Distributions with DiADEM

学习谁不一致:用于建模标注者分布的群体重要性加权

Samay U. Shetty, Tharindu Cyril Weerasooriya, Deepak Pandita, Christopher M. Homan

机构 * Rochester Institute of Technology(罗切斯特理工学院)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI

AI总结 DiADEM通过学习群体重要性权重,有效建模标注者分歧,优于现有方法,在多个基准上取得显著成果,揭示种族和年龄对标注者分歧的关键影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08368 2026-04-10 cs.LG cs.CL cs.CV 62%

SOLAR: Communication-Efficient Model Adaptation via Subspace-Oriented Latent Adapter Reparametrization

SOLAR:通过子空间导向的潜在适配器重参数化实现通信高效的模型适应

Seyed Mahmoud Sajjadi Mohammadabadi, Xiaolong Ma, Lei Yang, Feng Yan, Junshan Zhang

机构 * University of Nevada, Reno(内华达大学里诺分校) Argonne National Laboratory(阿贡国家实验室) University of Houston(休斯顿大学) University of California, Davis(加利福尼亚大学戴维斯分校)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 SOLAR通过子空间导向的潜在适配器重参数化方法,减少PEFT适配器的通信和存储成本,提升模型适应效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07729 2026-04-10 cs.AI cs.CL 62%

Emotion Concepts and their Function in a Large Language Model

情感概念及其在大语言模型中的功能

Nicholas Sofroniew, Isaac Kauvar, William Saunders, Runjin Chen, Tom Henighan, Sasha Hydrie, Craig Citro, Adam Pearce, Julius Tarng, Wes Gurnee, Joshua Batson, Sam Zimmerman, Kelley Rivoire, Kyle Fish, Chris Olah, Jack Lindsey

机构 * Anthropic

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示大语言模型中情感概念的内部表示及其对输出的影响,探讨其在对齐行为中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05086 2026-04-10 cs.CL cs.AI 62%

A systematic framework for generating novel experimental hypotheses from language models

从语言模型生成新颖实验假设的系统框架

Kanishka Misra, Najoung Kim

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一个系统框架,利用语言模型模拟未在文献中存在的实验结果,针对儿童语言发展中的代词动词习得和跨结构泛化问题,生成新颖未测试的假设,并设计可实验室测试的实验。

Comments Revised version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08537 2026-04-10 cs.LG q-bio.NC 57%

Meta-learning In-Context Enables Training-Free Cross Subject Brain Decoding

基于上下文的元学习实现无训练跨受试者脑解码

Mu Nan, Muquan Yu, Weijian Mai, Jacob S. Prince, Hossein Adeli, Rui Zhang, Jiahang Cao, Benjamin Becker, John A. Pyles, Margaret M. Henderson, Chunfeng Song, Nikolaus Kriegeskorte, Michael J. Tarr, Xiaoqing Hu, Andrew F. Luo

机构 * University of Hong Kong(香港大学) Shenzhen Loop Area Institute(深圳河套学院) Chinese University of Hong Kong(香港中文大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Harvard University(哈佛大学) Columbia University(哥伦比亚大学) University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出一种基于上下文的元学习方法,无需微调即可实现跨受试者的脑解码,通过上下文学习和分层推理提升解码效率与鲁棒性。

Comments Accepted to CVPR 2026, website: https://github.com/ezacngm/brainCodec

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08494 2026-04-10 cs.CV cs.CL cs.HC 57%

What They Saw, Not Just Where They Looked: Semantic Scanpath Similarity via VLMs and NLP metric

他们所见,而不仅仅是他们看的地方:通过VLMs和NLP度量的语义扫视路径相似性

Mohamed Amine Kerkouri, Marouane Tliba, Bin Wang, Aladine Chetouani, Ulas Bagci, Alessandro Bruno

机构 * Northwestern University(西北大学) Radiology, Northwestern University(西北大学放射学系)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出一种整合视觉语言模型的语义扫视路径相似性框架,通过控制视觉上下文生成文本描述,利用NLP度量计算语义相似性,揭示空间差异下的内容一致性。

Comments Accepted at ETRA 2026 GenAI workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08461 2026-04-10 cs.CV cs.AI 57%

OVS-DINO: Open-Vocabulary Segmentation via Structure-Aligned SAM-DINO with Language Guidance

OVS-DINO:通过结构对齐的SAM-DINO与语言引导实现开放词汇分割

Haoxi Zeng, Qiankun Liu, Yi Bin, Haiyue Zhang, Yujuan Ding, Guoqing Wang, Deqiang Ouyang, Heng Tao Shen

机构 * Tongji University(同济大学) Hong Kong Polytechnic University(香港理工大学) University of Electronic Science and Technology of China(电子科技大学) Chongqing University(重庆大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出OVS-DINO框架,通过结构对齐SAM和语言引导恢复DINO的边界敏感性,提升开放词汇分割的精度和鲁棒性。

Comments 14 pages, 12 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07612 2026-04-10 cs.SD cs.AI 57%

Towards Real-Time Human-AI Musical Co-Performance: Accompaniment Generation with Latent Diffusion Models and MAX/MSP

实时人机音乐合奏:基于潜在扩散模型和MAX/MSP的伴奏生成

Tornike Karchkhadze, Shlomo Dubnov

机构 * University of California San Diego(加州大学圣迭戈分校)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出实时人机音乐合奏框架,利用潜在扩散模型生成伴奏,结合MAX/MSP实时音频处理与Python服务器,实现低延迟的伴奏生成与评估。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08296 2026-04-10 cs.AI 57%

Towards a Science of Scaling Agent Systems

迈向代理系统的科学:扩展性研究

Yubin Kim, Ken Gu, Chanwoo Park, Chunjong Park, Samuel Schmidgall, A. Ali Heydari, Yao Yan, Zhihan Zhang, Yuchen Zhuang, Yun Liu, Mark Malhotra, Paul Pu Liang, Hae Won Park, Yuzhe Yang, Xuhai Xu, Yilun Du, Shwetak Patel, Tim Althoff, Daniel McDuff, Xin Liu

机构 * Google Research(谷歌研究院) Massachusetts Institute of Technology(麻省理工学院) Google DeepMind(谷歌DeepMind)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文通过260种配置评估六种代理基准,探讨代理系统在扩展维度上的性能变化规律,揭示协调、模型能力与任务结构之间的关系,发现协作成功取决于协调与任务结构的匹配程度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07891 2026-04-10 cs.SE 50%

AFGNN: API Misuse Detection using Graph Neural Networks and Clustering

AFGNN:基于图神经网络和聚类的API误用检测

Ponnampalam Pirapuraj, Tamal Mondal, Sharanya Gupta, Akash Lal, Somak Aditya, Jyothi Vedurada

专题命中 其他安全 :safety(abstract)

AI总结 本文提出AFGNN框架,利用API流程图捕捉代码中的执行序列、数据和控制流信息,通过自监督预训练和聚类识别不同API使用模式,有效检测Java代码中的API误用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18772 2026-04-10 cs.HC 50%

Are Conversational AI Agents the Way Out? Co-Designing Reader-Oriented News Experiences with Immigrants and Journalists

对话式AI代理是出路吗?与移民和记者共同设计以读者为导向的新闻体验

Yongle Zhang, Ge Gao

专题命中 其他安全 :alignment(abstract)

AI总结 本文通过与移民读者和记者共同设计,探索如何利用对话式AI代理改善移民读者的新闻体验,揭示了移民读者与记者之间价值对齐的悖论及AI代理的设计方法。

Journal ref In Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25597 2026-04-10 eess.SY cs.RO cs.SY 50%

Incorporating Social Awareness into Control of Unknown Multi-Agent Systems: A Real-Time Spatiotemporal Tubes Approach

将社交意识纳入未知多智能体系统的控制:一种实时时空管方法

Siddhartha Upadhyay, Ratnangshu Das, Pushpak Jagtap

机构 * Robert Bosch Centre for Cyber-Physical Systems, IISc(印度科学研究所罗伯特·博世网络物理系统中心)

专题命中 其他安全 :safety(abstract)

AI总结 本文提出一种去中心化控制框架,通过引入社交意识实现动态环境中多智能体的预定时间到达-避开-停留任务,采用实时时空管方法在线合成管状约束,确保安全避障和社交意识下的协同避碰。

详情

展开后加载摘要…

URL PDF HTML 收藏