arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-29 至 2026-07-29 共收录 85 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 39 篇

2607.25780 2026-07-29 cond-mat.stat-mech physics.soc-ph 新提交 50%

Macroscopic wall pressure and microscopic contact load in crowds without egress: social-group cohesion and boundary buffering

无出口人群中的宏观壁面压力和微观接触载荷:社会群体凝聚力和边界缓冲

Bo-Shiun Shen, Son-Hsien Chen

专题命中 安全评测 :safety(abstract)

AI总结 研究无出口人群中机械危险,通过弹性重定向模型和社会力模型及其耦合动力学,用社会群体凝聚力等量化风险,揭示耦合动力学产生的壁面压力/接触载荷权衡及相边界,为高密度场所人群风险缓解和安全规划提供指导。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11665 2026-07-29 cs.RO 版本更新 50%

Nautilus: From One Prompt to Plug-and-Play Robot Learning

Nautilus:从一个提示到即插即用的机器人学习

Yufeng Jin, Jianfei Guo, Xiaogang Jia, Yu Deng, Zechu Li, Han Liu, Weiran Liao, Vignesh Prasad, Mathias Franzius, Gerhard Neumann, Georgia Chalvatzaki

机构 * TU Darmstadt(图宾根大学) KIT(卡尔斯鲁厄理工学院) FZI(弗劳恩霍夫研究所) Robotics Institute Germany(德国机器人研究所) Honda Research Institute Europe(本田欧洲研究院)

专题命中 安全评测 :trustworthy(abstract)

AI总结 Nautilus通过单个提示生成可复现、评估、微调和部署的机器人学习工作流程,提供即插即用的代理技能集和统一接口,减少跨家族验证的工程负担。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 5 篇

2607.25648 2026-07-29 cs.CY cs.AI 新提交 73%

Why Public Service AI Governance Frameworks Risk Failing in the Age of General-Purpose AI: Lessons from Policing

为何公共服务人工智能治理框架在通用人工智能时代面临失败风险:来自警务领域的教训

Sam Relins, Daniel Birks

专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY

AI总结 研究公共服务中通用人工智能治理框架面临的风险,以警务为例,指出其特性破坏安全条件,常用缓解措施失效,建议明确分类、技术简约、暂停部署并建立国家安全基础设施。

Comments Preprint; submitted for peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08789 2026-07-29 cs.CR 版本更新 67%

Never compromise with vulnerabilities: a comprehensive survey on AI governance

绝不向漏洞妥协:人工智能治理综合调查

Yuchu Jiang, Jian Zhao, Yuchen Yuan, Tianle Zhang, Yao Huang, Yanghao Zhang, Yan Wang, Yanshu Li, Xizhong Guo, Yusheng Zhao, Huilin Zhou, Jun Zhang, Zhi Zhang, Xiaojian Lin, Yixiu Zou, Haoxuan Ma, Yuhu Shang, Yuzhi Hu, Keshu Cai, Ruochen Zhang, Boyuan Chen, Yilan Gao, Ziheng Jiao, Yi Qin, Shuangjun Du, Xiao Tong, Zhekun Liu, Yu Chen, Xuankun Rong, Rui Wang, Yejie Zheng, Zhaoxin Fan, Murat Sensoy, Hongyuan Zhang, Pan Zhou, Lei Jin, Hao Zhao, Xu Yang, Jiaojiao Zhao, Jianshu Li, Joey Tianyi Zhou, Zhi-Qi Cheng, Longtao Huang, Zhiyi Liu, Zheng Zhu, Jianan Li, Gang Wang, Qi Li, Xu-Yao Zhang, Yaodong Yang, Mang Ye, Wenqi Ren, Zhaofeng He, Hang Su, Rongrong Ni, Liping Jing, Xingxing Wei, Junliang Xing, Massimo Alioto, Shengmei Shen, Petia Radeva, Dacheng Tao, Ya-Qin Zhang, Shuicheng Yan, Xuelong Li

专题命中 AI治理与伦理 :alignment(abstract);trustworthy(abstract)

AI总结 针对人工智能发展带来的技术漏洞及社会风险,提出整合技术与社会维度的框架,围绕三个支柱构建,通过系统回顾识别核心挑战,给出综合研究议程,为开发可靠且符合伦理的人工智能系统提供指导。

Comments 26 pages, 3 figures, accepted by SCIS2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25507 2026-07-29 cs.CL 新提交 57%

Phase Structure in Rotary Attention: A Spectral Framework for Semantic Continuity and Execution-Boundary Governance

旋转注意力中的相位结构:语义连续性和执行边界治理的谱框架

Abraham Chachamovits

机构 * ENTRUST AI(ENTRUST人工智能公司)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 研究Transformer语言模型中旋转注意力的相位结构,通过定义有效域、推导分数和引入函数构建谱框架,可区分表征连续性与执行边界可接受性,为相关研究提供理论和方法程序。

Comments 14 pages; theoretical framework and proposed experimental program

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25227 2026-07-29 cs.CR cs.LG 新提交 57%

Decision-Level Hijacking: Injecting Cognitive Bias into Large Language Models via Bit-Flip Attacks

决策级劫持:通过位翻转攻击向大语言模型注入认知偏差

Yu Yan, Jiahao Chen, Siqi Lu, Yongjuan Wang, Ziming Zhao, Zhaoxuan Li, Tianyu Du, Qingjun Yuan, Shouling Ji

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG

AI总结 研究大语言模型在高风险决策场景中的决策级劫持问题,提出CogBias框架,利用位翻转攻击,通过可微情感评估器等将主观偏好转化为优化信号,经实验验证该方法能在少量位翻转下诱导目标主题立场转变,破坏模型价值对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17675 2026-07-29 cs.SE cond-mat.mtrl-sci 版本更新 50%

Bridging the Gap on AI-Assisted Scientific Software Development Through Transparency and Traceability

通过透明性和可追溯性弥合人工智能辅助科学软件开发的差距

Chaitanya Bhave, Pierre-Clément A. Simon, Casey Icenhour, Lin Yang, Cody J. Permann, Daniel Schwen, Christopher S. Ritter

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本文探讨了在严格软件质量保证背景下如何负责任地使用人工智能辅助科学软件开发,提出了一种结构化框架用于AI辅助的验证与验证案例开发,以确保软件质量。

Comments 11 figures, 25 main pages (42 total pages including supplementary materials)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 18 篇

2607.25680 2026-07-29 cs.LG cs.AI 新提交 81%

Rashomon Alignment

罗生门对齐

Moisés Santos, Peter van der Putten, Bernhard Pfahringer, Carlos Soares

机构 * Faculty of Engineering, University of Porto(波尔图大学工程学院) Artificial Intelligence and Computer Science Lab (LIACC)(人工智能与计算机科学实验室(LIACC)) Fraunhofer AICOS Portugal(弗劳恩霍夫葡萄牙人工智能与计算机科学中心) BrightFactory(光明工厂) LIACS, Leiden University(莱顿大学LIACS) School of Computing and Mathematical Sciences, University of Waikato(怀卡托大学计算与数学科学学院)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 提出罗生门对齐(RA)评估模型功能相似性,引入几何视角,提出几何RA,通过90多个数据集实验分析,表明几何与分布对齐提供不同互补视角,RA可用于模型选择等多用途。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25614 2026-07-29 cs.LG cs.CL 新提交 81%

MemSFT: Mitigating Alignment Tax with an External Parametric Memory

MemSFT:使用外部参数内存减轻对齐代价

Jiarui Wang, Xiang Shi, Jiaqi Cao, Rubin Wei, Xiquan Wang, Hao Sun, Jingzhi Wang, Zhiqi Yang, Qipeng Guo, Bowen Zhou, Zhouhan Lin

机构 * Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.LG

AI总结 研究针对大语言模型应用于特定领域产生的对齐代价问题,提出MemSFT方法,通过参数内存解耦领域专业化与主干参数更新,经多领域多模型评估,能提升领域性能且通用性能下降小,实现通用与专业能力解耦。

Comments 33 pages, 11 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25579 2026-07-29 cs.CL cs.AI 新提交 81%

IRIS: Reusable Identity Representations from Frozen LLMs for Entity Alignment

IRIS:来自冻结语言模型的可重复使用身份表示用于实体对齐

Xinran Liu, Shengtao Li, Shouqian Shi, Ge Wang, Xin-Wei Yao

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 研究实体对齐问题,传统方法语义理解不足,基于LLM的方法未形成稳定身份空间。提出IRIS框架,从冻结LLM提取上下文表示构建实体签名,形成共享空间实现跨图谱对齐,在多个基准测试中取得良好成绩。

Comments 9 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24782 2026-07-29 cs.AI 新提交 79%

Personalization, Personas, and Forecasting in Value Alignment

价值对齐中的个性化、角色设定与预测

James Wedgwood, Pratiksha Thaker, Neil Kale, Virginia Smith

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 研究探讨LLM行为受人类身份影响的方式,通过WVS测试不同框架的互换性,在多语言多国家问题上评估多个模型,发现提示框架是文化对齐的关键因素,不同框架效果有别,对齐增益集中在部分价值维度,制度信任等问题仍难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25794 2026-07-29 cs.CV 新提交 78%

Fine-Grained Food Image Understanding via Target-Aware Data Alignment

通过目标感知数据对齐实现细粒度食品图像理解

Jui-Feng Chi, Wei-Lun Chu, Bruce Coburn, Jinge Ma, Fengqing Zhu

专题命中 其他安全 :alignment(title,abstract)

AI总结 研究针对细粒度食品图像理解,提出以数据为中心的多模态对齐方法,先选视觉相关训练子集,再细化字幕,训练互补检索专家并融合决策,提升了检索性能,完整方法检索分数超纯VLM检索两倍且更高效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25633 2026-07-29 cs.CL cs.AI 新提交 73%

Construction-Driven Injection: Linguistically-Grounded Edit-Based Code-Mixing Fingerprints for Large Language Models

构造驱动注入:用于大语言模型的基于语言基础编辑的代码混合指纹

Yongyi Cui, Yue Li, Tianbao Jiang, Xin Yi

专题命中 其他安全 :alignment(abstract);harmlessness(abstract);分类 cs.CL、cs.AI

AI总结 研究针对大语言模型易被滥用问题,提出统一指纹框架。通过LCF按规则构造代码混合指纹,再用LCFEdit结合多语言表示和跨语言对齐注入指纹,实现构造感知注入,确保更新稳定,能持续验证所有权且对模型效用影响小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26042 2026-07-29 cs.CV cs.LG 新提交 57%

VetClaw: An Edge-Cloud Multimodal Agentic System for Veterinary Disease Screening

VetClaw:一种用于兽医疾病筛查的边缘云多模态智能系统

Syed Mhamudul Hasan, Anas AlSobeh, Hussein Zangoti, Abdur R. Shahid

机构 * Southern Illinois University(南伊利诺伊大学) Utah Valley University(犹他谷大学) Jazan University(吉赞大学)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 VetClaw是用于兽医疾病筛查的边缘云多模态智能系统,用相机模块采集图像等并发送至视觉语言模型分类。它分离智能体交互与工作流编排,超越静态图像分类,症状引导和多模态输入提升性能,将静态模型转变为多功能安全感知系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25873 2026-07-29 cs.SE cs.AI 新提交 57%

How Do LLMs Read Bug Reports? An Empirical Study of Attention in LLMs for Automated Program Repair

大语言模型如何读取错误报告?基于大语言模型的自动程序修复中注意力的实证研究

Ramtin Ehsani, Irene Manotas, Saurabh Pujar, Luca Buratti, Preetha Chatterjee

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 研究基于大语言模型的自动程序修复中模型注意力模式,通过分析319个真实错误,探究其在错误报告各部分的分布、成功与失败修复的注意力差异及与开发者重视信息的比较,发现注意力分配错误是失败关键因素,为改进系统提供见解。

Comments Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE) 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25283 2026-07-29 cs.AI cs.AR cs.CR 新提交 57%

ContractHIL-HLS: Contract-Aligned Multi-Agent Workflow with Hardware-in-the-Loop Feedback for HLS Design

ContractHIL-HLS:用于HLS设计的具有硬件在环反馈的合同对齐多智能体工作流

Jingbo Zhang, Haoxiang Sun, Wenbo Wang, Wenbo Zhang

机构 * BJUT-CS316-LAB(北京工业大学CS316实验室)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 研究针对实际HLS工程提出ContractHIL-HLS工作流,通过引入结构化合同、纳入硬件信息及分解智能体实现多方面改进,经实验验证其在HLS-Eval任务及板级测试中均有良好效果,提高了设计通过率并优化运行时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24829 2026-07-29 cs.IR cs.LG 新提交 57%

Improving Rare Medication Recommendation with Counterfactual Data Augmentation and Large Language Models

通过反事实数据增强和大语言模型改进罕见药物推荐

Shinhwan Kang, Soo Yong Lee, Jaewon Kim, Kijung Shin, Buru Chang

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 针对现有方法在推荐罕见药物时性能低的问题,提出GenRxR框架,利用大语言模型生成反事实数据缓解数据稀缺,集成大语言模型建模联合推荐药物关系,经指令调整增强临床推理,实验显示其性能优于多个基线。

Comments Accepted for publication at the 20th ACM Conference on Recommender Systems (RecSys 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25664 2026-07-29 cs.LG math.OC stat.ML 新提交 57%

Contextual Deconvolution for Variance-Stable Demand Sensing: Kernel-Modulated Operators in Promotional Retail

用于方差稳定需求感知的上下文反卷积:促销零售中的核调制算子

Mohammad Forouhesh

机构 * Amirkabir University of Technology(伊朗德黑兰阿米尔卡比尔理工大学)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 研究针对机器学习需求预测运营波动性大的问题,提出上下文反卷积(CD)方法,通过核调制算子分离冲击与基线、分层部分池化实现目录规模部署,经样本外评估,CD在降低成本和提高预测可靠性上有贡献。

Comments 46 pages, 12 figures, 22 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23929 2026-07-29 cs.AI 版本更新 57%

MemTX: Transactional Belief Commit for Stateful Agent Memory

MemTX:用于有状态智能体内存的事务性信念提交

Xiaoyang Li, Yiqi Wang, Haohui Lu, Zhi Chen, Mo Li, Pingan Song, Mingkai Zheng, Taotao Cai

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 研究针对大语言模型智能体通过共享内存协调时内存写入问题,提出事务性信念提交协议MemTX,通过携带多种信息、在事务中暂存写入等方式,经机器检查确保不变量,在多主干上领先基线且无下游危害。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15753 2026-07-29 cs.AI 版本更新 57%

RoboPIN: Grounded Embodied Reasoning via Pinned Chain-of-Thought

RoboPIN: 基于锚定思维链的具身推理

Yaoting Huang, Yifu Yuan, Linqi Han, Chengwen Li, Shuoheng Zhang, Xianze Yao, Hongyao Tang, Yan Zheng, Jianye Hao

机构 * Tianjin University(天津大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 提出Pinned Chain-of-Thought (PinCoT)推理范式,通过结构化视觉锚点绑定实体,解决多步推理中实体引用漂移和视觉解耦问题;训练4B参数模型在14个基准上平均超越最强7B基线12%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00435 2026-07-29 cs.CV cs.AI 版本更新 57%

Detect Before You Leap: Mirage Detection in Vision-Language Models

在跳跃前检测:视觉语言模型中的幻象检测

Sayeed Shafayet Chowdhury, Md. Shaown Miah, S. M. Taiabul Haque, Syed Ishtiaque Ahmed

机构 * Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校) Bangladesh University of Engineering and Technology(孟加拉工程与技术大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 针对视觉语言模型在缺乏视觉证据时产生自信但无根据回答的幻象问题,提出文本条件层内对齐方法,通过分析视觉编码器各层补丁令牌与问题嵌入的对齐轨迹,结合像素统计、零样本域路由和结构化自评估,实现高精度预响应幻象检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10282 2026-07-29 cs.LG 版本更新 57%

Linear-LLM-SCM: Benchmarking LLMs for Coefficient Elicitation in Linear-Gaussian Causal Models

线性-LLM-SCM:用于线性高斯因果模型系数提取的LLM基准测试

Kanta Yamaoka, Sumantrak Mukherjee, Thomas Gärtner, David Antony Selby, Stefan Konigorski, Eyke Hüllermeier, Viktor Bengs, Sebastian Josef Vollmer

机构 * Data Science and its Applications, German Research Centre for Artificial Intelligence (DFKI)(德国人工智能研究中心数据科学与应用部门) Dept. of Computer Science, University of Kaiserslautern–Landau (RPTU)(科隆-兰道大学计算机科学系) Digital Health - Machine Learning Research Group, Hasso Plattner Institute for Digital Engineering(哈索·普朗纳研究所数字工程学院数字健康-机器学习研究组) Institute of Informatics, University of Munich (LMU)(慕尼黑大学信息学院) Hasso Plattner Institute for Digital Health at Mount Sinai, Icahn School of Medicine at Mount Sinai(西奈山医学院哈索·普朗纳研究所数字健康中心) Munich Center for Machine Learning (MCML), Germany(慕尼黑机器学习中心)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 本文提出线性-LLM-SCM框架,用于评估LLM在连续域中对线性高斯因果模型参数化的表现,揭示了LLM在定量因果推理中的局限性。

Comments [v2] Accepted at Workshop on Structured Data for Health@ICML 2026 Seoul,South Korea. 19 pages, 8 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16780 2026-07-29 cs.IR cs.AI cs.HC 版本更新 57%

Comparing RAG and GraphRAG for Page-Level Retrieval Question Answering on a Math Textbook

比较RAG和GraphRAG在数学教科书页面级检索问答中的应用

Eason Chen, Chuangji Li, Eric Li, Zimo Xiao, Jionghao Lin, Kenneth R. Koedinger

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 研究在本科数学教科书页面级问答中比较RAG和GraphRAG,用477个问答对数据集在检索准确率和答案质量两指标上对比五个RAG模型、BM25基线及GraphRAG,发现基于嵌入的RAG更优,还通过开源模型复制实验,为AI辅导系统设计提供参考。

Comments 6 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25355 2026-07-29 cs.SD 新提交 50%

From Semantics to Readout: Mechanistic Understanding of Audio Tokens after Fine-Tuning for Temporal Audio Grounding

从语义到读出:时间音频接地微调后音频令牌的机制理解

Yujian Ma, Jinqiu Sang, Ruizhe Li, Jiaao Yu, Ang Li

专题命中 其他安全 :alignment(abstract)

AI总结 研究大型音频语言模型中音频令牌在微调后的机制,通过四种分析研究其分层语义等,发现微调前已有潜在证据,微调后解码器更易访问事件信息,支持从语义到读出的解释,有助于解码器连接时间输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04569 2026-07-29 eess.SY cs.SY 版本更新 50%

LLMs for Agentic Home Energy Management

用于智能家庭能源管理的大语言模型

Sokipriala Jonah, Queen Moses, Abiola Babatunde, Michael Ajao-Olarinoye, Daniel Bammeke

专题命中 其他安全 :safety(abstract)

AI总结 研究家庭能源管理系统中,大语言模型智能体能否为多设备家庭能源调度提供自然语言接口。通过工具调用ReAct智能体及相关数据,对三个商业模型进行基准测试,结果显示模型表现各异,能实现高调度成功率和接近最优性。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏