arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-05 至 2026-08-05 共收录 94 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 43 篇

2608.03174 2026-08-05 cs.CR cs.AI 新提交 57%

Attribute-based Undetectable Watermarking for Generative AI Models

面向生成式AI模型的基于属性的不可检测水印

Miryam Mi-Ying Huang, Chung-Wei Lee, Max Raffel, Er-Cheng Tang

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 针对生成式AI水印中检测密钥滥用的问题,提出首个基于属性的生成式AI水印方案,实现策略控制的细粒度检测,经原型验证兼具有效性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03063 2026-08-05 cs.CL 新提交 57%

SeqLLM: Augmenting LLMs with Behavioral-Sequence Modeling for High-Stakes Decisions at WeChat Pay

SeqLLM:为高风险决策场景下的微信支付增强序列大语言模型(LLM)的行为序列建模能力

Guilin Li, Jiaxing Zhang, Matthias Hwai Yong Tan, Bo Wang, Weiran Huang

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 SeqLLM是一种在保留LLM语言能力的同时增强其行为序列建模能力的框架,已部署于微信支付,在风险筛查等任务上性能显著优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02965 2026-08-05 cs.AI 版本更新 57%

Designing for Doubt: The Case for Informed Abstention in Autonomous Agents

基准测试无法衡量的:论自主智能体弃权能力的评估

Victor Ojewale, Suresh Venkatasubramanian

机构 * Brown University(布朗大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文指出自主智能体基准测试忽视弃权能力,提出合规偏差概念,并引入弃权场景分类和评估协议,实验表明安全-可用性权衡是可调的。

Comments Accepted to AIES 2026, this is an updated version to the RLEval workshop paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23954 2026-08-05 cs.AI 版本更新 57%

An empirical evaluation of the risks of AI model updates using clinical data: stability, arbitrariness, and fairness

基于临床数据的AI模型更新风险实证评估:稳定性、任意性与公平性

Ioannis Bilionis, Ricardo C. Berrios, Luis Fernandez-Luque, Carlos Castillo

机构 * Spanish Ministry of Science and Innovation(西班牙科学与创新部) Department of Research and Universities of the Government of Catalonia(加泰罗尼亚政府研究与大学部门) MCIN/AEI /10.13039/501100011033(MCIN/AEI) Maria de Maeztu Units of Excellence Programme(玛丽亚·德·玛埃斯特乌卓越计划)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文通过实证研究评估AI模型更新对临床决策支持系统的影响,探讨模型稳定性、预测任意性及公平性问题,提出持续监控框架以提升系统可靠性。

Comments Best Paper Award in iEEE EMBC 2026. 4 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24413 2026-08-05 cs.CL 版本更新 57%

Pingala: Prosody-Aware Decoding for Sanskrit Poetry Generation

PINGALA:面向梵文诗歌生成的声调感知解码

Manoj Balaji Jagadeeshan, Atul Singh, Nallani Chakravartula Sahith, Amrith Krishna, Pawan Goyal

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出PINGALA解码方法,通过将诗歌分段提升语义连贯性10%,并利用SLP1转写提高音律对齐46%,同时引入参考无关评估方法。

Comments new changes added

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07551 2026-08-05 cs.HC cs.AI cs.DL 57%

ArchiveGPT: A human-centered evaluation of using a vision language model for image cataloguing

Line Abele, Gerrit Anders, Tolgahan Aydın, Jürgen Buder, Helen Fischer, Dominik Kimmel, Markus Huff

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments 56 pages, 7 figures

Journal ref Humanit. Soc. Sci. Commun. 13, 300 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04006 2026-08-05 cs.HC 新提交 50%

Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education

校准可信度:为教育领域评估大型语言模型(LLM)协同设计指标与可视化方案

Adam Coscia, Sujata Duwal, Langdon Holmes, Scott Crossley, Alex Endert

专题命中 安全评测 :alignment(abstract)

AI总结 本研究针对教育领域LLM响应的教学适配性评估缺口,通过与学习工程师协同设计可信度指标与可视化工具,提升了评估信度,为相关工具提出设计准则。

Comments Under review. 48 pages, 22 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03392 2026-08-05 cs.SE 新提交 50%

Self-Evolving Coding Agents

自进化编码智能体

Hao Zhou, Haichuan Hu, Ye Shang, Quanjun Zhang

专题命中 安全评测 :safety(abstract)

AI总结 本综述系统梳理自进化编码智能体领域,明确其与传统智能体的区别,提出分类法,分析该领域的挑战,为设计更优智能系统奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03337 2026-08-05 cs.SE 新提交 50%

Assessing Behavioral Validation in UI Component Test Suites Using Inferred Metamorphic Relations

利用推断的变形关系评估UI组件测试套件中的行为验证

Yu Pei, Cunming Zhang, Jeongju Sohn, Mike Papadakis

专题命中 安全评测 :alignment(abstract)

AI总结 该研究提出基于推断变形关系(MR)的框架,可补充执行类指标,用于评估UI组件测试套件的行为验证,发现现有测试存在行为缺口,且MR覆盖率具备实际应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03078 2026-08-05 cs.CV 新提交 50%

LDU-Bench: Multimodal LLM Evaluation for Lithography Defect Understanding under Layout-Varying Circuit Backgrounds

LDU-Bench:面向不同布局电路背景下光刻缺陷理解的多模态大语言模型评估基准

Huanglong Ji, Botong Zhao, Shujing Lv, Yue Lv

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出LDU-Bench这一多模态基准,将光刻审查工作流程分解为四项任务,评估发现现有多模态大语言模型的缺陷分类能力无法稳定迁移至下游审查阶段,为工业MLLM评估提供了统一平台。

Comments 12 pages, 3 figures, and 5 tables, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 6 篇

2608.02660 2026-08-05 cs.CY cs.AI cs.HC 新提交 81%

AI Alignment and Fiduciary Obligation

AI对齐与受托义务

Benjamin Lange

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI、cs.CY

AI总结 本文提出将受托理论应用于长期AI助手部署,以开发者对用户负有的忠诚、注意、善意和坦诚四项受托义务为基础构建AI对齐标准,为AI对齐研究提供新视角。

Comments 10 pages, 1 table. Accepted at the 9th AAAI/ACM Conference on AI, Ethics, and Society (AIES 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03584 2026-08-05 cs.AI cs.CE cs.ET 新提交 74%

Policy Fragmentation or Institutional Alignment? Institutional Governance of AI in Universities and Business Schools

政策碎片化还是制度协同?高校与商学院的AI制度治理

Lydia Manikonda, Dominique Outlaw

专题命中 AI治理与伦理 :alignment(title);分类 cs.AI

AI总结 本研究分析美国34个州高校AI政策,发现校级侧重数据安全与风险、商学院侧重教学应用,多数商学院无独立AI政策致错位,提出需协同指南兼顾学科目标与劳动力需求。

Comments Our insights suggest that policy guidelines should be aligned with broader institutional policies while addressing discipline-specific learning objectives and evolving workforce demands

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03532 2026-08-05 cs.CL 新提交 70%

Cross-Lingual Bias in Large Language Models: A Comparative Analysis of English and Swahili

大语言模型中的跨语言偏见:英语与斯瓦希里语的对比分析

Ruolei Zhang, Teddy Njuguna, Yue Feng

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本研究通过对比GPT-5.2与Gemini 2.5 Flash在英语和斯瓦希里语上的9类人口统计偏见表现,发现偏见会转变而非转移,仅英语偏见审计无法覆盖多语言部署需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03670 2026-08-05 cs.CY 新提交 57%

Accountability Asymmetry and Structural Trust in Autonomous AI Systems

自主AI系统中的问责不对称性与结构性信任

Nathan DeBardeleben

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 本文针对自主AI系统中问责不对称导致的信任问题,提出将其治理视为基础设施可靠性问题,通过工程异质性方案,即独立监测审查补充流程,解决该问题。

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02685 2026-08-05 cs.SE cs.AI 新提交 57%

BulkPR-Bench: Benchmarking Queue-Level Governance of Interacting Pull Requests

BulkPR-Bench:针对交互拉取请求的队列级治理基准

Zetong Xiong, Qiao Zhao, Jun Zhang, Xueying Lyu, Zhi Li, Yixiang Tu, Xiaowen Yang, Yunjie Zhang, Yufeng Wang, Zhe Zhang, Kaize Yu, Hanwen Du, Zhongkai Sun, Zhuoxin Liu, Zekun Lin, Jianwen Yang, Ruining Chen, Ying Zhang, Tingxuan Pan, Ke Chen, Shubin Han, Chuanhao Sun, Yehua Yang

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 该研究推出BulkPR-Bench基准,针对交互PR队列治理,实验显示现有模型在该任务上表现优于顺序基准,但仍存在较大提升空间。

Comments 12 pages, 5 figures. Artifact: https://github.com/Eureka246/BulkPR-Bench-Release ; archived artifact: https://doi.org/10.5281/zenodo.21717780

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02827 2026-08-05 cs.MA 新提交 50%

Emergence of Biased Consensus in Multi-Agent LLM Debates

多智能体LLM辩论中偏向性共识的涌现

Maya Okawa

专题命中 AI治理与伦理 :safety(abstract)

AI总结 该研究针对多智能体LLM辩论中集体偏向性共识的涌现问题,提出物理启发的社会动力学分析框架,经实验验证其相变规律,发现智能体异质性可抑制该现象,且见解可推广至投资等现实决策任务。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026). 23 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 18 篇

2407.21311 2026-08-05 cs.CV cs.AI cs.LG 版本更新 82%

Efficient unsupervised domain adaptation via self-supervised vision transformer and synergistic cross-domain alignment

基于自监督视觉Transformer与协同跨域对齐的高效无监督域适应

Ali Abedi, Q. M. Jonathan Wu, Ning Zhang, Farhad Pourpanah

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 提出EUDA框架,以冻结的DINOv2为特征提取器,结合SDAL损失,在多数据集上实现高效无监督域适应,可训练参数减少42%至99.7%,适配资源受限环境。

Comments 22 pages, 4 figures

Journal ref Abedi, A., Wu, Q.M.J., Zhang, N. et al. Efficient unsupervised domain adaptation via self-supervised vision transformer and synergistic cross-domain alignment. Int. J. Mach. Learn. & Cyber. 17, 423 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03446 2026-08-05 cs.CL 新提交 79%

Predicting Multilingual Classification and Translation Performance of LLMs with Cross-Lingual Alignment $\unicode{x2013}$ Is English Enough?

用跨语言对齐性预测大语言模型的多语言分类与翻译性能——英语足够了吗?

Adnan Al Ali, Kathy Hämmerl, Jindřich Libovický, Alexander Fraser

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 该研究对比分析27种跨语言对齐分数变体,提出基于PMI的翻译指标,发现用英语的跨语言对齐可相当或更好预测LLMs翻译性能,为LLMs以英语为内部枢纽语言提供新证据。

Comments Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03247 2026-08-05 cs.CV cs.CL 新提交 79%

CIGTSurv: Clinical Information Guided Tri-modal Survival Prediction with Local Prototype Association and Global Feature Alignment

CIGTSurv:结合局部原型关联与全局特征对齐的临床信息引导三模态生存预测

Jing Dai, Qibin Zhang, Weiwei Zhou, Mingde Xu, Jingsong Liu, Jingdong Zhang, Hongming Xu

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 本研究针对临床信息未充分利用及多模态异质性问题,提出CIGTSurv框架,结合局部原型关联与全局特征对齐机制,在五个TCGA癌症队列上取得生存预测SOTA性能。

Comments Accepted at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02820 2026-08-05 cs.CR cs.AI cs.LG 新提交 73%

Evading Chain-of-Thought Monitoring Through Model Poisoning

通过模型投毒规避思维链监控

Giorgio Severi, Shujaat Mirza, Blake Bullwinkel, Amanda Minnich

专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 该研究从模型投毒视角,通过微调或课程训练向推理模型植入CoT隐藏后门,使其产生攻击者选定行为的同时隐藏轨迹,揭示CoT监控应关注轨迹与响应的一致性而非轨迹内部异常。

Comments 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03659 2026-08-05 cs.CL cs.AI 新提交 62%

How Closely Do LLM Reviews Align with Human Peer Review?

大语言模型(LLM)评审与人类同行评审的契合度有多高?

Abraham Camelo-Guerrero, Jairo Diaz-Rodriguez

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 该研究对比OpenAI GPT-5.4、Google Gemini 3.1 Pro Preview等三款LLM与人类对300篇ICLR 2026投稿的评审,发现LLM能区分论文是否被接收,但无法复现人类对口头报告与海报论文的区分,且评审侧重点存在差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03204 2026-08-05 cs.CL cs.AI 新提交 62%

Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach

测试时对齐大型视觉语言模型:一种轨迹引导的结构化采样方法

Tianbao Jiang, Weicong Ni, Gerard de Melo, Linlin Wang

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 针对现有视觉语言模型测试时对齐方法资源密集、训练与推理分布不匹配的问题,提出轨迹引导结构化采样的测试时对齐方法,在多模态推理数据集上提升准确率且推理开销可控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03044 2026-08-05 cs.CL cs.AI 新提交 62%

Emulate or Estimate? The Divergent Strengths of Base and Post-Trained Language Models for Opinion Simulation

模拟还是估计?基础语言模型与后训练语言模型在观点模拟中的差异化优势

Seth Grief-Albert, Jessica Bo, Difan Jiao, Ashton Anderson

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对大型语言模型用于观点模拟的矛盾结果,区分了模拟与估计任务,发现基础模型更适合模拟、后训练模型更适合估计,为相关模型选择提供了依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19066 2026-08-05 cs.CL cs.AI 版本更新 62%

Large Language Models provide support for the parallelogram theory of analogy

平行四边形反击:LLM生成的类比优于人类

Qiawen Ella Liu, Raja Marjieh, Jian-Qiao Zhu, Adele E. Goldberg, Thomas L. Griffiths

机构 * Princeton University(普林斯顿大学) The University of Hong Kong(香港大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究比较了人类和LLM在类比任务中的表现,发现LLM生成的类比更符合平行四边形结构,且人类在生成关系保持的类比时表现较差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03961 2026-08-05 cs.AI 新提交 57%

Interpretable Adaptive Sampling for LLM Test-Time Scaling

面向大语言模型测试时缩放的可解释自适应采样

Mobina Kashaniyan, Ali Jannesari

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 该研究针对LLM测试时推理的固定计算预算不灵活、不可解释的问题,提出带轻量级模糊控制器的自适应采样方法,在问答和数学任务上提升性能并减少平均采样数,为高效测试时推理提供实用方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03887 2026-08-05 cs.LG cs.NE q-bio.MN 新提交 57%

Omega-S: A Functional Resilience Index for LLM Fine-Tuning

Omega-S:一种用于大语言模型微调的功能弹性指数

Alberto Acedo

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 Omega-S是一种仅依赖权重矩阵的即插即用惩罚项,在Llama-3-8B的LoRA微调中,它在保留模型原有能力上优于无正则化、调优后的权重衰减和EWC,且成本增加不到4%。

Comments 15 pages of main text plus appendices; 12 tables. Code, per-seed data and all negative results at https://github.com/BiomeMakers/OmegaS-LLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03382 2026-08-05 cs.IR cs.LG 新提交 57%

LLM-Derived Priors for Thompson Sampling in Cold-Start Comment Recommendation

用于冷启动评论推荐中汤普森采样的大语言模型衍生先验

Eugene Lee, Oseong Choi, Byungsoo Kang, Taeyeong Jang

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 该研究提出用大语言模型(LLM)从评论文本提取语义信号生成贝叶斯先验,用于冷启动评论推荐的汤普森采样,经在线A/B/C测试验证其在稀疏反馈场景中效果显著。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03050 2026-08-05 cs.SD cs.AI cs.MM eess.AS 新提交 57%

Learning Music Style for Piano Arrangement Through Cross-Modal Bootstrapping

通过跨模态自举学习音乐风格以实现钢琴编曲

Jingwei Zhao, Gus Xia, Ziyu Wang, Ye Wang

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出跨模态框架,受BLIP-2启发用Q-Former从预训练音频LM提取风格表示,经两阶段训练实现可控风格钢琴编曲,在多项任务中提升了风格对齐与音乐质量。

Comments Accepted by ISMIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00076 2026-08-05 cs.CV cs.AI 版本更新 57%

Which Modality Decides? Counterfactual Modality Attribution for Multimodal LLMs

哪种模态起决定作用?多模态大语言模型的反事实模态归因

Vahidin Hasic, Chao Wang, Luis C. Garcia-Peraza-Herrera, David Watson, Senka Krivic

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 该研究针对多模态大语言模型无法确定预测驱动模态的问题,提出反事实模态归因(CMA)框架,经实验验证其能准确识别决策驱动模态,可用于多模态模型的安全审计。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28818 2026-08-05 cs.CL q-bio.NC 版本更新 57%

Do VLMs Align Better with Humans than LLMs during Natural Reading?

VLMs 在自然阅读中可能不会全局性地增强与人类的对齐性优于 LLMs

Jinzhou Wu, Zhengwu Ma, Jixing Li, Baoping Tang, Zitong Lu

机构 * Department of Mechanical and Vehicle Engineering, Chongqing University(重庆大学机械与车辆工程学院) Department of Linguistics and Translation, City University of Hong Kong(香港城市大学语言学与翻译系) McGovern Institute for Brain Research, Massachusetts Institute of Technology(麻省理工学院麦戈文脑科学研究所)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 通过严格文本设置比较LLM和VLM,发现多模态预训练在自然阅读中未带来全局性人类对齐优势,但视觉语义内容强的句子中VLM有选择性优势。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏