Attribute-based Undetectable Watermarking for Generative AI Models
面向生成式AI模型的基于属性的不可检测水印
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 针对生成式AI水印中检测密钥滥用的问题,提出首个基于属性的生成式AI水印方案,实现策略控制的细粒度检测,经原型验证兼具有效性与实用性。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
面向生成式AI模型的基于属性的不可检测水印
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 针对生成式AI水印中检测密钥滥用的问题,提出首个基于属性的生成式AI水印方案,实现策略控制的细粒度检测,经原型验证兼具有效性与实用性。
SeqLLM:为高风险决策场景下的微信支付增强序列大语言模型(LLM)的行为序列建模能力
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 SeqLLM是一种在保留LLM语言能力的同时增强其行为序列建模能力的框架,已部署于微信支付,在风险筛查等任务上性能显著优于现有基线。
基准测试无法衡量的:论自主智能体弃权能力的评估
机构 * Brown University(布朗大学)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 本文指出自主智能体基准测试忽视弃权能力,提出合规偏差概念,并引入弃权场景分类和评估协议,实验表明安全-可用性权衡是可调的。
Comments Accepted to AIES 2026, this is an updated version to the RLEval workshop paper
基于临床数据的AI模型更新风险实证评估:稳定性、任意性与公平性
机构 * Spanish Ministry of Science and Innovation(西班牙科学与创新部) ; Department of Research and Universities of the Government of Catalonia(加泰罗尼亚政府研究与大学部门) ; MCIN/AEI /10.13039/501100011033(MCIN/AEI) ; Maria de Maeztu Units of Excellence Programme(玛丽亚·德·玛埃斯特乌卓越计划)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
AI总结 本文通过实证研究评估AI模型更新对临床决策支持系统的影响,探讨模型稳定性、预测任意性及公平性问题,提出持续监控框架以提升系统可靠性。
Comments Best Paper Award in iEEE EMBC 2026. 4 pages, 3 figures
PINGALA:面向梵文诗歌生成的声调感知解码
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 本文提出PINGALA解码方法,通过将诗歌分段提升语义连贯性10%,并利用SLP1转写提高音律对齐46%,同时引入参考无关评估方法。
Comments new changes added
专题命中 安全评测 :alignment(abstract);分类 cs.AI
Comments 56 pages, 7 figures
Journal ref Humanit. Soc. Sci. Commun. 13, 300 (2026)
校准可信度:为教育领域评估大型语言模型(LLM)协同设计指标与可视化方案
专题命中 安全评测 :alignment(abstract)
AI总结 本研究针对教育领域LLM响应的教学适配性评估缺口,通过与学习工程师协同设计可信度指标与可视化工具,提升了评估信度,为相关工具提出设计准则。
Comments Under review. 48 pages, 22 figures, 2 tables
自进化编码智能体
专题命中 安全评测 :safety(abstract)
AI总结 本综述系统梳理自进化编码智能体领域,明确其与传统智能体的区别,提出分类法,分析该领域的挑战,为设计更优智能系统奠定基础。
利用推断的变形关系评估UI组件测试套件中的行为验证
专题命中 安全评测 :alignment(abstract)
AI总结 该研究提出基于推断变形关系(MR)的框架,可补充执行类指标,用于评估UI组件测试套件的行为验证,发现现有测试存在行为缺口,且MR覆盖率具备实际应用价值。
LDU-Bench:面向不同布局电路背景下光刻缺陷理解的多模态大语言模型评估基准
专题命中 安全评测 :alignment(abstract)
AI总结 本文提出LDU-Bench这一多模态基准,将光刻审查工作流程分解为四项任务,评估发现现有多模态大语言模型的缺陷分类能力无法稳定迁移至下游审查阶段,为工业MLLM评估提供了统一平台。
Comments 12 pages, 3 figures, and 5 tables, including appendices
AI对齐与受托义务
专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI、cs.CY
AI总结 本文提出将受托理论应用于长期AI助手部署,以开发者对用户负有的忠诚、注意、善意和坦诚四项受托义务为基础构建AI对齐标准,为AI对齐研究提供新视角。
Comments 10 pages, 1 table. Accepted at the 9th AAAI/ACM Conference on AI, Ethics, and Society (AIES 2026)
政策碎片化还是制度协同?高校与商学院的AI制度治理
专题命中 AI治理与伦理 :alignment(title);分类 cs.AI
AI总结 本研究分析美国34个州高校AI政策,发现校级侧重数据安全与风险、商学院侧重教学应用,多数商学院无独立AI政策致错位,提出需协同指南兼顾学科目标与劳动力需求。
Comments Our insights suggest that policy guidelines should be aligned with broader institutional policies while addressing discipline-specific learning objectives and evolving workforce demands
大语言模型中的跨语言偏见:英语与斯瓦希里语的对比分析
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CL
AI总结 本研究通过对比GPT-5.2与Gemini 2.5 Flash在英语和斯瓦希里语上的9类人口统计偏见表现,发现偏见会转变而非转移,仅英语偏见审计无法覆盖多语言部署需求。
自主AI系统中的问责不对称性与结构性信任
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY
AI总结 本文针对自主AI系统中问责不对称导致的信任问题,提出将其治理视为基础设施可靠性问题,通过工程异质性方案,即独立监测审查补充流程,解决该问题。
Comments 16 pages, 2 figures
BulkPR-Bench:针对交互拉取请求的队列级治理基准
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI
AI总结 该研究推出BulkPR-Bench基准,针对交互PR队列治理,实验显示现有模型在该任务上表现优于顺序基准,但仍存在较大提升空间。
Comments 12 pages, 5 figures. Artifact: https://github.com/Eureka246/BulkPR-Bench-Release ; archived artifact: https://doi.org/10.5281/zenodo.21717780
多智能体LLM辩论中偏向性共识的涌现
专题命中 AI治理与伦理 :safety(abstract)
AI总结 该研究针对多智能体LLM辩论中集体偏向性共识的涌现问题,提出物理启发的社会动力学分析框架,经实验验证其相变规律,发现智能体异质性可抑制该现象,且见解可推广至投资等现实决策任务。
Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026). 23 pages, 12 figures
基于自监督视觉Transformer与协同跨域对齐的高效无监督域适应
专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG
AI总结 提出EUDA框架,以冻结的DINOv2为特征提取器,结合SDAL损失,在多数据集上实现高效无监督域适应,可训练参数减少42%至99.7%,适配资源受限环境。
Comments 22 pages, 4 figures
Journal ref Abedi, A., Wu, Q.M.J., Zhang, N. et al. Efficient unsupervised domain adaptation via self-supervised vision transformer and synergistic cross-domain alignment. Int. J. Mach. Learn. & Cyber. 17, 423 (2026)
用跨语言对齐性预测大语言模型的多语言分类与翻译性能——英语足够了吗?
专题命中 其他安全 :alignment(title,abstract);分类 cs.CL
AI总结 该研究对比分析27种跨语言对齐分数变体,提出基于PMI的翻译指标,发现用英语的跨语言对齐可相当或更好预测LLMs翻译性能,为LLMs以英语为内部枢纽语言提供新证据。
Comments Submitted to EMNLP 2026
CIGTSurv:结合局部原型关联与全局特征对齐的临床信息引导三模态生存预测
专题命中 其他安全 :alignment(title,abstract);分类 cs.CL
AI总结 本研究针对临床信息未充分利用及多模态异质性问题,提出CIGTSurv框架,结合局部原型关联与全局特征对齐机制,在五个TCGA癌症队列上取得生存预测SOTA性能。
Comments Accepted at MICCAI 2026
通过模型投毒规避思维链监控
专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG
AI总结 该研究从模型投毒视角,通过微调或课程训练向推理模型植入CoT隐藏后门,使其产生攻击者选定行为的同时隐藏轨迹,揭示CoT监控应关注轨迹与响应的一致性而非轨迹内部异常。
Comments 15 pages, 2 figures
大语言模型(LLM)评审与人类同行评审的契合度有多高?
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 该研究对比OpenAI GPT-5.4、Google Gemini 3.1 Pro Preview等三款LLM与人类对300篇ICLR 2026投稿的评审,发现LLM能区分论文是否被接收,但无法复现人类对口头报告与海报论文的区分,且评审侧重点存在差异。
测试时对齐大型视觉语言模型:一种轨迹引导的结构化采样方法
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 针对现有视觉语言模型测试时对齐方法资源密集、训练与推理分布不匹配的问题,提出轨迹引导结构化采样的测试时对齐方法,在多模态推理数据集上提升准确率且推理开销可控。
模拟还是估计?基础语言模型与后训练语言模型在观点模拟中的差异化优势
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 该研究针对大型语言模型用于观点模拟的矛盾结果,区分了模拟与估计任务,发现基础模型更适合模拟、后训练模型更适合估计,为相关模型选择提供了依据。
平行四边形反击:LLM生成的类比优于人类
机构 * Princeton University(普林斯顿大学) ; The University of Hong Kong(香港大学)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 研究比较了人类和LLM在类比任务中的表现,发现LLM生成的类比更符合平行四边形结构,且人类在生成关系保持的类比时表现较差。
面向大语言模型测试时缩放的可解释自适应采样
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 该研究针对LLM测试时推理的固定计算预算不灵活、不可解释的问题,提出带轻量级模糊控制器的自适应采样方法,在问答和数学任务上提升性能并减少平均采样数,为高效测试时推理提供实用方向。
Omega-S:一种用于大语言模型微调的功能弹性指数
专题命中 其他安全 :alignment(abstract);分类 cs.LG
AI总结 Omega-S是一种仅依赖权重矩阵的即插即用惩罚项,在Llama-3-8B的LoRA微调中,它在保留模型原有能力上优于无正则化、调优后的权重衰减和EWC,且成本增加不到4%。
Comments 15 pages of main text plus appendices; 12 tables. Code, per-seed data and all negative results at https://github.com/BiomeMakers/OmegaS-LLM
用于冷启动评论推荐中汤普森采样的大语言模型衍生先验
专题命中 其他安全 :alignment(abstract);分类 cs.LG
AI总结 该研究提出用大语言模型(LLM)从评论文本提取语义信号生成贝叶斯先验,用于冷启动评论推荐的汤普森采样,经在线A/B/C测试验证其在稀疏反馈场景中效果显著。
Comments 10 pages, 4 figures
通过跨模态自举学习音乐风格以实现钢琴编曲
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 本文提出跨模态框架,受BLIP-2启发用Q-Former从预训练音频LM提取风格表示,经两阶段训练实现可控风格钢琴编曲,在多项任务中提升了风格对齐与音乐质量。
Comments Accepted by ISMIR 2026
哪种模态起决定作用?多模态大语言模型的反事实模态归因
专题命中 其他安全 :safety(abstract);分类 cs.AI
AI总结 该研究针对多模态大语言模型无法确定预测驱动模态的问题,提出反事实模态归因(CMA)框架,经实验验证其能准确识别决策驱动模态,可用于多模态模型的安全审计。
Comments 9 pages, 5 figures
VLMs 在自然阅读中可能不会全局性地增强与人类的对齐性优于 LLMs
机构 * Department of Mechanical and Vehicle Engineering, Chongqing University(重庆大学机械与车辆工程学院) ; Department of Linguistics and Translation, City University of Hong Kong(香港城市大学语言学与翻译系) ; McGovern Institute for Brain Research, Massachusetts Institute of Technology(麻省理工学院麦戈文脑科学研究所)
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 通过严格文本设置比较LLM和VLM,发现多模态预训练在自然阅读中未带来全局性人类对齐优势,但视觉语义内容强的句子中VLM有选择性优势。
Comments 16 pages, 5 figures