arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-24 至 2026-06-24 共收录 73 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 28 篇

2606.23892 2026-06-24 cs.CV 新提交 67%

REALM: A Unified Red-Teaming Benchmark for Physical-World VLMs

REALM: 面向物理世界视觉语言模型的统一红队基准

Yifei Zhao, Qian Lou, Mengxin Zheng

机构 * University of Central Florida(中佛罗里达大学)

专题命中 安全评测 :safety(abstract);jailbreak(abstract)

AI总结 提出REALM,首个统一红队基准,集成12种攻击方法、3种防御和13个视觉语言模型,通过代理目标生成管道实现公平比较,发现文本注入攻击最有效。

Comments 20 pages, 5 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24259 2026-06-24 cs.CL cs.AI 新提交 66%

SURGELLM: Rethinking Multi-Task Evaluation through Task-Aware Feature Gating with Class-Balanced Normalization

SURGELLM: 通过任务感知特征门控与类别平衡归一化重新思考多任务评估

Noor Islam S. Mohammad, Ulug Bayazit

机构 * Istanbul Technical University(伊斯坦布尔理工大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI;trustworthy(comments)

AI总结 针对异构NLP任务中归纳偏置不匹配、类别不平衡和缺乏外部词汇知识的问题,提出统一Transformer框架SURGELLM,包含手术特征门控、任务条件前缀令牌和实例加权归一化,在四个任务上平均F1提升0.036。

Comments Proceedings of the 6th Workshop on Trustworthy NLP (TrustNLP 2026), ACL 2026, San Diego, California, USA. Available at https://openreview.net/forum?id=WJCalficPT

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24162 2026-06-24 cs.CL cs.LG 新提交 62%

BehaviorBench: Benchmarking Foundation Models for Behavioral Science Tasks

BehaviorBench: 行为科学任务的基础模型基准测试

Jin Huang, Yutong Xie, Wanli Song, Xingjian Zhang, Walter Yuan, Matthew O. Jackson, Qiaozhu Mei

机构 * University of Michigan(密歇根大学) MobLab Stanford University(斯坦福大学) Santa Fe Institute(圣塔菲研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 提出BehaviorBench基准,评估基础模型在行为预测、战略决策、特质推断和行为知识应用四类任务上的个体与分布级表现,发现通用模型个体预测强,而微调的行为模型分布对齐更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16821 2026-06-24 cs.CL cs.CR cs.CY cs.IR 新提交 62%

How Much Can We Trust LLM Search Agents? Measuring Endorsement Vulnerability to Web Content Manipulation

我们能在多大程度上信任LLM搜索智能体?衡量对网络内容操纵的认可脆弱性

Yimeng Chen, Zhe Ren, Firas Laakom, Yu Li, Dandan Guo, Jürgen Schmidhuber

机构 * Center of Excellence for Generative AI, KAUST(KAUST生成式人工智能卓越中心) Jilin University(吉林大学) Zhejiang University(浙江大学) The Swiss AI Lab, IDSIA-USI/SUPSI(瑞士人工智能实验室 IDSIA-USI/SUPSI) NNAISENSE

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.CY

AI总结 提出SearchGEO框架,通过五类攻击模式和输出级指标评估13种LLM后端对网络内容操纵的认可脆弱性,发现攻击成功率从0%到31.4%不等,且不同后端对攻击模式的敏感性和部署框架的影响存在显著差异。

Comments 23 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11552 2026-06-24 cs.CL cs.LG 新提交 62%

Teaching Diffusion to Speculate Left-to-Right

教导扩散模型从左到右推测

Lexington Whalen, Yuki Ito, Ryo Sakamoto

机构 * Lexington Whalen Yuki Ito Ryo Sakamoto

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 针对自回归解码的推理瓶颈,提出三种训练时干预方法(位置加权、首次错误焦点损失、链损失)来弥合块扩散草稿模型的双向生成与自回归目标模型从左到右验证之间的不对称性,显著提升接受草稿长度。

Comments 13 pages, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24797 2026-06-24 cs.CV cs.AI 新提交 57%

EG-VQA: Benchmarking Verifiable Video Question Answering with Grounded Temporal Evidence

EG-VQA: 基于接地时间证据的可验证视频问答基准

Linpeng Huang, Weixing Chen, Zexin Chen, Yang Liu, Liang Lin

机构 * Sun Yat-sen University(中山大学) Peng Cheng Laboratory(鹏城实验室) Shenzhen University(深圳大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 提出EG-VQA基准,通过细粒度时间证据标注和EG-F1指标,揭示视频大模型在答案正确性与证据定位之间的差距,并引入EG-Reasoner模型弥合这一差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24716 2026-06-24 cs.CV cs.AI 新提交 57%

Evaluating the Interpretability of Sparse Autoencoders with Concept Annotations

评估稀疏自编码器与概念标注的可解释性

Jonas Klotz, Cassio F. Dantas, Pallavi Jain, Diego Marcos, Begüm Demir

机构 * The Berlin Institute for the Foundations of Learning and Data (BIFOLD)(柏林学习与数据基础研究所) Technische Universität Berlin(柏林工业大学) INRAE(法国国家农业、食品与环境研究院) Inria, EVERGREEN(法国国家信息与自动化研究所,EVERGREEN) UMR TETIS, Univ Montpellier(UMR TETIS,蒙彼利埃大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 提出一种基于人类标注的评估框架,通过合成基准和二分匹配方法量化稀疏自编码器潜在变量与概念的对齐,并验证可解释性。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24619 2026-06-24 cs.AI 新提交 57%

When CQs Go Wrong: Challenges in CQ Verification with OE-Assist

当CQ出错时:OE辅助下CQ验证中的挑战

Anna Sofia Lippolis, Mohammad Javad Saeedizade, Robin Keskisärkkä, Aldo Gangemi, Eva Blomqvist, Andrea Giovanni Nuzzolese

机构 * University of Bologna(博洛尼亚大学) ISTC-CNR(意大利国家研究委员会认知科学与技术研究所) Linköping University(林雪平大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 研究能力问题(CQ)验证中的挑战,通过19名参与者使用LLM助手进行20项任务的实验,发现CQ的歧义和复杂性导致验证困难,提出需在发布前优化CQ以避免问题。

Comments Acceted poster at accepted-papers/poster-demo/" target="_blank" rel="noopener">https://2026.eswc-conferences.org/program/accepted-papers/poster-demo/ 23rd European Semantic Web Conference (Satellite Event)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24575 2026-06-24 cs.AI 新提交 57%

Quant Convergence: Bridging Classical Value Investing and Modern Factor Models for Systematic Equity Selection

量化收敛:连接经典价值投资与现代因子模型进行系统性股票选择

Augusto Eiji Yamazaki, Hugo Garrido-Lestache Belinchon

机构 * Milwaukee School of Engineering(密尔沃基工程学院)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本研究通过将格雷厄姆经典价值投资规则作为数学低通滤波器,结合现代因子模型,在S&P 500数据上测试XGBoost和AutoGluon等复杂模型,发现纯格雷厄姆随机森林实现了最高收益(232.13%)和较低风险,证明了价值投资规则能有效约束现代AI过度冒险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24420 2026-06-24 cs.CL 新提交 57%

Beyond Logprobs: A Multi-Signal Confidence Engine for LLM-Based Document Field Extraction

超越Logprobs:基于LLM的文档字段提取的多信号置信度引擎

Nitesh Kumar

机构 * Perfios Software Solutions Pvt. Ltd.(Perfios软件解决方案私人有限公司)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 提出ExtractConf,通过双视角文档解析(字段引导与文档引导)的不一致性,融合多信号实现高可靠置信度估计,在DocILE上AUC达0.928,准确率99.1%。

Comments Extended version of a paper accepted (Oral) at the RobustifAI Workshop, IJCAI-ECAI 2026, Bremen, Germany. 9 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24145 2026-06-24 cs.AI 新提交 57%

T2D-Bench: Evidence-Gated Evaluation of LLM Outputs for Type 2 Diabetes Using a Multi-Layer Clinical-Lifestyle Knowledge Graph

T2D-Bench:基于多层临床-生活方式知识图谱的2型糖尿病LLM输出证据门控评估

Saba A. Farahani, Hung Cao, Ramesh Jain, Amir M. Rahmani

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 提出T2D-Bench基准,通过多层知识图谱和证据门控机制,检测LLM输出中未满足指南约束的临床遗漏,并在2型糖尿病诊断、用药安全等场景中实现可测量纠正。

Comments 7 pages, 2 figures, 2 tables. Accepted as a poster at AMIA 2026 Annual Symposium

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23763 2026-06-24 cs.CV cs.AI 新提交 57%

Listening makes Vision Clear for VLMs

倾听使VLMs视觉清晰

Yiyang Chen, Yixin Tan, Binrui Shen

机构 * Beijing Normal University(北京师范大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 针对视觉语言模型解码漂移导致注意力分布与语义不一致的问题,提出基于提示侧语义的PV-TAM方法,通过过滤模态边界标记偏差并利用注意力峰值分布评估提示与视觉区域对齐,显著提升定位指标。

Comments 18pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19910 2026-06-24 cs.CL cs.SD eess.AS 新提交 57%

Light-weight Pronunciation Assessment via Discrete Speech Token Surprisal

轻量级发音评估:基于离散语音标记的意外度

Syeda Faiza Ahmed Sara, Shammur Absar Chowdhury

机构 * Qatar Computing Research Institute, Doha, Qatar(卡塔尔计算研究所,多哈,卡塔尔)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 提出仅使用母语语音资源训练的轻量级发音评估框架,通过离散化语音标记和语言模型计算意外度,结合文本引导对齐特征,在无监督或少量校准下达到接近监督方法的性能。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26144 2026-06-24 cs.SE cs.AI cs.CV 版本更新 57%

VISTA: An End-to-End Benchmark for Visual Spec-to-Web-App Coding Agents

VISTA:面向视觉规格到网页应用编码智能体的端到端基准

JunJia Guo, Yuhang Yao, Jiawei, Zhou, Jingdi Chen

机构 * University of Arizona(亚利桑那大学) Zoom Stony Brook University(石溪大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 提出VISTA基准,通过多维度输入条件和评估指标,衡量基于LLM的智能体从视觉规格生成功能完整、视觉一致的网页应用的能力。

Comments Project page: https://kaboider.github.io/VIS_APP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18542 2026-06-24 cs.CL 版本更新 57%

Business as Rulesual: A Benchmark and Framework for Business Rule Flow Modeling with LLMs

业务即规则:面向LLM的业务规则流建模基准与框架

Chen Yang, Ruping Xu, Ruizhe Li, Bin Cao, Jing Fan

机构 * Zhejiang University of Technology(浙江工业大学) Zhejiang Key Laboratory of Visual Information Intelligent Processing(浙江省视觉信息智能处理重点实验室) University of Aberdeen(阿伯丁大学) University of Birmingham(伯明翰大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 提出BREX基准(409份真实业务文档与2855条专家标注规则)和ExIde框架,通过可执行伪代码生成显式建模规则依赖,在13个LLM上验证了可执行接地作为归纳偏置的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24726 2026-06-24 cs.CV 新提交 50%

SER: Learning to Ground Video Reasoning with Semantic Evidence Rewards

SER: 用语义证据奖励学习视频推理定位

Sheng Xia, Zhengqin Lai, Tianxiang Jiang, Kanghui Tian, Shoujun Zhou, Bin Li, Yi Wang

机构 * Nanjing University(南京大学) Shanghai Innovation Institute(上海创新研究院) Shanghai AI Laboratory(上海人工智能实验室) Harbin Institute of Technology(哈尔滨工业大学) Shenzhen Institutes of Advanced Technology(深圳先进技术研究院)

专题命中 安全评测 :alignment(abstract)

AI总结 提出语义证据奖励(SER),通过将时空证据定位重构为约束验证任务,利用裁判VLM评估证据的相关性和定位质量,在V-STAR基准上提升3.0点mLGM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14792 2026-06-24 cs.CV 版本更新 50%

MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection

MSPL: 用于开放词汇目标检测的多步伪标签方法

Hojun Choi, Youngsun Lim, Jaeyo Shin, Hyunjung Shim

机构 * KAIST AI(韩国韩世大学AI研究所) Boston University(波士顿大学)

专题命中 安全评测 :alignment(abstract)

AI总结 提出MSPL框架,通过多步视觉推理(目标定位、类别识别、背景确认)生成伪标签,解决开放词汇检测中单步图像-文本匹配忽略中间推理步骤的问题,在OV-COCO和OV-LVIS上取得最优性能。

Comments This paper has been accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18582 2026-06-24 cs.NI 版本更新 50%

Wireless Copilot: An AI-Powered Partner for Navigating Next-Generation Wireless Complexity

无线副驾驶:一个AI驱动的合作伙伴,用于驾驭下一代无线复杂性

Haoxiang Luo, Ruichen Zhang, Yinqiu Liu, Gang Sun, Hongfang Yu, Dong In Kim

专题命中 安全评测 :trustworthy(abstract)

AI总结 提出“无线副驾驶”框架,通过集成大语言模型与认知架构,将人类意图转化为精确的网络操作,以管理6G的复杂性,并在低空无线网络中验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 7 篇

2606.23380 2026-06-24 cs.CY 新提交 88%

Affective AI Safety: The Missing Piece in LLM Safety

情感AI安全:LLM安全中缺失的一环

Carolin Ifländer, Alba Curry, Flor Miriam Plaza-del-Arco, Amanda Cercas Curry

专题命中 AI治理与伦理 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY

AI总结 本文提出情感安全作为AI安全的新类别,分类情感伤害类型,并指出现有框架未能充分应对,呼吁建立专门框架处理累积性、关系性和身份层面的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00069 2026-06-24 cs.CY cs.AI cs.CL 版本更新 82%

Societal Alignment Frameworks Can Improve LLM Alignment

社会对齐框架可以改进大语言模型对齐

Karolina Stańczak, Nicholas Meade, Mehar Bhatia, Hattie Zhou, Konstantin Böttinger, Jeremy Barnes, Jason Stanley, Jessica Montgomery, Richard Zemel, Nicolas Papernot, Nicolas Chapados, Denis Therien, Timothy P. Lillicrap, Ana Marasović, Sylvie Delacroix, Gillian K. Hadfield, Siva Reddy

机构 * ETH Zurich(苏黎世联邦理工学院) Mila, McGill University(麦吉尔大学米尔人工智能实验室) University of Cambridge(剑桥大学) Columbia University(哥伦比亚大学) University of Toronto, Google DeepMind(多伦多大学与DeepMind) McGill University, ServiceNow(麦吉尔大学与ServiceNow) Google DeepMind(谷歌DeepMind) University of Utah(犹他大学) King's College London(伦敦国王学院) Johns Hopkins University(约翰霍普金斯大学) Mila, McGill University, ServiceNow(麦吉尔大学米尔人工智能实验室与ServiceNow)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出借鉴社会、经济和契约对齐框架来改进大语言模型对齐,探讨不确定性在其中的作用,并将目标未指定性视为机遇而非缺陷,同时强调参与式对齐界面设计的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08245 2026-06-24 cs.CV cs.AI 版本更新 79%

When Language Overwrites Vision: Over-Alignment and Geometric Debiasing in Vision-Language Models

语言覆盖视觉:视觉语言模型中的过度对齐与几何去偏

Harshvardhan Saini, Samyak Jha, Yiming Tang, Dianbo Liu

机构 * Indian Institute of Technology Dhanbad(印度理工学院丹巴德分校) National University of Singapore(新加坡国立大学)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI

AI总结 本文研究视觉语言模型中过度对齐导致的幻觉问题,提出几何去偏方法,通过投影消除文本子空间影响,减少幻觉并提升长文本生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22560 2026-06-24 cs.LG cs.AI 62%

Operationalizing Fairness: Post-Hoc Threshold Optimization Under Hard Resource Limits

将公平性操作化:在硬性资源限制下的事后阈值优化

Moirangthem Tiken Singh, Amit Kalita, Sapam Jitu Singh

机构 * Department of Computer Science and Engineering, DUIET, Dibrugarh University, Assam, India(迪布鲁大学计算机科学与工程系,DUIET,阿萨姆,印度) Department of Computer Science and Engineering, MIT, Manipur University, 795003, India(曼尼普尔大学计算机科学与工程系,MIT,曼尼普尔大学,印度)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种事后阈值优化框架,在硬性资源限制下平衡安全、效率与公平性,通过全局阈值确保合规,并证明关键性质,实验表明资源限制主导伦理优先级,框架在资源受限下保持高风险识别能力。

Journal ref Neurocomputing (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24585 2026-06-24 cs.AI 新提交 57%

LLMs Prompted for Legal Context Object More: Overrefusal from Small On-Premises LLMs in Criminal Legal Context

LLMs在刑事法律语境中被提示为法律上下文对象:小型本地LLM的过度拒绝

Anastasiia Kucherenko, François Brouchoud, Dimitri Percia David, Andrei Kucharavy

机构 * IEM, HEG, HES-SO Valais-Wallis(瓦莱州-瓦利斯高等专业学院,管理与工程学院,经济与酒店管理学院)

专题命中 AI治理与伦理 :jailbreak(abstract);分类 cs.AI

AI总结 研究小型本地LLM在法律提示中的过度拒绝现象,发现权威性前缀(如“国家最高法院助理”)使拒绝率提高2-20倍,而角色扮演前缀效果不一,表明模型在真实机构用户可能引入的上下文框架下不稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23860 2026-06-24 cs.CY 新提交 57%

World Artificial Intelligence Cooperation Organization (WAICO): Mapping an Emerging Institution in the Global AI Governance Regime Complex

世界人工智能合作组织(WAICO):全球人工智能治理体制复合体中一个新兴机构的映射

William Guey, Pierrick Bougault, Wei Zhang, Vitor D. de Moura, José O. Gomes

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY

AI总结 本文通过编码15项国际AI治理文书和机构,分析中国提议的世界人工智能合作组织(WAICO)的设计特征,发现其结合了成员国开放、无价值观测试和发展优先议程,构成全球AI治理中基于主权与发展的第二极。

Comments 13 pages, 2 figures, 1 table. Data and code: https://github.com/williamguey/waico-ai-governance

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01127 2026-06-24 cs.CR 版本更新 50%

Multi-Agent LLM Governance for Safe Two-Timescale Reinforcement Learning in SDN-IoT Defense

多智能体LLM治理:SDN-IoT防御中安全的两时间尺度强化学习

Saeid Jamshidi, Negar Shahabi, Foutse Khomh, Carol Fung, Mohammad Hamdaqa

专题命中 AI治理与伦理 :safety(abstract)

AI总结 提出两时间尺度SDN-IoT防御方案,快时间尺度使用PPO智能体进行控制器感知的缓解,慢时间尺度使用多智能体LLM治理引擎生成可审计的策略更新,在保证安全约束下提升防御性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 18 篇

2606.23885 2026-06-24 cs.CV cs.AI cs.CL cs.MM 新提交 81%

Mind the Heads: Topological Representation Alignment for Multimodal LLMs

注意头:多模态大语言模型的拓扑表示对齐

Davide Caffagni, Alberto Compagnoni, Federico Melis, Sara Sarto, Pier Luigi Dovesi, Mark Granroth-Wilding, Marcella Cornia, Lorenzo Baraldi

机构 * University of Modena and Reggio Emilia(摩德纳和雷焦艾米利亚大学) University of Pisa(比萨大学) AMD Silo AI

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 提出头级表示对齐(HeRA)方法,在注意力头级别强制跨模态对齐,通过对比目标匹配局部拓扑结构,选择对齐最差的头进行训练,有效提升视觉任务性能并减少幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14001 2026-06-24 cs.CV cs.AI cs.LG 版本更新 81%

MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment

MOCHA: 多模态对象感知的跨架构对齐

Elena Camuffo, Francesco Barbato, Mete Ozay, Simone Milani, Umberto Michieli

机构 * University of Padova(帕多瓦大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 提出MOCHA蒸馏框架,将冻结VLM教师的多模态区域知识迁移至轻量视觉检测器,通过双重损失实现局部对齐与全局关系一致性,在少样本个性化检测中平均提升10.1%。

Comments 18 pages main paper, 10 pages supplementary material

Journal ref Proceedings of ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24123 2026-06-24 cs.SD 新提交 78%

Aligning MusicLLM with Emotion using Instruction Tuning and Feedback-Driven Alignment

使用指令微调和反馈驱动对齐将 MusicLLM 与情感对齐

Takuya Hasumi, Welly Naptali

机构 * LY Corporation

专题命中 其他安全 :alignment(title,abstract)

AI总结 本文研究如何通过指令微调和反馈驱动对齐策略,使音乐大语言模型(MusicLLM)具备情感回归能力,并证明反馈驱动对齐能显著提升唤醒度和效价预测性能,同时保持音乐问答能力。

Comments Accepted to Interspeech 2026, 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22413 2026-06-24 cs.SE cs.FL 新提交 78%

Formal-Method-Guided Vibe Coding: Closing the Verification Loop on AI-Generated Safety-Critical Software Through Model-Driven Engineering

形式化方法引导的Vibe编码:通过模型驱动工程关闭AI生成安全关键软件的验证循环

Ran Wei, Le Zhu, Haochi Wang, Jim Woodcock, Fang Yan, Simon Foster, Xiangyang Ji

专题命中 其他安全 :safety(title,abstract)

AI总结 提出Forge管道,结合Vibe编码与模型驱动工程,通过多种形式化验证(Dafny、CSP、Isabelle)迭代修正LLM生成的Java代码,生成符合安全标准的验证证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22366 2026-06-24 physics.optics 新提交 78%

Alignment-Free Nanometric Optical Metrology Enabled by Structured Light

基于结构光的无对准纳米光学计量

Yu Wang, Benquan Wang, Eng Aik Chan, Songze Li, Zhenyu Guo, Xi Xie, Masako Kishida, Che-Chin Chen, Yijie Shen, Jun-Yu Ou

专题命中 其他安全 :alignment(title,abstract)

AI总结 提出利用拉盖尔-高斯或厄米-高斯结构光照明,结合AI分析方法,实现单次、无标记、无对准的亚波长结构一维位置测量,精度达λ/110(7.2 nm)。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏