arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9331 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9331 篇

2511.04500 2026-07-02 cs.AI cs.CL cs.GT cs.MA 版本更新 62%

Large language models replicate and predict human cooperation across experiments in game theory

大型语言模型在博弈论实验中复制并预测人类合作行为

Andrea Cera Palatsi, Samuel Martin-Gutierrez, Ana S. Cardenal, Max Pellert

机构 * Department for Computational Social Sciences and Humanities, Barcelona Supercomputing Center(巴塞罗那超级计算中心计算社会科学与人文学系) Grupo de Sistemas Complejos, Universidad Politécnica de Madrid(马德里理工大学复杂系统研究组) School of Law and Political Science, Universitat Oberta de Catalunya(加泰罗尼亚开放大学法律与政治科学学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过复制大规模博弈实验,发现Llama模型能高保真复现人类合作模式,而Qwen更接近纳什均衡,并揭示了Llama的注意力机制与人类行为对齐的机理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31272 2026-07-01 cs.CR cs.CL cs.LG 新提交 62%

The Decomposition Is the Fingerprint: Per-Component Identity for Agent Skills

分解即指纹:面向智能体技能的组件级身份标识

Hongliang Liu, Yuhao Wu, Tung-Ling Li

机构 * Palo Alto Networks

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.LG

AI总结 提出一种基于多组SimHash的局部敏感指纹,将技能分解为提示、代码和工具三元组,通过汉明距离比较实现技能家族识别与变更定位,AUC达0.974。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12164 2026-07-01 cs.CY cs.CL 版本更新 62%

The Language You Ask In: Language-Conditioned Ideological Divergence in LLM Analysis of Contested Political Documents

提问的语言:语言条件对LLM分析争议性政治文件时的意识形态分歧的影响

Oleg Smirnov

机构 * Microsoft(微软)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.CY

AI总结 研究通过俄语和乌克兰语语义等价提示,发现ChatGPT和Claude Opus在分析同一乌克兰公民社会文件时,输出出现系统性意识形态分歧,且分歧程度因模型而异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11847 2026-07-01 cs.LG cs.CY 62%

Transparent and Fair Profiling in Employment Services: Evidence from Switzerland

透明且公平的就业服务中的 profiling:来自瑞士的证据

Tim Räz

专题命中 安全评测 :trustworthy(abstract);分类 cs.CY、cs.LG

AI总结 本文通过瑞士行政数据比较传统统计、可解释和黑箱模型,发现可解释 boosting 机器在预测性能上接近最佳黑箱模型,且通过模型稀疏性、特征平滑和公平性缓解可提升透明度和公平性。

Comments 35 pages including appendix

Journal ref Data & Policy 8 (2026) e30

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30107 2026-06-30 cs.AI cs.LG 62%

Structural Certification for Reliable Physical Design with Language Models

面向语言模型可靠物理设计的结构认证

Nakul Vyas, Iliya D. Stoev

机构 * Heysuvi Labs, LLC(Heysuvi实验室) Institute of Biological and Chemical Systems - Functional Molecular Systems, Karlsruhe Institute of Technology(生物和化学系统研究所-功能分子系统,卡尔斯鲁厄技术大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 提出Physics-Anchored Certification (PHACT)框架,通过提议-认证循环将断言权从模型转移到确定性引擎,在五个科学领域实现零错误认证。

Comments 16 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29809 2026-06-30 cs.CL cs.AI 62%

How Far Can You Get Without a GPU? A Systematic Benchmark of Lightweight Hallucination Detection Across Question Answering, Dialogue, and Summarisation

没有 GPU 你能走多远?轻量级幻觉检测在问答、对话和摘要中的系统基准测试

Kriti Faujdar, Smit Kadvani

机构 * Independent Researcher(独立研究者)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 系统评估五种轻量级、CPU可运行的幻觉检测方法在HaluEval基准上的表现,发现性能高度依赖任务,在摘要任务上接近随机,为资源受限场景提供方法选择指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29721 2026-06-30 cs.LG cs.AI 62%

Redefining Maritime Anomaly Detection via Equation-Grounded Synthetic Anomalies

通过方程引导的合成异常重新定义海上异常检测

Youngseok Hwang, Sungho Bae, Dohun Lee, Jaeeun Seo, Jeehong Kim, Wonhee Lee, Hyunwoo Park

机构 * Seoul National University(首尔国立大学) KRISO(韩国海洋研究组织)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 针对海上异常检测中缺乏标签和交互驱动异常的问题,提出基于方程引导的异常分类法,并构建统一评分-合成-标注流程,生成时间戳级标签,评估多种模型性能。

Comments 12 pages, KDD 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29347 2026-06-30 cs.LG cs.AI 62%

Adaptive Financial Transformer with Regime-Gated Attention for Stock Return Prediction

自适应金融Transformer:基于机制门控注意力的股票收益预测

Dishan Sarkar

机构 * Dishan Sarkar

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出自适应金融Transformer,通过机制编码器、自适应门控网络和金融上下文模块动态调整注意力,在降低模型复杂度15.2%的同时提升参数效率,实现可解释的股票收益预测。

Comments 10 pages, 4 figures, 10 tables. PyTorch implementation and code available at: https://github.com/Dishan18/FinancialTransformer

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28992 2026-06-30 cs.CL cs.AI 62%

Fine-Tuning General-Purpose Large Language Models for Agricultural Applications:A Reproducible Framework and Evaluation Protocol Based on Qwen3-8B

面向农业应用的通用大语言模型微调:基于Qwen3-8B的可复现框架与评估协议

Zhaoyang Li, Ruijie Zhang, Jiaqi Liu, Zhaoji Sun

机构 * Sanya University(三亚大学) Hebei International Studies University(河北国际 Studies 大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 提出AgriTune-R框架,通过数据治理、指令构建、LoRA/QLoRA微调、检索增强生成和专家评估,将通用大语言模型适配到农业任务,并设计了包含事实性、安全性、证据一致性和不确定性表达的评估协议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28674 2026-06-30 cs.LG cs.AI 62%

Constrained Tabular Diffusion for Finance

面向金融的约束表格扩散

Michael Cardei, Jose M Munoz, Oscar Barrera, Shreyas K Chandrahas, Partha Saha

机构 * University of Virginia(弗吉尼亚大学) Massachusetts Institute of Technology(麻省理工学院) Harvard University(哈佛大学) Visa Inc(Visa公司)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 提出CTDF方法,通过将训练时无约束的表格扩散与采样时的可行性操作结合,在金融数据生成中实现硬约束满足,零违规且提升稀缺数据效用。

Comments Published at ACM International Conference on AI in Finance (ICAIF) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28593 2026-06-30 cs.CV cs.AI cs.CL 62%

Animation2Code: Evaluating Temporal Visual Reasoning in Video-to-Code Generation

Animation2Code: 评估视频到代码生成中的时间视觉推理

Anya Ji, Abhijith Varma Mudunuri, David M. Chan, Alane Suhr

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出Animation2Code基准,通过从视频重建可执行网页动画代码来评估视觉语言模型的时间视觉推理能力,发现现有模型在时间一致性上表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20712 2026-06-30 cs.CL cs.AI 62%

SCRIBE: Diagnostic Evaluation and Rich Transcription Models for Indic ASR

SCRIBE:用于印度语言ASR的诊断评估和丰富转录模型

Kavya Manohar, Arghya Bhattacharya, Kush Juvekar, Kumarmanas Nethil

机构 * Adalat AI, India(印度Adalat人工智能公司)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 SCRIBE通过沙地容忍对齐和领域词汇注入,提供词错误率的分类分解,解决了传统词错误率在处理聚合语言时的不足,同时释放了用于印地语、马拉雅尔语和卡纳达语的丰富转录模型。

Comments Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02320 2026-06-30 cs.CL cs.AI q-bio.BM 62%

A Large-Scale Dataset for Molecular Structure-Language Description via a Rule-Regularized Method

通过规则正则化方法构建大规模分子结构-语言描述数据集

Feiyang Cai, Guijuan He, Yi Hu, Jingjing Wang, Joshua Luo, Tianyu Zhu, Srikanth Pilla, Gang Li, Ling Liu, Feng Luo

机构 * Clemson University(克莱姆森大学) Independent Researcher(独立研究者) University of Delaware(德雷克塞尔大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种全自动标注框架,生成精确分子描述,保留完整结构细节,构建了约16.3万分子-描述对数据集,验证精度达98.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01462 2026-06-30 cs.AI cs.CY 62%

Synthetic emotions and consciousness: exploring architectural boundaries

合成情绪与意识:探索建筑边界

Hermann Borotschnig

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文探讨合成情绪控制是否能在排除意识相关建筑特征的情况下实现,并提出建筑原则以评估意识风险。

Comments 34 pages, 2 tables, 1 figure. AI & Soc (2026)

Journal ref AI & Soc 41, 4929-4947 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05852 2026-06-30 cs.CL cs.AI 62%

Can Fine-Tuning Erase Your Edits? On the Fragile Coexistence of Knowledge Editing and Adaptation

微调是否会抹去你的修改?关于知识编辑与适应脆弱共存的研究

Yinjie Cheng, Paul Youssef, Christin Seifert, Jörg Schlötterer, Zhixue Zhao

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了微调对知识编辑的影响,发现微调会显著降低编辑效果,且仅微调编辑层可有效去除编辑,同时保持下游性能。

Comments Accepted to KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27973 2026-06-29 cs.CL cs.AI 新提交 62%

From Black-Box to Clinical Insight: A Multi-Stage Explainable Framework for Speech-Based Cognitive Impairment Detection

从黑盒到临床洞察:用于语音认知障碍检测的多阶段可解释框架

Yasaman Haghbin, Sina Rashidi, Ali Zolnour, Fatemeh Taherinezhad, Ali Fartoot, Hossein Azadmaleki, James M Noble, Maryam Dadkhah, Maryam Zolnoori

机构 * Independent Researcher(独立研究者) Columbia University(哥伦比亚大学) Chalmers University of Technology(查尔姆斯理工大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出多阶段可解释框架,结合SHAP、语言学特征和LLM推理,将黑盒Transformer预测转化为临床叙事,在NIA PREPARE基准上F1=72.11%,医生评估显示与患者认知特征高度一致,SUS评分82/100。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27577 2026-06-29 cs.LG cs.AI 新提交 62%

hia-gat: A Heterogeneous Interaction-Aware Graph Attention Network For Frame-Level Traffic Conflict Risk Prediction On Freeways

hia-gat: 一种用于高速公路帧级交通冲突风险预测的异构交互感知图注意力网络

Mahshid Malazizi, Seyedmehdi Khaleghian, Mina Sartipi, Toru Hirano, Yunfei Xu, Hoang H. Nguyen

机构 * DENSO International America, Inc.(电装国际美国公司)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 提出HIA-GAT,一种双流异构图注意力网络,通过专用注意力路径处理纵向和横向交互,并利用冲突类型感知门控机制融合,在NGSIM数据集上实现最佳风险排名性能(AUC最高0.867),并提供可解释的车辆级冲突归因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26982 2026-06-26 cs.CL cs.AI 新提交 62%

Auditing Framing-Sensitive Behavioral Instability in Large Language Models for Mental Health Interactions

审计心理健康交互中大语言模型的框架敏感行为不稳定性

Abla Bedoui, Ashley L. Greene, Mohammed Cherkaoui

机构 * a School of computer science, digital engineering and AI, Long Island University, Brooklyn, NY, USA(a 计算科学与数字工程及人工智能学院,罗格斯大学,布鲁克林,纽约,美国) b Department of Psychology, Long Island University, Brooklyn, NY, USA(b 心理学系,罗格斯大学,布鲁克林,纽约,美国)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 研究通过控制匹配提示,调查大语言模型在不同上下文框架下的行为变异性,发现框架系统性改变解释响应倾向,且内部表征可解码,激活操控可部分调节行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26541 2026-06-26 cs.LG cs.CY 新提交 62%

Can Large Language Models Reliably Code Qualitative Humanitarian Data? A Benchmark Study Against Human Expert Adjudication

大型语言模型能否可靠地编码定性人道主义数据?一项针对人类专家裁决的基准研究

Jerome Marston, Tino Kreutzer, Salomé Garnier, Ella Boone, Phuong N Pham, Patrick Vinck

专题命中 安全评测 :safety(abstract);分类 cs.CY、cs.LG

AI总结 本研究通过对比46个大型语言模型与人类专家在150份高保真合成人道主义转录本上的编码表现,发现多个LLM在结构化提示和推理配置下能达到与经验丰富人类编码员相当的可靠性,但聚合可靠性指标不足以指导部署,模型在识别间接表达的需求、类别外需求及保护相关问题方面存在差异。

Comments 34 pages, 4 tables, 3 Annexes

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26476 2026-06-26 cs.LG cs.AI 新提交 62%

Retrieval-Warmed Energy-Based Reasoning: A Five-Arm Ablation Methodology for Diffusion-as-Inference on Structured Reasoning Tasks

检索预热能量基推理:结构化推理任务上扩散即推断的五臂消融方法

Libo Sun, Po-Wei Harn, Zewei Zhang, Peixiong He, Xiao Qin

机构 * Department of Computer Science and Software Engineering, Auburn University(奥本大学计算机科学与软件工程系) Department of Information Management, National Central University(国立中央大学信息管理系)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出五臂消融方法(oracle、best-constant、per-query-random、shuffled、aligned)分离检索预热能量基推理中的三种混淆效应,在连通性-2任务上发现逐图对齐主导性能提升,而在数独任务上关键质量成为瓶颈。

Comments 8 Pages, 6 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25269 2026-06-25 stat.ML cs.AI cs.LG 新提交 62%

Stabilizing black-box algorithms through task-oriented randomization

通过任务导向的随机化稳定黑盒算法

Yali Wang, Zhaojun Wang

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 提出一种任务导向的随机化方法,根据输入数据的生成机制自适应调整策略,以稳定黑盒输出,并分析了稳定性与探索之间的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24901 2026-06-25 cs.LG cs.AI 新提交 62%

LLM Evolution as an Industry-Scale Ecosystem: A Lifecycle Perspective on Continual Learning

LLM演化作为行业规模生态系统:持续学习的生命周期视角

Hao Jiang, Enneng Yang, Guojie Zhu, Yibin Chen, Yunkun Xu, Zifu Kou, Jiayi Li, Chong Chen, Zhao Cao, Li Shen

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Renmin University of China(中国人民大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 从生态系统视角重新定义工业级LLM持续学习为闭环更新与发布问题,识别三大挑战,提出五项生命周期设计原则,并评估其成熟度与部署蓝图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11425 2026-06-25 cs.LG cs.CL 版本更新 62%

Narrative Feature or Structured Feature? A Study of Large Language Models to Identify Cancer Patients at Risk of Heart Failure

叙事特征还是结构化特征?大型语言模型识别癌症患者心力衰竭风险的研究

Ziyi Chen, Mengyuan Zhang, Mustafa Mohammed Ahmed, Yi Guo, Thomas J. George, Jiang Bian, Yonghui Wu

机构 * Department of Health Outcomes and Biomedical Informatics, College of Medicine, University of Florida(健康结局与生物医学信息学系,佛罗里达大学医学院) Division of Cardiovascular Medicine, Department of Medicine, College of Medicine, University of Florida(心血管医学部,医学院,佛罗里达大学) Division of Hematology & Oncology, Department of Medicine, College of Medicine, University of Florida(血液学与肿瘤学部,医学院,佛罗里达大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.LG

AI总结 本研究利用电子健康记录,比较传统机器学习、T-LSTM和大型语言模型(LLM)在识别癌症患者心力衰竭风险上的表现,LLM(GatorTron-3.9B)通过叙事特征取得最佳F1分数,优于其他模型。

Comments 10 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24162 2026-06-24 cs.CL cs.LG 新提交 62%

BehaviorBench: Benchmarking Foundation Models for Behavioral Science Tasks

BehaviorBench: 行为科学任务的基础模型基准测试

Jin Huang, Yutong Xie, Wanli Song, Xingjian Zhang, Walter Yuan, Matthew O. Jackson, Qiaozhu Mei

机构 * University of Michigan(密歇根大学) MobLab Stanford University(斯坦福大学) Santa Fe Institute(圣塔菲研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 提出BehaviorBench基准,评估基础模型在行为预测、战略决策、特质推断和行为知识应用四类任务上的个体与分布级表现,发现通用模型个体预测强,而微调的行为模型分布对齐更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16821 2026-06-24 cs.CL cs.CR cs.CY cs.IR 新提交 62%

How Much Can We Trust LLM Search Agents? Measuring Endorsement Vulnerability to Web Content Manipulation

我们能在多大程度上信任LLM搜索智能体?衡量对网络内容操纵的认可脆弱性

Yimeng Chen, Zhe Ren, Firas Laakom, Yu Li, Dandan Guo, Jürgen Schmidhuber

机构 * Center of Excellence for Generative AI, KAUST(KAUST生成式人工智能卓越中心) Jilin University(吉林大学) Zhejiang University(浙江大学) The Swiss AI Lab, IDSIA-USI/SUPSI(瑞士人工智能实验室 IDSIA-USI/SUPSI) NNAISENSE

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.CY

AI总结 提出SearchGEO框架,通过五类攻击模式和输出级指标评估13种LLM后端对网络内容操纵的认可脆弱性,发现攻击成功率从0%到31.4%不等,且不同后端对攻击模式的敏感性和部署框架的影响存在显著差异。

Comments 23 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11552 2026-06-24 cs.CL cs.LG 新提交 62%

Teaching Diffusion to Speculate Left-to-Right

教导扩散模型从左到右推测

Lexington Whalen, Yuki Ito, Ryo Sakamoto

机构 * Lexington Whalen Yuki Ito Ryo Sakamoto

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 针对自回归解码的推理瓶颈,提出三种训练时干预方法(位置加权、首次错误焦点损失、链损失)来弥合块扩散草稿模型的双向生成与自回归目标模型从左到右验证之间的不对称性,显著提升接受草稿长度。

Comments 13 pages, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23391 2026-06-23 cs.LG cs.AI 新提交 62%

Distribution-Aware Diffusion-LLM for Robust Ultra-Long-Term Time Series Forecasting

分布感知的扩散-大语言模型用于鲁棒的超长期时间序列预测

Falguni Ghosh, Vahid Hashemi, Bernhard Kainz

机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(埃尔朗根-纽伦堡大学) Imperial College London(伦敦帝国学院) AUDI AG(奥迪股份公司)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出Diffusion-LLM框架,将条件扩散模型集成到基于LLM的预测流程中,学习未来数据条件分布并改善语义对齐,在超长期和少样本预测中显著优于现有LLM基线。

Comments 18 pages, 6 figures, 8 tables. Accepted at 35th International Conference on Artificial Neural Networks (ICANN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23189 2026-06-23 cs.AI cs.CL 新提交 62%

Capable but Careless: Do Computer-Use Agents Follow Contextual Integrity?

有能力但粗心:计算机使用代理是否遵循情境完整性?

Anmol Goel, Iryna Gurevych

机构 * Ubiquitous Knowledge Processing Lab (UKP Lab), Department of Computer Science, TU Darmstadt(达姆施塔特工业大学计算机科学系泛在知识处理实验室(UKP Lab)) National Research Center for Applied Cybersecurity ATHENE(国家应用网络安全研究中心ATHENE)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 提出AgentCIBench基准,测试计算机使用代理在跨应用操作时是否泄露不适当信息,发现15个前沿代理中11个在超过50%场景中泄露信息,平均泄露率67.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21981 2026-06-23 cs.CL cs.LG 新提交 62%

Can LLMs Control Readability? A Multi-Dimensional Evaluation Framework for CEFR-Controlled Arabic Generation

LLM能否控制可读性?面向CEFR可控阿拉伯语生成的多维评估框架

Nour Rabih, Chatrine Qwaider, Ted Briscoe

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 提出一个多维评估框架,通过结构化提示和词汇约束,使指令跟随型LLM在CEFR可控阿拉伯语生成中达到高可读性一致性(余弦相似度0.91,可读性预测一致性0.99)。

Comments 15 PAGES, READIxTSAR WORKSHOP, LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21821 2026-06-23 cs.LG cs.CL 新提交 62%

Local Causal Attribution of Chain-of-Thought Reasoning

链式思维推理的局部因果归因

Dennis Wei, Yannis Belkhiter, Erik Miehling, Radu Marinescu

机构 * IBM Research(IBM研究院)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.LG

AI总结 提出AttriCoT算法,通过结构因果模型对链式思维推理中的单元进行局部因果归因,仅需O(U)次前向传播即可获得忠实于模型行为的归因结果。

Comments Camera-ready version for the Mechanistic Interpretability Workshop at ICML 2026. 37 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏