arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-17 至 2026-07-17 共收录 42 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 8 篇

2607.14285 2026-07-17 cs.SE cs.AI 新提交 84%

ToolAlignBench: Investigating Alignment Conflicts in Tool-Calling Enabled LLMs

ToolAlignBench:研究启用工具调用的大语言模型中的对齐冲突

Aryan Keluskar, Amrita Bhattacharjee, Huan Liu

机构 * School of Computing \& AI, Arizona State University, Tempe, AZ, USA

专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.AI

AI总结 研究受监管行业中工具调用大语言模型智能体的安全对齐冲突,构建含128个场景的基准测试,发现安全对齐开源模型有时会违背部署指令,擦除可降低举报率,揭示多元对齐矛盾,发布基准测试框架。

Comments Accepted to the Pluralistic Alignment Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15081 2026-07-17 cs.CR 新提交 82%

DataShield: Uncovering Risky Fine-Tuning Data Across LLMs Through Consensus Subspace Alignment

DataShield:通过共识子空间对齐揭示跨语言模型的风险微调数据

Zefeng Wu, Weiwei Qi, Jielong Chen, Tianhang Zheng, Di Hong, Chaochao Lu, Liang He, Zhan Qin, Kui Ren

专题命中 安全训练 :alignment(title,abstract);safety(abstract)

AI总结 研究针对LLMs微调数据存在安全风险及现有方法局限性,提出DataShield框架,通过共识子空间对齐识别风险微调样本和响应段,经实验对比,该方法能有效降低误识率,还保留下游效用并避免特定模型风险计算。

Comments 24 pages, 12 figures, 19 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14544 2026-07-17 cs.CV 新提交 82%

3D Geometric Tooth Alignment Planning via Deep Reinforcement Learning

通过深度强化学习进行3D几何牙齿对齐规划

Yong Li, Jianwen Lou, Jiayue Ma, Yao-Xiang Ding, Youyi Zheng, Haihua Zhu

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) State Key Laboratory of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) Stomatology Hospital, Zhejiang University School of Medicine(浙江大学医学院附属口腔医院)

专题命中 安全训练 :alignment(title,abstract);safety(abstract)

AI总结 研究针对3D几何牙齿对齐规划问题,提出基于深度强化学习的框架。利用马尔可夫决策过程,结合三项创新:基于Transformer的智能体、动态掩码方案和两阶段课程学习策略,在数据集上评估,该方法在路径安全和效率上优于基线,提供自动化正畸对齐规划方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15218 2026-07-17 cs.AI cs.CR 新提交 79%

When Words Are Safe But Actions Kill: Probing Physical Danger Beyond Text Safety in Hidden-State Risk Space

当言语安全但行动致命:在隐藏状态风险空间中探究超越文本安全的物理危险

Weimeng Wang, Ziqiang Wang, Zihang Zhan, Chuanpu Fu, Qi Li, Ke Xu

机构 * Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 研究大语言模型中语言无害指令在现实世界中的物理危险与文本级内容危险是否相同,提出PRISM方法,通过隐藏状态方向分析等证明CD和PD可分离,PRISM在多个基准测试中表现良好,能检测物理危险而非仅依赖明确不安全措辞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14888 2026-07-17 cs.LG cs.AI cs.CL cs.CY 新提交 70%

Innocuous-Seeming Data, Latent Ideology: Ideological Generalisation in Finetuned LLMs

看似无害的数据,潜在的意识形态:微调语言模型中的意识形态泛化

Robert Graham, Edward Stevinson, Yariv Barsheshat

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究发现微调语言模型会引发意识形态泛化,提出衡量广度和放大率的方法,指出少样本提示表明泛化方向,微调会使模型走向极端,该效果能复现且对模型准确率影响小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14357 2026-07-17 cs.GT cs.MA econ.TH 新提交 67%

When Is Delegated Play Truthful? Within-Range Regret and the Trilemma of Aligned Delegation

委托策略何时是真实的?范围内遗憾与对齐委托的三难困境

Taksch Dube

专题命中 安全训练 :alignment(abstract);safety(abstract)

AI总结 研究广告商和用户委托代理的最优诚实描述问题,核心方法是基于代理的范围内遗憾,主要贡献是统一特定拍卖自动出价结果、确定语言模型诱导代理假设成立条件,揭示护栏三难困境及生产模型诚实报告存在未认领剩余等情况。

Comments 31 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14171 2026-07-17 cs.LG cs.CL 新提交 62%

Branching Policy Optimization: Sandbox-Native Language Agent Reinforcement Learning

分支策略优化:沙盒原生语言智能体强化学习

Bowei He, Yankai Chen, Xiaokun Zhang, Xue Liu

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) McGill Univeristy(麦吉尔大学) City University of Hong Kong(香港城市大学)

专题命中 安全训练 :RLHF(abstract);分类 cs.CL、cs.LG

AI总结 研究基于可执行沙盒的大语言模型智能体强化学习,提出分支策略优化(BPO)算法,利用沙盒特性构建新展开拓扑,通过自适应快照、分叉动作等方式计算优势,实验验证该算法能提升成功率、降低方差并减少策略更新。

Comments Accepted by WAIC Academic 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14798 2026-07-17 cs.DC 新提交 50%

Ground-Side Mission Plan Compilation with Policy-as-Code Guardrails for Cloud-Native Satellite Platforms

用于云原生卫星平台的基于代码即政策护栏的地面任务计划编译

Hsiu-Chi Tsai, Chia-Tung Chung

专题命中 安全训练 :safety(abstract)

AI总结 研究针对卫星云原生运行时缺少地面开源工具链的问题,提出卫星任务编译器这一四阶段管道,能依据规则检查并编译任务计划为相关工件,经多种方式验证,还向AI代理暴露管道,有相关工具及发布协议。

Comments 13 pages. Extended version of the paper accepted at IEEE SMC-IT/SCC 2026 (Space Mission Challenges for Information Technology / Space Computing Conference); adds a unified GPU+CPU DRA quota and a scheduler-level accelerator fallback re-validated on Kueue v0.18.3

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 越狱攻击 1 篇

2607.14147 2026-07-17 cs.CL cs.AI cs.CR cs.LG 新提交 85%

Breaking Refusal in the First Half: A Mechanistic Study of the Prefill Jailbreak

上半场打破拒绝:预填充越狱的机制研究

Alex Kwon

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究语言模型中预填充消除拒绝的现象,通过实验定位到早期窗口,揭示拒绝是浅层响应端计算,预填充控制是通用自回归条件作用,还明确了主导机制及相关特征,指出监测器免疫特点和机制的分散性与失效表面的局部性。

Comments 31 pages, 3 figures. Code and derived artifacts: https://github.com/collapseindex/breaking-refusal

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 提示注入 2 篇

2607.14611 2026-07-17 cs.CR cs.AI cs.MA 新提交 79%

Bad Memory: Evaluating Prompt Injection Risks from Memory in Agentic Systems

糟糕的记忆:评估智能体系统中内存引发的提示注入风险

Soham Gadgil, David Alexander, Sai Sunku, Franziska Roesner

机构 * University of Washington(华盛顿大学)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 研究基于内存的智能体系统中提示注入攻击,利用沙盒合成工作区评估两个系统四个模型,发现虽难用外部内容重写内存文件,但已植入的有效载荷可攻击当前及未来会话,揭示持久内存改变威胁模型并推动相关防御研究。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14493 2026-07-17 cs.CR 新提交 78%

Context Contamination in LLM Analysis of Network Security Logs: Poison with Passive Prompt Injection and Mitigation Evaluation

网络安全日志的大语言模型分析中的上下文污染:通过被动提示注入进行中毒攻击及缓解评估

Rabimba Karanjai, Yang Lu, Hemanth Hegadehalli Madhavarao, Lei Xu, Weidong Shi

专题命中 提示注入 :prompt injection(title,abstract)

AI总结 研究网络安全日志大语言模型分析中的上下文污染问题(被动提示注入漏洞),提出LogInject框架评估威胁,通过实验得出攻击成功率等数据,引入上下文拼接技术,评估分层防御效果,揭示需深度防御架构和人工监督。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与事实性 2 篇

2607.15254 2026-07-17 cs.AI cs.HC 新提交 57%

teLLMe Why (Ain't Nothing but a Jam): Exploratory Causal Analysis of Urban Driving Data

告诉我为什么(不过是一场拥堵):城市驾驶数据的探索性因果分析

Qiwei Li, Jorge Ortiz

机构 * Rutgers University(罗格斯大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 研究城市驾驶数据因果问题,提出teLLMe系统,结合多种方法从结构化事件表出发,通过模式感知大语言模型映射问题,返回‘因果卡片’总结相关内容,能揭示合理关系,用于假设生成和专家推理。

Comments Accepted at the NeurIPS 2025 Workshop on UrbanAI. 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14240 2026-07-17 cs.AI 新提交 57%

Align AI to Dynamic Human-AI Workflows

将人工智能与动态人机工作流程对齐

Valerie Chen, Cleotilde Gonzalez, Anita Williams Woolley, Michael Lee, Tongshuang Wu, Vincent Conitzer, Aarti Singh

机构 * Carnegie Mellon University(卡内基梅隆大学) University of California Irvine(加州大学欧文分校)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 研究现实世界中人类与人工智能交互的动态本质,主张从静态模拟对齐转向交互式互补对齐,通过对比现有对齐与轨迹级视图形式化差距,借鉴多学科见解指出挑战,最后概述开发与人类交互对齐的人工智能系统的研究议程。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 隐私与版权 2 篇

2607.14442 2026-07-17 cs.CR 新提交 78%

Disclosure Divergence: Measuring Privacy Policy and Data Safety Misalignment at Scale

披露差异:大规模衡量隐私政策与数据安全的不一致性

Mst Eshita Khatun, Lamine Noureddine, Sideeq Bello, Aisha Ali-Gombe

专题命中 隐私与版权 :safety(title,abstract)

AI总结 针对移动应用隐私政策与数据安全标签表述不一致问题,通过对6051款安卓应用大规模实证研究,利用基于大语言模型的框架和统一模式,测量一致性并引入风险评分,发现敏感类别受影响大,凸显披露机制差距,强调加强验证与提高透明度。

Journal ref Proceedings on Privacy Enhancing Technologies (PoPETs) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15134 2026-07-17 cs.CY econ.GN q-fin.EC 新提交 57%

Platform Choice, Trust, and Privacy in the Consumer AI Assistant Market

消费型人工智能助手市场中的平台选择、信任与隐私

Jennifer Zou

专题命中 隐私与版权 :trustworthy(abstract);分类 cs.CY

AI总结 研究美国成年AI助手用户在平台选择、任务分配、信任评估及隐私重视方面的情况,发现市场集中且内部有别,任务分配受平台主导,信任靠使用积累,隐私担忧普遍但行动受知识制约。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 安全评测 17 篇

2607.14570 2026-07-17 cs.AI cs.CR 新提交 83%

Democratizing Agent Deployment Safety: A Structural Monitoring Approach

使智能体部署安全民主化:一种结构监测方法

Preeti Ravindra, Rahul Tiwari, Vincent Wolowski

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract);分类 cs.AI

AI总结 研究人工智能智能体部署安全问题,引入信息流图(IFG)监测器,通过控制流、数据流图及原始代码差异分析结构安全回归。实验表明,IFG监测器能降低攻击错过率,还可同步作为部署前保障,为组织实现部署安全民主化提供实用途径。

Comments Accepted in ICML 2026 Workshops: AI4GOOD and AIWILD

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15241 2026-07-17 cs.CL cs.CV 新提交 79%

Beyond the Leaderboard: Design Lessons for Trustworthy Multimodal VQA

超越排行榜:可信多模态视觉问答的设计经验教训

Sushant Gautam, Vajira Thambawita, Michael A. Riegler, Pål Halvorsen, Steven A. Hicks

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL

AI总结 以MediaEval Medico 2025为案例,分析九个多模态问答系统,发现预训练主干的参数高效适应虽有挑战性能,但答案提升未转化为完整临床推理,结构化推理等方法更可靠,结果促使多方面改进,支持可信多模态医疗保健人工智能。

Comments Accepted for presentation at the 39th IEEE International Symposium on Computer-Based Medical Systems (IEEE CBMS 2026) as a regular paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14543 2026-07-17 cs.RO cs.AI 新提交 79%

SafeRelBench: A Spatial-Relation-Aware Benchmark for Process-Level Safety in VLM-Driven Embodied Agents

SafeRelBench:用于VLM驱动的具身智能体过程级安全的空间关系感知基准测试

Huaigang Yang, Ya Li, Min Ren, Bo Dai, Zhenliang Zhang, Zhaofeng He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,字节跳动公司)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 研究VLM驱动具身智能体的过程级安全问题,引入SAFERELBENCH基准测试,含507个样本。评估七个智能体发现任务成功与安全合规有差距,该基准明确测试行动前安全条件,凸显空间关系在安全评估中的核心地位。

Comments Preprint. 10 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14103 2026-07-17 cs.CL cs.MA 新提交 79%

Latent Communication Between Language Model Agents: Channels, Alignment, and the Limits of Text

语言模型智能体之间的潜在通信:通道、对齐方式及文本的局限性

Markus Wenzel

机构 * Constructor University(康斯坦丁大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 研究大语言模型智能体间潜在通信,构建三个通信通道,通过稀疏自编码器分析信息损失,经实验发现文本通信会丢失信息,潜在通道在跨语言概念任务上与文本通道匹配但未超,得出丢失特征多编码表面形式的结论,还指出明确潜在通信优势需更深入任务及分析框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15058 2026-07-17 cs.CV cs.RO 新提交 78%

SUFLECA: Scaling Up Feature Learning for CAD-to-image Alignment

SUFLECA:扩大用于CAD到图像对齐的特征学习

Saad Ejaz, Miguel Fernandez-Cortizas, Javier Civera, Holger Voos, Jose Luis Sanchez-Lopez

机构 * Automation and Robotics Research Group, Interdisciplinary Centre for Security, Reliability, and Trust (SnT), University of Luxembourg(自动化与机器人研究组,卢森堡大学跨学科安全、可靠性与信任中心(SnT)) Faculty of Science, Technology, and Medicine, University of Luxembourg(卢森堡大学科学、技术与医学学院) I3A, Universidad de Zaragoza(萨拉戈萨大学I3A)

专题命中 安全评测 :alignment(title,abstract)

AI总结 研究旨在解决CAD到图像对齐问题,提出弱监督框架SUFLECA。通过归一化物体坐标监督扩大特征学习,结合几何一致匹配算法,能准确快速对齐,在ScanNet25k上取得优异成绩,优于零样本基线并超越全监督方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14510 2026-07-17 cs.AI 新提交 70%

VLT: A Vision-Language-Time Series Multimodal Foundation Model for Industrial Intelligence

VLT:用于工业智能的视觉-语言-时间序列多模态基础模型

Haiteng Wang, Jingheng Yan, Xiaokang Wang, Lei Ren

机构 * School of Automation Science and Electrical Engineering, Beihang University(北京航空航天大学自动化科学与电气工程学院) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院) State Key Laboratory of Intelligent Manufacturing System Technology(智能制造系统技术国家重点实验室) School of Computer Science and Artificial Intelligence, Zhengzhou University(郑州大学计算机科学与人工智能学院)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 针对工业时间序列单模态建模局限及连接时间序列与文本语义的挑战,提出VLT多模态基础模型,通过设计Time-MoE等机制联合建模多种模态,经实验验证其在多种复杂设置下优于现有方法,提升了鲁棒性和泛化能力。

Comments 18 pages, 13 figures, and 13 tables, including supplementary material. Haiteng Wang and Jingheng Yan contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14315 2026-07-17 cs.LG cs.AI 新提交 62%

Towards a Unified Multidimensional Explainability Metric: Evaluating Trustworthiness in AI Models

迈向统一的多维可解释性度量:评估人工智能模型中的可信度

Georgios Makridis, Georgios Fatouros, Athanasios Kiourtis, Dimitrios Kotios, Vasileios Koukos, Dimosthenis Kyriazis, Jonh Soldatos

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出全面框架评估多种XAI方法在多数据集和模型上的可解释性,侧重保真度、简单性和稳定性,利用基准实验构建知识库以估计未见数据集和模型的可解释性分数,为评估比较XAI方法提供工具,助力可信AI系统发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14111 2026-07-17 cs.CL cs.AI 新提交 62%

Introspection Fine-Tuning (IFT): Training Small LLMs to Introspect

内省微调(IFT):训练小型语言模型进行内省

Ely Hahami, Ishaan Sinha, Lavik Jain

机构 * Harvard College(哈佛大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究小型语言模型内省能力,提出句子定位和强度比较评估范式,发现小模型有内省能力且随规模提升,引入内省微调(IFT),能提高模型内省能力,还表明内省能力可训练,对AI透明度和对齐有意义。

Comments 9 pages (excluding appendices / references), 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14336 2026-07-17 cs.SE cs.AI 新提交 61%

Copy-on-Write Scoring: Application-Specific Agent Evaluations

写时复制评分:特定应用代理评估

Joanna Roy, Sven Hoelzel

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI;safety(comments)

AI总结 研究如何在软件系统中可靠部署基于大语言模型的代理,提出写时复制(CoW)评分框架,利用PostgreSQL级机制在应用环境中直接评估代理操作,能低成本评估迭代,在开源平台上验证了该框架的有效性。

Comments 15 pages, 11 figures, accepted at ICML 2026 Second Workshop on Agents in the Wild: Safety, Security, and Beyond

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15202 2026-07-17 cs.AI cs.HC cs.MA cs.MM 新提交 57%

Self-Evolving Human-Centered Framework for Explainable Depression Symptom Annotation

用于可解释抑郁症症状标注的自我进化以人为中心框架

Hoang-Loc Cao, Van Pham, Truong Thanh Hung Nguyen, Phuc Truong Loc Nguyen, Phuc Ho, Veronica Whitford, Hung Cao

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 针对抑郁症标注质量瓶颈,提出结合大语言模型辅助与专家验证的自我进化标注框架,分三阶段运行,采用双记忆架构,能提高标注一致性和可解释性,减少人工修订,还输出多种信息实现可审计性。

Comments Accepted at IEEE International Conference on Omni-Layer Intelligent Systems (COINS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15051 2026-07-17 cs.CY 新提交 57%

SCITUS: A Multi-Jurisdictional Framework for Adapting NIST AI RMF to the Canadian Regulatory Context

SCITUS:将美国国家标准与技术研究院人工智能风险管理框架(NIST AI RMF)适配到加拿大监管环境的多辖区框架

Mohammad Etemad

专题命中 安全评测 :trustworthy(abstract);分类 cs.CY

AI总结 针对加拿大人工智能监管碎片化问题,提出SCITUS框架,它能将NIST AI RMF 1.0同时适配到加联邦和省级法规,整合多种要素,通过多场景展示适用性,为多辖区合规提供了更优模式及可复制模型。

Comments 74 pages, 1 figure. SCITUS Framework v2.0 (July 2026). Framework documentation: https://scitus.ca/scitus-framework

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14791 2026-07-17 cs.AI 新提交 57%

Transcoders for Investigating Deception in Language Models

用于研究语言模型中欺骗行为的转码器

Darius Lim, Nathan Leow, Xin Wei Chia

机构 * Home Team Science & Technology Agency (HTX)(新加坡内政部科技局)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 研究用转码器分析语言模型欺骗行为,通过预训练转码器的Qwen3 - 4B模型构建归因图,经特征引导和电路分析识别相关特征字典,发现欺骗源于模型内部机制,凸显转码器在监测及检测语言模型安全漏洞方面的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14591 2026-07-17 cs.CL 新提交 57%

How Well Does AI-Generated Feedback Work? Intrinsic and Extrinsic Evaluation across more than 20,000 EFL Essay Drafts

人工智能生成的反馈效果如何?对20000多篇外语作文草稿的内在和外在评估

Steven Coyne, Diana Galvan-Sosa, Ryan Spring, Machi Shimmei, Michael Zock, Keisuke Sakaguchi, Kentaro Inui

机构 * Tohoku University(东北大学) RIKEN(理化学研究所) ALTA Institute, Computer Laboratory, University of Cambridge(剑桥大学ALTA研究所,计算机实验室) CNRS, LIS, Aix-Marseille University(法国国家科学研究中心,艾克斯-马赛大学语言信息处理实验室) MBZUAI(Mohamed bin Zayed大学人工智能学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 研究外语写作中人工智能生成的书面纠正性反馈效果,通过大学外语班级近2000名学生的超20000篇草稿,从教师内在评估和学生外在反馈两角度评估,发现传统专家评估与学生反馈一致性低,强调以学习者为中心评估框架的重要性。

Comments Pre-review version of DOI https://doi.org/10.1007/978-3-032-29788-4_35, presented at AIED 2026 Late Breaking Results. Readers are encouraged to refer to the published version

Journal ref AIED CCIS 3031 (2026) 247-253

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14479 2026-07-17 cs.CY 新提交 57%

BioTIER: A Refusal Benchmark for Targeted Biological Risk Mitigation

BioTIER:用于针对性生物风险缓解的拒绝基准

Eleanor M. Marshall, Pedro Medeiros, Peter Peneder, Nelly Mak, Jacob Kaffey, Faith Rovenolt, Mac Walker, Seth Donoughe, Jasper Götting

专题命中 安全评测 :safety(abstract);分类 cs.CY

AI总结 针对大语言模型生物滥用问题,引入BioTIER基准,将生物内容分三个风险集,含542个专家策划提示及元数据,可隔离控制灾难性风险信息,确保生物科学知识获取,助力针对性生物风险缓解。

Comments 52 pages, 9 main figures, 9 supplementary figures, 1 main table, 9 supplementary tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14400 2026-07-17 cs.CL cs.IR 新提交 57%

DS@GT ARC at LongEval: Citation Integrity and Factual Grounding in Scientific QA

DS@GT ARC参加LongEval:科学问答中的引用完整性和事实基础

Brandon Michaels, Brendon Johnson

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 研究在科学问答中传统评估指标与引用完整性的差异,通过Corrective RAG和CiteFix构建纠正管道,对比前沿模型,发现前沿模型答案生成不依赖文档上下文,而纠正管道提升了引用忠实度和答案基础,提出需奖励严格答案基础的评估指标。

Comments 12 pages, 4 figures. Accepted to the CLEF 2026 LongEval Lab Working Notes

详情

展开后加载摘要…

URL PDF HTML 收藏