arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-29 至 2026-06-29 共收录 51 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 5 篇

2606.27578 2026-06-29 cs.LG cs.AI 新提交 90%

PEBS: Per-rater Empirical-Bayes Shrinkage for RLHF Reward-Model Calibration

PEBS: 用于RLHF奖励模型校准的每评分者经验贝叶斯收缩

Arnav Raj

专题命中 偏好对齐 :RLHF(title,title_cn);分类 cs.AI、cs.LG;alignment(comments)

AI总结 针对RLHF中奖励模型忽略评分者个体差异的问题,提出PEBS方法,对每个评分者拟合仿射校准器并应用经验贝叶斯收缩,在PRISM和PluriHarms数据集上分别降低RMSE 8.58%和9.66%。

Comments Accepted at the ICML 2026 Workshop on Pluralistic Alignment. Code: https://github.com/deadsmash07/pebs-pluralistic

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27608 2026-06-29 cs.CV cs.LG 新提交 77%

Qwen-Image-2.0-RL Technical Report

Qwen-Image-2.0-RL 技术报告

Yixian Xu, Kaiyuan Gao, Yuxiang Chen, Yilei Chen, Zecheng Tang, Zihao Liu, Zikai Zhou, Deqing Li, Hao Meng, Kuan Cao, Jiahao Li, Jie Zhang, Liang Peng, Lihan Jiang, Ningyuan Tang, Shengming Yin, Tianhe Wu, Xiaoyue Chen, Yan Shu, Yanran Zhang, Yi Wang, Yu Wu, Yujia Wu, Zekai Zhang, Zhendong Wang, Xiao Xu, Kun Yan, Chenfei Wu

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.LG

AI总结 提出基于强化学习与在线蒸馏的后训练流程,通过复合奖励模型和GRPO框架提升扩散模型的视觉质量与指令遵循能力,在多个基准上取得显著提升。

Comments 16 pages, 6 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26530 2026-06-29 cs.CL cs.AI 新提交 62%

DiARC: Distinguishing Positive and Negative Samples Helps Improving ARC-like Reasoning Ability of Large Language Models

DiARC:区分正负样本有助于提升大型语言模型的类ARC推理能力

Yuxuan Yang, Feiyang Li, Yile Wang

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机与软件学院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出DiARC方法,通过构建偏好对(正负样本)来提升大型语言模型在类ARC任务上的推理能力,实验表明该方法在多个基准上持续改进基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28294 2026-06-29 cs.LG cs.MA 新提交 57%

Democratic ICAI: Debating Our Way to Steering Principles from Preferences

民主ICAI:通过辩论从偏好中推导指导原则

Kevin Kingslin, Anish Natekar, Ashutosh Ranjan, Vivek Srivastava, Savita Bhat, Shirish Karande

机构 * TCS Research(TCS研究)

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

AI总结 提出Democratic ICAI方法,通过结构化角色辩论收集多元理由,从偏好中提取更全面的指导原则,提升偏好预测准确性。

Comments Accepeted to the ICLR 2026 HCAIR Workshop, 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07533 2026-06-29 cs.AI 版本更新 57%

Joint Reward Modeling: Internalizing Chain-of-Thought for Efficient Visual Reward Models

联合奖励建模:将思维链内化以实现高效的视觉奖励模型

Yankai Yang, Yancheng Long, Hongyang Wei, Wei Chen, Tianke Zhang, Kaiyu Jiang, Haonan Fan, Changyi Liu, Jiankang Chen, Kaiyu Tang, Bin Wen, Fan Yang, Tingting Gao, Han Li, Shuo Yang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Kuaishou Technology(快手科技)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 提出联合奖励建模(JRM),通过共享视觉-语言骨干联合优化偏好学习和语言建模,将生成模型的语义推理能力内化到判别表示中,实现快速准确评估,在MMRB2和EditReward-Bench上取得最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 7 篇

2601.17642 2026-06-29 cs.AI 版本更新 83%

Health-ORSC-Bench: A Benchmark for Measuring Over-Refusal and Safety Completion in Health Context

Health-ORSC-Bench:衡量健康领域过度拒绝与安全完成的基准

Zhihao Zhang, Liting Huang, Guanghao Wu, Preslav Nakov, Heng Ji, Usman Naseem

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 针对大语言模型在健康场景中过度拒绝良性查询或对有害查询不安全遵从的问题,提出Health-ORSC-Bench基准,通过31,920个边界提示评估模型在意图模糊下的过度拒绝与安全完成质量,揭示安全优化模型过度拒绝率达80%。

Comments Accepted by ACL'26 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27709 2026-06-29 cs.CL cs.AI 新提交 79%

Low-Agreeableness Persona Conditioning for Safe LLM Fine-Tuning

低宜人性人格条件化用于安全的大语言模型微调

Austin MY Cheung, Yi Yang

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 针对温暖微调降低大语言模型安全性的问题,提出基于低宜人性人格的改写流水线,在保持对话温暖的同时降低越狱成功率与有害输出率。

Comments 9 pages, 8 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27379 2026-06-29 cs.CL cs.AI cs.LG 新提交 75%

Position: The Term "Machine Unlearning" Is Overused in LLMs

立场:术语“机器遗忘”在大型语言模型中被过度使用

Sangyeon Yoon, Yeachan Jun, Albert No

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文主张机器遗忘应限于数据集定义的删除,而许多标为“遗忘”的任务(如拒绝有害请求、实体/知识移除)实为不同目标,需不同术语和基线,并指出术语混淆导致指标误用。

Comments 13 pages; ICML 2026 Position Paper Track. Sangyeon Yoon and Yeachan Jun contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28270 2026-06-29 cs.AI cs.MA 新提交 57%

Agent-Native Immune System: Architecture, Taxonomy, and Engineering

智能体原生免疫系统:架构、分类与工程

Bo Shen, Lifeng Chang, Tianyuan Wei, Yunpeng Li, Feng Shi, Yichen Han, Peijie Gao, Shiyi Kuang, Xin Chang, Dehui Li

机构 * Novo Ordo for AI

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 提出智能体原生免疫系统(ANIS),一种嵌入智能体认知循环的生物启发式内生防御架构,通过六层免疫塔、统一病毒疫苗分类和元认知自动化骨干实现运行时动态防护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27944 2026-06-29 cs.MM cs.AI cs.CR 新提交 57%

It Lied to a Doctor to Buy Poison Ingredients: Quantifying Real-World Misuse of Phone-use Agents

它向医生撒谎购买毒药成分:量化手机使用代理的现实世界滥用

Yiming Sun, Chen Chen, Zifan Zhou, Mi Zhang

机构 * Fudan University(复旦大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 研究手机使用代理在真实设备与商业应用中的恶意滥用,发现主流模型拒绝率低、任务完成率高,甚至能欺骗医生获取毒药前体,揭示安全意识-执行差距。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22873 2026-06-29 cs.CV cs.CL 新提交 57%

SingGuard: A Policy-Adaptive Multimodal LLM Guardrail with Dynamic Reasoning

SingGuard: 一种策略自适应的多模态大语言模型护栏,具有动态推理能力

SingGuard Team

机构 * AI Security Lab, Ant Group(蚂蚁集团AI安全实验室)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 提出SingGuard,一种策略自适应的多模态护栏模型,通过将策略作为运行时输入,支持快速、混合和慢速推理模式,实现动态规则下的安全评估,在多个基准上取得最优F1。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26199 2026-06-29 cs.CR 新提交 50%

MIRAGE: Protecting against Malicious Image Editing via False Moderation

MIRAGE: 通过虚假审核保护图像免受恶意编辑

Anshul Nasery, Ramnath Kumar, Cho-Jui Hsieh, Sewoong Oh

专题命中 安全训练 :safety(abstract)

AI总结 提出MIRAGE方法,通过对抗性扰动使审核分类器将图像标记为违规,从而阻止AI图像编辑,无需模型权重或提示,在商业API上成功率超88%。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 3 篇

2606.28153 2026-06-29 cs.CR cs.AI 新提交 85%

Robust Harmful Features Under Jailbreak Attacks: Mechanistic Evidence from Attention Head Specialization in Large Language Models

越狱攻击下的鲁棒有害特征:来自大型语言模型中注意力头特化的机制证据

Yanchen Yin, Dongqi Han, Linghui Li

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI

AI总结 通过分析注意力头特化,发现越狱攻击通过抑制早期层的对抗妥协头(ACHs)绕过安全对齐,而中间层的安全对齐头(SAHs)保持鲁棒激活,揭示了鲁棒有害特征现象,并利用这些持久激活实现无需训练的检测。

Comments 33 pages, 19 figures. Accepted at ICML 2026 as an Oral presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10179 2026-06-29 cs.CV cs.AI 版本更新 85%

When the Prompt Becomes Visual: Vision-Centric Jailbreak Attacks for Large Image Editing Models

当提示变为视觉:面向大型图像编辑模型的以视觉为中心的越狱攻击

Jiacheng Hou, Yining Sun, Ruochong Jin, Haochen Han, Fangming Liu, Wai Kin Victor Chan, Alex Jinpeng Wang

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 提出首个视觉到视觉的越狱攻击VJA,通过纯视觉输入传递恶意指令,并构建安全基准IESBench,在商业模型上攻击成功率高达80.9%,同时提出无需训练的内省多模态推理防御方法。

Comments Accepted for spotlight and oral presentation at ICML 2026 (Project: https://csu-jpg.github.io/vja.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10271 2026-06-29 cs.CR cs.AI 版本更新 77%

MetaBreak: Jailbreaking Online LLM Services via Special Token Manipulation

MetaBreak: 通过特殊标记操纵越狱在线LLM服务

Wentian Zhu, Zhen Xiang, Wei Niu, Le Guan

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 提出利用特殊标记构造攻击原语,绕过LLM安全对齐和内容审核,并发现防御困难,实验显示MetaBreak在内容审核下优于现有方法。

Comments Accepted version. Revised to match the version accepted to the 2026 IEEE Symposium on Security and Privacy (SP); added publication information and DOI

Journal ref Proceedings of the 2026 IEEE Symposium on Security and Privacy (SP), pp. 98-117, IEEE Computer Society, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 3 篇

2606.27567 2026-06-29 cs.CR cs.AI cs.LG 新提交 73%

On the Inseparability of Instructions and Data in Shared-Embedding Sequence Models

论共享嵌入序列模型中指令与数据的不可分离性

Dewank Pant, Shruti Lohani, Avijit Kumar

机构 * Independent Researcher(独立研究员)

专题命中 提示注入 :alignment(abstract);prompt injection(abstract);分类 cs.AI、cs.LG

AI总结 本文证明在共享嵌入架构中,由于缺乏强制控制-数据分离,完美防御提示注入在数学上是不可能的,并提出了语义忠实控制(SFC)的概念,通过三个理论结果揭示了其根本原因,类比冯·诺依曼架构的代码-数据混淆问题。

Comments 18 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25836 2026-06-29 cs.AI 新提交 57%

AI Snitches Get Glitches: Towards Evading Agentic Surveillance

AI告密者出故障:走向规避智能体监控

Hyejun Jeong, Dzung Pham, Amir Houmansadr, Eugene Bagdasarian

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出智能体监控问题,创建SurveilBench数据集评估模型监控能力,并开发三种规避技术(隐藏、欺骗、诱导过度升级)以保护用户。

Comments The code and Demo are available at https://aisec.cs.umass.edu/demo/ai-snitches-get-stitches/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21233 2026-06-29 cs.AI 版本更新 57%

Just Ask: Curious Code Agents Reveal System Prompts in Frontier LLMs

Just Ask: 好奇的代码代理揭示前沿大语言模型中的系统提示

Xiang Zheng, Yutao Wu, Hanxun Huang, Yige Li, Xingjun Ma, Bo Li, Yu-Gang Jiang, Cong Wang

专题命中 提示注入 :safety(abstract);分类 cs.AI

AI总结 提出JustAsk框架,利用代码代理的自主交互能力,通过在线探索策略自动提取大语言模型的隐藏系统提示,揭示了系统提示作为新兴安全漏洞。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 2 篇

2510.16492 2026-06-29 cs.CL 版本更新 79%

Check Yourself Before You Wreck Yourself: Selectively Quitting Improves LLM Agent Safety

在自毁之前检查自己:选择性退出提升LLM智能体安全性

Vamshi Krishna Bonagiri, Ponnurangam Kumaragurum, Khanh Nguyen, Benjamin Plaut

专题命中 幻觉与事实性 :safety(title,abstract);分类 cs.CL

AI总结 提出让LLM智能体在不确定时主动退出,通过ToolEmu框架在12个模型上评估,发现该方法在几乎不降低有用性的情况下显著提升安全性。

Comments Reliable ML and Regulatable ML workshops, Neurips 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02896 2026-06-29 cs.LG 版本更新 70%

Bridging Mechanistic Interpretability and Prompt Engineering with Gradient Ascent for Interpretable Persona Control

通过梯度上升实现可解释人格控制与提示工程的桥梁

Harshvardhan Saini, Yiming Tang, Dianbo Liu

机构 * Department of Computer Science(计算机科学系) Indian Institute of Technology (ISM), Dhanbad(印度理工学院(ISM),丹巴德) National University of Singapore(新加坡国立大学) CIFAR Fellow(CIFAR研究员)

专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.LG

AI总结 本文提出RESGA和SAEGA方法,利用梯度上升优化随机初始化提示,以实现与识别的人格方向更一致的表示,有效控制LLM中的人格行为。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 安全评测 20 篇

2606.25034 2026-06-29 cs.CV cs.AI 新提交 89%

Yuvion VL: A Multimodal Foundation Model for Adversarial Content and AI Safety

Yuvion VL:面向对抗性内容和AI安全的多模态基础模型

Shikai Qiu, Xiaowen Xu, Benlei Cui, Ting Ma, Xiufeng Huang, Wenjing Jiang, Shaoxuan He, Haolei Xu, Chunyang Chai, Yujian Li, Yiliang Zhang, Guanghui Wang, Ziheng Wang, Ziwen Xu, Zhaoyu Fan, Jinhao Chen, Ruijie Jian, Hongxing Li, Chuxi Xiao, Xinyue Chen, Wenxuan Liu, Libin Dong, Yupeng Cao, Xiaoqian Xia, Jing Wang, Zhe Jiang, Zhenan Ye, Guang Yang, Bin Liu, Wei Peng, Ziqiang Zhu, Meihui Lian, Kaiwen Lv Kacuila, Haidong Ding, Dongjie Zhang, Yangfan Zhou, Bingyu Zhu, Yan Wang, Hai Zhao, Xuan Jin, Wei Zhao, Pengfei Sun, Huiming Zhang, Wei Wang, Xipeng Cao, Jialun Chen, Xiao Chen, Shaola Ren, Yunqing Hu, Bin Li, Chengwen Yao, Meng Huang, Xianfeng Li, Bin Tang, Chao Liu, Hui Xue, Longtao Huang, Haiwen Hong

机构 * Alibaba Security AGI Lab(阿里巴巴安全AGI实验室)

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 提出Yuvion VL系列多模态大语言模型,通过对抗性感知数据合成、三阶段训练和混淆对比微调,在内容和AI安全任务上达到行业领先性能,同时保持通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27632 2026-06-29 cs.CL 新提交 88%

Yuvion LLM: An Adversarially-Aware Large Language Model for Content And AI Safety

Yuvion LLM:一种面向内容和AI安全的对抗感知大语言模型

Ting Ma, Xiufeng Huang, Benlei Cui, Xiaowen Xu, Shikai Qiu, Ruijie Jian, Hongxing Li, Guanghui Wang, Longtao Huang, Haiwen Hong, Haolei Xu, Wenjing Jiang, Ziwen Xu, Zhaoyu Fan, Shaoxuan He, Chuxi Xiao, Yujian Li, Xinyue Chen, Chunyang Chai, Wenxuan Liu, Ziheng Wang, Dongjie Zhang, Yangfan Zhou, Libin Dong, Yupeng Cao, Xiaoqian Xia, Jing Wang, Zhe Jiang, Zhenan Ye, Guang Yang, Bin Liu, Wei Peng, Ziqiang Zhu, Meihui Lian, Kaiwen Lv Kacuila, Haidong Ding, Bingyu Zhu, Yan Wang, Hai Zhao, Xuan Jin, Wei Zhao, Pengfei Sun, Wei Wang, Huiming Zhang, Bin Li, Hui Xue

机构 * Alibaba Security AGI Lab(阿里巴巴安全AGI实验室)

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.CL

AI总结 针对大语言模型在对抗性攻击下的安全脆弱性,提出Yuvion LLM,通过对抗感知数据构建、知识增强预训练及多任务安全后训练,在安全基准和对抗鲁棒性上优于GPT-5.4等更大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23686 2026-06-29 cs.RO 新提交 87%

LIBERO-Safety: A Comprehensive Benchmark for Physical and Semantic Safety in Vision-Language-Action Models

LIBERO-Safety:视觉-语言-动作模型中物理与语义安全的综合基准

Rongxu Cui, Zongzheng Zhang, Jingrui Pang, Haohan Chi, Jinbang Guo, Saining Zhang, Shaoxuan Xie, Xin Jin, Yao Mu, Jiaolong Yang, Guocai Yao, Xianyuan Zhan, Ya-Qin Zhang, Hao Zhao

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Beijing Academy of Artificial Intelligence (BAAI)(北京智源人工智能研究院) Beihang University(北京航空航天大学) Eastern Institute of Technology, Ningbo(宁波东方理工大学) Shanghai Jiao Tong University(上海交通大学) Microsoft Research Asia (MSRA)(微软亚洲研究院)

专题命中 安全评测 :safety(title,title_cn)

AI总结 针对视觉-语言-动作模型操作安全未验证的问题,提出参数化安全基准和关键帧驱动数据生成流水线,构建大规模无碰撞数据集,系统评估八种模型,揭示泛化-安全张力。

Comments Accepted by ECCV 2026, Project Page: https://libero-safety.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11229 2026-06-29 stat.ML cs.LG 版本更新 74%

Trustworthy Predictive Distributions for Tail Events with Semiparametric Diagnostic Transport Maps

面向尾部事件的可信预测分布:基于半参数诊断传输图

Elizabeth Cucuzzella, Rafael Izbicki, Ann B. Lee

机构 * Department of Statistics and Data Science, Carnegie Mellon University(统计与数据科学系,卡内基梅隆大学) Department of Statistics, Federal University of Sao Carlos(统计系,圣卡洛斯联邦大学)

专题命中 安全评测 :trustworthy(title);分类 cs.LG

AI总结 针对预测分布在尾部事件中局部校准不足的问题,提出半参数局部摊销诊断与重塑(LADaR)框架,通过非参数回归构建诊断传输图,校正尾部概率,生成可解释且鲁棒的预测分布,在热带气旋强度预测中验证有效性。

Comments 29 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16150 2026-06-29 cs.CR cs.AI cs.CL 版本更新 73%

PRISON: Unmasking the Criminal Potential of Large Language Models

PRISON:揭示大型语言模型的犯罪潜力

Xinyi Wu, Geng Hong, Pei Chen, Yueyue Chen, Xudong Pan, Min Yang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 提出PRISON框架,通过五个特质量化LLMs的犯罪潜力,发现最先进模型常表现出犯罪倾向,且检测欺骗行为准确率仅44%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28077 2026-06-29 cs.CV 新提交 71%

TextDS: Parameter-Efficient Representation Alignment for Scene Text Detection under Distribution Shifts

TextDS: 分布偏移下场景文本检测的参数高效表示对齐

Boyuan Chen, Zichen Dang, Chuang Yang, Lap-Pui Chau, Yi Wang

机构 * School of Electrical Engineering, Xi’an Jiaotong University(西安交通大学电气工程学院) Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(香港理工大学电机及电子工程学系)

专题命中 安全评测 :alignment(title)

AI总结 提出TextDS框架,通过视觉基础模型、逐步LoRA适应和公共子空间融合,仅用4.9M参数实现跨域和退化条件下的鲁棒场景文本检测。

Comments Accepted by ECCV 2026. Project page: https://github.com/ZChenDang/TextDS

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27619 2026-06-29 cs.AI cs.CL cs.HC cs.IR cs.LG 新提交 67%

DysLexLens: A Low-Resource LLM Framework for Analysing Dyslexic Learners Insights from Online Forums

DysLexLens:面向低资源场景的LLM框架,用于分析在线论坛中阅读障碍学习者的见解

Dana Rezazadegan, Atie Kia, Phongpadid Nandavong, Dominique Carlon, Jeremy Nguyen, Abhik Banerjee, James Marshall, Anthony McCosker, Yong-Bin Kang

机构 * Swinburne University of Technology(斯威本科技大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出DysLexLens框架,通过字典过滤、知识图谱推理和评估机制,从低资源论坛数据中分析阅读障碍学习者对AI工具的使用体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27973 2026-06-29 cs.CL cs.AI 新提交 62%

From Black-Box to Clinical Insight: A Multi-Stage Explainable Framework for Speech-Based Cognitive Impairment Detection

从黑盒到临床洞察:用于语音认知障碍检测的多阶段可解释框架

Yasaman Haghbin, Sina Rashidi, Ali Zolnour, Fatemeh Taherinezhad, Ali Fartoot, Hossein Azadmaleki, James M Noble, Maryam Dadkhah, Maryam Zolnoori

机构 * Independent Researcher(独立研究者) Columbia University(哥伦比亚大学) Chalmers University of Technology(查尔姆斯理工大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出多阶段可解释框架,结合SHAP、语言学特征和LLM推理,将黑盒Transformer预测转化为临床叙事,在NIA PREPARE基准上F1=72.11%,医生评估显示与患者认知特征高度一致,SUS评分82/100。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27577 2026-06-29 cs.LG cs.AI 新提交 62%

hia-gat: A Heterogeneous Interaction-Aware Graph Attention Network For Frame-Level Traffic Conflict Risk Prediction On Freeways

hia-gat: 一种用于高速公路帧级交通冲突风险预测的异构交互感知图注意力网络

Mahshid Malazizi, Seyedmehdi Khaleghian, Mina Sartipi, Toru Hirano, Yunfei Xu, Hoang H. Nguyen

机构 * DENSO International America, Inc.(电装国际美国公司)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 提出HIA-GAT,一种双流异构图注意力网络,通过专用注意力路径处理纵向和横向交互,并利用冲突类型感知门控机制融合,在NGSIM数据集上实现最佳风险排名性能(AUC最高0.867),并提供可解释的车辆级冲突归因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28011 2026-06-29 eess.SY cs.LG cs.SY 新提交 57%

From Detection to Action: Using LLM Agents for Fault-Tolerant Control

从检测到行动:使用LLM智能体进行容错控制

Javal Vyas, Milapji Singh Gill, Artan Markaj, Felix Gehlhoff, Mehmet Mercangöz

机构 * Imperial College London(帝国理工学院伦敦校区) Helmut Schmidt University(海德堡-施密特大学)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 提出基于大语言模型智能体的主动容错控制框架,通过多智能体协作、数字孪生和知识图谱增强检索,生成并验证最小风险恢复路径,在离散和连续过程控制中实现从故障检测到有效纠正行动的闭环。

详情

展开后加载摘要…

URL PDF HTML 收藏