arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-29 至 2026-06-29 共收录 35 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 4 篇

2606.27578 2026-06-29 cs.LG cs.AI 新提交 90%

PEBS: Per-rater Empirical-Bayes Shrinkage for RLHF Reward-Model Calibration

PEBS: 用于RLHF奖励模型校准的每评分者经验贝叶斯收缩

Arnav Raj

专题命中 偏好对齐 :RLHF(title,title_cn);分类 cs.AI、cs.LG;alignment(comments)

AI总结 针对RLHF中奖励模型忽略评分者个体差异的问题,提出PEBS方法,对每个评分者拟合仿射校准器并应用经验贝叶斯收缩,在PRISM和PluriHarms数据集上分别降低RMSE 8.58%和9.66%。

Comments Accepted at the ICML 2026 Workshop on Pluralistic Alignment. Code: https://github.com/deadsmash07/pebs-pluralistic

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27608 2026-06-29 cs.CV cs.LG 新提交 77%

Qwen-Image-2.0-RL Technical Report

Qwen-Image-2.0-RL 技术报告

Yixian Xu, Kaiyuan Gao, Yuxiang Chen, Yilei Chen, Zecheng Tang, Zihao Liu, Zikai Zhou, Deqing Li, Hao Meng, Kuan Cao, Jiahao Li, Jie Zhang, Liang Peng, Lihan Jiang, Ningyuan Tang, Shengming Yin, Tianhe Wu, Xiaoyue Chen, Yan Shu, Yanran Zhang, Yi Wang, Yu Wu, Yujia Wu, Zekai Zhang, Zhendong Wang, Xiao Xu, Kun Yan, Chenfei Wu

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.LG

AI总结 提出基于强化学习与在线蒸馏的后训练流程,通过复合奖励模型和GRPO框架提升扩散模型的视觉质量与指令遵循能力,在多个基准上取得显著提升。

Comments 16 pages, 6 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26530 2026-06-29 cs.CL cs.AI 新提交 62%

DiARC: Distinguishing Positive and Negative Samples Helps Improving ARC-like Reasoning Ability of Large Language Models

DiARC:区分正负样本有助于提升大型语言模型的类ARC推理能力

Yuxuan Yang, Feiyang Li, Yile Wang

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机与软件学院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出DiARC方法,通过构建偏好对(正负样本)来提升大型语言模型在类ARC任务上的推理能力,实验表明该方法在多个基准上持续改进基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28294 2026-06-29 cs.LG cs.MA 新提交 57%

Democratic ICAI: Debating Our Way to Steering Principles from Preferences

民主ICAI:通过辩论从偏好中推导指导原则

Kevin Kingslin, Anish Natekar, Ashutosh Ranjan, Vivek Srivastava, Savita Bhat, Shirish Karande

机构 * TCS Research(TCS研究)

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

AI总结 提出Democratic ICAI方法,通过结构化角色辩论收集多元理由,从偏好中提取更全面的指导原则,提升偏好预测准确性。

Comments Accepeted to the ICLR 2026 HCAIR Workshop, 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 6 篇

2606.27709 2026-06-29 cs.CL cs.AI 新提交 79%

Low-Agreeableness Persona Conditioning for Safe LLM Fine-Tuning

低宜人性人格条件化用于安全的大语言模型微调

Austin MY Cheung, Yi Yang

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 针对温暖微调降低大语言模型安全性的问题,提出基于低宜人性人格的改写流水线,在保持对话温暖的同时降低越狱成功率与有害输出率。

Comments 9 pages, 8 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27379 2026-06-29 cs.CL cs.AI cs.LG 新提交 75%

Position: The Term "Machine Unlearning" Is Overused in LLMs

立场:术语“机器遗忘”在大型语言模型中被过度使用

Sangyeon Yoon, Yeachan Jun, Albert No

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文主张机器遗忘应限于数据集定义的删除,而许多标为“遗忘”的任务(如拒绝有害请求、实体/知识移除)实为不同目标,需不同术语和基线,并指出术语混淆导致指标误用。

Comments 13 pages; ICML 2026 Position Paper Track. Sangyeon Yoon and Yeachan Jun contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28270 2026-06-29 cs.AI cs.MA 新提交 57%

Agent-Native Immune System: Architecture, Taxonomy, and Engineering

智能体原生免疫系统:架构、分类与工程

Bo Shen, Lifeng Chang, Tianyuan Wei, Yunpeng Li, Feng Shi, Yichen Han, Peijie Gao, Shiyi Kuang, Xin Chang, Dehui Li

机构 * Novo Ordo for AI

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 提出智能体原生免疫系统(ANIS),一种嵌入智能体认知循环的生物启发式内生防御架构,通过六层免疫塔、统一病毒疫苗分类和元认知自动化骨干实现运行时动态防护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27944 2026-06-29 cs.MM cs.AI cs.CR 新提交 57%

It Lied to a Doctor to Buy Poison Ingredients: Quantifying Real-World Misuse of Phone-use Agents

它向医生撒谎购买毒药成分:量化手机使用代理的现实世界滥用

Yiming Sun, Chen Chen, Zifan Zhou, Mi Zhang

机构 * Fudan University(复旦大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 研究手机使用代理在真实设备与商业应用中的恶意滥用,发现主流模型拒绝率低、任务完成率高,甚至能欺骗医生获取毒药前体,揭示安全意识-执行差距。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22873 2026-06-29 cs.CV cs.CL 新提交 57%

SingGuard: A Policy-Adaptive Multimodal LLM Guardrail with Dynamic Reasoning

SingGuard: 一种策略自适应的多模态大语言模型护栏,具有动态推理能力

SingGuard Team

机构 * AI Security Lab, Ant Group(蚂蚁集团AI安全实验室)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 提出SingGuard,一种策略自适应的多模态护栏模型,通过将策略作为运行时输入,支持快速、混合和慢速推理模式,实现动态规则下的安全评估,在多个基准上取得最优F1。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26199 2026-06-29 cs.CR 新提交 50%

MIRAGE: Protecting against Malicious Image Editing via False Moderation

MIRAGE: 通过虚假审核保护图像免受恶意编辑

Anshul Nasery, Ramnath Kumar, Cho-Jui Hsieh, Sewoong Oh

专题命中 安全训练 :safety(abstract)

AI总结 提出MIRAGE方法,通过对抗性扰动使审核分类器将图像标记为违规,从而阻止AI图像编辑,无需模型权重或提示,在商业API上成功率超88%。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 1 篇

2606.28153 2026-06-29 cs.CR cs.AI 新提交 85%

Robust Harmful Features Under Jailbreak Attacks: Mechanistic Evidence from Attention Head Specialization in Large Language Models

越狱攻击下的鲁棒有害特征:来自大型语言模型中注意力头特化的机制证据

Yanchen Yin, Dongqi Han, Linghui Li

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI

AI总结 通过分析注意力头特化,发现越狱攻击通过抑制早期层的对抗妥协头(ACHs)绕过安全对齐,而中间层的安全对齐头(SAHs)保持鲁棒激活,揭示了鲁棒有害特征现象,并利用这些持久激活实现无需训练的检测。

Comments 33 pages, 19 figures. Accepted at ICML 2026 as an Oral presentation

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 2 篇

2606.27567 2026-06-29 cs.CR cs.AI cs.LG 新提交 73%

On the Inseparability of Instructions and Data in Shared-Embedding Sequence Models

论共享嵌入序列模型中指令与数据的不可分离性

Dewank Pant, Shruti Lohani, Avijit Kumar

机构 * Independent Researcher(独立研究员)

专题命中 提示注入 :alignment(abstract);prompt injection(abstract);分类 cs.AI、cs.LG

AI总结 本文证明在共享嵌入架构中,由于缺乏强制控制-数据分离,完美防御提示注入在数学上是不可能的,并提出了语义忠实控制(SFC)的概念,通过三个理论结果揭示了其根本原因,类比冯·诺依曼架构的代码-数据混淆问题。

Comments 18 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25836 2026-06-29 cs.AI 新提交 57%

AI Snitches Get Glitches: Towards Evading Agentic Surveillance

AI告密者出故障:走向规避智能体监控

Hyejun Jeong, Dzung Pham, Amir Houmansadr, Eugene Bagdasarian

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出智能体监控问题,创建SurveilBench数据集评估模型监控能力,并开发三种规避技术(隐藏、欺骗、诱导过度升级)以保护用户。

Comments The code and Demo are available at https://aisec.cs.umass.edu/demo/ai-snitches-get-stitches/

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 安全评测 14 篇

2606.25034 2026-06-29 cs.CV cs.AI 新提交 89%

Yuvion VL: A Multimodal Foundation Model for Adversarial Content and AI Safety

Yuvion VL:面向对抗性内容和AI安全的多模态基础模型

Shikai Qiu, Xiaowen Xu, Benlei Cui, Ting Ma, Xiufeng Huang, Wenjing Jiang, Shaoxuan He, Haolei Xu, Chunyang Chai, Yujian Li, Yiliang Zhang, Guanghui Wang, Ziheng Wang, Ziwen Xu, Zhaoyu Fan, Jinhao Chen, Ruijie Jian, Hongxing Li, Chuxi Xiao, Xinyue Chen, Wenxuan Liu, Libin Dong, Yupeng Cao, Xiaoqian Xia, Jing Wang, Zhe Jiang, Zhenan Ye, Guang Yang, Bin Liu, Wei Peng, Ziqiang Zhu, Meihui Lian, Kaiwen Lv Kacuila, Haidong Ding, Dongjie Zhang, Yangfan Zhou, Bingyu Zhu, Yan Wang, Hai Zhao, Xuan Jin, Wei Zhao, Pengfei Sun, Huiming Zhang, Wei Wang, Xipeng Cao, Jialun Chen, Xiao Chen, Shaola Ren, Yunqing Hu, Bin Li, Chengwen Yao, Meng Huang, Xianfeng Li, Bin Tang, Chao Liu, Hui Xue, Longtao Huang, Haiwen Hong

机构 * Alibaba Security AGI Lab(阿里巴巴安全AGI实验室)

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 提出Yuvion VL系列多模态大语言模型,通过对抗性感知数据合成、三阶段训练和混淆对比微调,在内容和AI安全任务上达到行业领先性能,同时保持通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27632 2026-06-29 cs.CL 新提交 88%

Yuvion LLM: An Adversarially-Aware Large Language Model for Content And AI Safety

Yuvion LLM:一种面向内容和AI安全的对抗感知大语言模型

Ting Ma, Xiufeng Huang, Benlei Cui, Xiaowen Xu, Shikai Qiu, Ruijie Jian, Hongxing Li, Guanghui Wang, Longtao Huang, Haiwen Hong, Haolei Xu, Wenjing Jiang, Ziwen Xu, Zhaoyu Fan, Shaoxuan He, Chuxi Xiao, Yujian Li, Xinyue Chen, Chunyang Chai, Wenxuan Liu, Ziheng Wang, Dongjie Zhang, Yangfan Zhou, Libin Dong, Yupeng Cao, Xiaoqian Xia, Jing Wang, Zhe Jiang, Zhenan Ye, Guang Yang, Bin Liu, Wei Peng, Ziqiang Zhu, Meihui Lian, Kaiwen Lv Kacuila, Haidong Ding, Bingyu Zhu, Yan Wang, Hai Zhao, Xuan Jin, Wei Zhao, Pengfei Sun, Wei Wang, Huiming Zhang, Bin Li, Hui Xue

机构 * Alibaba Security AGI Lab(阿里巴巴安全AGI实验室)

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.CL

AI总结 针对大语言模型在对抗性攻击下的安全脆弱性,提出Yuvion LLM,通过对抗感知数据构建、知识增强预训练及多任务安全后训练,在安全基准和对抗鲁棒性上优于GPT-5.4等更大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23686 2026-06-29 cs.RO 新提交 87%

LIBERO-Safety: A Comprehensive Benchmark for Physical and Semantic Safety in Vision-Language-Action Models

LIBERO-Safety:视觉-语言-动作模型中物理与语义安全的综合基准

Rongxu Cui, Zongzheng Zhang, Jingrui Pang, Haohan Chi, Jinbang Guo, Saining Zhang, Shaoxuan Xie, Xin Jin, Yao Mu, Jiaolong Yang, Guocai Yao, Xianyuan Zhan, Ya-Qin Zhang, Hao Zhao

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Beijing Academy of Artificial Intelligence (BAAI)(北京智源人工智能研究院) Beihang University(北京航空航天大学) Eastern Institute of Technology, Ningbo(宁波东方理工大学) Shanghai Jiao Tong University(上海交通大学) Microsoft Research Asia (MSRA)(微软亚洲研究院)

专题命中 安全评测 :safety(title,title_cn)

AI总结 针对视觉-语言-动作模型操作安全未验证的问题,提出参数化安全基准和关键帧驱动数据生成流水线,构建大规模无碰撞数据集,系统评估八种模型,揭示泛化-安全张力。

Comments Accepted by ECCV 2026, Project Page: https://libero-safety.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28077 2026-06-29 cs.CV 新提交 71%

TextDS: Parameter-Efficient Representation Alignment for Scene Text Detection under Distribution Shifts

TextDS: 分布偏移下场景文本检测的参数高效表示对齐

Boyuan Chen, Zichen Dang, Chuang Yang, Lap-Pui Chau, Yi Wang

机构 * School of Electrical Engineering, Xi’an Jiaotong University(西安交通大学电气工程学院) Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(香港理工大学电机及电子工程学系)

专题命中 安全评测 :alignment(title)

AI总结 提出TextDS框架,通过视觉基础模型、逐步LoRA适应和公共子空间融合,仅用4.9M参数实现跨域和退化条件下的鲁棒场景文本检测。

Comments Accepted by ECCV 2026. Project page: https://github.com/ZChenDang/TextDS

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27619 2026-06-29 cs.AI cs.CL cs.HC cs.IR cs.LG 新提交 67%

DysLexLens: A Low-Resource LLM Framework for Analysing Dyslexic Learners Insights from Online Forums

DysLexLens:面向低资源场景的LLM框架,用于分析在线论坛中阅读障碍学习者的见解

Dana Rezazadegan, Atie Kia, Phongpadid Nandavong, Dominique Carlon, Jeremy Nguyen, Abhik Banerjee, James Marshall, Anthony McCosker, Yong-Bin Kang

机构 * Swinburne University of Technology(斯威本科技大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出DysLexLens框架,通过字典过滤、知识图谱推理和评估机制,从低资源论坛数据中分析阅读障碍学习者对AI工具的使用体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27973 2026-06-29 cs.CL cs.AI 新提交 62%

From Black-Box to Clinical Insight: A Multi-Stage Explainable Framework for Speech-Based Cognitive Impairment Detection

从黑盒到临床洞察:用于语音认知障碍检测的多阶段可解释框架

Yasaman Haghbin, Sina Rashidi, Ali Zolnour, Fatemeh Taherinezhad, Ali Fartoot, Hossein Azadmaleki, James M Noble, Maryam Dadkhah, Maryam Zolnoori

机构 * Independent Researcher(独立研究者) Columbia University(哥伦比亚大学) Chalmers University of Technology(查尔姆斯理工大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出多阶段可解释框架,结合SHAP、语言学特征和LLM推理,将黑盒Transformer预测转化为临床叙事,在NIA PREPARE基准上F1=72.11%,医生评估显示与患者认知特征高度一致,SUS评分82/100。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27577 2026-06-29 cs.LG cs.AI 新提交 62%

hia-gat: A Heterogeneous Interaction-Aware Graph Attention Network For Frame-Level Traffic Conflict Risk Prediction On Freeways

hia-gat: 一种用于高速公路帧级交通冲突风险预测的异构交互感知图注意力网络

Mahshid Malazizi, Seyedmehdi Khaleghian, Mina Sartipi, Toru Hirano, Yunfei Xu, Hoang H. Nguyen

机构 * DENSO International America, Inc.(电装国际美国公司)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 提出HIA-GAT,一种双流异构图注意力网络,通过专用注意力路径处理纵向和横向交互,并利用冲突类型感知门控机制融合,在NGSIM数据集上实现最佳风险排名性能(AUC最高0.867),并提供可解释的车辆级冲突归因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28011 2026-06-29 eess.SY cs.LG cs.SY 新提交 57%

From Detection to Action: Using LLM Agents for Fault-Tolerant Control

从检测到行动:使用LLM智能体进行容错控制

Javal Vyas, Milapji Singh Gill, Artan Markaj, Felix Gehlhoff, Mehmet Mercangöz

机构 * Imperial College London(帝国理工学院伦敦校区) Helmut Schmidt University(海德堡-施密特大学)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 提出基于大语言模型智能体的主动容错控制框架,通过多智能体协作、数字孪生和知识图谱增强检索,生成并验证最小风险恢复路径,在离散和连续过程控制中实现从故障检测到有效纠正行动的闭环。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27757 2026-06-29 cs.AI 新提交 57%

Towards Reliable and Robust LLM Planning: Symbolic Feedback-Driven Iterative Self-Refinement Framework

迈向可靠稳健的LLM规划:符号反馈驱动的迭代自我精炼框架

Jiajing Zhang, Jiamei Jiang, Chenyang Zhang, Feifei Mo, Linjing Li, Daniel Zeng

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 提出符号反馈驱动的迭代自我精炼框架,通过自然语言提示、符号验证器和计划识别器增强LLM在长时域规划中的鲁棒性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27624 2026-06-29 cs.RO cs.LG 新提交 57%

Physics-Guided Robotic Radiation Source Localization along Arbitrary Measurement Paths in Unstructured Environments

物理引导的机器人辐射源定位:非结构化环境中沿任意测量路径

Hojoon Son, Kai Tan, Fan Zhang

机构 * George W. Woodruff School of Mechanical Engineering, Georgia Institute of Technology(乔治·W·伍德拉夫机械工程学院,佐治亚理工学院)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 提出基于物理信息机器学习(PIML)的框架,使机器人沿任意路径在未知环境中精确估计辐射源位置,避免接近源,并通过并行计算提高鲁棒性。

Comments 18 pages, 14 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27500 2026-06-29 cs.CV cs.CL 新提交 57%

Aloe-Vision: Robust Vision-Language Models for Healthcare

Aloe-Vision: 面向医疗保健的鲁棒视觉-语言模型

Jaume Guasch-Martí, Enrique Lopez-Cuena, Martín Suárez-Fernández, Jordi Bayarri-Planas, Anna Arias-Duart, Dario Garcia-Gasulla

机构 * Barcelona Supercomputing Center (BSC)(巴塞罗那超级计算中心(BSC))

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 提出Aloe-Vision系列医疗LVLM,通过大规模高质量多模态数据微调,在保持通用能力的同时提升医疗任务性能,并引入低污染基准CareQA-Vision,揭示当前模型在临床环境中的鲁棒性挑战。

Comments MIDL 2026

Journal ref Proceedings of Machine Learning Research, Vol. 315, pp. 2404-2426, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25651 2026-06-29 cs.CL 新提交 57%

MedGuards: Multi-Agent System for Reliable Medical Error Detection and Correction

MedGuards: 用于可靠医疗错误检测与纠正的多智能体系统

Congbo Ma, Hu Wang, Yichun Zhang, Farah E. Shamout

机构 * New York University Abu Dhabi(纽约大学阿布扎比分校) Khalifa University(哈利法大学) New York University(纽约大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 提出MedGuards框架,通过多智能体上下文学习与置信度引导仲裁机制,无需额外训练即可检测、定位和纠正医疗文本错误,并引入关键词优先纠正评分(KPCS)评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15708 2026-06-29 cs.AI 新提交 57%

Artificial Intelligence Index Report 2026

人工智能指数报告2026

Sha Sajadieh, Loredana Fattorini, Raymond Perrault, Yolanda Gil, Vanessa Parli, Lapo Santarlasci, Juan Pava, Nestor Maslej, Russ Altman, Erik Brynjolfsson, Carla Brodley, Jack Clark, Virginia Dignum, Vipin Kumar, James Landay, Terah Lyons, James Manyika, Juan Carlos Niebles, Yoav Shoham, Elham Tabassi, Russell Wald, Toby Walsh, Dan Weld

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本报告追踪AI在推理、安全及现实任务执行方面的测试进展,分析治理框架、评估方法与技术发展之间的差距,并新增AI在科学与医学领域的独立章节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27398 2026-06-29 cs.SE 新提交 50%

Implementing GenAI-Supported Learning in Software Engineering and Computer Science Education using Bloom's Taxonomy

使用布鲁姆分类法在软件工程和计算机科学教育中实现生成式AI支持的学习

Vahid Garousi, Zafar Jafarov, Aytan Mövsümova, Leyla Memmedova, Hüseyn Mirzayev

专题命中 安全评测 :alignment(abstract)

AI总结 本研究设计布鲁姆分类法对齐的生成式AI框架,通过多课程实验发现:学生认为生成式AI对高阶认知活动最有价值,明确指导能促进反思性使用,为负责任使用生成式AI提供了可扩展的教学框架。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. AI治理与伦理 1 篇

2606.26729 2026-06-29 cs.HC 新提交 50%

'A bit of chaos and madness': The AI Assessment Scale and the work of assessment reform

“一丝混乱与疯狂”:AI评估量表与评估改革工作

Mike Perkins, Darius Postma, Jasper Roe, Susan Sisay, Craig Holdcroft

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本研究通过越南和英国两所大学的焦点小组,探讨AI评估量表(AIAS)的实施经验,发现其能促进真实评估设计,但若脱离学习成果和学科背景可能沦为合规工具。

Comments V2: Corrections of errata, additional limitations

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 其他安全 7 篇

2606.27930 2026-06-29 cs.IR stat.AP 新提交 78%

An LLM-Powered Semantic Alignment Framework for Journal Recommendation

基于LLM的语义对齐框架用于期刊推荐

Yanglin Yan, Zicheng Xie, Tianchen Gao, Rui Pan, Hansheng Wang

专题命中 其他安全 :alignment(title,abstract)

AI总结 提出一种基于大语言模型的语义对齐框架,将期刊推荐转化为稿件内容与期刊范围描述之间的语义匹配问题,无需训练即可实现高效推荐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27731 2026-06-29 cs.CL cs.AI cs.CE cs.LG 新提交 78%

Enhancing Numerical Prediction in LLMs via Smooth MMD Alignment

通过平滑MMD对齐增强LLM中的数值预测

Zhuo Zuo, Li Yue, Wenhao Zheng, Chenpeng Wang, Xianggen Liu

机构 * College of Computer Science, Sichuan University, Chengdu, China(四川大学计算机学院,成都,中国)

专题命中 其他安全 :alignment(title);分类 cs.CL、cs.AI、cs.LG

AI总结 针对LLM在数值预测任务中精度不足的问题,提出平滑最大均值差异(SMMD)方法,通过数值令牌的距离核和图平滑对齐预测分布,在数学推理等任务中显著提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏