arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-14 至 2026-04-14 共收录 62 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 62 篇

2604.11033 2026-04-14 cs.CY 85%

An ontological approach to foster the convergence, interoperability and operationalization of frameworks for Trustworthy AI

一种本体方法用于促进可信人工智能框架的收敛、互操作性和可操作性

Salvatore Flavio Pileggi

专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);AI safety(abstract);分类 cs.CY

AI总结 本文提出AI伦理本体(AI-EO),利用语义技术促进可信人工智能框架的收敛、互操作性和可操作性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03402 2026-04-14 cs.AI cs.LG 84%

Risk Awareness Injection: Calibrating Vision-Language Models for Safety without Compromising Utility

风险感知注入:为安全校准视觉-语言模型而不牺牲实用性

Mengxuan Wang, Yuxin Chen, Gang Xu, Tao He, Hongjie Jiang, Ming Li

机构 * Shien-Ming Wu School of Intelligent Engineering, South China University of Technology(华南理工大学吴贤铭智能工程学院) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系) University of Electronic Science and Technology of China(电子科技大学)

专题命中 安全评测 :safety(title,abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RAI框架,通过增强不安全信号恢复视觉-语言模型的安全识别能力,同时保持语义完整性,实验显示有效降低攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07462 2026-04-14 cs.AI 83%

Do Machines Fail Like Humans? A Human-Centred Out-of-Distribution Spectrum for Mapping Error Alignment

机器是否像人类一样失败?一种以人为中心的分布外谱系用于映射误差对齐

Binxia Xu, Xiaoliang Luo, Luke Dickens, Robert M. Mok

专题命中 安全评测 :alignment(title,abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出以人为中心的分布外谱系,通过量化刺激偏离参考集的程度,揭示不同深度学习架构在近分布外和远分布外条件下的模型-人类对齐差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10800 2026-04-14 cs.SE cs.AI cs.CR cs.LG cs.PL 81%

Verify Before You Fix: Agentic Execution Grounding for Trustworthy Cross-Language Code Analysis

在修复前验证:面向可信跨语言代码分析的代理执行 grounding

Jugal Gajjar

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出统一的跨语言漏洞生命周期框架,通过LLM驱动的三个阶段:混合结构-语义检测、执行 grounding 的代理验证和验证-aware 的迭代修复,确保修复前有执行验证。框架利用uAST和图神经网络融合,实现高准确率的漏洞检测与跨语言修复。

Comments 20 pages (13 main + 7 appendices), 9 figures, 10 tables. Submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11174 2026-04-14 cs.RO cs.AI 79%

EmbodiedGovBench: A Benchmark for Governance, Recovery, and Upgrade Safety in Embodied Agent Systems

EmbodiedGovBench: 一种用于具身代理系统治理、恢复和升级安全性的基准

Xue Qin, Simin Luan, John See, Cong Yang, Zhijun Li

机构 * School of Software, Harbin Institute of Technology(哈尔滨工业大学软件学院) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) School of Mathematical and Computer Sciences, Heriot-Watt University, Malaysia Campus(赫瑞-瓦特大学马来西亚校区数学与计算机科学学院) School of Future Science and Engineering, Soochow University(苏州大学未来科学与工程学院)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出EmbodiedGovBench基准,用于评估具身代理系统的治理能力,包括可控性、政策边界、安全恢复和审计完整性等,填补了传统任务成功率指标的不足。

Comments 34 pages, 7 tables. Code: https://github.com/s20sc/embodied-gov-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10286 2026-04-14 cs.AI 79%

STARS: Skill-Triggered Audit for Request-Conditioned Invocation Safety in Agent Systems

STARS:基于技能触发的请求条件调用安全性审计

Guijia Zhang, Shu Yang, Xilin Gong, Di Wang

机构 * Shenzhen University(深圳大学) King Abdullah University of Science & Technology(阿卜杜拉国王科技大学) PRADA Lab(PRADA实验室) University of Georgia(佐治亚大学)

专题命中 安全评测 :safety(title);prompt injection(abstract);分类 cs.AI

AI总结 STARS通过结合静态能力先验、请求条件调用风险模型和校准风险融合策略,提升代理系统调用时的风险评估与优先级排序能力,优于静态筛查和上下文评分方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09682 2026-04-14 cs.NI cs.AI 79%

Decision-Theoretic Safety Assessment of Persona-Driven Multi-Agent Systems in O-RAN

基于决策理论的面向角色驱动的多智能体系统在O-RAN中的安全性评估

Zeinab Nezami, Syed Ali Raza Zaidi, Maryam Hafeez, Louis Powell, Vara Prasad Talari, Mallik Tatipamula

机构 * GSMA(全球移动通信系统协会) University of Leeds(利兹大学) AWS(亚马逊云服务) Ericsson(爱立信)

专题命中 安全评测 :safety(title);alignment(abstract);分类 cs.AI

AI总结 本文提出一种基于角色驱动的多智能体框架,通过角色行为规范影响五个专业智能体,结合决策理论构建三维评估框架,验证486种角色配置在O-RAN优化挑战中的性能与协调效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09606 2026-04-14 cs.AI cs.SE 79%

Evaluating Reliability Gaps in Large Language Model Safety via Repeated Prompt Sampling

通过重复提示采样评估大语言模型安全性的可靠性差距

Keita Broadwater

机构 * Independent Researcher(独立研究员)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出APST框架,通过重复采样相同提示在受控条件下揭示LLM潜在故障模式,量化不同模型和配置下的操作风险,展示浅层基准分数可能掩盖持续使用下的可靠性差异。

Comments 9 pages, 4 figures; accepted at the CCAI 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10733 2026-04-14 cs.CL cs.AI 79%

Too Nice to Tell the Truth: Quantifying Agreeableness-Driven Sycophancy in Role-Playing Language Models

太过讨好而不说实话:量化角色扮演语言模型中由顺从性驱动的阿谀奉承

Arya Shah, Deepali Mishra, Chaklam Silpasuwanchai

机构 * IIT Gandhinagar(印度理工学院甘地讷格尔分校) IIT Kanpur(印度理工学院坎普尔分校) Asian Institute of Technology(亚洲理工学院)

专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了角色扮演语言模型中顺从性对阿谀奉承行为的影响,通过13种模型验证了顺从性与阿谀奉承的正相关性,揭示了顺从性作为预测因素的重要性。

Comments 14 Pages, 5 Figures, 9 Tables, ACL Main Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11686 2026-04-14 cs.IR 78%

EA-Agent: A Structured Multi-Step Reasoning Agent for Entity Alignment

EA-Agent:一种用于实体对齐的结构化多步推理代理

Yixuan Nan, Xixun Lin, Yanmin Shang, Ge Zhang, Zheng Fang, Fang Fang, Yanan Cao

专题命中 安全评测 :alignment(title,abstract)

AI总结 本文提出EA-Agent,通过多步规划与执行将实体对齐转化为结构化推理过程,引入属性和关系三元组选择器提升效率,实验表明其在三个基准数据集上均优于现有方法。

Comments ACL 2026,Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09622 2026-04-14 cs.CY cs.AI cs.CL 75%

Explainability and Certification of AI-Generated Educational Assessments

人工智能生成教育评估的可解释性与认证

Antoun Yaacoub, Zainab Assaghir, Anuradha Kar

机构 * aivancity School for Technology, Business & Society(aivancity 科技、商业与社会学院) Lebanese University(黎巴嫩大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出了一种综合框架,用于解释和认证AI生成的评估项目,结合自我理性化、基于归因的分析和事后验证,以产生基于布卢姆和SOLO分类法的认知对齐证据。通过结构化的认证元数据模式,实现可审计的文档,满足新兴治理需求。

Comments Chapter to be published in a Springer special book "Emerging trends in Computer Science and Computer Engineering Education Book"

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10300 2026-04-14 cs.SE cs.AI 74%

From Helpful to Trustworthy: LLM Agents for Pair Programming

从有益到可信:用于配对编程的LLM代理

Ragib Shahariar Ayon

机构 * Texas State University(德克萨斯州立大学)

专题命中 安全评测 :trustworthy(title);分类 cs.AI

AI总结 本文研究多代理LLM配对编程,通过外部化意图和工具迭代验证,提升代码可靠性、可审计性和可维护性。

Comments Accepted in 34th ACM Joint European Software Engineering Conference and Symposium on the Foundations of Software Engineering (FSE Companion 26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11689 2026-04-14 cs.CV cs.RO 71%

LARY: A Latent Action Representation Yielding Benchmark for Generalizable Vision-to-Action Alignment

LARY:一种产生通用视觉到动作对齐基准的潜在动作表示

Dujun Nie, Fengjiao Chen, Qi Lv, Jun Kuang, Xiaoyu Li, Xuezhi Cao, Xunliang Cai

机构 * Meituan(美团)

专题命中 安全评测 :alignment(title)

AI总结 本文提出LARY基准,通过大规模人类视频数据评估潜在动作表示,发现通用视觉模型在动作控制上优于专用模型,且潜在空间比像素空间更符合物理动作空间。

Comments Project: https://meituan-longcat.github.io/LARYBench Code: https://github.com/meituan-longcat/LARYBench Dataset: https://huggingface.co/datasets/meituan-longcat/LARYBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10789 2026-04-14 cs.CV 71%

ReplicateAnyScene: Zero-Shot Video-to-3D Composition via Textual-Visual-Spatial Alignment

ReplicateAnyScene:通过文本-视觉-空间对齐实现零样本视频到3D场景的合成

Mingyu Dong, Chong Xia, Mingyuan Jia, Weichen Lyu, Long Xu, Zheng Zhu, Yueqi Duan

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学)

专题命中 安全评测 :alignment(title)

AI总结 本文提出ReplicateAnyScene框架,通过五阶段流水线实现视频到结构化3D场景的零样本合成,引入C3DR基准评估重建质量,实验表明其在生成高质量3D场景方面优于现有方法。

Comments Project Page: https://xiac20.github.io/ReplicateAnyScene/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11548 2026-04-14 cs.AI 70%

SemaClaw: A Step Towards General-Purpose Personal AI Agents through Harness Engineering

SemaClaw:通过Harness工程迈向通用个人AI代理的一步

Ningyan Zhu, Huacan Wang, Jie Zhou, Feiyu Chen, Shuo Zhang, Ge Chen, Chen Liu, Jiarou Wu, Wangyi Chen, Xiaofeng Mou, Yi Xu

机构 * Midea AIRC(美的AIRC)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 SemaClaw通过Harness工程推动个人AI代理发展,提出DAG-based两阶段混合代理团队编排方法、PermissionBridge行为安全系统、三级上下文管理架构和代理维基技能,提升AI代理的可控性与可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17516 2026-04-14 cs.CL cs.AI cs.CY cs.LG 70%

SimBench: Benchmarking the Ability of Large Language Models to Simulate Human Behaviors

SimBench:大型语言模型模拟人类行为能力的基准测试

Tiancheng Hu, Joachim Baumann, Lorenzo Lupo, Nigel Collier, Dirk Hovy, Paul Röttger

机构 * University of Cambridge(剑桥大学) Stanford University(斯坦福大学) Bocconi University(博科尼大学) University of Oxford(牛津大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 SimBench通过统一20个多样化的数据集,评估大型语言模型模拟人类行为的 fidelity,发现模型性能与模型大小呈对数线性关系,但与计算资源无关,且存在指令微调与模拟准确性之间的权衡。

Comments Accepted at ICLR 2026. Project Website: http://simbench.tiancheng.hu/ Data: https://huggingface.co/datasets/pitehu/SimBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15489 2026-04-14 cs.CV cs.CL cs.MM 70%

Seeing Through Deception: Uncovering Misleading Creator Intent in Multimodal News with Vision-Language Models

穿透欺骗:在多模态新闻中揭示误导性创作者意图

Jiaying Wu, Fanxiao Li, Zihang Fu, Min-Yen Kan, Bryan Hooi

机构 * National University of Singapore(新加坡国立大学) Yunnan University(云南大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL

AI总结 本文提出DeceptionDecoded基准数据集,通过意图引导模拟框架生成12000组图像-描述对,旨在揭示多模态虚假信息中的误导性意图,评估14种最新视觉-语言模型,发现其在意图推理上存在不足,提出系统合成数据以提升模型意图理解能力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11070 2026-04-14 cs.AI 70%

PRISM Risk Signal Framework: Hierarchy-Based Red Lines for AI Behavioral Risk

PRISM风险信号框架:基于层级的AI行为风险红线

Seulki Lee

机构 * AI Integrity Organization (AIO)(AI诚信组织)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本文提出基于层级的PRISM框架,定义27种行为风险信号,通过双重阈值原则评估,区分确认风险与预警信号,提升AI安全性的前瞻性、全面性和可测量性。

Comments 13 pages, 13 tables, 1 appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06813 2026-04-14 cs.CL 70%

A Comparative Benchmark of Large Language Models for Labelling Wind Turbine Maintenance Logs

大型语言模型在风力涡轮机维护日志标注中的比较基准

Max Malyi, Jonathan Shek, Alasdair McDonald, Andre Biscaya

机构 * Institute for Energy Systems, School of Engineering, The University of Edinburgh(爱丁堡大学工程学院能源系统研究所) Nadara

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL

AI总结 本文提出一种可复现的框架,用于评估大型语言模型在分类复杂工业记录任务中的性能,通过对比不同模型的可靠性、效率和校准能力,发现最佳模型需结合人类在循环系统提升数据标注质量。

Comments Associated GitHub repository: https://github.com/mvmalyi/wind-farm-maintenance-logs-labelling-with-llms

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10833 2026-04-14 cs.HC cs.AI cs.CL cs.CY cs.ET 67%

Speaking to No One: Ontological Dissonance and the Double Bind of Conversational AI

对无人说话:本体不协调与对话式AI的双重困境

Hugh Brosnahan, Izabela Lipinska

机构 * Bioethics Centre, University of Otago(奥塔哥大学生物伦理学中心) Independent Researcher(独立研究者)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文探讨对话式AI交互中本体不协调的风险,指出其源于交互本身的关联与本体结构,通过沟通双重困境和注意不对称放大,导致情感脆弱时形成技术媒介的双重妄想样态,揭示设计与使用中的伦理与临床影响。

Comments This version of the article has been accepted for publication in Medicine, Health Care and Philosophy following peer review. This version is distributed under Springer Nature's terms for accepted manuscripts and does not reflect any post-acceptance improvements or corrections. The Version of Record will be available via Springer Nature upon publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17022 2026-04-14 cs.CV cs.AI cs.CL cs.LG cs.MM 67%

GoT-R1: Unleashing Reasoning Capability of MLLM for Visual Generation with Reinforcement Learning

GoT-R1:通过强化学习提升MLLM的视觉生成推理能力

Chengqi Duan, Rongyao Fang, Yuqing Wang, Kun Wang, Linjiang Huang, Xingyu Zeng, Hongsheng Li, Xihui Liu

机构 * HKU MMLAB(香港大学多媒体实验室) CUHK MMLAB(香港中文大学多媒体实验室) Sensetime(商汤科技) Beihang University(北京航空航天大学) SUAT(上海人工智能实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 GoT-R1通过强化学习提升视觉生成中的语义-空间推理能力,改进了复杂提示下的图像生成效果,实验表明在T2I-CompBench基准上表现优异。

Comments Github page refer to: https://github.com/gogoduan/GoT-R1. Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09619 2026-04-14 cs.CY cs.AI cs.CL 67%

Assessing the Pedagogical Readiness of Large Language Models as AI Tutors in Low-Resource Contexts: A Case Study of Nepal's K-10 Curriculum

评估大型语言模型作为AI辅导教师在低资源环境中的教学准备性:尼泊尔K-10课程的案例研究

Pratyush Acharya, Prasansha Bharati, Yokibha Chapagain, Isha Sharma Gauli, Kiran Parajuli

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文评估了四个先进LLM在尼泊尔K-10课程中的教学有效性,发现存在显著的课程对齐差距,提出人机协同部署策略和课程特定微调方法。

Comments 14 pages and 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11655 2026-04-14 cs.CL cs.AI cs.MA 62%

RPA-Check: A Multi-Stage Automated Framework for Evaluating Dynamic LLM-based Role-Playing Agents

RPA-Check:一种多阶段自动框架,用于评估基于大语言模型的角色扮演代理

Riccardo Rosati, Edoardo Colucci, Massimiliano Bolognini, Adriano Mancini, Paolo Sernani

机构 * Department of Political Sciences, Communication and International Relations, University of Macerata(马切拉塔大学政治学、传播与国际关系系) Department of Law, University of Macerata(马切拉塔大学法律系)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RPA-Check框架,通过四阶段流程评估LLM基于角色扮演代理的性能,发现模型规模与过程一致性呈反比关系,小型模型在特定场景下表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10905 2026-04-14 cs.SD cs.AI cs.CL eess.AS 62%

Audio Flamingo Next: Next-Generation Open Audio-Language Models for Speech, Sound, and Music

音频Flamingo Next:下一代开放音频-语言模型用于语音、声音和音乐

Sreyan Ghosh, Arushi Goel, Kaousheik Jayakumar, Lasha Koroshinadze, Nishit Anand, Zhifeng Kong, Siddharth Gururani, Sang-gil Lee, Jaehyeon Kim, Aya Aljafari, Chao-Han Huck Yang, Sungwon Kim, Ramani Duraiswami, Dinesh Manocha, Mohammad Shoeybi, Bryan Catanzaro, Ming-Yu Liu, Wei Ping

机构 * NVIDIA, USA(英伟达,美国) University of Maryland, USA(马里兰大学,美国)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 AF-Next通过改进基础模型、扩展数据集和引入时序推理方法,提升了语音、环境声音和音乐的理解与推理能力,展示了更强的性能和实用性。

Comments Project website: https://afnext-umd-nvidia.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14299 2026-04-14 cs.CL cs.AI 62%

Template-assisted Contrastive Learning of Task-oriented Dialogue Sentence Embeddings

基于模板的对话句嵌入对比学习

Minsik Oh, Jiwei Li, Guoyin Wang

机构 * Stanford University(斯坦福大学) Zhejiang University(浙江大学) Alibaba Qwen Pilot(阿里巴巴Qwen Pilot)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TaDSE方法,利用模板信息通过自监督对比学习学习对话句嵌入,通过合成数据集增强效果,并在五个对话基准数据集上验证了其有效性。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09587 2026-04-14 cs.AI cs.LG cs.SE 62%

MobiFlow: Real-World Mobile Agent Benchmarking through Trajectory Fusion

MobiFlow: 通过轨迹融合实现真实世界移动代理基准测试

Yunfei Feng, Xi Zhao, Cheng Zhang, Dahu Feng, Daolin Cheng, Jianqi Yu, Yubin Xia, Erhu Feng

机构 * Institute of Parallel and Distributed Systems (IPADS), Shanghai Jiao Tong University(上海交通大学并行与分布式系统研究所(IPADS)) Department of Precision Instrument, Tsinghua University(清华大学精密仪器系) National Innovation Institute of High-end Smart Appliances(国家高端智能家电创新研究院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 MobiFlow通过轨迹融合算法构建任务,覆盖20个常用第三方应用,提供240种真实任务,提升模型在真实负载下的评估精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05142 2026-04-14 cs.AI cs.CY q-bio.PE 62%

A mathematical theory of evolution for self-designing AIs

自我设计AI的数学进化理论

Kenneth D Harris

机构 * UCL Queen Square Institute of Neurology(伦敦大学学院皇后广场神经科学研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文提出自我设计AI的数学进化模型,通过有向树替代随机突变,探讨AI进化与生物进化差异,分析fitness集中于最大可达值的条件,以及欺骗人类评估对AI对齐的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23219 2026-04-14 cs.CL cs.LG 62%

Decoding AI Authorship: Can LLMs Truly Mimic Human Style Across Literature and Politics?

解码AI作者身份:LLMs能否真正模仿文学和政治领域的作家风格?

Nasser A Alsadhan

机构 * College of Computer and Information Sciences, King Saud University(沙特国王大学计算机与信息科学学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 研究探讨了先进大语言模型在模仿文学和政治作家风格方面的能力,发现AI生成文本仍易被检测,主要差异在于随机性与情感密度。

Comments Preprint. Accepted for publication in Digital Scholarship in the Humanities (OUP)

Journal ref Digital Scholarship in the Humanities, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00891 2026-04-14 cs.AI cs.CL 62%

ChatCLIDS: Simulating Persuasive AI Dialogues to Promote Closed-Loop Insulin Adoption in Type 1 Diabetes Care

ChatCLIDS: 模拟说服性人工智能对话以促进1型糖尿病护理中的闭环胰岛素采用

Zonghai Yao, Talha Chafekar, Junda Wang, Shuo Han, Feiyun Ouyang, Junhui Qian, Lingxi Li, Hong Yu

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ChatCLIDS基准,用于评估基于LLM的说服对话在健康行为改变中的效果,通过模拟多轮交互和长期咨询场景,揭示当前LLM在行为改变中的局限性。

Comments Equal contribution for the first two authors. To appear in AAAI 2026 Special Track on AI for Social Impact

Journal ref AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11801 2026-04-14 cs.CL 57%

CLSGen: A Dual-Head Fine-Tuning Framework for Joint Probabilistic Classification and Verbalized Explanation

CLSGen:一种用于联合概率分类和 verbalized 解释的双头微调框架

WonJin Yoon, Kangyu Zhu, Ian Bulovic, Autumn Sehy, Yanjun Gao, Dmitriy Dligach, Majid Afshar, Timothy A. Miller

机构 * Boston Children’s Hospital(波士顿儿童医院) Harvard Medical School(哈佛医学院) University of Colorado Anschutz Medical Campus(科罗拉多大学安施图茨医学院) Loyola University Chicago(芝加哥洛约拉大学) University of Wisconsin Madison(威斯康星大学麦迪逊分校)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 CLSGen 提出了一种双头微调框架,通过新的架构和方法实现概率估计与解释生成的平衡,实验表明其在分类和解释质量上优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏