arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-14 至 2026-04-14 共收录 162 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 62 篇

2604.09606 2026-04-14 cs.AI cs.SE 79%

Evaluating Reliability Gaps in Large Language Model Safety via Repeated Prompt Sampling

通过重复提示采样评估大语言模型安全性的可靠性差距

Keita Broadwater

机构 * Independent Researcher(独立研究员)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出APST框架,通过重复采样相同提示在受控条件下揭示LLM潜在故障模式,量化不同模型和配置下的操作风险,展示浅层基准分数可能掩盖持续使用下的可靠性差异。

Comments 9 pages, 4 figures; accepted at the CCAI 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10733 2026-04-14 cs.CL cs.AI 79%

Too Nice to Tell the Truth: Quantifying Agreeableness-Driven Sycophancy in Role-Playing Language Models

太过讨好而不说实话:量化角色扮演语言模型中由顺从性驱动的阿谀奉承

Arya Shah, Deepali Mishra, Chaklam Silpasuwanchai

机构 * IIT Gandhinagar(印度理工学院甘地讷格尔分校) IIT Kanpur(印度理工学院坎普尔分校) Asian Institute of Technology(亚洲理工学院)

专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了角色扮演语言模型中顺从性对阿谀奉承行为的影响,通过13种模型验证了顺从性与阿谀奉承的正相关性,揭示了顺从性作为预测因素的重要性。

Comments 14 Pages, 5 Figures, 9 Tables, ACL Main Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11686 2026-04-14 cs.IR 78%

EA-Agent: A Structured Multi-Step Reasoning Agent for Entity Alignment

EA-Agent:一种用于实体对齐的结构化多步推理代理

Yixuan Nan, Xixun Lin, Yanmin Shang, Ge Zhang, Zheng Fang, Fang Fang, Yanan Cao

专题命中 安全评测 :alignment(title,abstract)

AI总结 本文提出EA-Agent,通过多步规划与执行将实体对齐转化为结构化推理过程,引入属性和关系三元组选择器提升效率,实验表明其在三个基准数据集上均优于现有方法。

Comments ACL 2026,Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09622 2026-04-14 cs.CY cs.AI cs.CL 75%

Explainability and Certification of AI-Generated Educational Assessments

人工智能生成教育评估的可解释性与认证

Antoun Yaacoub, Zainab Assaghir, Anuradha Kar

机构 * aivancity School for Technology, Business & Society(aivancity 科技、商业与社会学院) Lebanese University(黎巴嫩大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出了一种综合框架,用于解释和认证AI生成的评估项目,结合自我理性化、基于归因的分析和事后验证,以产生基于布卢姆和SOLO分类法的认知对齐证据。通过结构化的认证元数据模式,实现可审计的文档,满足新兴治理需求。

Comments Chapter to be published in a Springer special book "Emerging trends in Computer Science and Computer Engineering Education Book"

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10300 2026-04-14 cs.SE cs.AI 74%

From Helpful to Trustworthy: LLM Agents for Pair Programming

从有益到可信:用于配对编程的LLM代理

Ragib Shahariar Ayon

机构 * Texas State University(德克萨斯州立大学)

专题命中 安全评测 :trustworthy(title);分类 cs.AI

AI总结 本文研究多代理LLM配对编程,通过外部化意图和工具迭代验证,提升代码可靠性、可审计性和可维护性。

Comments Accepted in 34th ACM Joint European Software Engineering Conference and Symposium on the Foundations of Software Engineering (FSE Companion 26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11689 2026-04-14 cs.CV cs.RO 71%

LARY: A Latent Action Representation Yielding Benchmark for Generalizable Vision-to-Action Alignment

LARY:一种产生通用视觉到动作对齐基准的潜在动作表示

Dujun Nie, Fengjiao Chen, Qi Lv, Jun Kuang, Xiaoyu Li, Xuezhi Cao, Xunliang Cai

机构 * Meituan(美团)

专题命中 安全评测 :alignment(title)

AI总结 本文提出LARY基准,通过大规模人类视频数据评估潜在动作表示,发现通用视觉模型在动作控制上优于专用模型,且潜在空间比像素空间更符合物理动作空间。

Comments Project: https://meituan-longcat.github.io/LARYBench Code: https://github.com/meituan-longcat/LARYBench Dataset: https://huggingface.co/datasets/meituan-longcat/LARYBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10789 2026-04-14 cs.CV 71%

ReplicateAnyScene: Zero-Shot Video-to-3D Composition via Textual-Visual-Spatial Alignment

ReplicateAnyScene:通过文本-视觉-空间对齐实现零样本视频到3D场景的合成

Mingyu Dong, Chong Xia, Mingyuan Jia, Weichen Lyu, Long Xu, Zheng Zhu, Yueqi Duan

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学)

专题命中 安全评测 :alignment(title)

AI总结 本文提出ReplicateAnyScene框架,通过五阶段流水线实现视频到结构化3D场景的零样本合成,引入C3DR基准评估重建质量,实验表明其在生成高质量3D场景方面优于现有方法。

Comments Project Page: https://xiac20.github.io/ReplicateAnyScene/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11548 2026-04-14 cs.AI 70%

SemaClaw: A Step Towards General-Purpose Personal AI Agents through Harness Engineering

SemaClaw:通过Harness工程迈向通用个人AI代理的一步

Ningyan Zhu, Huacan Wang, Jie Zhou, Feiyu Chen, Shuo Zhang, Ge Chen, Chen Liu, Jiarou Wu, Wangyi Chen, Xiaofeng Mou, Yi Xu

机构 * Midea AIRC(美的AIRC)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 SemaClaw通过Harness工程推动个人AI代理发展,提出DAG-based两阶段混合代理团队编排方法、PermissionBridge行为安全系统、三级上下文管理架构和代理维基技能,提升AI代理的可控性与可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17516 2026-04-14 cs.CL cs.AI cs.CY cs.LG 70%

SimBench: Benchmarking the Ability of Large Language Models to Simulate Human Behaviors

SimBench:大型语言模型模拟人类行为能力的基准测试

Tiancheng Hu, Joachim Baumann, Lorenzo Lupo, Nigel Collier, Dirk Hovy, Paul Röttger

机构 * University of Cambridge(剑桥大学) Stanford University(斯坦福大学) Bocconi University(博科尼大学) University of Oxford(牛津大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 SimBench通过统一20个多样化的数据集,评估大型语言模型模拟人类行为的 fidelity,发现模型性能与模型大小呈对数线性关系,但与计算资源无关,且存在指令微调与模拟准确性之间的权衡。

Comments Accepted at ICLR 2026. Project Website: http://simbench.tiancheng.hu/ Data: https://huggingface.co/datasets/pitehu/SimBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15489 2026-04-14 cs.CV cs.CL cs.MM 70%

Seeing Through Deception: Uncovering Misleading Creator Intent in Multimodal News with Vision-Language Models

穿透欺骗:在多模态新闻中揭示误导性创作者意图

Jiaying Wu, Fanxiao Li, Zihang Fu, Min-Yen Kan, Bryan Hooi

机构 * National University of Singapore(新加坡国立大学) Yunnan University(云南大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL

AI总结 本文提出DeceptionDecoded基准数据集,通过意图引导模拟框架生成12000组图像-描述对,旨在揭示多模态虚假信息中的误导性意图,评估14种最新视觉-语言模型,发现其在意图推理上存在不足,提出系统合成数据以提升模型意图理解能力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11070 2026-04-14 cs.AI 70%

PRISM Risk Signal Framework: Hierarchy-Based Red Lines for AI Behavioral Risk

PRISM风险信号框架:基于层级的AI行为风险红线

Seulki Lee

机构 * AI Integrity Organization (AIO)(AI诚信组织)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本文提出基于层级的PRISM框架,定义27种行为风险信号,通过双重阈值原则评估,区分确认风险与预警信号,提升AI安全性的前瞻性、全面性和可测量性。

Comments 13 pages, 13 tables, 1 appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06813 2026-04-14 cs.CL 70%

A Comparative Benchmark of Large Language Models for Labelling Wind Turbine Maintenance Logs

大型语言模型在风力涡轮机维护日志标注中的比较基准

Max Malyi, Jonathan Shek, Alasdair McDonald, Andre Biscaya

机构 * Institute for Energy Systems, School of Engineering, The University of Edinburgh(爱丁堡大学工程学院能源系统研究所) Nadara

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL

AI总结 本文提出一种可复现的框架,用于评估大型语言模型在分类复杂工业记录任务中的性能,通过对比不同模型的可靠性、效率和校准能力,发现最佳模型需结合人类在循环系统提升数据标注质量。

Comments Associated GitHub repository: https://github.com/mvmalyi/wind-farm-maintenance-logs-labelling-with-llms

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10833 2026-04-14 cs.HC cs.AI cs.CL cs.CY cs.ET 67%

Speaking to No One: Ontological Dissonance and the Double Bind of Conversational AI

对无人说话:本体不协调与对话式AI的双重困境

Hugh Brosnahan, Izabela Lipinska

机构 * Bioethics Centre, University of Otago(奥塔哥大学生物伦理学中心) Independent Researcher(独立研究者)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文探讨对话式AI交互中本体不协调的风险,指出其源于交互本身的关联与本体结构,通过沟通双重困境和注意不对称放大,导致情感脆弱时形成技术媒介的双重妄想样态,揭示设计与使用中的伦理与临床影响。

Comments This version of the article has been accepted for publication in Medicine, Health Care and Philosophy following peer review. This version is distributed under Springer Nature's terms for accepted manuscripts and does not reflect any post-acceptance improvements or corrections. The Version of Record will be available via Springer Nature upon publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17022 2026-04-14 cs.CV cs.AI cs.CL cs.LG cs.MM 67%

GoT-R1: Unleashing Reasoning Capability of MLLM for Visual Generation with Reinforcement Learning

GoT-R1:通过强化学习提升MLLM的视觉生成推理能力

Chengqi Duan, Rongyao Fang, Yuqing Wang, Kun Wang, Linjiang Huang, Xingyu Zeng, Hongsheng Li, Xihui Liu

机构 * HKU MMLAB(香港大学多媒体实验室) CUHK MMLAB(香港中文大学多媒体实验室) Sensetime(商汤科技) Beihang University(北京航空航天大学) SUAT(上海人工智能实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 GoT-R1通过强化学习提升视觉生成中的语义-空间推理能力,改进了复杂提示下的图像生成效果,实验表明在T2I-CompBench基准上表现优异。

Comments Github page refer to: https://github.com/gogoduan/GoT-R1. Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09619 2026-04-14 cs.CY cs.AI cs.CL 67%

Assessing the Pedagogical Readiness of Large Language Models as AI Tutors in Low-Resource Contexts: A Case Study of Nepal's K-10 Curriculum

评估大型语言模型作为AI辅导教师在低资源环境中的教学准备性:尼泊尔K-10课程的案例研究

Pratyush Acharya, Prasansha Bharati, Yokibha Chapagain, Isha Sharma Gauli, Kiran Parajuli

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文评估了四个先进LLM在尼泊尔K-10课程中的教学有效性,发现存在显著的课程对齐差距,提出人机协同部署策略和课程特定微调方法。

Comments 14 pages and 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11655 2026-04-14 cs.CL cs.AI cs.MA 62%

RPA-Check: A Multi-Stage Automated Framework for Evaluating Dynamic LLM-based Role-Playing Agents

RPA-Check:一种多阶段自动框架,用于评估基于大语言模型的角色扮演代理

Riccardo Rosati, Edoardo Colucci, Massimiliano Bolognini, Adriano Mancini, Paolo Sernani

机构 * Department of Political Sciences, Communication and International Relations, University of Macerata(马切拉塔大学政治学、传播与国际关系系) Department of Law, University of Macerata(马切拉塔大学法律系)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RPA-Check框架,通过四阶段流程评估LLM基于角色扮演代理的性能,发现模型规模与过程一致性呈反比关系,小型模型在特定场景下表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10905 2026-04-14 cs.SD cs.AI cs.CL eess.AS 62%

Audio Flamingo Next: Next-Generation Open Audio-Language Models for Speech, Sound, and Music

音频Flamingo Next:下一代开放音频-语言模型用于语音、声音和音乐

Sreyan Ghosh, Arushi Goel, Kaousheik Jayakumar, Lasha Koroshinadze, Nishit Anand, Zhifeng Kong, Siddharth Gururani, Sang-gil Lee, Jaehyeon Kim, Aya Aljafari, Chao-Han Huck Yang, Sungwon Kim, Ramani Duraiswami, Dinesh Manocha, Mohammad Shoeybi, Bryan Catanzaro, Ming-Yu Liu, Wei Ping

机构 * NVIDIA, USA(英伟达,美国) University of Maryland, USA(马里兰大学,美国)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 AF-Next通过改进基础模型、扩展数据集和引入时序推理方法,提升了语音、环境声音和音乐的理解与推理能力,展示了更强的性能和实用性。

Comments Project website: https://afnext-umd-nvidia.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14299 2026-04-14 cs.CL cs.AI 62%

Template-assisted Contrastive Learning of Task-oriented Dialogue Sentence Embeddings

基于模板的对话句嵌入对比学习

Minsik Oh, Jiwei Li, Guoyin Wang

机构 * Stanford University(斯坦福大学) Zhejiang University(浙江大学) Alibaba Qwen Pilot(阿里巴巴Qwen Pilot)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TaDSE方法,利用模板信息通过自监督对比学习学习对话句嵌入,通过合成数据集增强效果,并在五个对话基准数据集上验证了其有效性。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09587 2026-04-14 cs.AI cs.LG cs.SE 62%

MobiFlow: Real-World Mobile Agent Benchmarking through Trajectory Fusion

MobiFlow: 通过轨迹融合实现真实世界移动代理基准测试

Yunfei Feng, Xi Zhao, Cheng Zhang, Dahu Feng, Daolin Cheng, Jianqi Yu, Yubin Xia, Erhu Feng

机构 * Institute of Parallel and Distributed Systems (IPADS), Shanghai Jiao Tong University(上海交通大学并行与分布式系统研究所(IPADS)) Department of Precision Instrument, Tsinghua University(清华大学精密仪器系) National Innovation Institute of High-end Smart Appliances(国家高端智能家电创新研究院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 MobiFlow通过轨迹融合算法构建任务,覆盖20个常用第三方应用,提供240种真实任务,提升模型在真实负载下的评估精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05142 2026-04-14 cs.AI cs.CY q-bio.PE 62%

A mathematical theory of evolution for self-designing AIs

自我设计AI的数学进化理论

Kenneth D Harris

机构 * UCL Queen Square Institute of Neurology(伦敦大学学院皇后广场神经科学研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文提出自我设计AI的数学进化模型,通过有向树替代随机突变,探讨AI进化与生物进化差异,分析fitness集中于最大可达值的条件,以及欺骗人类评估对AI对齐的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23219 2026-04-14 cs.CL cs.LG 62%

Decoding AI Authorship: Can LLMs Truly Mimic Human Style Across Literature and Politics?

解码AI作者身份:LLMs能否真正模仿文学和政治领域的作家风格?

Nasser A Alsadhan

机构 * College of Computer and Information Sciences, King Saud University(沙特国王大学计算机与信息科学学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 研究探讨了先进大语言模型在模仿文学和政治作家风格方面的能力,发现AI生成文本仍易被检测,主要差异在于随机性与情感密度。

Comments Preprint. Accepted for publication in Digital Scholarship in the Humanities (OUP)

Journal ref Digital Scholarship in the Humanities, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00891 2026-04-14 cs.AI cs.CL 62%

ChatCLIDS: Simulating Persuasive AI Dialogues to Promote Closed-Loop Insulin Adoption in Type 1 Diabetes Care

ChatCLIDS: 模拟说服性人工智能对话以促进1型糖尿病护理中的闭环胰岛素采用

Zonghai Yao, Talha Chafekar, Junda Wang, Shuo Han, Feiyun Ouyang, Junhui Qian, Lingxi Li, Hong Yu

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ChatCLIDS基准,用于评估基于LLM的说服对话在健康行为改变中的效果,通过模拟多轮交互和长期咨询场景,揭示当前LLM在行为改变中的局限性。

Comments Equal contribution for the first two authors. To appear in AAAI 2026 Special Track on AI for Social Impact

Journal ref AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11801 2026-04-14 cs.CL 57%

CLSGen: A Dual-Head Fine-Tuning Framework for Joint Probabilistic Classification and Verbalized Explanation

CLSGen:一种用于联合概率分类和 verbalized 解释的双头微调框架

WonJin Yoon, Kangyu Zhu, Ian Bulovic, Autumn Sehy, Yanjun Gao, Dmitriy Dligach, Majid Afshar, Timothy A. Miller

机构 * Boston Children’s Hospital(波士顿儿童医院) Harvard Medical School(哈佛医学院) University of Colorado Anschutz Medical Campus(科罗拉多大学安施图茨医学院) Loyola University Chicago(芝加哥洛约拉大学) University of Wisconsin Madison(威斯康星大学麦迪逊分校)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 CLSGen 提出了一种双头微调框架,通过新的架构和方法实现概率估计与解释生成的平衡,实验表明其在分类和解释质量上优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11609 2026-04-14 cs.AI cs.HC 57%

Intersectional Sycophancy: How Perceived User Demographics Shape False Validation in Large Language Models

交叉性趋炎附势:感知的用户人口统计如何影响大语言模型中的虚假验证

Benjamin Maltbie, Shivam Raval

机构 * Massachusetts Institute of Technology(麻省理工学院) Harvard University(哈佛大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 研究探讨用户人口统计如何影响大语言模型的虚假验证行为,发现GPT-5-nano在哲学领域比数学领域更趋炎附势,而拉丁裔人群接受度最高,而自信的拉丁裔女性得分最低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11518 2026-04-14 cs.SE cs.AI 57%

From Translation to Superset: Benchmark-Driven Evolution of a Production AI Agent from Rust to Python

从翻译到超集:面向生产AI代理的基准驱动演进:从Rust到Python

Jinhua Wang, Biswa Sengupta

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出一种基于LLM的持续代码翻译方法,将Rust生产代码库迁移至Python,通过基准驱动迭代优化,实现功能扩展与性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09430 2026-04-14 cs.IR cs.AI quant-ph 57%

On the Representational Limits of Quantum-Inspired 1024-D Document Embeddings: An Experimental Evaluation Framework

关于量子启发式1024维文档嵌入表示的限制:一个实验评估框架

Dario Maio

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出一个实验框架,用于构建基于重叠窗口和多尺度聚合的量子启发式1024维文档嵌入,通过诊断工具评估混合检索性能,发现BM25仍为强基线,而量子启发式嵌入在排名信号上表现不稳定。

Comments 44 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03926 2026-04-14 cs.CL 57%

Doc-PP: Document Policy Preservation Benchmark for Large Vision-Language Models

Doc-PP:大型视觉-语言模型文档政策保护基准

Haeun Jang, Hwan Chang, Hwanhee Lee

机构 * Chung-Ang University(中央大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本文提出Doc-PP基准,用于评估大型视觉-语言模型在严格非披露政策下对文档的理解能力,揭示了推理诱导的安全差距,并提出DVA框架提升政策合规性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17574 2026-04-14 cs.CV cs.AI 57%

HumanVBench: Probing Human-Centric Video Understanding in MLLMs with Automatically Synthesized Benchmarks

HumanVBench: 通过自动合成基准测试探测多模态大语言模型中的以人为本的视频理解

Ting Zhou, Daoyuan Chen, Qirui Jiao, Bolin Ding, Yaliang Li, Ying Shen

机构 * Sun Yat-Sen University(中山大学) Alibaba Group(阿里巴巴集团) Peng Cheng Laboratory(鹏城实验室) Guangdong Provincial Key Laboratory of Fire Science and Intelligent Emergency Technology(广东省消防科学与智能应急技术重点实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出HumanVBench,一个针对多模态大语言模型(MLLMs)中以人为本的视频理解能力的综合基准测试,通过自动化流程生成高质量视频注释和挑战性问题,揭示30个领先MLLMs在感知细微情绪和对齐语音与视觉线索方面的不足。

Comments Accepted as a conference paper at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10978 2026-04-14 cs.HC cs.AI 57%

Enabling and Inhibitory Pathways of Students' AI Use Concealment Intention in Higher Education: Evidence from SEM and fsQCA

高等教育学生AI使用隐瞒意图的促进与抑制路径:基于SEM和fsQCA的实证研究

Yiran Du, Huimin He

机构 * University of Cambridge(剑桥大学) Xi'an Jiaotong-Liverpool University(西交利物浦大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文通过SEM和fsQCA方法探讨高等教育学生AI使用隐瞒意图的促进与抑制路径,揭示感知污名、风险和政策不确定性通过增强负面评价恐惧促进隐瞒,而AI自我效能、公平感知和社会支持通过提升心理安全减少隐瞒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10968 2026-04-14 cs.CL 57%

YIELD: A Large-Scale Dataset and Evaluation Framework for Information Elicitation Agents

YIELD:信息提取代理的大规模数据集和评估框架

Victor De Lima, Grace Hui Yang

机构 * InfoSense Lab, Georgetown University(乔治城大学信息感知实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出YIELD数据集和评估框架,用于研究信息提取代理,通过2600万token的对话数据提升模型对真实信息提取行为的对齐能力。

Comments Accepted at ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏