arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-21 至 2026-04-21 共收录 192 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 54 篇

2604.17008 2026-04-21 cs.CL 77%

BIASEDTALES-ML: A Multilingual Dataset for Analyzing Narrative Attribute Distributions in LLM-Generated Stories

BIASEDTALES-ML:一个多语言数据集用于分析LLM生成故事中的叙述属性分布

Yuxuan Ouyang, yingfeng luo, JingBo Zhu, Tong Xiao

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院,中国沈阳) NiuTrans Research, Shenyang, China(NiuTrans研究院,中国沈阳)

专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.CL

AI总结 本文提出BiasedTales-ML数据集,通过多语言生成分析叙述属性分布,揭示跨语言生成模式的差异,强调英语中心评估的局限性。

Comments Accepted to ACL 2026 Findings. Data are available at https://huggingface.co/spaces/Linyuana/BIASEDTALES-ML

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20409 2026-04-21 cs.CL cs.AI cs.CY 75%

Cognitive Chain-of-Thought (CoCoT): Structured Multimodal Reasoning about Social Situations

认知链式推理(CoCoT):关于社会情境的结构化多模态推理

Eunkyu Park, Wesley Hanwen Deng, Gunhee Kim, Motahhare Eslami, Maarten Sap

机构 * Seoul National University(首尔国立大学) Human-Computer Interaction Institute, Carnegie Mellon University(人机交互研究所,卡内基梅隆大学) Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出CoCoT框架,通过感知、情境推断和规范应用三个阶段提升多模态社会推理能力,在多个任务中取得显著提升。

Comments Under review; 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01770 2026-04-21 cs.CR cs.AI cs.LG cs.SE 73%

ReGA: Model-Based Safeguard for LLMs via Representation-Guided Abstraction

ReGA:通过表示引导抽象的基于模型的安全保障方法

Zeming Wei, Chengcan Wu, Meng Sun

机构 * Peking University(北京大学)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ReGA框架,通过利用安全关键表示缩小模型分析在大规模语言模型中的可扩展性差距,有效区分安全与有害输入,提升LLM安全性。

Comments FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18394 2026-04-21 cs.SE 67%

OpenGame: Open Agentic Coding for Games

OpenGame: 开源代理游戏开发

Yilei Jiang, Jinyuan Hu, Qianyin Xiao, Yaozhi Zheng, Ruize Ma, Kaituo Feng, Jiaming Han, Tianshuo Peng, Kaixuan Fan, Manyuan Zhang, Xiangyu Yue

专题命中 安全评测 :alignment(abstract,abstract_cn)

AI总结 OpenGame通过Game Skill和GameCoder-27B实现端到端网页游戏开发,解决跨文件不一致和逻辑不一致问题,建立新状态-of-the-art。

Comments OpenGame Report-v1

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06155 2026-04-21 cs.LG cs.AI cs.CL 67%

Toward Consistent World Models with Multi-Token Prediction and Latent Semantic Enhancement

迈向一致的世界模型:多令牌预测与潜在语义增强

Qimin Zhong, Hao Liao, Haiming Qin, Mingyang Zhou, Rui Mao, Wei Chen, Naipeng Chao

机构 * Shenzhen University(深圳大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过多令牌预测和潜在语义增强方法,解决大语言模型内部世界模型一致性问题,提升表示对齐性和鲁棒性。

Comments Accepted by ACL 2026 Main Conference. 21 pages, 3 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08480 2026-04-21 cs.CV cs.IR 67%

Compressing then Matching: An Efficient Pre-training Paradigm for Multimodal Embedding

压缩后再匹配:一种高效的多模态嵌入预训练范式

Da Li, Yuxiao Luo, Keping Bi, Jiafeng Guo, Wei Yuan, Biao Yang, Yan Wang, Fan Yang, Tingting Gao, Guorui Zhou

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Kuaishou Technology(快手科技)

专题命中 安全评测 :trustworthy(abstract,abstract_cn)

AI总结 本文提出CoMa,一种高效的多模态嵌入预训练方法,通过压缩预训练阶段提升对比学习效率,实现多模态嵌入模型的高效优化。

Comments ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11281 2026-04-21 cs.CL cs.AI cs.CY 67%

ToxiFrench: Benchmarking and Enhancing Language Models via CoT Fine-Tuning for French Toxicity Detection

ToxiFrench:通过CoT微调提升法语毒性检测的语言模型基准测试

Axel Delaval, Shujian Yang, Haicheng Wang, Han Qiu, Jialiang Lu

机构 * École Polytechnique(巴黎高等理工学院) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出ToxiFrench数据集,通过半自动化标注流程构建,发现小语言模型在毒性检测任务中表现更优,并提出动态加权损失策略提升模型忠实度,Qwen3-4B模型在基准测试中取得最佳性能。

Comments 22 pages, 5 figures, 11 tables. This paper introduces TOXIFRENCH, a benchmark of 53,622 comments for French toxicity detection. It proposes a Chain-of-Thought fine-tuning method with a dynamic weighted loss. The fine-tuned 4B model (Qwen3-4B) achieves state-of-the-art performance, outperforming larger models like GPT-4o and DeepSeek-R1

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18052 2026-04-21 cs.CR cs.AI cs.LG 62%

ExAI5G: A Logic-Based Explainable AI Framework for Intrusion Detection in 5G Networks

ExAI5G:一种用于5G网络入侵检测的基于逻辑的可解释人工智能框架

Saeid Sheikhi, Panos Kostakos, Lauri Loven

机构 * organization= Faculty of Information Technology Electrical Engineering, University of Oulu , addressline= , city= Oulu , postcode= 90570 , state= , country= Finland

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ExAI5G框架,结合Transformer深度学习与逻辑可解释AI技术,实现高精度且透明的入侵检测,通过逻辑规则提取和解释评估方法,达到99.9%准确率和0.854宏F1分数,展示出模型推理的透明性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09275 2026-04-21 cs.CL cs.AI 62%

Inflated Excellence or True Performance? Rethinking Medical Diagnostic Benchmarks with Dynamic Evaluation

卓越还是真实表现?通过动态评估重新思考医疗诊断基准

Xiangxu Zhang, Lei Li, Yanyun Zhou, Xiao Zhou, Yingying Zhang, Xian Wu

机构 * GSAI, Renmin University of China(清华大学人工智能研究院,中国人民大学) Tencent Jarvis Lab(腾讯 Jarvis实验室) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理研究关键实验室) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(下一代智能搜索与推荐工程技术研究中心,教育部)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文提出DyReMe动态基准,通过生成临床相关干扰因素的咨询式案例,评估医疗诊断模型的鲁棒性,揭示现有模型在临床干扰下的不足。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17771 2026-04-21 cs.CL cs.AI cs.DB 62%

SPENCE: A Syntactic Probe for Detecting Contamination in NL2SQL Benchmarks

SPENCE:一种用于检测NL2SQL基准污染的句法探针

Mohammadtaher Safarzadeh, Hitesh Laxmichand Patel, Afshin Orojlooyjadid, Graham Horwood, Dan Roth

机构 * Oracle AI

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 SPENCE通过生成句法变体检测NL2SQL基准中的污染,分析模型在句法差异下的执行准确性变化,揭示基准释放时间与污染程度的关系。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17755 2026-04-21 cs.CY cs.AI 62%

Community-Led AI Integration for Wildfire Risk Assessment: A Participatory AI Literacy and Explainability Integration (PALEI) Framework in Los Angeles, CA

以社区为主导的AI整合用于野火风险评估:加利福尼亚州洛杉矶的参与式AI素养与可解释性整合(PALEI)框架

Sanaz Sadat Hosseini, Mona Azarbayjani, Mohammad Pourhomayoun, Hamed Tabkhi

机构 * The University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) California State University, Los Angeles(加州州立大学洛杉矶分校)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文提出一种社区主导的AI整合框架,通过PALEI方法提升野火风险评估的透明度和公众信任,展示本地化设计在增强用户参与和风险意识中的作用。

Comments 8 pages, 3 figures, This paper was accepted following peer review, presented at the ARCC-EAAE 2026 International Conference, Local Solutions for Global Issues, held in April 2026 in Atlanta, Georgia, USA, and will be published in the conference proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17714 2026-04-21 cs.CL cs.AI 62%

Screen Before You Interpret: A Portable Validity Protocol for Benchmark-Based LLM Confidence Signals

在解释前筛查:一种便携式有效性协议用于基于基准的LLM置信信号

Jon-Paul Cacioli

机构 * Independent Researcher(独立研究者)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种便携式有效性协议,用于评估基于基准的LLM置信信号,通过临床人格评估中的有效性筛查原则,定义了三个核心指标和结构指标,验证了20个前沿LLM在524个项目上的有效性。

Comments 25 pages, 6 figures, 8 tables, 2 appendices. Companion to arXiv:2604.15702

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16586 2026-04-21 cs.LG cs.AI q-bio.QM 62%

A Systematic Survey and Benchmark of Deep Learning for Molecular Property Prediction in the Foundation Model Era

在基础模型时代对深度学习用于分子性质预测的系统调查和基准测试

Zongru Li, Xingsheng Chen, Honggang Wen, Regina Qianru Zhang, Ming Li, Xiaojin Zhang, Hongzhi Yin, Qiang Yang, Kwok-Yan Lam, Pietro Lio, Siu-Ming Yiu

机构 * The University of Hong Kong, Hong Kong SAR(香港大学) Nanyang Technological University, Singapore(南洋理工大学) University of Cambridge, United Kingdom(剑桥大学) Zhejiang Normal University, China(浙江师范大学) The Hong Kong University of Science and Technology, Hong Kong SAR(香港科学与技术大学) The University of Queensland(昆士兰大学) The Hong Kong Polytechnic University, Hong Kong SAR(香港理工大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文系统调查了深度学习在分子性质预测中的应用,探讨了四种互补范式,并提出了未来三个发展方向,包括物理感知学习、可信推理的基础模型和整合计算与实验数据的基准生态系统。

Comments 32 pages. It is just accepted by Journal of Chemical Theory and Computation 2026

Journal ref Journal of Chemical Theory and Computation 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04638 2026-04-21 cs.CL cs.AI 62%

SpeechMedAssist: Efficiently and Effectively Adapting Speech Language Models for Medical Consultation

SpeechMedAssist: 有效且高效地适应语音语言模型用于医疗咨询

Sirry Chen, Jieyi Wang, Wei Chen, Zhongyu Wei

机构 * Fudan University(复旦大学) Shanghai Innovation Institude(上海创新研究院) Peking University(北京大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SpeechMedAssist,一种能进行语音多轮交互的语音语言模型,通过分阶段训练减少对医疗语音数据的需求,提升医疗咨询场景下的效果和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16280 2026-04-21 cs.CR cs.AI cs.CY 62%

Love, Lies, and Language Models: Investigating AI's Role in Romance-Baiting Scams

爱情、谎言与语言模型:探讨人工智能在情爱诱骗诈骗中的作用

Gilad Gressel, Rahul Pankajakshan, Shir Rozenfeld, Ling Li, Ivan Franceschini, Krishnashree Achuthan, Yisroel Mirsky

机构 * Center for Cybersecurity Systems & Networks, Amrita Vishwa Vidyapeetham, Amritapuri(网络安全系统与网络中心,阿米特大学,阿米塔普里) Ca’ Foscari University of Venice(威尼斯卡弗斯卡里大学) University of Melbourne(墨尔本大学) Ben Gurion University of the Negev(内盖夫本· Gurion大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY

AI总结 研究探讨AI在情爱诱骗诈骗中的角色,通过访谈和实验发现LLM已被广泛用于诈骗,且安全过滤器无法有效阻止其扩张。

Journal ref USENIX Security Symposium 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18473 2026-04-21 cs.LG 57%

Train Separately, Merge Together: Modular Post-Training with Mixture-of-Experts

分开训练,合并一起:模块化后训练与专家混合

Jacob Morrison, Sanjay Adhikesaven, Akshita Bhagia, Matei Zaharia, Noah A. Smith, Sewon Min

机构 * University of Washington(华盛顿大学) University of California, Berkeley(加州大学伯克利分校) Allen Institute for AI(人工智能研究院)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 本文提出BAR方法,通过独立训练领域专家并采用专家混合架构实现高效更新,避免了传统重训练的高成本和性能下降问题,实验显示其在多个领域任务中表现优异。

Comments 9 content pages, 23 pages overall, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18429 2026-04-21 cs.CV cs.AI 57%

Revisiting Change VQA in Remote Sensing with Structured and Native Multimodal Qwen Models

重新审视遥感中的变化视觉问答问题:结构化与原生多模态Qwen模型

Yakoub Bazi, Mohamad M. Al Rahhal, Mansour Zuair, Faroun Mohamed

机构 * Computer Engineering Department, College of Computer and Information Sciences, King Saud University(计算机工程系,计算机与信息科学学院,沙特国王大学) Applied Computer Science Department, College of Applied Computer Science, King Saud University(应用计算机科学系,应用计算机科学学院,沙特国王大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文重新审视遥感中的变化视觉问答问题,比较了结构化视觉语言模型与原生多模态模型在CDVQA基准上的表现,发现原生模型在语义变化推理中更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18071 2026-04-21 cs.AI 57%

Architectural Design Decisions in AI Agent Harnesses

人工智能代理体系中的架构设计决策

Hu Wei

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文研究了人工智能代理系统中 reusable 非大语言模型工程基础设施的架构设计决策,通过分析70个公开项目,识别了五个常见设计维度和典型架构模式,为框架设计者和研究者提供证据支持。

Comments 35 pages, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17966 2026-04-21 cs.AI 57%

TPS-CalcBench: A Benchmark and Diagnostic Evaluation Framework for LLM Analytical Calculation Competence in Hypersonic Thermal Protection System Engineering

TPS-CalcBench: 一种用于高超音速热防护系统工程中LLM分析计算能力的基准和诊断评估框架

Jinglai Zheng, Chuhan Qiao, Haiming Huang

机构 * School of Civil Engineering, Beijing Jiaotong University, Beijing 100044, China(北京交通大学土木工程学院)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出TPS-CalcBench,首个针对高超音速气动学和高温气体动力学中闭式解析计算的诊断基准,通过领域导向任务分类、双轨评估和人类-AI数据管道,建立安全关键工程LLM部署评估的完整诊断-评估-干预框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17883 2026-04-21 cs.SE cs.HC cs.LG 57%

Scaling Human-AI Coding Collaboration Requires a Governable Consensus Layer

规模化的人工智能编码协作需要一个可治理的共识层

Tianfu Wang, Zhezheng Hao, Yin Wu, Wei Wu, Qiang Lin, Hande Dong, Nicholas Jing Yuan, Hui Xiong

机构 * Tencent(腾讯)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文提出Agentic Consensus共识层,通过类型属性图替代代码作为主要工程产物,解决AI辅助开发中代码与聊天历史维度塌陷导致的系统不透明问题,强调通过共识熵衡量协作流程的对齐度和干预距离。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05489 2026-04-21 cs.AI cs.MA 57%

SCMAPR: Self-Correcting Multi-Agent Prompt Refinement for Complex-Scenario Text-to-Video Generation

SCMAPR: 自校正多智能体提示精修用于复杂场景文本到视频生成

Chengyi Yang, Pengzhen Li, Jiayin Qi, Aimin Zhou, Ji Wu, Ji Liu

机构 * HiThink Research(HiThink研究院) East China Normal University(华东师范大学) Guangzhou University(广州大学) Tsinghua University(清华大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出SCMAPR框架,通过多智能体分阶段精修提升复杂场景下的文本到视频生成质量,实验表明在VBench和EvalCrafter等基准上平均得分提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17718 2026-04-21 cs.CL cs.SI 57%

Do LLMs Use Cultural Knowledge Without Being Told? A Multilingual Evaluation of Implicit Pragmatic Adaptation

大型语言模型是否在未被告知的情况下使用文化知识?一种多语言隐含语用适应性评估

Mehwish Nasim, Sanjeevan Selvaganapathy, Neel Ganapathi Sabhahit, Marie Griesbach, Pranav Bhandari, Janina Lütke Stockdiek, Lennart Schäpermeier, Usman Naseem, Christian Grimme

机构 * Network Analysis and Social Influence Modelling (NASIM) Lab(网络分析与社会影响力建模实验室) School of Physics Maths and Computing(物理数学与计算学院) The University of Western Australia(西澳大学) School of Computing(计算学院) Macquarie University(麦考瑞大学) Computational Social Science & Systems Analysis(计算社会科学与系统分析) University of Münster(明斯特大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文研究了大型语言模型在隐含文化提示下是否改变其说话方式,通过五种语言的60个文化相关对话场景,评估了模型在不同提示条件下的语用特征,发现模型在隐含提示下只能部分恢复显式指令下的语用变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17587 2026-04-21 cs.SE cs.AI 57%

AIRA: AI-Induced Risk Audit: A Structured Inspection Framework for AI-Generated Code

AIRA:AI诱导风险审计:一种用于AI生成代码的结构化检查框架

William M. Parris

机构 * BDB Labs(BDB实验室) Jurisprudential AI Governance Initiative(法理人工智能治理计划)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出AIRA框架,用于检测AI生成代码中的失败不真实模式,通过三个研究验证AI生成代码在严重性上的显著差异,适用于治理和安全关键系统。

Comments 15 pages, 6 tables. Introduces the Reward-Shaped Failure Hypothesis and AIRA, a deterministic inspection framework for detecting failure-untruthful patterns in AI-generated code. Includes three empirical studies and a strict matched-control replication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17562 2026-04-21 cs.AI cs.MA 57%

SafeAgent: A Runtime Protection Architecture for Agentic Systems

SafeAgent: 代理系统的一种运行时保护架构

Hailin Liu, Eugene Ilyushin, Jie Ni, Min Zhu

机构 * Lomonosov Moscow State University(莫斯科罗蒙诺索夫国立大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出SafeAgent,一种运行时安全架构,通过分离执行治理与语义风险推理,提升代理系统在多步骤流程中的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17282 2026-04-21 cs.CL 57%

MedPRMBench: A Fine-grained Benchmark for Process Reward Models in Medical Reasoning

MedPRMBench: 一种面向医疗推理过程奖励模型的细粒度基准

Lingyan Wu, Xiang Zheng, Weiqi Zhai, Wei Wang, Xuan Ren, Zifan Zhang, Hu Wei, Bing Zhao

机构 * Alibaba Group(阿里巴巴集团)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本文提出MedPRMBench,首个医疗领域过程奖励模型基准,通过三阶段流程生成高质量数据,涵盖14种细粒度错误类型,评估模型在医疗推理中的误差检测能力,提升下游任务准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17274 2026-04-21 cs.CV cs.AI 57%

Instinct vs. Reflection: Unifying Token and Verbalized Confidence in Multimodal Large Models

本能与反思:统一令牌和 verbalized 自信在多模态大模型中

Yunkai Dang, Yifan Jiang, Yizhu Jiang, Anqi Chen, Wenbin Li, Yang Gao

机构 * School of Artificial Intelligence, Nanjing University(南京大学人工智能学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文研究多模态大模型响应自信估计的本能-反思不一致问题,提出融合框架和均值对齐方法,提升校准和失败预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17217 2026-04-21 cs.CV cs.AI 57%

Cross-Modal Attention Analysis and Optimization in Vision-Language Models: A Study on Visual Reliability

视觉-语言模型中的跨模态注意力分析与优化:对视觉可靠性的研究

Lijie Zhou

机构 * School of Computer Science(计算机科学学院) University of Nottingham Ningbo China(诺丁汉大学宁波分校)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文研究了视觉-语言模型中跨模态依赖性问题,通过对抗性评估框架发现优化模型能显著降低跨模态依赖,提升视觉特征关注度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17186 2026-04-21 cs.SE cs.AI cs.ET cs.HC cs.MA 57%

Persona-Based Requirements Engineering for Explainable Multi-Agent Educational Systems: A Scenario Simulator for Clinical Reasoning Training

基于角色的可解释多智能体教育系统需求工程:用于临床推理训练的场景模拟器

Weibing Zheng, Laurah Turner, Jess Kropczynski, Matthew Kelleher, Murat Ozer, Shane Halse

机构 * School of Information Technology University of Cincinnati, OH Cincinnati, USA(信息科技学院 奥地利辛辛那提大学) College of Medicine University of Cincinnati, OH Cincinnati, USA(医学院 奥地利辛辛那提大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出基于角色的可解释多智能体教育系统需求工程框架,通过临床推理训练系统展示如何利用角色和用户故事捕捉多方需求,提升系统可解释性和临床场景真实性。

Comments 7 pages, 2 figures, CSTE2026: https://cste.net/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17174 2026-04-21 cs.CL 57%

Modeling Multi-Dimensional Cognitive States in Large Language Models under Cognitive Crowding

在认知拥挤下对大语言模型中的多维认知状态建模

Lin Zhong, Siyu Zhu, Zizhen Yuan, Jinhao Cui, Xinyang Zhao, Lingzhi Wang, Hao Chen, Qing Liao

机构 * Harbin Institute of Technology(哈尔滨工业大学) City University of Macau(澳门城市大学) Peng Cheng Laboratory(鹏城实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出CognitiveBench基准,通过统一标注四个认知维度,发现LLM在多维建模中表现下降,提出HyCoLLM在双曲空间中建模,提升多维认知理解。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11161 2026-04-21 cs.HC cs.CL 57%

Althea: Human-AI Collaboration for Fact-Checking and Critical Reasoning

Althea:面向事实核查和批判性推理的人机协作

Svetlana Churina, Kokil Jaidka, Anab Maulana Barik, Harshit Aneja, Cai Yang, Wynne Hsu, Mong Li Lee

机构 * Centre for Trusted Internet & Community (CTIC)(可信互联网与社区中心) National University of Singapore (NUS)(新加坡国立大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 Althea通过整合问题生成、证据检索和结构化推理,提升在线主张的核查效率与准确性,其在AVeriteC基准测试中达到宏F1值0.44,且在用户研究中显示指导性交互对短期准确性和长期改进均有显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏