arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-21 至 2026-05-21 共收录 31 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 31 篇

2603.10015 2026-05-21 cs.CY econ.GN q-fin.EC 88%

The coordination gap in frontier AI safety policies

前沿人工智能安全政策中的协调缺口

Isaak Mengesha

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY

AI总结 本文探讨了前沿人工智能安全政策在预防措施之外的协调能力不足问题,提出通过借鉴核安全、疫情准备和关键基础设施中的机制来改进人工智能治理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04042 2026-05-21 cs.CL 87%

Causal Path Alignment: Anchoring the Optimization Trajectory for Controllable In-Parameter Knowledge Editing

因果路径对齐:为可控的参数知识编辑锚定优化轨迹

Xiyu Liu, Zhengxiao Liu, Naibin Gu, Zheng Lin, Weiping Wang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 安全评测 :alignment(title,summary_cn);trustworthy(abstract);分类 cs.CL

AI总结 本文提出Causal Path Alignment框架,通过锚定优化轨迹来解决参数知识编辑中的主体主导记忆干扰问题,提升关系特异性并减少副作用。

Comments Accepted by IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20241 2026-05-21 cs.LG cs.AI cs.CL 82%

Geometry-Lite: Interpretable Safety Probing via Layer-Wise Margin Geometry

Geometry-Lite: 通过层间边际几何进行可解释的安全探测

Woo Seob Sim, Yu Rang Park

机构 * Yonsei University(延世大学) Yonsei University College of Medicine(延世大学医学院) Department Biomedical Systems Informatics(生物医学系统信息学部门)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了大语言模型在提示级别上的安全探测问题,提出了一种名为Geometry-Lite的紧凑探测器,通过层间边际几何分析来提高安全检测的可解释性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08277 2026-05-21 q-bio.NC cs.AI cs.CL cs.CV cs.LG 82%

Task-conditioned probing of instruction-tuned multimodal LLMs: Region-specific brain alignment patterns under naturalistic stimuli

基于任务的指令调制多模态大语言模型探测:在自然主义刺激下的区域特定大脑对齐模式

Subba Reddy Oota, Khushbu Pahwa, Prachi Jindal, Satya Sai Srinath Namburi, Maneesh Singh, Tanmoy Chakraborty, Bapi S. Raju, Manish Gupta

机构 * Technische Universität Berlin(柏林技术大学) Rice University(Rice 大学) AWS AI Labs, Amazon(Amazon 人工智能实验室) IIT Delhi(德里理工学院) University of Wisconsin - Madison(威斯康星大学麦迪逊分校) Spector Inc(Spector 公司) IIIT-Hyderabad(海得拉巴理工学院) Microsoft(微软)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究探讨了指令调制多模态大语言模型在自然主义刺激下的大脑对齐模式,通过比较不同模型在视频和音频任务中的表现,揭示了指令调制对模型表示能力的影响。

Comments 57 pages, 39 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05942 2026-05-21 cs.CL cs.AI 81%

EvalMORAAL: Interpretable Chain-of-Thought and LLM-as-Judge Evaluation for Moral Alignment in Large Language Models

EvalMORAAL: 可解释的链式推理与大语言模型道德对齐的LLM-as-Judge评估

Hadi Mohammadi, Anastasia Giachanou, Robert A. Bagheri

机构 * Department of Methodology and Statistics, Utrecht University(方法论与统计学系,乌得勒支大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出EvalMORAAL框架,通过两种评分方法和模型作为裁判的同行评审,评估20个大语言模型的道德对齐情况,发现西方与非西方地区存在显著的道德对齐差距。

Comments Accepted as a poster at *SEM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21049 2026-05-21 cs.CL 79%

Cross-lingual robustness of LLM-brain alignment and its computational roots

LLM-脑对齐的跨语言鲁棒性及其计算根源

Ni Yang, Rui He, Philipp Homan, Iris Sommer, Davide Staub, Wolfram Hinzen

机构 * Grammar and Cognition Lab, Department of Translation & Language Sciences, Universitat Pompeu Fabra(语言与翻译科学系语法与认知实验室,庞培法华大学) Department of Adult Psychiatry and Psychotherapy, University of Zurich(苏黎世大学成人精神病学与心理治疗系) Neuroscience Center Zurich, University of Zurich and ETH Zurich(苏黎世大学神经科学中心与苏黎世联邦理工学院) Center for Clinical Neuroscience and Cognition and Department of Psychiatry, University of Groningen, University Medical Center Groningen(格罗宁根大学临床神经科学与认知中心及精神病学系,格罗宁根大学医学中心) Scalable Scientific Machine Learning Lab, Imperial College London, Department of Earth Science and Engineering(伦敦帝国理工学院可扩展科学机器学习实验室,地球科学与工程系) Institut Català de Recerca i Estudis Avançats (ICREA), Barcelona, Spain(加泰罗尼亚高级研究与研究机构(ICREA),巴塞罗那,西班牙)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 该研究探讨了大型语言模型与大脑对齐的跨语言鲁棒性,通过多语言全脑编码框架分析了中文、英语和法语在自然故事听觉过程中大脑与LLM的对齐情况,发现其在空间上具有跨语言重叠性,但无法通过预测不确定性或表征几何来解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20203 2026-05-21 cs.HC cs.AI 79%

GrandGuard: Taxonomy, Benchmark, and Safeguards for Elderly-Chatbot Interaction Safety

GrandGuard:面向老年人与聊天机器人交互安全的分类、基准及防护措施

Changxuan Fan, Xi Yang, Yueyuan Zheng, Bin Zhou, Yuanping Wang, Wenbin Hu, Huihao Jing, Ki Sen Hung, Dazhao Du, Haoran Li, Janet Hui-wen Hsiao, Yangqiu Song

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出GrandGuard框架,用于评估和缓解LLM交互中的老年人特定风险,通过建立包含50种细粒度风险类型的三级分类体系,构建了10,404个标注提示和响应的基准,展示了主流LLM在处理老年人特定情境风险时的不足,并通过两种防护措施实现了高达96.2%和90.9%的不安全提示检测准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20759 2026-05-21 cs.CR 78%

Rethinking Fraud Safety Evaluation: Multi-Round Attacks Reveal Safety-Utility Tradeoffs in Graph-Context LLM Defenders

重新思考欺诈安全评估:多轮攻击揭示图上下文LLM防御中的安全与效用权衡

Laura Jiang, Reza Ryan, Qian Li, Nasim Ferdosian

专题命中 安全评测 :safety(title,abstract)

AI总结 本文通过多轮攻击评估欺诈防御系统,发现图上下文防御在早期安全拒绝方面优于纯文本基线,但同时产生更多的良性误报,揭示了安全与效用之间的权衡。

Comments 19 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08812 2026-05-21 cs.LG 77%

TRAM: Test-Time Risk Adaptation with Mixture of Agents

TRAM: 测试时风险适应与代理混合

Mohamad Fares El Hajj Chehade, Amrit Singh Bedi, Amy Zhang, Hao Zhu

机构 * UT Austin(得克萨斯大学) University of Central Florida(中央佛罗里达大学) MIT(麻省理工学院) UMD(大学公园分校)

专题命中 安全评测 :safety(abstract,abstract_cn);alignment(abstract);分类 cs.LG

AI总结 本文研究了在部署时无需更新的零更新适应问题,提出TRAM方法通过混合代理评估源策略的风险调整分数,以降低部署风险并保持奖励。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20296 2026-05-21 cs.LG cs.AI 73%

Spectral Unforgetting: Post-Hoc Recovery of Damaged Capabilities Without Retraining

谱遗忘:无需重新训练的后验能力恢复

Aarash Abro, Muhammad Tahir

机构 * Zeta Labs(泽塔实验室) Lahore University of Management Sciences(拉合尔管理科学大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨了语言模型在目标任务微调过程中因训练数据未显式威胁而退化的能力现象,提出了一种仅使用预训练检查点和微调后检查点的后验修复方法,通过谱修复技术恢复受损能力并保留目标任务收益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04155 2026-05-21 cs.CL 70%

Toxic Subword Pruning for Dialogue Response Generation on Large Language Models

针对大型语言模型的对话响应生成中的有毒子词修剪

Hongyuan Lu, Wai Lam

机构 * FaceMind Corporation(FaceMind公司) The Chinese University of Hong Kong(香港中文大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本文提出了一种名为ToxPrune的新型算法,通过修剪包含有毒词的子词来防止大型语言模型生成有毒内容,同时提升了对话响应生成任务中非有毒模型的表现。

Comments ACL *SEM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03433 2026-05-21 eess.SY cs.SY 67%

When control meets large language models: From words to dynamics

当控制遇见大语言模型:从词语到动态

Komeil Nosrati, Aleksei Tepljakov, Juri Belikov, Eduard Petlenkov

专题命中 安全评测 :alignment(abstract);trustworthy(abstract)

AI总结 本文探讨了大语言模型与控制之间的双向关系,研究了LLM如何通过直接辅助控制器设计和间接增强研究流程来推动控制领域的发展,同时分析了控制理论如何帮助LLM偏离不良含义,提高可达性和对齐性,并通过状态空间框架将LLM视为动态系统,最后指出了关键挑战和未来研究方向。

Journal ref Engineering Applications of Artificial Intelligence 178(2), 115119 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20270 2026-05-21 cs.LG cs.AI stat.ML 62%

Conformal Selective Acting: Anytime-Valid Risk Control for RLVR-Trained LLMs

conformal selective acting: any-time-valid risk control for rlvr-trained llms

Hamed Khosravi, Xiaoming Huo

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出了一种 conformal selective acting 方法,用于在 rlvr 训练的 llms 部署中实现 anytime-valid 的风险控制,通过在部署要求下强制一个空单元,利用 e-process 和 bonferroni 网格来维护 pathwise 有效性,同时在多个基准测试中证明了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20202 2026-05-21 cs.CL cs.AI 62%

Under Pressure: Emotional Framing Induces Measurable Behavioral Shifts and Structured Internal Geometry in Small Language Models

在压力下:情感框架引发小型语言模型可测量的行为转变和结构化内部几何

Rana Muhammad Usman

机构 * Independent Researcher(独立研究者)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 该研究探讨情感框架如何影响小型本地部署语言模型的行为和内部表示,通过四个不可能约束编码任务和八个后续框架评估,发现压力框架在行为和内部几何上产生显著变化,同时揭示了模型在不同框架下的响应模式。

Comments 18 pages, 4 figures. Exploratory empirical study with fully local experiments on small open language models. Code and data: https://github.com/ranausmanai/LLMEmotionGeometry

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17140 2026-05-21 cs.CV cs.AI cs.CL 62%

UCSF-PDGM-VQA: Visual Question Answering dataset for brain tumor MRI interpretation

UCSF-PDGM-VQA: 用于脑肿瘤MRI解读的视觉问答数据集

Shiv Ghosh, Junayd Lateef, Chih-Hua Liu, Yannan Yu, Andreas M. Rauschecker, Madhumita Sushil

机构 * Fung Institute for Engineering Leadership(工程领导力基金会) University of California, Berkeley(加州大学伯克利分校) Department of Radiology(放射科) University of California, San Francisco(加州大学旧金山分校) Division of Clinical Informatics and Digital Transformation(临床信息学与数字转型部) Department of Neurological Surgery(神经外科部)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一个临床相关的视觉问答基准数据集UCSF-PDGM-VQA,包含2387个问题-答案对,用于评估视觉语言模型在处理多序列3D MRI扫描中的能力,发现现有模型在多模态处理上存在缺陷。

Comments 10 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01449 2026-05-21 cs.AI cs.LG 62%

When AI Gets it Wrong: Reliability and Risk in AI-Assisted Medication Decision Systems

当AI出错时:AI辅助用药决策系统中的可靠性与风险

Khalid Adnan Alsayed

机构 * Ducaltus(Ducaltus公司) School of Computing, Engineering & Digital Technologies(计算、工程与数字技术学院) Teesside University(泰赛德大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了AI辅助用药系统在现实决策中的可靠性问题,通过模拟药物相互作用和剂量决策场景,分析系统故障类型及其潜在临床影响,强调在安全关键领域如药房实践中,需补充传统性能指标的风险意识评估方法。

Comments 9 pages, 1 figure. Position paper with simulated experimental analysis of AI reliability in medication decision systems. Minor Correction to Title Metadata (Typo Fix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21404 2026-05-21 cs.LG 57%

What Twelve LLM Agent Benchmark Papers Disclose About Themselves: A Pilot Audit and an Open Scoring Schema

十二篇LLM代理基准测试论文披露了什么:一项初步审计和开放评分方案

Mahdi Naser Moghadasi, Faezeh Ghaderi

机构 * Research Division, BrightMind AI(BrightMind AI研究部) Texas Tech University(德克萨斯理工大学) University of Texas at Arlington(德克萨斯大学阿灵顿分校)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 本文通过分析十二篇知名LLM代理基准测试论文,揭示了这些论文在评估方法披露方面的不足,设计了一种开放评分方案以提高透明度和可重复性。

Comments Pilot audit of 12 LLM agent benchmark papers; schema, codebook, and per-paper scoring sheet released. Submission to IEEE Big Data 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21086 2026-05-21 cs.CL 57%

LoCar: Localization-Aware Evaluation of In-Vehicle Assistants through Fine-Grained Sociolinguistic Control

LoCar: 通过细粒度社会语言学控制评估车载助手的本地化

Seogyeong Jeong, Kiwoong Park, Seyoung Song, Eunsu Kim, Ken E. Friedl, Jaeho Kim, Alice Oh

机构 * KAIST(韩国科学技术院) BMW Group(宝马集团)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本文提出了一种新的车载助手评估框架,专注于韩语本地化,揭示了当前LLM在细粒度韩语敬语控制方面的不稳定性以及策略性对话指标上的表现不足,强调了汽车AI需要向精确语言定制和可靠安全交互管理发展。

Comments To appear in ACL 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21083 2026-05-21 physics.app-ph cs.LG physics.bio-ph physics.med-ph 57%

AIMBio-Mat: An AI-Native FAIR Platform for Closed-Loop Materials Discovery and Biomedical Translation

AIMBio-Mat: 一个面向AI的FAIR平台,用于闭环材料发现与生物医学转化

D. -M. Mei, K. Acharya, C. M. Adhikari, M. Adhikari, S. Aryal, B. V. Benson, K. Bhatta, S. Bhattarai, N. Budhathoki, A. M. Castillo, D. Chakraborty, S. Chhetri, S. Choudhury, T. A. Chowdhury, R. D. Cruz, B. Cui, S. Dhital, K. -M. Dong, R. Gapuz, A. Ghasemi, E. Z. Gnimpieba, B. D. S. Gurung, H. A. Hashim, R. I. Harry, K. -E. Hasin, M. K. Hassanzadeh, M. K. Jha, D. Kim, K. -C. Kong, B. Lama, A. Mahat, N. Maharjan, A. Majeed, J. Mammo, M. M. Masud, K. S. Moore, A. Nawaz, H. Oli, S. A. Panamaldeniya, L. Pandey, R. Pandey, Z. Peng, A. Prem, M. M. Rana, K. Rana Magar, R. Rizk, C. S. Tadi, L. -W. Wang, Y. Yang, G. -L. Yin, C. -X. Yu, D. Zeng, M. Zhou, Q. Zhou

机构 * Department of Physics, University of South Dakota(南达科他大学物理系) South Dakota School of Mines and Technology(南达科他州矿学院) Department of Chemistry, Physics and Materials Science, Fayetteville State University(费耶特维尔州立大学化学、物理与材料科学系) University of South Dakota(南达科他大学) PROMISE Lab, Sanford Research(桑福德研究机构PROMISE实验室) Department of Mechanical Engineering, University of Mississippi(密西西比大学机械工程系) Department of Physics and Astronomy, University of Kansas(堪萨斯大学物理与天文学系) Tiospa Zina Tribal School(蒂奥萨宾纳部落学校) Department of Mechanical and Materials Engineering, University of Nebraska–Lincoln(内布拉斯加大学林肯分校机械与材料工程系)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 本文提出AIMBio-Mat平台,通过整合材料来源、生物医学背景、知识图谱、不确定性感知的机器学习和人机协作主动学习,解决材料发现与生物医学转化中跨领域推理的问题,并提供可验证的平台蓝图。

Comments 35 pages, 4 figures, and 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20729 2026-05-21 cs.CL 57%

MTR-Suite: A Framework for Evaluating and Synthesizing Conversational Retrieval Benchmarks

MTR-Suite: 一个用于评估和合成对话检索基准的框架

Junhao Ruan, Abudukeyumu Abudula, Bei Li, Yongjing Yin, Xinyu Liu, Kechen Jiao, Xin Chen, Jingang Wang, Xunliang Cai, Tong Xiao, Jingbo Zhu

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) Meituan Inc.(美团公司) NiuTrans Research(牛译研所) Tsinghua University(清华大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出MTR-Suite框架,通过LLM审计、多智能体系统生成和通用领域基准,解决对话检索基准评估和合成中的成本高、标注稀疏和自动化方法僵化的问题。

Comments Accepted to ACL 2026 (main conference). 28 pages. Code and data: https://github.com/rangehow/mtr-suite

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18579 2026-05-21 cs.LG 57%

S2Aligner: Pair-Efficient and Transferable Pre-Training for Sparse Text-Attributed Graphs

S2Aligner: 用于稀疏文本属性图的高效且可迁移的预训练方法

Yuhan Wang, Haopeng Zhang, Yibo Ding, Jiaqi Yu, Xinyu Zhao, Yuhang Liu, Ziwei Zhang, Xiao Wang, Ruijie Wang

机构 * Beihang University(北航大学) Tianjin University(天津大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文提出S2Aligner,一种针对稀疏文本属性图的高效且可迁移的预训练方法,通过解耦语义对齐与结构建模,增强对齐过程而不污染共享的语义空间,从而减少跨域泛化差距。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17269 2026-05-21 cs.CV cs.AI 57%

FineVision: Open Data Is All You Need

FineVision: 你只需要开放数据

Luis Wiedmann, Orr Zohar, Amir Mahla, Xiaohan Wang, Rui Li, Thibaud Frere, Leandro von Werra, Aritra Roy Gosthipaty, Andrés Marafioti

机构 * Hugging Face Technical University of Munich(慕尼黑技术大学) Stanford University(斯坦福大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出FineVision,一个包含2400万样本的高质量数据集,通过半自动化流程整合了200多个来源,通过严格的数据清洗和人工审核确保数据质量,训练基于该数据集的模型在广泛评估中表现更优,推动数据驱动的视觉语言模型研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09215 2026-05-21 cs.AI cs.CR 57%

Enabling Regulatory Multi-Agent Collaboration: Architecture, Challenges, and Solutions

使监管多智能体协作成为可能:架构、挑战与解决方案

Qinnan Hu, Yuntao Wang, Yuan Gao, Zhou Su, Linkang Du, Qichao Xu

机构 * School of Cyber Science and Engineering(网络科学与工程学院) Xi'an Jiaotong University(西安交通大学) School of Mechatronic Engineering and Automation(机械电子工程与自动化学院) Shanghai University(上海大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出了一种基于区块链的分层架构,用于监管智能体协作,设计了三个关键模块以实现自动问责、动态声誉评估和恶意行为预测,从而建立可信、健壮和可扩展的监管机制。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20355 2026-05-21 cs.RO cs.HC cs.LG 57%

Proximal State Nudging: Reducing Skill Atrophy from AI Assistance

近端状态引导:减少人工智能辅助下的技能退化

Megha Srivastava, Jonathan Ouyang, Eric Zhou, Andrew Silva, Emily Sumner, Dorsa Sadigh, Yuchen Cui, Deepak Gopinath, Guy Rosman

机构 * Stanford University(斯坦福大学) University of California Los Angeles(加州大学洛杉矶分校) Toyota Research Institute(丰田研究院)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种名为近端状态引导(PSN)的共享自主算法,通过引导用户向最易学习的状态发展,同时优化技能发展和任务表现,以减少人工智能辅助下的技能退化问题。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21090 2026-05-21 cs.CV 50%

TextSculptor: Training and Benchmarking Scene Text Editing

TextSculptor: 训练和评估场景文本编辑

Yiheng Lin, Siyu Jiao, Xiaohan Lan, Wei Zhou, Qi She, Fei Yu, Heyun Chen, Zhengwei Wang, Jinghuan Chen, Moran Li, Yingchen Yu, Zijian Feng, Yao Zhao, Yunchao Wei, Yujie Zhong

机构 * Beijing Jiaotong University(北京交通大学) Bytedance(字节跳动)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出TextSculptor框架,通过构建大规模数据集和基准测试,解决场景文本编辑中高质量训练数据稀缺和缺乏标准化评估的问题,提升开源模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20777 2026-05-21 cs.CV 50%

AttriStory: Fine-grained Attribute Realization for Visual Storytelling with Diffusion Models

AttriStory: 基于扩散模型的视觉叙事中细粒度属性实现

Manogna Sreenivas, Rohit Kumar, Soma Biswas

机构 * Indian Institute of Science(印度科学研究院)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出AttriStory基准,通过细粒度属性实现提升视觉叙事的质量,引入了在早期去噪步骤中操作的潜在优化模块,并通过AttriLoss目标增强属性-对象对的对齐度,从而实现更精确的属性定位。

Comments Accepted at CVPR AIStory Workshop, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20676 2026-05-21 cs.CV 50%

VISTAQA: Benchmarking Joint Visual Question Answering and Pixel-Level Evidence

VISTAQA: 评估联合视觉问答与像素级证据

Mozhgan Nasr Azadani, Yimu Wang, Yongpeng Zhu, Lihong Chen, Milan Ganai, Sean Sedwards, Marco Pavone, Krzysztof Czarnecki

机构 * University of Waterloo(滑铁卢大学) Stanford University(斯坦福大学) NVIDIA(英伟达)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出VISTAQA基准,用于评估视觉问答中自由回答的正确性和像素级证据的定位,通过引入GROVE指标,强调回答正确性与视觉证据对齐的重要性,实验显示现有系统在该指标下表现有限,揭示了回答准确性和视觉证据对齐之间的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15281 2026-05-21 cs.SE 50%

Semantic Grounding of Digital Twin Metamodels Using RDF Graphs

基于 RDF 图的数字孪生元模型语义 grounding

Faima Abbasi, Jean-Sébastien Sottet, Cedric Pruski

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出了一种基于 RDF 图的数字孪生元模型语义 grounding 方法,通过设计多层数字孪生模型、将元模型提升为 RDF 图以及图基对齐方法 SSM-OM,实现了多层数字孪生的语义一致性与互操作性。

Comments Submitted to Conference, 15 pages excluding references, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00520 2026-05-21 cs.CV 50%

CardioBench: Do Echocardiography Foundation Models Generalize Beyond the Lab?

CardioBench: 心脏超声基础模型是否能超越实验室?

Darya Taratynova, Ahmed Aly, Numan Saeed, Mohammad Yaqub

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫莫德·本·扎耶德人工智能大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出CardioBench,一个用于评估心脏超声基础模型的基准,通过统一多个公开数据集,评估不同模型在零样本、探测和对齐协议下的性能,揭示通用模型在功能任务上表现优异,但细粒度区分任务上存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20469 2026-05-21 cs.CV 50%

HalluCXR: Benchmarking and Mitigating Hallucinations in Medical Vision-Language Models for Chest Radiograph Interpretation

HalluCXR: 评估和缓解医疗视觉-语言模型在胸部X光解读中的幻觉

Haoyu Wang, Zitong Li

机构 * Department of Biostatistics & Health Informatics, Institute of Psychiatry, Psychology & Neuroscience, King’s College London(生物统计学与健康信息学系,精神病学、心理学与神经科学研究所,伦敦国王学院)

专题命中 安全评测 :safety(abstract)

AI总结 本文提出HalluCXR基准,评估六种不同架构的视觉-语言模型在856例分层MIMIC-CXR胸部X光图像上的表现,发现61.9%-82.3%的输出存在幻觉,其中80.2%存在临床危险错误,通过引入幻觉分类学、检测管道和模型集成方法,提出了缓解幻觉的策略。

详情

展开后加载摘要…

URL PDF HTML 收藏