arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 2719 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 984 篇

2607.02230 2026-07-03 cs.CV cs.AI 新提交 57%

Efficient Waste Sorting for Circular Economy: A Confidence-guided comparison between One-Vs-All and One-Vs-Rest Classification Strategies with Human-in-the-Loop for Automated Waste Sorting

面向循环经济的高效废物分类:基于置信度的人机协同自动废物分类中一对多与一对一分类策略比较

Mohammed Fahad Ali, Dominique Briechle, Marit Briechle-Mathiszig, Tobias Geger, Andreas Rausch

机构 * Institute for Software and Systems Engineering(软件与系统工程研究所) Clausthal University of Technology(克莱斯特哈根技术大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 针对德国不同城市废物分类方案差异问题,比较OvA和OvR分类策略,通过置信度阈值筛选不确定样本进行人工复核,平衡误分类与人工标注成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01936 2026-07-03 cs.MA cs.AI 新提交 57%

CausalSteward: An Agentic Divide-Conquer-Combine Copilot for Causal Discovery

CausalSteward: 一种用于因果发现的智能分治-合并副驾驶

Nicholas Tagliapietra, Gian Lorenzo Marchioni, Moritz Willig, Juergen Luettin, Lavdim Halilaj, Kristian Kersting

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 提出CausalSteward多智能体框架,通过分治策略将高维变量迭代划分并分别分析,融合先验知识与数据驱动方法,解决因果可识别性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01522 2026-07-03 eess.SY cs.AI cs.CE cs.SY 新提交 57%

Robust and Explainable 3D Mode Shape Recognition Using Region-Aware Graph Neural Networks

鲁棒且可解释的3D模态形状识别:基于区域感知图神经网络

Tong Duy Son, Marc Brughmans, Andrey Hense, Kohta Sugiura, Sebastian Ciceo, Paolo di Carlo, Theo Geluk

机构 * Siemens Digital Industries Software(西门子数字工业软件) KU Leuven(根特大学) Department of Mechanical Engineering(机械工程系)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 提出规范工程图表示与区域感知图学习框架,将异构有限元模型和实验测量转化为通用图,通过图注意力学习和区域感知池化实现跨车辆架构的鲁棒3D模态形状识别,并提供物理解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01388 2026-07-03 cs.CL 新提交 57%

RusFinChain: A Russian Benchmark for Verifiable Chain-of-Thought Reasoning in Finance with Fuzzy-Aligned Evaluation

RusFinChain:面向金融领域可验证思维链推理的俄语基准与模糊对齐评估

M. K. Arabov

机构 * Kazan Federal University(喀山联邦大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 提出首个俄语金融可验证思维链推理基准RusFinChain,包含5280个参数化示例和模糊对齐评估指标,揭示模型在步骤对齐与最终答案正确性之间存在显著差距。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01278 2026-07-03 cs.LG 新提交 57%

Multilayer Q-Matrix-Embedded Neural Network for Cognitive Diagnosis (M-QCDNet): Structure-Aware Deep Learning Architecture for Psychometric Interpretability

多层Q矩阵嵌入的认知诊断神经网络(M-QCDNet):面向心理测量可解释性的结构感知深度学习架构

Yiyao Yang

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 提出M-QCDNet,将Q矩阵作为结构先验嵌入神经网络,通过带L2惩罚的损失函数平衡预测性能与结构对齐,实现可解释的认知诊断。

Comments 15 pages, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31478 2026-07-01 cs.AI cs.CV 新提交 57%

One Reflection Is Not Enough: Self-Correcting Autonomous Research via Multi-Hypothesis Failure Attribution

一次反思不够:通过多假设失败归因进行自我修正的自主研究

Jie Ma, Binfei Chu, Jie Gao, Jinlu Zhang, Yiwei Ma, Yi Tan, Jiayi Ji, Xiaoshuai Sun, Rongrong Ji

机构 * Xiamen University(厦门大学) Hello Inc.(Hello公司) Xiaohongshu Inc.(小红书公司)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 提出SAGE框架,通过多假设失败归因(MHFA)机制将实验失败恢复转化为结构化因果诊断,显著提升自主研究代理的可靠性和产出质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31470 2026-07-01 cs.AI 新提交 57%

CLOUDADV: Decision-Aligned Instance Sizing with Zero-Shot Foundation Models under Drift

CLOUDADV: 漂移下基于零样本基础模型的决策对齐实例大小调整

Jack Bell, Giacomo Carfi, Gerlando Gramaglia, Andrea Simioni, Daniele Fontani, Vincenzo Lomonaco

机构 * University of Pisa(比萨大学) Independent Researcher(独立研究员) Sintra Consulting Limited(Sintra咨询有限公司) Luiss University(路易斯大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 提出CLOUDADV系统,结合零样本时间序列预测与有界推荐生成,在非平稳云环境中实现决策对齐的实例大小调整,通过参考推荐和成本节约评估,在7个生产VM案例中实现52.9%成本节省。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31334 2026-07-01 cs.AI 新提交 57%

Optimization Algorithms for Joint OFDM Waveform Design and RIS Configuration in 6G Networks: From Convex Relaxation to Foundation Models

面向6G网络的联合OFDM波形设计与RIS配置的优化算法:从凸松弛到基础模型

Ahmet Kaplan

机构 * Istanbul Medipol University(伊斯坦布尔梅迪波尔大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 综述2021-2026年间78篇联合OFDM-RIS优化工作,将其分为四类范式,发现基于ML的方法在推理速度上比模型方法快2-4个数量级,并指出六个开放挑战。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31325 2026-07-01 cs.AI 新提交 57%

HistoriQA-ThirdRepublic: Multi-Hop Question Answering Corpus for Historical Research, Parliamentary Debates from the French Third Republic (1870-1940)

HistoriQA-ThirdRepublic: 面向历史研究的多跳问答语料库——来自法兰西第三共和国(1870-1940)的议会辩论

Aurélien Pellet, Julien Perez, Marie Puren

机构 * LRE EPITA EPITECH Bpifrance CJM

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 提出一个法语多跳历史问答数据集,基于第三共和国议会辩论和报纸,由历史学家协作构建,涵盖跨源综合、时间推理等复杂推理模式,共1782个问题,用于评估检索增强和大型语言模型在特定领域的效果。

Journal ref LREC 2026: Language Resources and Evaluation Conference, ELRA Language Resources Association, May 2026, Palma de Mallorca, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31209 2026-07-01 cs.AI cs.RO 新提交 57%

Long-term Traffic Simulation via Structured Autoregressive Modeling

基于结构化自回归建模的长期交通仿真

Lingyu Xiao, Zexin Feng, Xintao Yan

机构 * The University of Hong Kong(香港大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 提出RosettaSim框架,利用大规模序列模型的归纳偏置和统计先验,通过结构化自回归流建模场景拓扑、智能体状态和生成意图,实现短期准确与长期稳定仿真;并引入基于检索的交通评估(RTE)解决长期评估难题。

Comments ECCV 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27154 2026-07-01 cs.AI 新提交 57%

OpenRCA 2.0: From Outcome Labels to Causal Process Supervision

OpenRCA 2.0:从结果标签到因果过程监督

Aoyang Fang, Yifan Yang, Jin'ao Shang, Qisheng Lu, Junjielung Xu, Rui Wang, Songhan Zhang, Yuzhong Zhang, Boxi Yu, Pinjia He

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 针对现有根因分析数据集仅标注结果而忽略因果传播路径的问题,提出PAVE协议重建因果路径,构建OpenRCA 2.0基准,发现LLM在根因定位中因果验证不足的缺陷。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24392 2026-07-01 cs.AI 新提交 57%

ATRIA: Adaptive Traceable ECG Reporting with Iterative Agents

ATRIA: 自适应可追溯心电图报告与迭代智能体

Donggyun Hong, Kyuhwan Lee, Junmyung Kwon, Yong-Yeon Jo

机构 * MedicalAI Co., Ltd.(MedicalAI有限公司)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 提出多智能体系统ATRIA,模拟临床医生迭代工作流,实现可追溯、可编辑的心电图报告生成,支持证据绑定和中间修正。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28011 2026-06-29 eess.SY cs.LG cs.SY 新提交 57%

From Detection to Action: Using LLM Agents for Fault-Tolerant Control

从检测到行动:使用LLM智能体进行容错控制

Javal Vyas, Milapji Singh Gill, Artan Markaj, Felix Gehlhoff, Mehmet Mercangöz

机构 * Imperial College London(帝国理工学院伦敦校区) Helmut Schmidt University(海德堡-施密特大学)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 提出基于大语言模型智能体的主动容错控制框架,通过多智能体协作、数字孪生和知识图谱增强检索,生成并验证最小风险恢复路径,在离散和连续过程控制中实现从故障检测到有效纠正行动的闭环。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27757 2026-06-29 cs.AI 新提交 57%

Towards Reliable and Robust LLM Planning: Symbolic Feedback-Driven Iterative Self-Refinement Framework

迈向可靠稳健的LLM规划:符号反馈驱动的迭代自我精炼框架

Jiajing Zhang, Jiamei Jiang, Chenyang Zhang, Feifei Mo, Linjing Li, Daniel Zeng

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 提出符号反馈驱动的迭代自我精炼框架,通过自然语言提示、符号验证器和计划识别器增强LLM在长时域规划中的鲁棒性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27624 2026-06-29 cs.RO cs.LG 新提交 57%

Physics-Guided Robotic Radiation Source Localization along Arbitrary Measurement Paths in Unstructured Environments

物理引导的机器人辐射源定位:非结构化环境中沿任意测量路径

Hojoon Son, Kai Tan, Fan Zhang

机构 * George W. Woodruff School of Mechanical Engineering, Georgia Institute of Technology(乔治·W·伍德拉夫机械工程学院,佐治亚理工学院)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 提出基于物理信息机器学习(PIML)的框架,使机器人沿任意路径在未知环境中精确估计辐射源位置,避免接近源,并通过并行计算提高鲁棒性。

Comments 18 pages, 14 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27500 2026-06-29 cs.CV cs.CL 新提交 57%

Aloe-Vision: Robust Vision-Language Models for Healthcare

Aloe-Vision: 面向医疗保健的鲁棒视觉-语言模型

Jaume Guasch-Martí, Enrique Lopez-Cuena, Martín Suárez-Fernández, Jordi Bayarri-Planas, Anna Arias-Duart, Dario Garcia-Gasulla

机构 * Barcelona Supercomputing Center (BSC)(巴塞罗那超级计算中心(BSC))

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 提出Aloe-Vision系列医疗LVLM,通过大规模高质量多模态数据微调,在保持通用能力的同时提升医疗任务性能,并引入低污染基准CareQA-Vision,揭示当前模型在临床环境中的鲁棒性挑战。

Comments MIDL 2026

Journal ref Proceedings of Machine Learning Research, Vol. 315, pp. 2404-2426, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25651 2026-06-29 cs.CL 新提交 57%

MedGuards: Multi-Agent System for Reliable Medical Error Detection and Correction

MedGuards: 用于可靠医疗错误检测与纠正的多智能体系统

Congbo Ma, Hu Wang, Yichun Zhang, Farah E. Shamout

机构 * New York University Abu Dhabi(纽约大学阿布扎比分校) Khalifa University(哈利法大学) New York University(纽约大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 提出MedGuards框架,通过多智能体上下文学习与置信度引导仲裁机制,无需额外训练即可检测、定位和纠正医疗文本错误,并引入关键词优先纠正评分(KPCS)评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15708 2026-06-29 cs.AI 新提交 57%

Artificial Intelligence Index Report 2026

人工智能指数报告2026

Sha Sajadieh, Loredana Fattorini, Raymond Perrault, Yolanda Gil, Vanessa Parli, Lapo Santarlasci, Juan Pava, Nestor Maslej, Russ Altman, Erik Brynjolfsson, Carla Brodley, Jack Clark, Virginia Dignum, Vipin Kumar, James Landay, Terah Lyons, James Manyika, Juan Carlos Niebles, Yoav Shoham, Elham Tabassi, Russell Wald, Toby Walsh, Dan Weld

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本报告追踪AI在推理、安全及现实任务执行方面的测试进展,分析治理框架、评估方法与技术发展之间的差距,并新增AI在科学与医学领域的独立章节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27174 2026-06-26 cs.LG 新提交 57%

RecallRisk-BERT: A Multi-Task Framework for Post-Report Medical Device Recall Triage

RecallRisk-BERT:用于报告后医疗器械召回分类的多任务框架

Ali Semih Atalay, Sevgi Yigit-Sert

机构 * Department of Computer Engineering, Faculty of Engineering, Ankara University(安卡拉大学工程学院计算机工程系)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 提出RecallRisk-BERT多任务模型,联合预测召回严重等级和根因类别,在FDA数据集上优于单任务基线,支持可扩展的召回分类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26922 2026-06-26 cs.RO cs.AI 新提交 57%

Risk-Aware Selective Multimodal Driver Monitoring with Driver-State World Modeling

风险感知的选择性多模态驾驶员监控与驾驶员状态世界建模

Daosheng Qiu, Haozhuang Chi, Hao Su, Shu Long, Xinyue Miao, Yongle Dong, Wei Zhang

机构 * Hubei University(湖北大学) Nanyang Technological University(南洋理工大学) Osaka University(大阪大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 提出成本感知的选择性推理框架,结合轻量级RGB-生理学生网络和门控机制,在低延迟下减少不安全决策,实现可部署的多模态驾驶员监控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26794 2026-06-26 cs.CV cs.AI 新提交 57%

ReasonCLIP-58M: Visually Grounded Commonsense Reasoning Supervision for CLIP

ReasonCLIP-58M: CLIP的视觉基础常识推理监督

Sicheng Zhang, Muzammal Naseer, Binzhu Xie, Naufal Suryanto, Shi Qiu, Jamal Bentahar, Naveed Akhtar, Mubarak Shah

机构 * Khalifa University(卡利法大学) University of Western Australia(西澳大学) The Chinese University of Hong Kong(香港中文大学) University of Melbourne(墨尔本大学) University of Central Florida(佛罗里达中央大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 提出ReasonCLIP-58M框架,通过两阶段策略将大规模推理监督集成到CLIP模型中,构建ReasonLite-42M和ReasonPro-16M数据集及RCLIP-Bench基准,提升视觉基础常识推理和零样本检索性能。

Comments Accepted to ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26566 2026-06-26 cs.CR cs.CL 新提交 57%

Adversarial Diffusion Across Modalities: A Fusion Survey of Attacks, Defenses, and Evaluation for Text, Vision, and Vision-Language Models

跨模态对抗扩散:文本、视觉与视觉-语言模型的攻击、防御与评估融合综述

Abrar Alotaibi, Moataz Ahmed

机构 * Information and Computer Science Department, King Fahd University of Petroleum & Minerals(国王法赫德石油矿物大学信息与计算机科学系) College of Computer Science and Information Technology, Imam Abdulrahman Bin Faisal University(伊玛目阿卜杜勒拉赫曼·本·法伊塞尔大学计算机科学与信息科技学院) SDAIA-KFUPM Joint Research Center for Artificial Intelligence, King Fahd University of Petroleum & Minerals(SDAIA-KFUPM人工智能联合研究中心,国王法赫德石油矿物大学)

专题命中 安全评测 :jailbreak(abstract);分类 cs.CL

AI总结 本文整合了文本、图像分类器和视觉-语言模型上的对抗攻击与防御研究,提出统一分类法和评估框架,并识别了当前文献中的五个常见弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26346 2026-06-26 cs.AI 新提交 57%

How Do Tool-Augmented LLM Agents Perform on Real-World Energy Analytics Tasks?

工具增强的LLM智能体在真实世界能源分析任务中的表现如何?

David Akinpelu, Akintonde Abbas, Rereloluwa Alimi, Ayodeji Lana

机构 * Independent Researcher(独立研究员) Tume AI

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 针对能源领域缺乏智能体评估基准的问题,构建了包含243个专家策划问题的测试环境,评估工具增强的LLM智能体在数据检索、知识解释和定量建模三类任务上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25894 2026-06-25 cs.CV cs.AI 新提交 57%

Enhancing Brain MRI Anomaly Detection and Reasoning with ROI Rethink and Synthetic Data

通过ROI重思考与合成数据增强脑部MRI异常检测与推理

Shangkun Li, Jie Xu, Yi Guo, Zeju Li, Yuanyuan Wang

机构 * College of Biomedical Engineering, Fudan University(复旦大学 生物医学工程学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 提出BrReMark框架,通过显式区域标记和假设验证机制增强脑部MRI诊断的可信度,结合结构化推理轨迹的监督微调和强化学习,以及基于域随机化的病理合成增强,显著提升定位精度并减少幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25819 2026-06-25 cs.CL cs.SE 新提交 57%

Beyond Function Calling: Benchmarking Tool-Using Agents under Tool-Environment Unreliability

超越函数调用:工具环境不可靠性下的工具使用智能体基准测试

Yang Tian, Zhengpeng Shi, Yu Zhou, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 提出ToolBench-X基准,在工具环境中注入五种可恢复可靠性风险,评估智能体任务完成能力,发现可靠工具下表现良好的智能体在可恢复风险下失败,失败主因是诊断和恢复能力不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25529 2026-06-25 cs.SD cs.AI 新提交 57%

STEB: A Speech-to-Speech Translation Expressiveness Benchmark for Evaluating Beyond Translation Fidelity

STEB:用于评估超越翻译保真度的语音到语音翻译表现力基准

Sitong Cheng, Weizhen Bian, Songjun Cao, Jin Li, Bei Liu, Chunyang Jiang, Yike Zhang, Weihao Wu, Yiming Li, Chi-Min Chan, Long Ma, Wei Xue

机构 * Hong Kong University of Science and Technology(香港科技大学) Tencent Youtu Lab(腾讯优图实验室) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 提出STEB基准,通过描述-总结框架评估语音到语音翻译在情感、场景风格和非语言发声方面的表现力,发现现有系统在语义保真度上表现良好但表现力保留不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25445 2026-06-25 cs.CV cs.AI 新提交 57%

C3-Bench: A Context-Aware Change Captioning Benchmark

C3-Bench:一种上下文感知的变化描述基准

Jae-Woo Kim, Hyeongbeom Kim, Ue-Hwan Kim

机构 * Gwangju Institute of Science and Technology(光州科学技术院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 提出C3-Bench基准,包含51种真实变化场景的4996对图像,并首次引入LLM-as-Judge评估框架,揭示现有模型在非训练分布场景下的系统性盲点。

Comments ECCV 2026 Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25396 2026-06-25 cs.AI 新提交 57%

Long-Term Simulation Exposes Cognitive-Developmental Risks in AI Companions

长期模拟揭示AI伴侣的认知发展风险

Kaicheng Shen, Lingyu Li, Wen Wu, Yan Teng, Liang He, Yingchun Wang

机构 * Shanghai Institute of Artificial Intelligence for Education, East China Normal University(华东师范大学上海人工智能教育研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 提出TSJ框架,通过角色驱动用户模拟、动态心理状态更新和回顾性评估,在12,960模拟人天交互中揭示短期测试低估长期认知发展风险,并识别出幼儿期和成年初期为最脆弱阶段。

Comments 19 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19887 2026-06-25 cs.CR cs.AI 新提交 57%

FinRED: An Expert-Guided Benchmark Generation and Evaluation Framework for Financial LLM Red-Teaming

FFinRED:面向金融大语言模型红队测试的专家引导基准生成与评估框架

Chaeyun Kim, Daeyoung Park, Junghwan Kim, Jinyoung Jeong, Eunji Song, Yongtaek Lim, Minwoo Kim

机构 * DATUMO INC.(DATUMO公司) Korea Advanced Institute of Science and Technology (KAIST)(韩国先进科学研究院) Financial Security Institute (FSI)(金融安全研究所)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 提出FinRED框架,通过专家引导的两级分类法将全球金融标准映射为威胁,并利用真实金融文档生成上下文丰富的红队行为提示,结合专家验证的评估标准,有效降低关键假阴性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24797 2026-06-24 cs.CV cs.AI 新提交 57%

EG-VQA: Benchmarking Verifiable Video Question Answering with Grounded Temporal Evidence

EG-VQA: 基于接地时间证据的可验证视频问答基准

Linpeng Huang, Weixing Chen, Zexin Chen, Yang Liu, Liang Lin

机构 * Sun Yat-sen University(中山大学) Peng Cheng Laboratory(鹏城实验室) Shenzhen University(深圳大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 提出EG-VQA基准,通过细粒度时间证据标注和EG-F1指标,揭示视频大模型在答案正确性与证据定位之间的差距,并引入EG-Reasoner模型弥合这一差距。

详情

展开后加载摘要…

URL PDF HTML 收藏