arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-06 至 2026-08-06 共收录 42 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 42 篇

2601.23112 2026-08-06 cs.CY 版本更新 88%

How Should AI Safety Benchmarks Benchmark Safety?

AI安全基准应该如何进行基准测试?

Cheng Yu, Severin Engelmann, Ruoxuan Cao, Dalia Ali, Orestis Papakyriakopoulos

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY

AI总结 本文提出改进AI安全基准的方法,通过系统回顾210个基准,指出其技术、知识论和社会技术缺陷,并提出稳健度量和风险管理原则以提升基准有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05086 2026-08-06 cs.AI cs.CL 新提交 87%

Item Response Theory for AI Safety

面向AI安全的项目反应理论

Joshua Fonseca Rivera, Neil Shah, David Demitri Africa, Konstantinos Voudouris

机构 * Independent(独立研究者)

专题命中 安全评测 :safety(title,abstract);AI safety(title);分类 cs.CL、cs.AI

AI总结 该研究将项目反应理论(IRT)应用于192个语言模型的8个安全基准,识别出三个关键因素,证明IRT可降低评估成本并审计模型,建议前沿实验室采用。

Comments 15 pages, 9 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04626 2026-08-06 cs.CR 新提交 85%

Blockchain Empowered Trustworthy Agent Networks: Foundations, Taxonomy, and Future Directions

区块链赋能的可信智能体网络:基础、分类与未来方向

Liehuang Zhu, Yuhang Li, Tianxing Wang, Zhihao Chen, Ke Li, Hongyi Liu, Yajie Wang, Lei Xu, Peng Jiang, Zijian Zhang

专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);safety(abstract)

AI总结 本文综述从经典多智能体系统到开放智能体网络的演化,构建五维信任分类,明确区块链作为共享信任层为可信智能体网络提供多类支撑机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02684 2026-08-06 q-bio.QM cs.AI 版本更新 83%

A Blind Spot in Alignment: Quantifying Biosecurity Risks in Large Language Models

对齐机制中的盲区:量化大语言模型的生物安全风险

Shu Quan, Tianfang Hao, Sitong Fang, He Geng, Jiayi Zhou, Boyuan Chen, Kaile Wang, Donghai Hong, Juntao Dai, Yaodong Yang, Jiaming Ji

专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.AI

AI总结 本研究针对大语言模型生物安全评估盲区,构建SPIKE-Bench评估框架,发现多数模型易生成毒素序列,提出BioSafe-Guard分类器降低功能风险并开源相关资源。

Comments Accepted to COLM 2026. 40 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21396 2026-08-06 cs.CV cs.AI 83%

VG-CoT: Towards Trustworthy Visual Reasoning via Grounded Chain-of-Thought

VG-CoT:通过 grounded Chain-of-Thought 实现可信的视觉推理

Byeonggeuk Lim, Kyeonghyun Kim, JungMin Yun, YoungBin Kim

机构 * Graduate School of Advanced Imaging Science, Multimedia & Film, Chung-Ang University(高级影像科学、多媒体与电影研究生院, Chung-Ang 大学) Department of Artificial Intelligence, Chung-Ang University(人工智能系, Chung-Ang 大学)

专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);分类 cs.AI

AI总结 本文提出 VG-CoT 数据集,通过自动化三阶段流程将推理步骤与图像真实视觉证据联系起来,提升大视觉-语言模型的可信度和推理能力。

Comments Accepted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05107 2026-08-06 cs.AI cs.MA cs.SE 新提交 79%

CoPlan: A Trustworthy Co-Intelligence Interface for Care Planning through Role-Based Contestable Argument Graphs

CoPlan:一种基于角色可争议论证图的可信协同智能照护规划界面

Hung Truong Thanh Nguyen, Hélène Fournier, Piper Jackson, Makoto Itoh, Shannon Freeman, Rene Richard, Hung Cao

机构 * University of New Brunswick(新不伦瑞克大学) National Research Council Canada(加拿大国家研究委员会) Thompson Rivers University(汤普森河大学) ISB Corporation(ISB公司) University of Northern British Columbia(北英属哥伦比亚大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

AI总结 本研究提出CoPlan界面,通过多智能体工作流结合协同智能与可争议性,实现人机协同照护规划,保留人类自主性与临床问责制,已在就地养老场景中验证其有效性。

Comments Accepted at the 2026 International Conference on Next Generation AI Systems (NGEN-AI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04776 2026-08-06 cs.AI 新提交 79%

NSF-HRPT: Neural Semantic Field meets Hierarchical Risk Perception Tree for Safety-Critical Scenario Assessment

NSF-HRPT:神经语义场结合分层风险感知树的安全关键场景评估方法

Yu Zhao, Jiangyu Pan, Tao Hu, Ming Yin, Fan Yang, Jiangfan Liu, Xiubo Liang

机构 * Zhejiang University(浙江大学) Beihang University(北京航空航天大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 该研究提出NSF-HRPT框架,结合神经语义场与分层风险感知树,引入Sim2Real策略,实现单目视觉输入下安全关键场景的高效风险评估,在合成与现实数据集上均取得优异性能。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04768 2026-08-06 cs.CV 新提交 78%

Embedding Large Language Models into Flow Controls: An Agentic Framework for Adaptive and Trustworthy Automated Cooking

将大语言模型嵌入流程控制:一种用于自适应且可信的自动化烹饪的智能体框架

Zihan Song, Hongwei Huang, Yueshuo Sun, Yonglin Tian, Fei-Yue Wang, Bai Li

专题命中 安全评测 :trustworthy(title,abstract)

AI总结 针对自动化烹饪机器人的个性化与可信性问题,提出智能体框架,通过多智能体分解需求、分阶段生成执行代码,实验验证其在真实场景中可靠且实用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04464 2026-08-06 cs.CE 新提交 78%

Trie-Constrained Token Prediction with Hierarchy-Aware Semantic Alignment for HS Code Prediction

结合前缀树约束的令牌预测与层级感知语义对齐的HS编码预测

Minseop Kim, Taekhyun Park, Kikun Park, Hyerim Bae

专题命中 安全评测 :alignment(title,abstract)

AI总结 本研究提出TRIE-HSA方法,结合前缀树约束的令牌预测与层级感知语义对齐,在集装箱码头数据实验中,其HS6准确率较零样本推理提升49.96个百分点,为受限环境下的HS编码预测提供实用方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24093 2026-08-06 q-bio.QM cs.DB 版本更新 78%

TCellAlign: Cross-study T-cell Populations Alignment with Nomenclature-Guided Multi-Agent Workflow

TCellAlign:使用命名法引导的多智能体工作流程进行跨研究 T 细胞群体对齐

Pengyu Xie, Rongjia Zhou, Zhilin Ou, Junyuan Zhang, Xiang Zhou, Xiaobo Sun, Jiaying Lu, Wenjing Ma

专题命中 安全评测 :alignment(title,abstract)

AI总结 该研究针对跨研究 T 细胞群体对齐难题,提出 TCellAlign 多智能体框架,含文献检索等模块,能保留原始术语与证据并生成标准化标签。构建基准数据集,实验表明其在语义一致性等方面表现出色,助力 T 细胞相关知识整合与模型发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08256 2026-08-06 cs.CL cs.AI cs.LG cs.SD 版本更新 78%

Best-of-$N$ TTS Evaluation is Confounded by ASR Family Alignment

N选最佳语音合成评估受自动语音识别家族对齐的影响

Taehyung Yu, Seongjae Kang

专题命中 安全评测 :alignment(title);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现最佳N选语音合成评估受ASR家族对齐影响,同家族验证器-评估器对效果更好。提出两种跨家族排名集成方法,能降低平均词错误率,建议交叉评估器三角测量作为默认报告实践。

Comments Accepted at ICML 2026 Workshop on Machine Learning for Audio

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21216 2026-08-06 cs.SI 版本更新 78%

ECHO-PPI: Evidence-Bundled Overlapping Protein Module Detection with Hierarchical Assignment Confidence for Network Biology

ECHO-PPI:用于蛋白质-蛋白质相互作用网络中重叠蛋白质模块检测的可信人工智能

Sima Soltani, Mehrdad Jalali, Yahya Forghani, Reza Sheibani

专题命中 安全评测 :trustworthy(title,abstract)

AI总结 提出ECHO-PPI框架,通过整合加权网络拓扑、语义蛋白特征和基因本体证据,实现可解释的重叠蛋白质模块检测,并为每个分配提供证据分数和置信度标签。

Comments 39 pages, 15 figures, 12 tables, and 8 algorithm descriptions. The manuscript presents ECHO-PPI, an original computational biology framework evaluated on the Gavin and Krogan yeast PPI benchmarks and compared with MCL, MCL+overlap, ClusterONE, and SLPA. Reproducibility scripts, code, machine-readable outputs, and appendices are included in the submission package

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21343 2026-08-06 cs.CV 版本更新 78%

Latent Denoising Improves Visual Alignment in Large Multimodal Models

潜在去噪提升大多模态模型的视觉对齐

Dhruv Parikh, Jacob Fein-Ashley, Rajgopal Kannan, Viktor Prasanna

机构 * University of Southern California(南加州大学) DEVCOM ARL Army Research Office(DEVCOM ARL陆军研究办公室)

专题命中 安全评测 :alignment(title,abstract)

AI总结 本文提出通过潜在去噪框架改进大多模态模型的内部视觉特征对齐和多模态理解,采用掩码和高斯噪声混合腐蚀视觉token,并利用解码器恢复教师特征,提升模型在分布偏移下的鲁棒性。

Comments ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03321 2026-08-06 cs.LG cs.AI 版本更新 76%

HERO: Hierarchical Evidential Reasoning Optimization for Radiology Report Generation via Reason-then-Summarize

对齐发现与诊断:一种自洽的强化学习框架用于可信的放射学报告

Kun Zhao, Guodong Liu, Hui Ji, Siyuan Dai, Pan Wang, Jifeng Song, Chenghua Lin, Liang Zhan, Haoteng Tang

机构 * University of Pittsburgh(匹兹堡大学) University of Texas Rio Grande Valley(德克萨斯大学里奥格兰德谷分校) The University of Manchester(曼彻斯特大学)

专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.LG

AI总结 本文提出了一种自洽的强化学习框架,用于生成可信的放射学报告,通过优化生成过程和减少幻觉,提升了临床效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02070 2026-08-06 cs.CV cs.LG 版本更新 74%

STEAM: A Spatio-TEmporal Alignment Mixture-of-Experts Model with Hierarchical Pre-training for EEG Decoding

STEAM:用于EEG解码的分层预训练时空对齐混合专家模型

Zhu Chen, Dingkun Liu, Yuheng Chen, Dongrui Wu

专题命中 安全评测 :alignment(title);分类 cs.LG

AI总结 STEAM是一种分层迁移框架,通过双分支时空编码器与SSMoE模块实现EEG解码的通用表征学习与范式专业化,在7个数据集的14种评估设置中表现优异且推理成本具竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00285 2026-08-06 cs.CL 版本更新 74%

Enhancing Trustworthy Clinical Diagnosis Decision-Making in Large Language Models via Etiology-Aware Attention Supervision

通过病因感知注意力监督增强大型语言模型在临床诊断决策中的可信性

Peixian Li, Yu Tian, Ruiqi Tu, Chengkai Wu, Jingjing Ren, Jingsong Li

专题命中 安全评测 :trustworthy(title);分类 cs.CL

AI总结 该研究提出病因感知注意力监督框架,通过引入临床病因模式对大型语言模型进行参数高效微调,在两类诊断队列上提升了诊断准确率与注意力聚焦性,增强了模型临床诊断的可信性。

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25073 2026-08-06 cs.CR cs.AI cs.LG 73%

Security in the Fine-Tuning Lifecycle of Large Language Models: Threats, Defenses,Evaluation, and Future Directions

大型语言模型微调生命周期中的安全:威胁、防御、评估与未来方向

Wenjuan Li, Yitao Liu, Runze Chen, Rajkumar Buyya

机构 * Hangzhou Normal University(杭州师范大学) Zhejiang University(浙江大学) China Mobile (Zhejiang) Innovation Research Institute Co., Ltd.(中国移动(浙江)创新研究院有限公司) Quantum Cloud Computing and Distributed Systems (qCLOUDS) Lab, School of Computing and Information Systems(量子云计算与分布式系统(qCLOUDS)实验室,计算与信息学院) The University of Melbourne(墨尔本大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文系统综述了大型语言模型微调过程中的安全威胁与防御,提出了基于生命周期的三阶段框架,并通过统一实验评估了攻击与防御的有效性及跨阶段局限性。

Comments 39 pages, 7 figures, 22 tables

Journal ref Software: Practice and Experience, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04347 2026-08-06 cs.LG 新提交 70%

Looking in the Mirror: Introspecting Side-Effect Misalignments Induced by Fine-Tuning

镜像审视:微调引发的副作用对齐偏差内省

Kotaro Yoshida, Laura Gomezjurado Gonzalez, Yukinori Yamamoto, Yuji Naraki, Ryotaro Shimizu, Wenya Wang

机构 * Institute of Science Tokyo(东京科学大学) ZOZO Research(ZOZO研究所) Stanford University(斯坦福大学) Waseda University(早稻田大学) Nanyang Technological University(南洋理工大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 该研究针对微调引发的副作用对齐偏差问题,提出了Delta感知内省适配器(DAIA),构建了对应数据集,实验显示DAIA性能优于现有内省适配器且泛化性良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04030 2026-08-06 cs.GR cs.AI cs.CV cs.CY cs.LG 新提交 67%

NuclearDiffusion: Text-to-Image Foundation Models for Learning Nuclear Energy Concepts

NuclearDiffusion:用于学习核能概念的文生成像基础模型

Mohammed I. Radaideh, Jeremy Moon, Andre Gala-Garza, Emma Son, Yug Shah, Majdi I. Radaideh

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本研究通过微调开源扩散模型构建核能文生成像模型,发现微调效果依赖生成架构,且微调后开源模型在专业核能图像生成上优于主流商业系统,证实领域特定微调是开发可信领域生成式AI的可行路径。

Comments 29 pages, 10 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11183 2026-08-06 cs.CL cs.AI cs.LG 版本更新 67%

Amplitude-Only FFN Intervention for Tool-Structured LLM Inference Method: Gated Evaluation Protocol, and Cross-Model Empirical Results

用于工具结构化大语言模型推理方法的仅幅度前馈网络干预:门控评估协议及跨模型实证结果

Sheng Xu, Zhen Chen, Junhua Wang, Boyuan Huang, Ke Jia, Jiadun Zhu, Yiming Xu

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究推理时FFN干预改善大语言模型结构化输出,提出无损的幅度门控方法,定义细粒度干预系统和评估协议。在多个模型上实验,AG在工具结构化任务中效果最佳,不同AG变体各有优劣,确定工具结构化推理是FFN级推理优化首要目标。

Comments 30 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05139 2026-08-06 cs.CL cs.LG 新提交 62%

Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning

面向技能原生的大语言模型:用于基准测试和训练长程推理的技能熵

Yinghui He, Ling Yang, Jiarui Liu, Yongjin Yang, Lechen Zhang, Yingcheng Wu, Zhenfei Yin, Mengdi Wang, Sanjeev Arora

机构 * Princeton University(普林斯顿大学) Carnegie Mellon University(卡内基梅隆大学) University of Toronto(多伦多大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stanford University(斯坦福大学) University of Oxford(牛津大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对现有基准无法评估LLM跨技能长程推理能力的问题,提出Skill Entropy(技能熵)并构建Skill²-Bench基准,还开发Skill-Entropy RL训练框架,显著提升了Qwen3模型在该基准上的表现。

Comments https://github.com/Gen-Verse/Skill-Entropy-RL

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04524 2026-08-06 cs.CL cs.LG 新提交 62%

ODRA: Synthesizing Cognitive Behavioral Therapy Sessions with Structured Chain-Of-Thought and Dynamic Patient Resistance

ODRA:结合结构化思维链与动态患者阻抗的认知行为治疗会话合成

Javier Rodriguez-Juan, Hiba Arnaout, Jose Garcia-Rodriguez, David Tomás, Iryna Gurevych

机构 * University of Alicante(阿利坎特大学) Technische Universität Darmstadt(达姆施塔特工业大学) Hessian Center for AI (hessian.AI)(黑森人工智能中心)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出ODRA框架,结合结构化思维链与动态患者阻抗建模合成CBT会话,解决现有方法的顺从性问题,其生成的会话及微调数据集可提升下游治疗性能。

Comments 39 pages, 23 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04285 2026-08-06 cs.AI cs.LG 新提交 62%

The RAIL Principles for Neurosymbolic AI: Reasoning, Assurances, Interfacing and Learning

神经符号AI的RAIL原则:推理(Reasoning)、保证(Assurances)、接口(Interfacing)与学习(Learning)

Agnese Chiatti, Michael Cochez, Cristina Cornelio, Sebastijan Dumancic, Artur d'Avila Garcez, Luis C. Lamb, Lia Morra, Mathias Niepert, Robert Peharz, Alberto Speranzon, Maarten Stol, Annette Ten Teije, Thiviyan Thanapalasingam, Frank Van Harmelen, Emile Van Krieken, Antonio Vergari, Benjie Wang

机构 * Politecnico di Milano(米兰理工大学) ELLIS Institute Finland(芬兰ELLIS研究所) Åbo Akademi University(奥博 Akademi 大学) Samsung AI(三星人工智能研究院) Delft University of Technology(代尔夫特理工大学) Stony Brook University(石溪大学) Politecnico di Torino(都灵理工大学) University of Stuttgart(斯图加特大学) Graz University of Technology(格拉茨工业大学) Lockheed Martin, Advanced Technology Labs(洛克希德·马丁公司先进技术实验室) BrainCreators(BrainCreators公司) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) University of Amsterdam(阿姆斯特丹大学) University of Edinburgh(爱丁堡大学) UCLA(加利福尼亚大学洛杉矶分校)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 该文提出神经符号AI的RAIL四项原则,可统一分析多类AI系统,助力工程师更科学地设计部署生产级AI,指导整合神经符号方法到下一代AI技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04525 2026-08-06 cs.CL cs.LG q-bio.GN 版本更新 62%

GENEB: Why Genomic Models Are Hard to Compare

GENEB:为什么基因组模型难以比较

Daria Ledneva, Mikhail Nuridinov, Denis Kuznetsov

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 针对基因组基础模型评估碎片化的问题,提出GENEB基准,通过统一探测协议在100项任务上比较40个模型,揭示模型排名不稳定、规模收益有限等关键发现。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05004 2026-08-06 cs.CL 新提交 57%

DelusionEval: Measuring Delusion-Linked Behaviors in AI Chatbots

DelusionEval:评估AI聊天机器人中与妄想相关的行为

Jared Moore, Andrea Mock, Yifan Mai, Jacy Reese Anthis, Ryan Louie, William Agnew, Ashish Mehta, Kevin Klyman, Percy Liang, Nick Haber, Eric Lin, Desmond C. Ong

机构 * Stanford University(斯坦福大学) University of Chicago(芝加哥大学) Carnegie Mellon University(卡内基梅隆大学) Harvard University(哈佛大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本研究开发DelusionEval评估协议,发现LLM表现出与妄想相关行为的倾向与模型规模等无可靠关联,扩展上下文会提升此类行为发生率,所有模型家族均存在相关风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04921 2026-08-06 cs.SE cs.AI 新提交 57%

A Chain Is Only as Strong as Its Weakest Link: A Scoping Review of System Integration Audits in AI

链条的强度取决于最薄弱的环节:AI中系统集成审计的范围综述

Leah Davis, Dominic Martin, AJung Moon

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本研究对4259篇文献中58篇以系统集成为核心的AI审计文献开展范围综述,分析其要素等内容,指出需将系统集成作为AI风险应对核心策略以完善审计实践。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04885 2026-08-06 cs.CV cs.CL 新提交 57%

Evaluating the Diagnostic Robustness of Vision-Language Models Under Visual and Textual Perturbations

评估视觉-语言模型在视觉和文本扰动下的诊断鲁棒性

Ali Khoramfar, Mohammad Javad Dousti, Alireza Mohamadian, Heshaam Faili

机构 * University of Tehran(德黑兰大学) Tehran University of Medical Sciences(德黑兰医科大学) Advanced Diagnostic and Interventional Radiology Research Center (ADIR)(高级诊断与介入放射学研究中心(ADIR))

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本研究通过脑部MRI数据集评估四类视觉-语言模型在视觉、文本扰动下的诊断鲁棒性,发现其存在预测翻转、文本选择偏差、诊断过度承诺等问题,指出需采用稳定性指标评估其临床应用可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04830 2026-08-06 cs.AI 新提交 57%

ContextWeave: A Real-World Workflow Benchmark

ContextWeave:一个真实世界工作流基准测试

Bo Wang, Yuqian Yao, Enxi Wang, Luozhijie Jin, Yang Liu, Yiran Suo, Yuxuan Cai, Enyu Zhou, Yufei Gao, Honglin Guo, Tianyu Huai, Li Ji, Zhikai Lei, Bufan Li, Lizhi Lin, Jinxiu Liu, Jie Yang, Jiazheng Zhou, Maosen Zhou, Pengfang Qian, Shichun Liu, Guanshan Liu, Hao Zheng, Yunhao Yu, Hang Yan, Jihua Kang, Xinchi Chen, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) ByteDance(字节跳动)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 该研究推出ContextWeave工作流基准测试,通过实验发现可操作的经验记忆能提升智能体工作流性能,为优化记忆系统提供了依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04613 2026-08-06 cs.LG 新提交 57%

Why Ranking Anomaly Detection Algorithms Isn't as Reliable as You May Think

为何异常检测算法的排名并不如你所想的可靠

Simon Klüttermann, Jérôme Rutinowski, Frederik Polachowski, Alice Kirchheim

机构 * Carnegie Mellon University(卡内基梅隆大学) TU Dortmund University(多特蒙德工业大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究所) iits Consulting GmbH(iits咨询有限公司) Fraunhofer Institute for Material Flow and Logistics IML(弗劳恩霍夫物流与材料流动研究所IML)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 本研究通过分析7种算法在690个数据集上的表现,发现异常检测算法排名高度不稳定,数据集选择和超参数选择是主要影响因素,可靠基准测试需更大更多样的数据集。

Comments Accepted at the 2026 ICPR Workshop on Workshop on Reproducible Research in Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04574 2026-08-06 cs.CL 新提交 57%

When Memory Lies: An Empirical Study of Spatial Memory Staleness in VLM Agents

当记忆“说谎”:VLM智能体中空间记忆过时的实证研究

Yushi Sun, Yanjie Zhang

机构 * Tencent LIGHTSPEED(腾讯光速工作室)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 该研究通过动态FrozenLake测试平台,探究了VLM智能体的空间记忆过时问题,发现文本可解性不代表视觉接地、信任过时记忆存在安全隐患、审核无法完全消除差距,明确了相关核心挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏