arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-18 至 2026-08-18 共收录 661 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 94 篇

2604.04120 2026-08-18 cs.CL 版本更新 57%

Shorter, but Still Trustworthy? An Empirical Study of Chain-of-Thought Compression

更短,但依然可信?链式推理压缩的实证研究

Lingjie Zeng, Xiaofan Chen, Yanbo Wang, Xiuying Chen

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 推理与问题求解 :post-training(abstract);分类 cs.CL

AI总结 本文实证研究了链式推理压缩对模型可信度的影响,评估了不同模型在安全、抗幻觉和多语言鲁棒性上的表现,提出标准化效率评分以揭示信任度权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17006 2026-08-18 cs.AI 版本更新 57%

Budget-Aware Tool Use Enables Effective Agent Scaling

预算感知的工具使用实现有效的代理扩展

Tengxiao Liu, Zifeng Wang, Jin Miao, I-Hung Hsu, Jun Yan, Jiefeng Chen, Rujun Han, Fangyuan Xu, Yanfei Chen, Ke Jiang, Samira Daruki, Yi Liang, William Yang Wang, Tomas Pfister, Chen-Yu Lee

机构 * Google Cloud AI Research(谷歌云人工智能研究) Google DeepMind(谷歌DeepMind) New York University(纽约大学) UC Santa Barbara(加州大学圣塔芭芭拉分校)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本研究提出BATS框架,通过预算感知机制提升工具增强代理的扩展效率,实现更优的成本-性能平衡。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12399 2026-08-18 cs.LG stat.ML 版本更新 57%

ROC-n-reroll: How verifier imperfection affects test-time scaling

ROC-n-reroll:验证器缺陷对测试时缩放的影响

Florian E. Dorner, Yatong Chen, André F. Cruz, Fanny Yang

机构 * ETH Zürich(苏黎世联邦理工学院) Max Planck ETH Center for Learning Systems(马克斯·普朗克ETH学习系统中心) Max Planck Institute for Intelligent Systems, Tübingen(图宾根马克斯·普朗克智能系统研究所) Tübingen AI Center(图宾根人工智能中心)

专题命中 推理与问题求解 :language model(abstract);分类 cs.LG

AI总结 本工作针对测试时缩放中验证器缺陷的理论空白,证明相关方法的实例级精度由验证器ROC曲线几何刻画,经Qwen、LLaMA模型在指定数据集上验证,得出RS与BoN在不同计算条件下的性能规律。

Comments 47 pages, 10 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24691 2026-08-18 cs.CL cs.SD eess.AS 57%

Speech-to-Text Translation with Phoneme-Augmented CoT: Enhancing Cross-Lingual Transfer in Low-Resource Scenarios

Gerard I. Gállego, Oriol Pareras, Martí Cortada Garcia, Lucas Takanori, Javier Hernando

机构 * Barcelona Supercomputing CenterSpain(巴塞罗那超级计算中心西班牙) Universitat Politècnica de CatalunyaSpain(巴塞罗那理工大学西班牙)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL

Comments Accepted at Interspeech 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15788 2026-08-18 cs.CV 新提交 50%

ChainSpace: A Chained-Reasoning Paradigm for Spatial Intelligence

ChainSpace:面向空间智能的链式推理范式

Xiaohan Zhang, Feng Gu, Xudong Rao, Xuhao Pan, Tao Wei, Zhou Pan, Kun Zhan

机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) Li Auto Inc.(理想汽车有限公司)

专题命中 推理与问题求解 :foundation model(abstract)

AI总结 针对现有空间推理方法的缺陷,提出ChainSpace链式推理范式,构建对应基准与训练框架,相关模型在基准上表现最优且可迁移至多类外部基准,为空间智能评估与学习提供有效方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01503 2026-08-18 cs.CV 版本更新 50%

Disentangling Pictorial Cue Understanding from Language Bias in VLMs via Depth Ordering Task

通过深度排序任务解构视觉语言模型中的图像线索理解与语言偏差

Yiqian Liu, Iuliia Kotseruba, John K. Tsotsos

机构 * York University(约克大学) University of Guelph(圭尔夫大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 提出深度排序与异常检测任务,结合控制图像线索和语言表达,量化视觉语言模型的深度感知能力,发现模型对深度线索利用不足且存在语言偏差。

Comments 15 pages, 7 figures, accepted to ECCV 2026 (30 pages, 13 figures, supplementary materials included)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25467 2026-08-18 cs.CV 版本更新 50%

GridVAD: Open-Set Video Anomaly Detection via Spatial Reasoning over Stratified Frame Grids

GridVAD: 通过分层帧网格上的空间推理实现开放集视频异常检测

Mohamed Eltahir, Ahmed O. Ibrahim, Obada Siralkhatim, Tabarak Abdallah, Sondos Mohamed

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) Independent Researcher(独立研究员) National Center for Research (NCR)(国家研究中心)

专题命中 推理与问题求解 :language model(abstract)

AI总结 GridVAD通过分层帧网格的空间推理生成开放集候选描述,结合自一致性巩固和空间跟踪模块实现像素级异常掩码,其在UCSD Ped2上达到77.59的Pixel-AUROC,优于其他方法。

Comments Accepted at the Large-scale Video Object Segmentation (LVOS) Workshop in conjunction with ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02917 2026-08-18 cs.RO 版本更新 50%

Language-Guided Generation for Personalized Inspection Planning

语言引导的个性化巡检规划生成

Xingpeng Sun, Zherong Pan, Xifeng Gao, Kui Wu, Aniket Bera

机构 * Faculty of Electrical Engineering, Mathematics and Computer Science, University of Twente(代尔夫特理工大学电子工程、数学和计算机科学学院) Department of Electrical Engineering, Wright State University(电气工程系,怀特州立大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 该研究提出一种无训练的VLM引导方法,针对已知场景高效生成符合文本指令的巡检轨迹,可应用于多领域,经多环境验证效果良好。

Comments 8 pages, 6 figures

Journal ref IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 166 篇

2608.15535 2026-08-18 cs.CL cs.LG 新提交 93%

L3Cube-IndicQuest v2: A Large-Scale Multilingual Benchmark for Evaluating Factual Knowledge of Large Language Models Across Indic Languages

L3Cube-IndicQuest v2:用于评估大型语言模型(LLM)印度诸语言事实知识的大规模多语言基准

Rinit Jain, Tirthraj Mahajan, Advait Joshi, Raviraj Joshi

机构 * Pune Institute of Computer Technology(浦那计算机技术学院) L3Cube Labs(L3Cube实验室) Indian Institute of Technology Madras(马德拉斯印度理工学院)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本研究构建了面向印度诸语言的大规模多语言问答基准L3Cube-IndicQuest v2,评估6种LLM的事实知识,发现前沿商业模型表现突出,开放权重模型Gemma4 31B优于Sarvam 30B。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08085 2026-08-18 cs.DC cs.AI 版本更新 93%

Effect of Abstractions and Prompting Strategies on LLM-Guided High-Performance Optimizations

抽象与提示策略对大语言模型(LLM)指导的高性能优化的影响

Jiří Klepl, Matyáš Brabec, Martin Kruliš

专题命中 评测与基准 :LLM(title,title_cn);prompting(title);large language model(abstract);language model(abstract)

AI总结 本文探究传统抽象对LLM指导并行HPC应用优化的影响,以PolyBench为基准评估发现,获特定优化目标的LLM生成C代码的性能与有效性优于成熟框架,建议探索可验证的替代优化方法。

Comments This preprint has not undergone peer review or any post-submission improvements or corrections

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16594 2026-08-18 cs.AI 新提交 92%

CACSurv: Concordance-Aligned Comparative Learning with Large Language Models for Cancer Survival Prediction

CACSurv:基于大型语言模型的一致性对齐比较学习用于癌症生存预测

Tianqi Xiang, Qixiang Zhang, Xinpeng Ding, Yi Li, Xiaomeng Li

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 该研究针对癌症生存预测中LLM时间回归的公式与监督不匹配问题,提出CACSurv框架,构建TCGA-SurvReport基准,在6个TCGA癌症队列上的平均C指数达0.722,显著优于现有模型与基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15591 2026-08-18 cs.AI 新提交 92%

Agent Gym: A Framework for Continuous Evaluation and Evolution of LLM Agents Through Human-in-the-Loop Feedback

Agent Gym:通过人在回路反馈实现LLM智能体持续评估与演化的框架

Pouya Ghiasnezhad Omran, Michael Zimmermann, Duncan Cambridge, Ashmita Kapoor, Tanya Dixit

机构 * Google Cloud(谷歌云)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Agent Gym是支持LLM智能体持续评估演化的模块化框架,通过人在回路反馈实现行为修正,其发票处理参考验证表明框架实用可用。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15391 2026-08-18 cs.AI cs.CR 新提交 92%

TwinGridShield: Consequence-Aware Runtime Authorization for LLM Grid-Agent Actions

TwinGridShield:面向LLM网格智能体动作的后果感知运行时授权

Md Fazley Rafy

机构 * West Virginia University(西弗吉尼亚大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 TwinGridShield是与模型无关的LLM网格智能体动作运行时授权层,通过确定性网络孪生体评估动作,在匹配模型实验中实现0次不安全发布,模型不匹配下鲁棒性存在一定风险。

Comments 6 pages, 3 figures, 4 tables and accepted in North American Power Symposium 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03444 2026-08-18 cs.RO cs.SY eess.SY 版本更新 91%

PerFACT: Motion Policy with LLM-Powered Dataset Synthesis and Fusion Action-Chunking Transformers

PerFACT: 基于LLM驱动的数据集合成与融合动作分块变换器的运动策略

Davood Soleymanzadeh, Xiao Liang, Minghui Zheng

机构 * J. Mike Walker ’66 Department of Mechanical Engineering, Texas A&M University(J. Mike Walker ’66机械工程系,德克萨斯A&M大学) Zachry Department of Civil and Environmental Engineering, Texas A&M University(Zachry土木与环境工程系,德克萨斯A&M大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 PerFACT通过LLM驱动的数据集合成和融合动作分块变换器,提升机械臂运动规划的泛化能力和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16347 2026-08-18 cs.CL cs.LG 新提交 91%

Architecture-Dependent Causal Transfer of Activation States Across Large Language Models

大语言模型间激活状态的架构依赖型因果迁移

Fernando Cardenas Piepereit

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文探究大语言模型间激活状态的因果迁移,发现该迁移依赖模型架构,仅部分仅解码器模型对可实现具统计显著性的因果效应,且迁移的是表征载体而非意义。

Comments 13 pages, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15396 2026-08-18 cs.AI cs.CL cs.SY eess.SY 新提交 91%

Large Language Model Assisted Operational Monitoring for Battery Energy Storage System Integrated Power Distribution Networks

大型语言模型辅助的电池储能系统集成配电网运行监测

Azmeer Akhtar, Md Fazley Rafy, Anurag K. Srivastava

机构 * West Virginia University(西弗吉尼亚大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 该研究提出了大型语言模型辅助的人工智能监测框架,用于分析电池储能系统集成配电网,可将自然语言问题转为SQL查询,实现电网运行数据的自动化评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04491 2026-08-18 cs.HC cs.AI cs.CL cs.CY 版本更新 91%

A validity-guided workflow for robust large language model research in psychology

面向心理学中鲁棒大语言模型研究的有效性导向工作流程

Zhicheng Lin

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出一个六阶段工作流程,通过整合心理测量与因果推断,提升心理学中大语言模型研究的有效性,强调研究目标、计算工具验证、实验设计、透明执行、数据分析和结果报告的全面性。

Journal ref Behavior Research Methods, 58, 216 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14626 2026-08-18 cs.CL cs.AI cs.LG 新提交 90%

LLM Safety Alignment in Low-Resource Languages: A Systematic Literature Review

低资源语言下的大语言模型安全对齐:系统文献综述

Valdini Douglace Lemofouet, Blessing Ngozi Uzor, Paula Chikaodinaka Anyanwu, Danielle Blanche Kapsa, Sukairaj Hafiz Imam, P Sam Sahil, Abigail Oppong, Tassallah Abdullahi, Clemencia Siro, Idris Abdulmumin, Seid Muhie Yimam, Shamsuddeen Hassan Muhammad

机构 * African Institute for Mathematical Sciences (AIMS)(非洲数学科学研究所) Bayero University Kano(卡诺贝罗大学) Brown University(布朗大学) Centrum Wiskunde & Informatica(数学与计算机科学中心) University of Pretoria(比勒陀利亚大学) University of Hamburg(汉堡大学) Imperial College London(伦敦帝国学院)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过PRISMA 2020方法学开展系统文献综述,分析50项相关研究,揭示低资源语言下LLM存在多语言安全差距,提出安全对齐分类,并给出未来研究方向。

Comments The paper was accepted at LM4UC workshop organize by IJCAI. I added a screenshot of the decision (Open Review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14551 2026-08-18 cs.CL cs.DL cs.IR cs.LG 新提交 90%

Auxiliary uncertainty signals for LLM-assisted systematic review screening: a benchmark across eight Cohen drug-class reviews

用于大语言模型辅助系统评价筛选的辅助不确定性信号:八项Cohen药物分类综述的基准测试

Arya Rahgozar, Pouria Mortezaagha

机构 * University of Ottawa(渥太华大学) Ottawa Hospital Research Institute(渥太华医院研究所)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对LLM辅助系统评价筛选的不确定性问题,提出BERT+GCN辅助分类器的不确定性信号,在8个Cohen药物分类数据集上验证了提示策略的效率,发现仅弃权路由为帕累托最优且LLM无法自我分类。

Comments 27 pages, 7 figures, 10 tables. Code, prompts, and cached LLM responses at https://github.com/rahgoar/LR-Spectral-BERTGCN-Topological-Undecidability-in-Clinical-AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15145 2026-08-18 cs.AI 新提交 90%

ACTS-SQL: Agentic and Critic-Oriented Tree-Structured SQL Correctness with Large Language Models

ACTS-SQL:基于大型语言模型的面向智能体与评判器的树结构化SQL正确性校验

Xinmei Huang, Jie Song, Peng Li, Fuxin Jiang, Jing Zhang, Tieying Zhang, Jianjun Chen, Chenming Liu, Tao Yang, Maoyin Liu, Wenda Li, Hong Chen, Cuiping Li

机构 * Renmin University of China(中国人民大学) ByteDance Inc.(字节跳动公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出无训练框架ACTS-SQL,将SQL修正建模为计划引导的树结构化调试过程,集成执行校验与诊断工具,在BIRD-Critic基准及火山引擎TLS生产环境中均实现显著准确率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22456 2026-08-18 cs.SE cs.AI 版本更新 90%

Automating the Detection of Requirement Dependencies Using Large Language Models

利用大语言模型自动化检测需求依赖

Ikram Darif, Feifei Niu, Manel Abdellatif, Lionel C. Briand, Ramesh S., Arun Adiththan

机构 * University of Ottawa(渥太华大学) École de technologie supérieure(超技术学院) Research Ireland Lero Centre for Software Research(爱尔兰Lero软件研究中心) University of Limerick(利默里克大学) General Motors(通用汽车公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出LEREDD,一种基于大语言模型的自动化需求依赖检测方法,利用RAG和ICL技术,实现高准确率的依赖分类和细粒度依赖检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14630 2026-08-18 cs.CL cs.AI 新提交 90%

Characterizing Rhetorical Misalignment in Decision-Making with Language Models

表征语言模型决策中的修辞失配问题

Zirui Cheng, Joey Chan, Simo Du, Chenhao Tan, Yue Guo, Hao Peng

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) NYC Health + Hospitals/Jacobi Medical Center(纽约市健康与医院公司雅各比医学中心) University of Chicago(芝加哥大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究开发决策理论框架研究LLM的修辞失配问题,通过临床实验发现其会诱导平均2.81%的有害决策翻转,还提出用LLM模拟决策者实现可扩展评估,揭示了高风险领域的新安全隐患。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06008 2026-08-18 cs.AI cs.CL 版本更新 90%

PolyWorkBench: Benchmarking LLM Agents for Cross-Lingual Long-Horizon Workflows

PolyWorkBench:多语言长视野语言模型智能体基准测试

Hongliang Li, Yijin Liu, Zhiwei Zhang, Zihe Liu, Xinyue Lou, Jinan Xu, Fandong Meng, Kaiyu Huang

机构 * Beijing Jiaotong University(北京交通大学) Weixin AI, Tencent Inc(腾讯微云人工智能实验室)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究多语言长视野工作流程中LLM智能体的表现,提出PolyWorkBench基准测试及结合多种评估方式的混合框架,发现最先进LLM智能体在多语言设置中性能降,强调联合建模语言变化和程序决策对智能体评估的重要性。

Comments 17 Pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13341 2026-08-18 cs.LG stat.ML 版本更新 90%

Limits to scalable evaluation at the frontier: LLM as Judge won't beat twice the data

可扩展评估的极限:LLM作为裁判无法超越两倍数据

Florian E. Dorner, Vivian Y. Nastl, Moritz Hardt

机构 * Max Planck Institute for Intelligent Systems, Tübingen(马克斯·普朗克智能系统研究所,图宾根) Tübingen AI Center(图宾根人工智能中心) ETH Zürich(苏黎世联邦理工学院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.LG

AI总结 本文研究了使用LLM作为裁判进行模型评估的局限性,发现当裁判准确性不足时,去偏方法无法显著减少所需的真实标签数量。

Comments ICLR 2025; 27 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16030 2026-08-18 cs.RO cs.CY 新提交 90%

Benchmarking Identity-Sensitive LLM Outputs for Surveillance and Security Robots

针对监控与安全机器人的身份敏感型大语言模型输出基准测试

Nneka Hyman, Jasmine Khan, Raj Korpan

机构 * Hunter College, City University of New York(纽约城市大学亨特学院) The Graduate Center, City University of New York(纽约城市大学研究生中心)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);foundation model(comments)

AI总结 该研究测试身份条件提示对LLM生成的监控与安全机器人设计描述的影响,用236个人口统计学身份标签分析可读性,发现存在显著差异,可读性可为相关基准框架提供可解释基线。

Comments Accepted to the Foundation Models in the Ro-Man Age (FoRMA) Workshop at IEEE RO-MAN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16253 2026-08-18 stat.AP 新提交 89%

Second-Order Response Laws for LLM Judges: Debiased Estimation of Prompt Instability

LLM 评判者的二阶响应定律:提示不稳定性的无偏估计

Pengbin Feng, Chunlei Meng, Daozheng Qu, Zhilin Zhang, Haoran Liu, Jiekai Wu

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 该研究针对 LLM 评判者,推导了提示不稳定性的无偏估计量,分离提示内与跨提示差异,经实验验证校正估计更准确,可单独估计提示鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07519 2026-08-18 cs.CY 版本更新 89%

From Survey Personas to LLM Agents: A Generative Agent-based Simulation of Mobility Policy Preference Dynamics

从调查画像到大语言模型智能体:基于生成式智能体的流动性政策偏好动态模拟

Ali Torkayesh, Julia Offermann, Regina Gimpel, Linda Engelmann, Katrin Arning, Martina Ziefle, Sandra Venghaus

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本研究提出基于调查的生成式智能体建模框架,将德国514名调查受访者转化为LLM智能体,模拟公众对淘汰新型内燃机汽车的政策偏好动态,以助力行为实验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18245 2026-08-18 cs.SE cs.CR 版本更新 89%

Who Tests the Testers? Systematic Enumeration and Coverage Audit of LLM Agent Tool Call Safety

谁测试测试者?LLM代理工具调用安全的系统枚举与覆盖审计

Xuan Chen, Lu Yan, Ruqi Zhang, Xiangyu Zhang

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出SafeAudit框架,通过系统生成测试用例和规则阻力指标,发现现有测试未覆盖的20%不安全行为,揭示当前安全评估的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15382 2026-08-18 cs.AI cs.IR 新提交 89%

Grounding Healthcare LLMs in a Causal Knowledge Graph: Framework, Metrics, and a Cardiovascular Pilot

将医疗大语言模型(LLM)基于因果知识图谱:框架、指标与心血管试点研究

Ummara Mumtaz, Aimen Noor, Awais Ahmed

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出以因果知识图谱为核心的医疗LLM评估框架,在心血管试点中验证其有效性,发现集成条件C4在因果推理相关指标上表现最优,未基于图的C1原始干预准确性最高但缺乏因果与证据基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14622 2026-08-18 cs.AI 新提交 89%

A Human-Centred Approach to Benchmarking LLMs for Parenting Advice

以人为中心的基准测试大型语言模型(LLM)育儿建议方法

Yunke Zhao, Isobel Voysey, Alastair van Heerden, Rob Hughes, Jun Zhao

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文以育儿专家的多维度评分为标准,采用LLM作为评判者,评估15个LLM在100个育儿场景中英、中文的表现,发现聚合分数掩盖弱点、模型隐性影响育儿风格等,为相关应用提供见解。

Comments 15 pages. Submitted for review

详情

展开后加载摘要…

URL PDF HTML 收藏