arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-18 至 2026-08-18 共收录 163 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 163 篇

2608.15535 2026-08-18 cs.CL cs.LG 新提交 93%

L3Cube-IndicQuest v2: A Large-Scale Multilingual Benchmark for Evaluating Factual Knowledge of Large Language Models Across Indic Languages

L3Cube-IndicQuest v2:用于评估大型语言模型(LLM)印度诸语言事实知识的大规模多语言基准

Rinit Jain, Tirthraj Mahajan, Advait Joshi, Raviraj Joshi

机构 * Pune Institute of Computer Technology(浦那计算机技术学院) L3Cube Labs(L3Cube实验室) Indian Institute of Technology Madras(马德拉斯印度理工学院)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本研究构建了面向印度诸语言的大规模多语言问答基准L3Cube-IndicQuest v2,评估6种LLM的事实知识,发现前沿商业模型表现突出,开放权重模型Gemma4 31B优于Sarvam 30B。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08085 2026-08-18 cs.DC cs.AI 版本更新 93%

Effect of Abstractions and Prompting Strategies on LLM-Guided High-Performance Optimizations

抽象与提示策略对大语言模型(LLM)指导的高性能优化的影响

Jiří Klepl, Matyáš Brabec, Martin Kruliš

专题命中 评测与基准 :LLM(title,title_cn);prompting(title);large language model(abstract);language model(abstract)

AI总结 本文探究传统抽象对LLM指导并行HPC应用优化的影响,以PolyBench为基准评估发现,获特定优化目标的LLM生成C代码的性能与有效性优于成熟框架,建议探索可验证的替代优化方法。

Comments This preprint has not undergone peer review or any post-submission improvements or corrections

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16594 2026-08-18 cs.AI 新提交 92%

CACSurv: Concordance-Aligned Comparative Learning with Large Language Models for Cancer Survival Prediction

CACSurv:基于大型语言模型的一致性对齐比较学习用于癌症生存预测

Tianqi Xiang, Qixiang Zhang, Xinpeng Ding, Yi Li, Xiaomeng Li

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 该研究针对癌症生存预测中LLM时间回归的公式与监督不匹配问题,提出CACSurv框架,构建TCGA-SurvReport基准,在6个TCGA癌症队列上的平均C指数达0.722,显著优于现有模型与基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15591 2026-08-18 cs.AI 新提交 92%

Agent Gym: A Framework for Continuous Evaluation and Evolution of LLM Agents Through Human-in-the-Loop Feedback

Agent Gym:通过人在回路反馈实现LLM智能体持续评估与演化的框架

Pouya Ghiasnezhad Omran, Michael Zimmermann, Duncan Cambridge, Ashmita Kapoor, Tanya Dixit

机构 * Google Cloud(谷歌云)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Agent Gym是支持LLM智能体持续评估演化的模块化框架,通过人在回路反馈实现行为修正,其发票处理参考验证表明框架实用可用。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15391 2026-08-18 cs.AI cs.CR 新提交 92%

TwinGridShield: Consequence-Aware Runtime Authorization for LLM Grid-Agent Actions

TwinGridShield:面向LLM网格智能体动作的后果感知运行时授权

Md Fazley Rafy

机构 * West Virginia University(西弗吉尼亚大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 TwinGridShield是与模型无关的LLM网格智能体动作运行时授权层,通过确定性网络孪生体评估动作,在匹配模型实验中实现0次不安全发布,模型不匹配下鲁棒性存在一定风险。

Comments 6 pages, 3 figures, 4 tables and accepted in North American Power Symposium 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03444 2026-08-18 cs.RO eess.SY 版本更新 91%

PerFACT: Motion Policy with LLM-Powered Dataset Synthesis and Fusion Action-Chunking Transformers

PerFACT: 基于LLM驱动的数据集合成与融合动作分块变换器的运动策略

Davood Soleymanzadeh, Xiao Liang, Minghui Zheng

机构 * J. Mike Walker ’66 Department of Mechanical Engineering, Texas A&M University(J. Mike Walker ’66机械工程系,德克萨斯A&M大学) Zachry Department of Civil and Environmental Engineering, Texas A&M University(Zachry土木与环境工程系,德克萨斯A&M大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 PerFACT通过LLM驱动的数据集合成和融合动作分块变换器,提升机械臂运动规划的泛化能力和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16347 2026-08-18 cs.CL cs.LG 新提交 91%

Architecture-Dependent Causal Transfer of Activation States Across Large Language Models

大语言模型间激活状态的架构依赖型因果迁移

Fernando Cardenas Piepereit

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文探究大语言模型间激活状态的因果迁移,发现该迁移依赖模型架构,仅部分仅解码器模型对可实现具统计显著性的因果效应,且迁移的是表征载体而非意义。

Comments 13 pages, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15396 2026-08-18 cs.AI cs.CL eess.SY 新提交 91%

Large Language Model Assisted Operational Monitoring for Battery Energy Storage System Integrated Power Distribution Networks

大型语言模型辅助的电池储能系统集成配电网运行监测

Azmeer Akhtar, Md Fazley Rafy, Anurag K. Srivastava

机构 * West Virginia University(西弗吉尼亚大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 该研究提出了大型语言模型辅助的人工智能监测框架,用于分析电池储能系统集成配电网,可将自然语言问题转为SQL查询,实现电网运行数据的自动化评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04491 2026-08-18 cs.HC cs.AI cs.CL cs.CY 版本更新 91%

A validity-guided workflow for robust large language model research in psychology

面向心理学中鲁棒大语言模型研究的有效性导向工作流程

Zhicheng Lin

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出一个六阶段工作流程,通过整合心理测量与因果推断,提升心理学中大语言模型研究的有效性,强调研究目标、计算工具验证、实验设计、透明执行、数据分析和结果报告的全面性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14626 2026-08-18 cs.CL cs.AI cs.LG 新提交 90%

LLM Safety Alignment in Low-Resource Languages: A Systematic Literature Review

低资源语言下的大语言模型安全对齐:系统文献综述

Valdini Douglace Lemofouet, Blessing Ngozi Uzor, Paula Chikaodinaka Anyanwu, Danielle Blanche Kapsa, Sukairaj Hafiz Imam, P Sam Sahil, Abigail Oppong, Tassallah Abdullahi, Clemencia Siro, Idris Abdulmumin, Seid Muhie Yimam, Shamsuddeen Hassan Muhammad

机构 * African Institute for Mathematical Sciences (AIMS)(非洲数学科学研究所) Bayero University Kano(卡诺贝罗大学) Brown University(布朗大学) Centrum Wiskunde & Informatica(数学与计算机科学中心) University of Pretoria(比勒陀利亚大学) University of Hamburg(汉堡大学) Imperial College London(伦敦帝国学院)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过PRISMA 2020方法学开展系统文献综述,分析50项相关研究,揭示低资源语言下LLM存在多语言安全差距,提出安全对齐分类,并给出未来研究方向。

Comments The paper was accepted at LM4UC workshop organize by IJCAI. I added a screenshot of the decision (Open Review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14551 2026-08-18 cs.CL cs.DL cs.IR cs.LG 新提交 90%

Auxiliary uncertainty signals for LLM-assisted systematic review screening: a benchmark across eight Cohen drug-class reviews

用于大语言模型辅助系统评价筛选的辅助不确定性信号:八项Cohen药物分类综述的基准测试

Arya Rahgozar, Pouria Mortezaagha

机构 * University of Ottawa(渥太华大学) Ottawa Hospital Research Institute(渥太华医院研究所)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对LLM辅助系统评价筛选的不确定性问题,提出BERT+GCN辅助分类器的不确定性信号,在8个Cohen药物分类数据集上验证了提示策略的效率,发现仅弃权路由为帕累托最优且LLM无法自我分类。

Comments 27 pages, 7 figures, 10 tables. Code, prompts, and cached LLM responses at this https URL (https://github.com/rahgoar/LR-Spectral-BERTGCN-Topological-Undecidability-in-Clinical-AI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15145 2026-08-18 cs.AI 新提交 90%

ACTS-SQL: Agentic and Critic-Oriented Tree-Structured SQL Correctness with Large Language Models

ACTS-SQL:基于大型语言模型的面向智能体与评判器的树结构化SQL正确性校验

Xinmei Huang, Jie Song, Peng Li, Fuxin Jiang, Jing Zhang, Tieying Zhang, Jianjun Chen, Chenming Liu, Tao Yang, Maoyin Liu, Wenda Li, Hong Chen, Cuiping Li

机构 * Renmin University of China(中国人民大学) ByteDance Inc.(字节跳动公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出无训练框架ACTS-SQL,将SQL修正建模为计划引导的树结构化调试过程,集成执行校验与诊断工具,在BIRD-Critic基准及火山引擎TLS生产环境中均实现显著准确率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22456 2026-08-18 cs.SE cs.AI 版本更新 90%

Automating the Detection of Requirement Dependencies Using Large Language Models

利用大语言模型自动化检测需求依赖

Ikram Darif, Feifei Niu, Manel Abdellatif, Lionel C. Briand, Ramesh S., Arun Adiththan

机构 * University of Ottawa(渥太华大学) École de technologie supérieure(超技术学院) Research Ireland Lero Centre for Software Research(爱尔兰Lero软件研究中心) University of Limerick(利默里克大学) General Motors(通用汽车公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出LEREDD,一种基于大语言模型的自动化需求依赖检测方法,利用RAG和ICL技术,实现高准确率的依赖分类和细粒度依赖检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14630 2026-08-18 cs.CL cs.AI 新提交 90%

Characterizing Rhetorical Misalignment in Decision-Making with Language Models

表征语言模型决策中的修辞失配问题

Zirui Cheng, Joey Chan, Simo Du, Chenhao Tan, Yue Guo, Hao Peng

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) NYC Health + Hospitals/Jacobi Medical Center(纽约市健康与医院公司雅各比医学中心) University of Chicago(芝加哥大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究开发决策理论框架研究LLM的修辞失配问题,通过临床实验发现其会诱导平均2.81%的有害决策翻转,还提出用LLM模拟决策者实现可扩展评估,揭示了高风险领域的新安全隐患。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06008 2026-08-18 cs.AI cs.CL 版本更新 90%

PolyWorkBench: Benchmarking LLM Agents for Cross-Lingual Long-Horizon Workflows

PolyWorkBench:多语言长视野语言模型智能体基准测试

Hongliang Li, Yijin Liu, Zhiwei Zhang, Zihe Liu, Xinyue Lou, Jinan Xu, Fandong Meng, Kaiyu Huang

机构 * Beijing Jiaotong University(北京交通大学) Weixin AI, Tencent Inc(腾讯微云人工智能实验室)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究多语言长视野工作流程中LLM智能体的表现,提出PolyWorkBench基准测试及结合多种评估方式的混合框架,发现最先进LLM智能体在多语言设置中性能降,强调联合建模语言变化和程序决策对智能体评估的重要性。

Comments 17 Pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13341 2026-08-18 cs.LG stat.ML 版本更新 90%

Limits to scalable evaluation at the frontier: LLM as Judge won't beat twice the data

可扩展评估的极限:LLM作为裁判无法超越两倍数据

Florian E. Dorner, Vivian Y. Nastl, Moritz Hardt

机构 * Max Planck Institute for Intelligent Systems, Tübingen(马克斯·普朗克智能系统研究所,图宾根) Tübingen AI Center(图宾根人工智能中心) ETH Zürich(苏黎世联邦理工学院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.LG

AI总结 本文研究了使用LLM作为裁判进行模型评估的局限性,发现当裁判准确性不足时,去偏方法无法显著减少所需的真实标签数量。

Comments ICLR 2025; 27 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16030 2026-08-18 cs.RO cs.CY 新提交 90%

Benchmarking Identity-Sensitive LLM Outputs for Surveillance and Security Robots

针对监控与安全机器人的身份敏感型大语言模型输出基准测试

Nneka Hyman, Jasmine Khan, Raj Korpan

机构 * Hunter College, City University of New York(纽约城市大学亨特学院) The Graduate Center, City University of New York(纽约城市大学研究生中心)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);foundation model(comments)

AI总结 该研究测试身份条件提示对LLM生成的监控与安全机器人设计描述的影响,用236个人口统计学身份标签分析可读性,发现存在显著差异,可读性可为相关基准框架提供可解释基线。

Comments Accepted to the Foundation Models in the Ro-Man Age (FoRMA) Workshop at IEEE RO-MAN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16253 2026-08-18 stat.AP 新提交 89%

Second-Order Response Laws for LLM Judges: Debiased Estimation of Prompt Instability

LLM 评判者的二阶响应定律:提示不稳定性的无偏估计

Pengbin Feng, Chunlei Meng, Daozheng Qu, Zhilin Zhang, Haoran Liu, Jiekai Wu

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 该研究针对 LLM 评判者,推导了提示不稳定性的无偏估计量,分离提示内与跨提示差异,经实验验证校正估计更准确,可单独估计提示鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07519 2026-08-18 cs.CY 版本更新 89%

From Survey Personas to LLM Agents: A Generative Agent-based Simulation of Mobility Policy Preference Dynamics

从调查画像到大语言模型智能体:基于生成式智能体的流动性政策偏好动态模拟

Ali Torkayesh, Julia Offermann, Regina Gimpel, Linda Engelmann, Katrin Arning, Martina Ziefle, Sandra Venghaus

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本研究提出基于调查的生成式智能体建模框架,将德国514名调查受访者转化为LLM智能体,模拟公众对淘汰新型内燃机汽车的政策偏好动态,以助力行为实验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18245 2026-08-18 cs.SE cs.CR 版本更新 89%

Who Tests the Testers? Systematic Enumeration and Coverage Audit of LLM Agent Tool Call Safety

谁测试测试者?LLM代理工具调用安全的系统枚举与覆盖审计

Xuan Chen, Lu Yan, Ruqi Zhang, Xiangyu Zhang

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出SafeAudit框架,通过系统生成测试用例和规则阻力指标,发现现有测试未覆盖的20%不安全行为,揭示当前安全评估的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09546 2026-08-18 q-fin.TR cs.SI 版本更新 89%

A Reflective LLM-based Agent to Guide Zero-shot Cryptocurrency Trading

一种用于指导零样本加密货币交易的反思型大语言模型智能体

Yuan Li, Bingqiao Luo, Qian Wang, Nuo Chen, Xu Liu, Bingsheng He

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本研究开发了结合链上链下数据分析与反思机制的LLM智能体CryptoTrade,拓展了LLM在加密货币交易的应用,建立了相关策略基准,其收益表现优于传统策略和时间序列基线。

Comments Published at EMNLP 2024 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15382 2026-08-18 cs.AI cs.IR 新提交 89%

Grounding Healthcare LLMs in a Causal Knowledge Graph: Framework, Metrics, and a Cardiovascular Pilot

将医疗大语言模型(LLM)基于因果知识图谱:框架、指标与心血管试点研究

Ummara Mumtaz, Aimen Noor, Awais Ahmed

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出以因果知识图谱为核心的医疗LLM评估框架,在心血管试点中验证其有效性,发现集成条件C4在因果推理相关指标上表现最优,未基于图的C1原始干预准确性最高但缺乏因果与证据基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14622 2026-08-18 cs.AI 新提交 89%

A Human-Centred Approach to Benchmarking LLMs for Parenting Advice

以人为中心的基准测试大型语言模型(LLM)育儿建议方法

Yunke Zhao, Isobel Voysey, Alastair van Heerden, Rob Hughes, Jun Zhao

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文以育儿专家的多维度评分为标准,采用LLM作为评判者,评估15个LLM在100个育儿场景中英、中文的表现,发现聚合分数掩盖弱点、模型隐性影响育儿风格等,为相关应用提供见解。

Comments 15 pages. Submitted for review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05177 2026-08-18 cs.CL cs.AI eess.AS 版本更新 88%

MCBench: A Multicontext Safety Assessment Benchmark for Omni Large Language Models

MCBench:面向全能大语言模型的多上下文安全评估基准

Manh Luong, Tamas Abraham, Junae Kim, Amar Kaur, Rollin Omari, Gholamreza Haffari, Trang Vu, Lizhen Qu, Dinh Phung

机构 * Monash University(墨尔本大学) Defence Science and Technology Group(国防科学与技术集团)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 针对现有多模态安全基准仅处理视觉输入的局限,提出MCBench基准,包含1196个跨四类安全场景的测试,要求整合多模态信息进行安全评估,揭示当前全能大语言模型在跨模态安全推理上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00890 2026-08-18 econ.EM cs.CL cs.LG 版本更新 88%

Macroeconomic Forecasting with Large Language Models

基于大型语言模型的宏观经济预测

Andrea Carriero, Davide Pettenuzzo, Shubhranshu Shekhar

机构 * School of Economics and Finance, Queen Mary University of London(伦敦大学女王学院经济与金融学院) School of Business and Economics, Brandeis University(布兰迪大学商学院与经济学学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文以FRED-MD数据库为基础,对比评估大型语言模型与传统宏观时间序列预测方法的准确性,明确了LLMs在宏观经济预测中的优劣势及现实适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14107 2026-08-18 cs.CL cs.AI 版本更新 88%

DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models

DiagnosisArena:面向大型语言模型的诊断推理基准测试

Yakun Zhu, Zhongzhen Huang, Linjie Mu, Yutong Huang, Wei Nie, Jiaji Liu, Shaoting Zhang, Pengfei Liu, Xiaofan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) SII SPIRAL Lab(SPIRAL实验室) Generative AI Research Lab (GAIR)(生成式AI研究实验室) Shanghai Chest Hospital(上海胸科医院) Beijing Anzhen Hospital, Capital Medical University(北京安贞医院,首都医科大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究提出DiagnosisArena基准,评估大型语言模型的临床诊断推理能力,发现顶尖模型准确率仅最高51.12%,凸显其泛化瓶颈,旨在推动AI诊断推理进步。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23694 2026-08-18 cs.CL 版本更新 88%

ChartFI: Benchmarking Faithfulness and Insightfulness of Chart Descriptions from Multimodal Large Language Models

ChartFI: 多模态大语言模型图表描述的忠实性与洞察力基准测试

Fen Wang, Zekai Shao, Qiman Kang, Chunran Hu, Zhixuan Zhang, Lexu Xie, Chao Liu, Siming Chen

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Zhengzhou Zhongke Institute of Integrated Circuit and System Application(郑州中凯集成电路与系统应用研究院) School of Computer Science, Fudan University(复旦大学计算机科学学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 提出ChartFI-Bench基准,包含896个复杂图表-描述对,并设计四个评估指标(忠实性、覆盖率、信息量、敏锐度),系统评估多模态大语言模型生成图表描述的质量。

Comments Accepted by VIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08974 2026-08-18 cs.CV cs.AI 版本更新 88%

Tracking the Truth: Object-Centric Spatio-Temporal Monitoring for Video Large Language Models

追踪真相:面向视频大语言模型的物体感知时空监控

Tri Cao, Khoi Le, Thong Nguyen, Cong-Duy Nguyen, Quynh Vo, Anh Tuan Luu, Chunyan Miao, See-Kiong Ng, Shuicheng Yan, Bryan Hooi

机构 * National University of Singapore(新加坡国立大学) VinUniversity(文大学) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出STEMO-Bench基准测试,通过分解查询验证时空监控能力,改进视频大语言模型的时空推理一致性。

Comments The authors are withdrawing this manuscript due to errors identified in the experimental evaluation and result aggregation, which affect several reported quantitative results and some conclusions. These issues require substantial re-evaluation of the experiments and analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22415 2026-08-18 cs.CV cs.AI 版本更新 88%

Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models

多模态大语言模型中用于视觉归因的证据重组与预测上下文残差化

Jiawei Liang, Jianjie Huang, Xianghao Jiao, Siyuan Liang, Shiming Liu, Xiaochun Cao

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Zhongguancun Academy(中关村学院) University of Chinese Academy of Sciences(中国科学院大学) Nanyang Technological University(南洋理工大学) Department of Mechanical Engineering, Imperial College London(伦敦帝国理工学院机械工程系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 研究多模态大语言模型token级视觉证据难检查问题,提出基于证据重组和预测上下文残差化的ERCR框架,经实验验证该框架能改善目标token视觉证据、减轻上下文干扰,为视觉证据检查提供实用改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16349 2026-08-18 cs.AI 新提交 87%

AeroCopilotBench: A Two-Tier Benchmark for Evaluating LLM Agents as Aviation Copilots in an Interactive Virtual Cockpit Environment

AeroCopilotBench:用于在交互式虚拟驾驶舱环境中评估作为航空副驾驶的大语言模型智能体的双层基准

Yuchen Yuan, Zhenghuang Wu, Yuangan Li, Liang Ma, Ke Li

机构 * School of Aeronautic Science and Engineering, Beihang University(北京航空航天大学航空科学与工程学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出AeroCopilot操作环境与双层航空智能体评估基准,通过12个模型测试发现静态知识表现难转化为流程执行能力,为航空智能体评估提供可复现基础。

Comments 38 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏