arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-17 至 2026-06-17 共收录 294 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 82 篇

2606.17506 2026-06-17 cs.CL 新提交 81%

Evaluating Second-Order Bias of LLMs Through Epistemic Entitlement

通过认知权利评估大语言模型的二阶偏见

Ramaravind Kommiya Mothilal, Terry Jingchen Zhang, Raiyan Ahmed, Zhijing Jin, Shion Guha, Syed Ishtiaque Ahmed

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) EuroSafeAI Max Planck Institute for Intelligent Systems, Tübingen, Germany(马克斯·普朗克智能系统研究所(德国图宾根))

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 提出基于认知权利理论的逻辑推理任务,评估LLM在判断偏见内容时表现出的二阶偏见,发现模型判断存在系统性偏差且能规避安全护栏。

Comments 20 pages, 13 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15121 2026-06-17 cs.CL 新提交 81%

When Cognitive Graphs Meet LLMs: BDEI Cognitive Pathways for Panic Emotional Arousal Prediction

当认知图遇见大语言模型:恐慌情绪唤醒预测的BDEI认知路径

Mengzhu Liu, Long Qin, Chuan Ai, Zhengqiu Zhu, Hongru Liang, Chen Gao, Yong Li, Xin Lu, Quanjun Yin

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 提出PanicCognitivePath框架,通过心理安全距离模型融合多域信号,引入显式情绪节点构建BDEI认知路径,将LLM限制于单步参数估计,实现恐慌情绪唤醒时间预测,准确率提升10.68%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17362 2026-06-17 cs.CV cs.AI cs.LG cs.RO 新提交 81%

DriveJudge: Rethinking Autonomous Driving Evaluation with Vision-Language Models

DriveJudge: 用视觉-语言模型重新思考自动驾驶评估

Xinglong Sun, Kevin Xie, Jenny Schmalfuss, Despoina Paschalidou, Xiuming Zhang, Sanja Fidler, Kashyap Chitta, Jose M. Alvarez

机构 * NVIDIA(英伟达)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出DriveJudge,结合规则评估与VLM推理,通过选择性调用物理规则函数实现可解释且上下文感知的驾驶评估,在驾驶质量分类和轨迹偏好选择任务上超越现有方法。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18054 2026-06-17 eess.AS 新提交 80%

AI-based Cognitive-linguistic Features for Dementia Assessment in Picture Description

基于AI的认知语言特征在图片描述任务中的痴呆评估

Lingfeng Xu, Prad Kadambi, Samuel Goldinger, Visar Berisha, Kimberly D. Mueller, Julie Liss

专题命中 评测与基准 :LLM(summary_cn);large language model(abstract);language model(abstract)

AI总结 提出七个针对Cookie Theft图片描述任务的临床构念,利用大语言模型生成严重度评分和解释,Claude 3.5 Sonnet在ADReSS数据集上达到85%准确率,专家一致性评分3.99/5,展示了LLM在可解释认知筛查中的潜力。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17391 2026-06-17 cs.CL cs.AI cs.LG 新提交 80%

NarrativeWorldBench: A Frontier-Saturated Benchmark and a Latent World Model for Long-Horizon Co-Creative Audio Drama

NarrativeWorldBench:面向长程共创音频剧的前沿饱和基准与潜在世界模型

Logan Mann, Abdur Rahman, Mohammad Saifullah, Taaha Kazi, Vasu Sharma

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) Pocket FM

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出NarrativeWorldBench基准,在九种叙事结构指标上评估21个模型,并引入N-VSSM变分状态空间模型,通过Mamba-2骨干和事件条件后验在200集以上维持结构化潜在状态,在长弧一致性和可控性上超越Claude Opus 4.5。

Comments 10 pages. Accepted to the ICML 2026 Workshops on High-dimensional Learning Dynamics (HiLD) and Culture x AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18001 2026-06-17 cs.LG 新提交 79%

Half a Link can Be Enough to Predict a Whole Link: Understanding Generalization in Knowledge Graph Foundation Models

半条链接足以预测整条链接:理解知识图谱基础模型中的泛化

Cosimo Gregucci, Obaidah Theeb, Daniel Hernandez, Antonio Vergari, Steffen Staab

机构 * Institute for AI, University of Stuttgart(斯图加特大学人工智能研究所) University of Southampton(南安普顿大学) University of Edinburgh(爱丁堡大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 本文通过分析知识图谱基础模型在未见图上的零样本泛化,发现模型利用部分可见的“半链接”进行预测,并基于此提出四类场景的分类法,揭示现有模型的泛化机制与改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17904 2026-06-17 cs.AI 新提交 79%

DiagFlowBench: Evaluating How Language Models Handle Off-Procedure Inputs in Grounded Diagnostic Dialogue

DiagFlowBench:评估语言模型在基于规程的诊断对话中如何处理偏离规程输入

Guillermo Gil de Avalle, Laura Maruster, Shaina Raza, Christos Emmanouilidis

机构 * University of Groningen(格罗宁根大学) Vector Institute for Artificial Intelligence(向量人工智能研究所)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 提出DiagFlowBench基准,包含50个工业诊断流程图转化的1676轮对话,评估10个模型在识别偏离规程输入时的表现,发现模型常选择真实但不恰当的步骤而非捏造事实。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18193 2026-06-17 cs.CR cs.AI cs.CL 新提交 79%

A Red-Team Study of Anthropic Fable 5 & Opus 4.8 Models

Anthropic Fable 5 与 Opus 4.8 模型的红队研究

Nicola Franco

机构 * AI4I

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 通过 HackAgent 框架对两个前沿大语言模型进行自动化越狱攻击,发现尽管模型抵抗大部分攻击,但自适应迭代攻击仍能成功,且残差表面比总体框架更大。

Comments White paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17423 2026-06-17 q-fin.CP stat.ML 新提交 78%

Martingale Doppelgänger-Eval: An Identification Framework for Auditing Candlestick Understanding in Vision-Language Models

鞅双生评估:审计视觉语言模型对K线图理解的识别框架

Ziyao Wang

专题命中 评测与基准 :language model(title,abstract)

AI总结 提出Martingale Doppelgänger-Eval基准,通过受控实验识别VLM是否基于K线证据而非趋势外推进行判断,发现模型忽略或反向利用K线语义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17609 2026-06-17 cs.CL 新提交 77%

The Benchmark Illusion: Pruned LLMs Can Pass Multiple Choice but Fail to Answer

基准测试幻觉:剪枝后的大语言模型能通过多项选择但无法回答问题

Rui Wen, Lu Sun, Jiayang Liu, Zesheng Xu, Tianshuo Cong, Zheng Li

机构 * Institute of Science Tokyo(东京科学大学) Tohoku University(东北大学) Nanyang Technological University(南洋理工大学) KTH Royal Institute of Technology(瑞典皇家理工学院) Shandong University(山东大学)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究发现,高稀疏度剪枝后的大语言模型在多项选择评估中表现良好,但在开放生成中无法正确回答相同问题,揭示了基准测试的盲点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15932 2026-06-17 cs.CL 新提交 77%

Beyond NL2Code: A Structured Survey of Multimodal Code Intelligence

超越NL2Code:多模态代码智能的结构化综述

Xuanle Zhao, Qiushi Sun, Jingyu Xiao, Xuexin Liu, Haoyue Yang, Qiaosheng Chen, Xianzhen Luo, Jing Huang, Yufeng Zhong, Lei Chen, Shuai Fu, Zhenlin Wei, Jinhe Bi, Lei Jiang, Haibo Qiu, Siqi Yang, Peng Shi, Jian Hu, Zhixiong Zeng

机构 * Meituan(美团) The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Nanjing University(南京大学) Harbin Institute of Technology(哈尔滨工业大学) Australian Institute for Machine Learning, Adelaide University(阿德莱德大学澳大利亚机器学习研究所) Ludwig Maximilian University of Munich(慕尼黑大学) University of Science and Technology of China(中国科学技术大学) Queen Mary University of London(伦敦玛丽女王大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文系统综述多模态代码智能,将任务按代码角色分类,覆盖GUI、科学可视化、结构化图形及前沿任务,并提出四个基于验证的未来方向。

Comments Work completed in January 2026. Updating now

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10384 2026-06-17 cs.CL 版本更新 77%

When Tables Go Crazy: Evaluating Multimodal Models on French Financial Documents

当表格失控:评估多模态模型在法语金融文档上的表现

Virginie Mouilleron, Théo Lasnier, Anna Mosolova, Djamé Seddah

机构 * Inria Paris(巴黎国家信息与自动化研究所) Sorbonne Université(索邦大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL

AI总结 提出Scribe Finance基准,评估多模态模型在法语金融文档上的文本、表格、图表及多轮对话理解能力,发现模型在图表和多轮对话中表现脆弱。

Comments 16 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18134 2026-06-17 eess.AS 新提交 75%

Grounding Spoken LLMs in Multi-Speaker Audio via Diarization Conditioning

通过说话人日志条件将口语大语言模型扩展到多说话人音频

Alexander Polok, Samuele Cornell, Sathvik Udupa, Jan Černocký, Shinji Watanabe, Lukáš Burget

专题命中 评测与基准 :SLM(abstract,abstract_cn);language model(abstract)

AI总结 提出基于说话人日志条件的口语语言模型,通过条件化声学编码器提取目标说话人表示,避免序列化输出训练导致的灾难性遗忘,在多个数据集上显著提升说话人属性转录性能。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17433 2026-06-17 cs.CV 新提交 75%

LADBench: A Benchmark for Logical Fault Detection in Images

LADBench: 图像中逻辑故障检测的基准

Sahasra Kondapalli, Lara Radovanovic, Aadi Palnitkar, Mingyang Mao, Xiaomin Lin

机构 * University of South Florida(南佛罗里达大学)

专题命中 评测与基准 :language model(abstract);foundation model(abstract);prompting(abstract)

AI总结 提出LAD-Bench基准,包含1000多张合成图像的四域逻辑异常,通过分层提示协议评估模型,揭示现有VLM在隐式逻辑故障检测上的不足。

Comments Accepted to the IEEE International Conference on Development and Learning (ICDL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17564 2026-06-17 cs.CV cs.AI 新提交 74%

Geometric Consistency Protocol for Foundation Model Features in Multi-View Satellite Imagery

多视图卫星图像中基础模型特征的几何一致性协议

Qiyan Luo, Jie Yang, Yingdong Pi, Lekang Wen, Mi Wang

机构 * Hubei Province Key Research and Development Program(湖北省重点研发计划) LIESMARS Special Research Funding(测绘遥感信息工程国家重点实验室专项研究基金) National Science Fund for Distinguished Young Scholars(国家杰出青年科学基金)

专题命中 评测与基准 :foundation model(title);分类 cs.AI

AI总结 针对卫星多视图重建中传统2D全局匹配的误导性,提出基于有理函数模型(RFM)的几何忠实评估协议,通过RPC投影3D一致性度量和几何约束密集匹配代理,揭示语义一致性与几何定位的解耦,并证明在RPC一致评估下2D骨干网络仍具竞争力。

Comments The manuscript is accepted as Oral Presentation in IEEE International Geoscience and Remote Sensing Symposium(IGARSS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25937 2026-06-17 cs.RO cs.LG 版本更新 74%

Can Vision Foundation Models Navigate? Zero-Shot Real-World Evaluation and Lessons Learned

视觉基础模型能否导航?零样本真实世界评估与经验教训

Maeva Guerrier, Karthik Soma, Jana Pavlasek, Giovanni Beltrame

机构 * Polytechnique Montreal(蒙特利尔理工学院)

专题命中 评测与基准 :foundation model(title);分类 cs.LG

AI总结 本文对五种视觉导航模型在真实环境中进行零样本评估,发现其存在几何理解不足、感知混淆和分布漂移等系统性问题,并公开评估代码与数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18203 2026-06-17 cs.CL cs.AI 新提交 73%

RubricsTree: Scalable and Evolving Open-Ended Evaluation of Personal Health Agents across Health Memory and Medical Skills

RubricsTree: 面向个人健康代理在健康记忆与医疗技能上的可扩展且不断演进的开放式评估

Weizhi Zhang, Zechen Li, Hamid Palangi, Ben Graef, A. Ali Heydari, Simon A. Lee, Salman Rahman, Ray Luo, Zeinab Esmaeilpour, Erik Schenck, Chloe Zhang, Yamin Li, Menglian Zhou, Philip S. Yu, Daniel McDuff, Lindsey Sunden, Mark Malhotra, Shwetak Patel, Ahmed A. Metwally

机构 * Google Research(谷歌研究院) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出RubricsTree框架,通过专家对齐的层次化分类法(含100多个原子布尔规则)和上下文自适应路由,实现可扩展、可审计且不断演进的开放式评估,在HealthBench上使模型性能提升高达约66%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17819 2026-06-17 cs.SE cs.AI cs.CL 新提交 73%

A Framework for Evaluating Agentic Skills at Scale

大规模评估智能体技能的框架

Maksim Shaposhnikov, Nicolas Fortuin, Simon Stipcich, Maria I. Gorinova, Amy Heineike, Rob Willoughby

机构 * Tessl London United Kingdom(伦敦英国Tessl)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出一个评估框架,通过构建真实任务和评分标准,大规模评估500个真实技能在19种智能体模型上的表现,发现模型对技能指令的遵循程度差异显著,且技能显著改变模型行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17786 2026-06-17 cs.HC cs.CL 新提交 70%

Toward Accessible Psychotherapy Training Using AI-Driven Interactive Patient Avatars

利用AI驱动的交互式患者化身实现可及的心理治疗培训

Pascal Riachi, Sofie Kamber, Stella Brogna, Andrew Gloster, Rafael Wampfler

机构 * ETH Zurich(苏黎世联邦理工学院) University of Lucerne(卢塞恩大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出一个通过具身虚拟患者进行对话训练ACT心理治疗师的系统,利用大语言模型模拟患者行为,并提供基于ACT保真度标准的逐轮反馈,专家评估证实了高真实性和培训效果。

Journal ref 2026 IEEE 14th International Conference on Healthcare Informatics (ICHI), Minneapolis, MN, June 1-3, 2026, pp. 990-995

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17574 2026-06-17 cs.AI 新提交 70%

DeepInsight: A Unified Evaluation Infrastructure Across the Physical AI Stack

DeepInsight:跨物理AI栈的统一评估基础设施

Siyi Li, Chunyu Sun, Jiahao Zhang, Yuchen Kang, Wuliang Wang, Yu Qiu, Rui Jiang, Haitao Cui, Jie Chen

机构 * Xiaopeng(小鹏汽车)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出DeepInsight,一个在单一运行时上支持物理AI栈全谱系评估的基础设施,通过三个抽象(任务、资源、结果)保持异构性,实现跨层回归诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17092 2026-06-17 cs.CR cs.CL 新提交 70%

Securing Multi-Agent GIS Systems: Risk Evaluation and Prompt Hardening Optimization

保护多智能体GIS系统:风险评估与提示硬化优化

Kyle Gao, Pranavi Kotta, Linlin Xu, Jonathan Li, David A. Clausi

机构 * Department of Systems Design Engineering, University of Waterloo(系统设计工程系,滑铁卢大学) Department of Mechatronics Engineering, University of Waterloo(机电工程系,滑铁卢大学) Department of Geomatics Engineering, University of Calgary(测绘工程系,卡尔加里大学) Department of Geography and Environmental Management, University of Waterloo(地理与环境管理系,滑铁卢大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 针对多智能体GIS系统的安全风险,提出基于模块化状态机编排和提示优化的安全框架,通过红队测试和对抗演示提升系统鲁棒性。

Comments Kyle Gao and Pranavi Kotta contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16070 2026-06-17 cs.AI 新提交 70%

Mind-Studio: Executable World Models with Lookahead Evaluation for Partially Observable Games

Mind-Studio: 针对部分可观测游戏的可执行世界模型与前向评估

Yifei Dong, Mingen Zheng, Linquan Wu, Jeff Z. Pan, Jiaxin Bai

机构 * Hong Kong University of Science and Technology(香港科技大学) City University of Hong Kong(香港城市大学) University of Edinburgh(爱丁堡大学) Hong Kong Baptist University(香港浸会大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出Mind-Studio框架,利用大语言模型从轨迹合成可执行的pygame风格世界模型,通过K步前向保真度协议评估,在Montezuma's Revenge等游戏中显著提升预测准确性和子目标验证。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09376 2026-06-17 cs.CL 新提交 70%

Precision Is Not Faithfulness: Coverage-Aware Evaluation of Grounded Generation with a Complete Oracle

精确性不等于忠实度:基于完全神谕的覆盖感知接地生成评估

Juan S. Santillana

机构 * Globant

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 针对参考无关忠实度指标仅测量精确性而忽略召回率的问题,提出利用完全神谕(F1赛事和NOAA天气预报)测量覆盖度,并设计结合精确性与覆盖度的综合指标及验证器引导生成方法。

Comments 9 pages. v2: adds Anthropic Claude + 3 additional fine-tuned bases (1B-7B); 6 frontier families x 3 languages. Code https://github.com/vectrayx/precision-is-not-faithfulness Demo https://huggingface.co/spaces/jsantillana/faithful-strategy-engineer-f1

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18198 2026-06-17 cs.CR cs.CV 新提交 67%

Seeing Is Not Screening: Multimodal Hidden Instruction Attacks on Agent Skill Scanners

看见不等于筛查:针对智能体技能扫描仪的多模态隐藏指令攻击

Xiaojun Jia, Jie Liao, Simeng Qin, Ke Ma, Wenbo Guo, Yebo Feng, Aishan Liu, Yang Liu

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Chongqing University, China(重庆大学) Northeastern University, China(东北大学) University of Chinese Academy of Sciences, China(中国科学院大学) Beihang University, China(北航大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 针对现有技能扫描仪忽视图像中恶意指令的盲点,提出SkillCamo多模态攻击将指令隐藏于图像,并设计ExecScan执行级扫描模块,通过意图提取、行为重建等检测隐藏指令,实验证明其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17458 2026-06-17 cs.CE 新提交 67%

ICBCBench: An Industry Consortium Benchmark for Financial Deep Research

ICBCBench:面向金融深度研究的行业联盟基准

Weiya Li, Zhiwei Tang, Yizhou He, Chenghao Wang, Liang Feng, Xiao Sun, Dongrui Liu, Zichen Wen, Hu Wei, Jinghang Wang, Yi Luo, Li Guo, Linfeng Zhang

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对金融领域深度研究代理评估标准缺失的问题,提出ICBCBench基准,采用客观任务与主观报告评估双轨范式,揭示当前模型在复杂推理、事实依据和报告质量上的显著差距。

Comments 33 pages, 14 figures. Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17449 2026-06-17 cs.CL cs.AI cs.CV cs.LG cs.MM 新提交 67%

MODE-RAG: Manifold Outlier Diagnosis and Energy-based Retrieval-Augmented Generation Evaluation

MODE-RAG: 基于流形异常诊断和能量的检索增强生成评估

Zehang Wei, Jiaxin Dai, Jiamin Yan, Xiang Xiang

机构 * School of Computer Science & Tech, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) School of AI and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出MODE-RAG多智能体系统,利用变分自由能和内部注意力状态动态门控干预,结合蒙特卡洛树搜索和logit扰动减少多模态检索增强生成中的幻觉和逻辑捏造。

Comments To be presented at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10728 2026-06-17 cs.SE 新提交 67%

DeNovoSWE: Scaling Long-Horizon Environments for Generating Entire Repositories from Scratch

DeNovoSWE:扩展长时域环境以从零生成完整仓库

Jiale Zhao, Guoxin Chen, Fanzhe Meng, Wayne Xin Zhao, Ruihua Song, Ji-Rong Wen, Kai Jia

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出DeNovoSWE数据集,通过沙盒代理工作流自动构建4818个从文档生成完整仓库的实例,采用分治与批评修复策略及难度感知轨迹过滤,微调Qwen3-30B-A3B将BeyondSWE-Doc2Repo基准得分从5.8%提升至47.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23176 2026-06-17 cs.CV 版本更新 67%

DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving

DRIVESPATIAL:自动驾驶中视觉语言模型时空智能的基准

Hao Vo, Khoa Vo, Phu Loc Nguyen, Sieu Tran, Duc Minh Nguyen, Ngo Xuan Cuong, Gladys Gawugah, Sreevenkata Anjani Tishita Godavarthi, Chase Rainwater, Nghi D. Q. Bui, Anh Nguyen, Duy Minh Ho Nguyen, Ngan Le

机构 * University of Arkansas, USA(美国阿肯色大学) Google Research, Google(谷歌研究院) University of Liverpool, UK(英国利物浦大学) Max Planck Research School for Intelligent Systems(马克斯·普朗克智能系统研究学校)

专题命中 评测与基准 :language model(abstract);prompting(abstract)

AI总结 提出DriveSpatial基准,通过多视角、时空推理任务评估视觉语言模型在自动驾驶中的场景构建、关系理解、时序推理和泛化能力,发现人类与模型间存在显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12620 2026-06-17 cs.CV 67%

BusterX: MLLM-Powered AI-Generated Video Forgery Detection and Explanation

BusterX:基于MLLM的AI生成视频伪造检测与解释

Haiquan Wen, Yiwei He, Zhenglin Huang, Tianxiao Li, Zihan Yu, Xingru Huang, Lu Qi, Baoyuan Wu, Xiangtai Li, Guangliang Cheng

机构 * University of Liverpool, UK(利物浦大学) Nanyang Technological University, SG(南洋理工大学) The Chinese University of Hong Kong, Shenzhen, Guangdong, China(香港中文大学(深圳)) Wuhan University(武汉大学) Hangzhou Dianzi University(杭州电子科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出BusterX,一种基于多模态大语言模型的视频伪造检测系统,通过改进数据集和评估基准,提升检测准确性和解释质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03471 2026-06-17 eess.AS 67%

The PARLO Dementia Corpus: A German Multi-Center Resource for Alzheimer's Disease

PARLO痴呆语料库:一种用于阿尔茨海默病的德国多中心资源

Franziska Braun, Christopher Witzl, Florian Hönig, Elmar Nöth, Tobias Bocklet, Korbinian Riedhammer

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本文介绍PARLO痴呆语料库,通过多中心临床验证的德国资源,用于阿尔茨海默病的非侵入性检测,提供语音记录、转录及详细元数据,展示自动语音认知评估的可行性。

Comments Accepted at LREC 2026

Journal ref Proceedings of the Fifteenth Language Resources and Evaluation Conference (LREC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏