arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-29 至 2026-06-29 共收录 53 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 53 篇

2606.28062 2026-06-29 cs.DB cs.AI cs.CL cs.IR 新提交 93%

Single and Multi Truth Data Fusion using Large Language Models

使用大型语言模型的单真值与多真值数据融合

Hira Beril Kucuk, Norman W Paton, Jiaoyan Chen, Zhenyu Wu

机构 * Department of Computer Science University of Manchester(计算机科学系曼彻斯特大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 研究利用大型语言模型(LLM)解决表格数据的单真值和多真值数据融合问题,通过多种提示策略在三个基准数据集上实验,结果表明LLM方法优于传统无监督方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27383 2026-06-29 cs.DL cs.AI cs.CL 新提交 93%

CalBrief: A Pilot Diagnostic Benchmark for Evidence-Calibrated Scientific Briefing with Large Language Models

CalBrief:面向大型语言模型证据校准科学简报的试点诊断基准

Yu Fu, Yongqi Kang, Yong Zhao

机构 * Sichuan University(四川大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 提出CalBrief基准,通过16个科学证据包和96个人工验证要点,诊断LLM在证据校准简报中的不足,发现保守性主要源于标签空间扩展而非信号注入。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20094 2026-06-29 cs.AI 版本更新 92%

CausalFlip: A Benchmark for LLM Causal Judgment Beyond Semantic Matching

CausalFlip: 超越语义匹配的LLM因果判断基准

Yuzhe Wang, Yaochen Zhu, Jundong Li

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出CausalFlip基准,通过构建语义相似但因果答案相反的问题对和噪声前缀评估,揭示LLM依赖语义匹配而非因果推理,并验证内化因果推理方法可提升因果基础。

Comments 8 pages plus references, 3 figures, 3 tables. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16492 2026-06-29 cs.CL 版本更新 92%

Check Yourself Before You Wreck Yourself: Selectively Quitting Improves LLM Agent Safety

在自毁之前检查自己:选择性退出提升LLM智能体安全性

Vamshi Krishna Bonagiri, Ponnurangam Kumaragurum, Khanh Nguyen, Benjamin Plaut

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出让LLM智能体在不确定时主动退出,通过ToolEmu框架在12个模型上评估,发现该方法在几乎不降低有用性的情况下显著提升安全性。

Comments Reliable ML and Regulatable ML workshops, Neurips 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16116 2026-06-29 cs.CR cs.AI 版本更新 92%

DMind Benchmark: Toward a Holistic Assessment of LLM Capabilities across the Web3 Domain

DMind Benchmark:面向Web3领域LLM能力的全面评估

Enhao Huang, Pengyu Sun, Shuxun Wang, Zixin Lin, Alex Chen, Kaichun Hu, Joey Ouyang, Frank Li, Zhiyu Zhang, Haobo Wang, Yiming Li, Zhan Qin, James Yi, Gang Zhao, Ziang Ling, Lowes Yang

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出DMind Benchmark,覆盖Web3九个子领域,结合客观知识与开放推理任务,评估31个LLM,发现模型在安全审计等高推理任务中存在显著弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14568 2026-06-29 cs.SE cs.CL cs.LG 版本更新 91%

Given, When, Then, Again: Mining Subscenario Refactoring Candidates in Behaviour-Driven Test Suites with ML Classifiers and LLM-Judge Baselines

在行为驱动软件测试套件中挖掘子场景重构机会:ML分类器和LLM-判断基线

Ali Hassaan Mughal, Noor Fatima, Muhammad Bilal

机构 * Independent Researcher(独立研究者;应用MBA(数据分析),德克萨斯韦斯利安大学) Applied MBA (Data Analytics), Texas Wesleyan University(独立研究者;计算机工程学士,国立科学与技术大学(NUST)) Independent Researcher(独立研究者;管理硕士,慕尼黑技术大学) B.E. Computer Engineering, National University of Sciences and Technology (NUST) Independent Researcher M.Sc. Management, Technical University of Munich

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文通过ML分类器和LLM基线,识别行为驱动开发测试套件中可提取的子场景,量化其在公共BDD生态系统中的普及率。

Comments 31 pages, 10 figures, 6 tables, 56 references. v2: retitled; references corrected and verified; threshold-sensitivity and imbalance-robust metrics added; figures restyled. Code and data (Apache-2.0): https://github.com/amughalbscs16/cukereuse_subscenarios_release (archived: https://doi.org/10.5281/zenodo.20356527). Upstream corpus: https://doi.org/10.5281/zenodo.19754359

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16150 2026-06-29 cs.CR cs.AI cs.CL 版本更新 90%

PRISON: Unmasking the Criminal Potential of Large Language Models

PRISON:揭示大型语言模型的犯罪潜力

Xinyi Wu, Geng Hong, Pei Chen, Yueyue Chen, Xudong Pan, Min Yang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 提出PRISON框架,通过五个特质量化LLMs的犯罪潜力,发现最先进模型常表现出犯罪倾向,且检测欺骗行为准确率仅44%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27666 2026-06-29 cs.AR 新提交 89%

MultModLM: A multi-modal benchmark for Large-Language Model based hardware schematic generation

MultModLM:基于大语言模型的硬件原理图生成的多模态基准

Dhruv Kulkarni, Sai Manoj Pudukotai Dinkarrao

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract)

AI总结 提出MultModLM基准,评估LLM从RTL描述生成硬件原理图的能力,通过多阶段评估框架发现模型生成原理图功能正确性有限,且LLM评估者与人类评分一致性极低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27650 2026-06-29 cs.MA 新提交 89%

GenWorld: Empirically Grounded Urban Simulation Infrastructure for Scalable LLM-Agent Studies

GenWorld:用于可扩展LLM智能体研究的经验性城市模拟基础设施

Gen Li, Jieyuan Lan, Pengcheng Xu, Zongyuan Wu, Masaki Ogura, Tao Feng

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 提出GenWorld,一种结合合成城市、结构化接口和离线编译LLM决策信号为查找策略的经验性城市模拟基础设施,实现可扩展的LLM智能体研究。

Comments 27 pages, 24 figures. Code: https://github.com/Perseus1993/genworld. Project page: https://genworld1993.netlify.app/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03180 2026-06-29 cs.CL 89%

BengaliMoralBench: A Benchmark for Auditing Moral Reasoning in Large Language Models within Bengali Language and Culture

BengaliMoralBench:一种用于审计大型语言模型道德推理的基准,针对孟加拉语和文化

Shahriyar Zaman Ridoy, Azmine Toushik Wasi, Koushik Ahamed Tonmoy, Taki Hasan Rafi, Dong-Kyu Chae

机构 * North South University(北南大学) Computational Intelligence and Operations Laboratory(计算智能与运营实验室) Hanyang University(翰林大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

AI总结 本文提出BengaliMoralBench,一个针对孟加拉语和文化背景的道德推理评估基准,涵盖五个道德领域,通过三种伦理框架进行标注,评估不同模型的性能差异及文化适应性问题。

Comments Accepted at ACM FAccT 2026

Journal ref ACM FAccT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28061 2026-06-29 cs.CR cs.AI 新提交 89%

ToolPrivacyBench: Benchmarking Purpose-Bound Privacy in Tool-Using LLM Agents

ToolPrivacyBench: 对使用工具的LLM代理进行目的绑定隐私基准测试

Shijing Hu, Liang Liu, Zhu Meng, Zhicheng Zhao

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing(北京未来区块链与隐私计算先进创新中心)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对现有评估忽略多工具轨迹中目的绑定信息流的问题,提出ToolPrivacyBench基准,通过策略知识库审计工具参数和后端日志,评估任务完成与隐私过度披露,发现成功执行任务可能伴随不必要的隐私泄露。

Comments 24 pages, 7 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27619 2026-06-29 cs.AI cs.CL cs.HC cs.IR cs.LG 新提交 88%

DysLexLens: A Low-Resource LLM Framework for Analysing Dyslexic Learners Insights from Online Forums

DysLexLens:面向低资源场景的LLM框架,用于分析在线论坛中阅读障碍学习者的见解

Dana Rezazadegan, Atie Kia, Phongpadid Nandavong, Dominique Carlon, Jeremy Nguyen, Abhik Banerjee, James Marshall, Anthony McCosker, Yong-Bin Kang

机构 * Swinburne University of Technology(斯威本科技大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出DysLexLens框架,通过字典过滤、知识图谱推理和评估机制,从低资源论坛数据中分析阅读障碍学习者对AI工具的使用体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13072 2026-06-29 cs.CL cs.AI cs.LG 版本更新 88%

LiveClawBench: Benchmarking LLM Agents on Complex, Real-World Assistant Tasks

LiveClawBench: 在复杂真实世界助理任务上评估大语言模型代理的基准测试

Xiang Long, Li Du, Yilong Xu, RongJian Xu, Qiyanhui Lu, Ying Gao, Qinhua Xie, Fangcheng Liu, Ning Ding, Haoqing Wang, Ziheng Li, Changjiang Zhou, Jianyuan Guo, Yehui Tang

机构 * Samsung Research(三星研究院) HKUST (Guangzhou)(香港科技大学(广州)) Peking University(北京大学) City University of Hong Kong(香港城市大学)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出LiveClawBench基准,通过三轴复杂性框架评估LLM代理在真实世界助理任务中的表现,涵盖环境复杂性、认知需求和运行时适应性,为未来扩展提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20820 2026-06-29 cs.LG 新提交 87%

CELEUS: Certifiable and Efficient LLM Evaluation via E-Processes

CELEUS: 基于E-Process的可认证且高效的大语言模型评估

Zhijian Zhou, Zesheng Ye, Zhaorun Chen, Bo Li, Feng Liu

机构 * The University of Melbourne(墨尔本大学)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.LG

AI总结 提出Celeus框架,利用E-process构建任意有效的置信区间,通过不确定性引导采样和代理辅助近似减少评估样本,实现高效且统计严谨的LLM评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28050 2026-06-29 cs.CL cs.AI 新提交 87%

Can LLMs Judge Better Than They Generate? Evaluating Task Asymmetry, Mechanistic Interpretability and Transferability for In-Context QA

LLM能否比生成更好地判断?探究上下文问答中的任务不对称性、机制可解释性与可迁移性

Sambaran Bandyopadhyay

机构 * Adobe Research(Adobe研究院)

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.CL、cs.AI

AI总结 本研究在受控上下文问答中测试LLM自我评估是否比生成更容易,发现评估并非普遍更易,注意力分析显示评估对上下文关注更少,微调实验证实不对称性非训练伪影,挑战了自我评估管线的核心假设。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17838 2026-06-29 cs.SE 版本更新 87%

Using Mutation-Analysis to Examine an LLM's Ability to Summarize Code

使用变异分析检验大语言模型总结代码的能力

Lara Khatib, Michael Pu, Bogdan Vasilescu, Meiyappan Nagappan

专题命中 评测与基准 :LLM(title,summary_cn)

AI总结 提出基于变异分析的评估方法,通过注入代码突变并检查摘要是否更新,测试LLM摘要是否反映实际行为;实验表明摘要准确率随复杂度下降,模型常描述意图而非行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27959 2026-06-29 cs.CL 新提交 86%

An Empirical Analysis of Factual Errors in Human-Written Text and its Application

人类撰写文本中事实错误的实证分析及其应用

Kazuma Iwamoto, Kazumasa Omura, Shotaro Ishihara

机构 * Nikkei Inc.(日本产经公司)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 通过分析报纸文章修正,提炼人类事实错误分类,并评估LLM在合成和真实数据上的检测能力,发现GPT-5.4仅达52% F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.05201 2026-06-29 cs.AI cs.HC econ.GN q-fin.EC 版本更新 86%

"Generate" the Future of Work through AI: Empirical Evidence from Online Labor Markets

通过AI“生成”工作的未来:来自在线劳动力市场的实证证据

Jin Liu, Xingchen Xu, Xi Nan, Yongjun Li, Yong Tan

机构 * School of Management, University of Science and Technology of China(中国科学技术大学管理学院) Michael G. Foster School of Business, University of Washington(华盛顿大学迈克尔·G·福斯特商学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 利用在线平台数据,发现LLM生成式AI导致与核心功能匹配的子市场需求和供给下降,但供给减少较小,加剧竞争,尤其在编程密集型领域,因ChatGPT降低编程门槛促使高技能自由职业者转入。

Comments 102 pages, 17 figures, 39 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28002 2026-06-29 cs.CL cs.AI eess.AS 新提交 82%

Dialogue to Detection: A Multimodal Hybrid NLP Pipeline for Insurance Fraud Detection

对话到检测:用于保险欺诈检测的多模态混合 NLP 流水线

Muhammad Shakeel Akram, Amal Htait, Abdul Hamid Sadka, Emma Meisingseth, Karishma Jaitly

机构 * Aston University(阿斯顿大学) Domestic & General

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 提出一种合成多模态框架,结合ASR、NER、LLM-RAG和说话人嵌入,通过规则风险评分检测保险欺诈中的叙述复用、结构不一致和跨案件语音重复。

Comments 10 pages, 8 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00784 2026-06-29 cs.CV 版本更新 82%

An Approach to Enriching Surgical Video Datasets for Fine-Grained Spatial-Temporal Understanding of Vision-Language Models

一种丰富手术视频数据集的方法,用于视觉-语言模型的细粒度时空理解

Lennart Maack, Alexander Schlaefer

机构 * Hamburg University of Technology(汉堡理工大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract)

AI总结 提出SurgSTU-Pipeline生成管道,通过时空连续性过滤创建细粒度时空问答数据集SurgSTU,提升视觉-语言模型在手术视频中的时空理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28013 2026-06-29 cs.CL 新提交 81%

The Signal-Coverage Matrix: Stratifying Type and Semantic Errors in Statement Autoformalization

信号-覆盖矩阵:对语句自动形式化中的类型错误和语义错误进行分层

Chengxiao Dai, Zhaokun Yan, Zhanhui Lin

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 提出信号-覆盖矩阵,将LLM自动形式化输出按类型正确性和语义等价性分为四类,揭示类型错误和语义错误的恢复模式,并预测总体正确率变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22902 2026-06-29 cs.AI 新提交 81%

Agent-as-a-Router: Agentic Model Routing for Coding Tasks

Agent-as-a-Router: 面向编码任务的智能体模型路由

Pengfei Zhou, Zhiwei Tang, Yixing Ma, Jiasheng Tang, Yizeng Han, Zhenglin Wan, Fanqing Meng, Wei Wang, Bohan Zhuang, Wangbo Zhao, Yang You

机构 * National University of Singapore(新加坡国立大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) University of California, Berkeley(加州大学伯克利分校) The Hong Kong University of Science and Technology(香港科技大学) Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出Agent-as-a-Router框架,通过C-A-F循环积累执行经验,实现编码任务的动态模型路由,ACRouter在分布内任务上取得最低累积遗憾并泛化到分布外任务。

Comments 39 pages, 21 figures, a living technical report with a living benchmark that continuously updates

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04564 2026-06-29 cs.LG 版本更新 80%

SurvPFN: Towards Foundation Models for Survival Predictions

SurvPFN:面向生存预测的基础模型

Samuel Böhm, Lennart Purucker, Frank Hutter, Pascal Schlosser

机构 * University of Freiburg(弗赖堡大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 提出SurvPFN,一种基于先验数据拟合网络(PFN)的生存预测模型,通过合成数据预训练和删失负对数似然损失,无需逐数据集拟合即可在真实任务中与经典和深度生存基线竞争。

Comments 10 pages, 1 figure. Accepted to "Foundation Models for Structured Data" Workshop at the International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28237 2026-06-29 cs.RO 新提交 80%

Unleashing Infinite Motion: Scaling Expressive Quadrupedal Motion via Generative Video Priors

释放无限运动:通过生成式视频先验扩展富有表现力的四足运动

Youzhi Liu, Li Gao, Yifei Qian, Liu Liu, Yang Cai, Ziqiao Li

机构 * Amap, Alibaba Group(高德,阿里巴巴集团)

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 提出Uni-Mo全自动流水线,利用LLM和视频扩散模型生成四足机器人运动数据,通过身份一致性损失提取3D轨迹,训练真实机器人跟踪策略,并发布包含7488个语言标注运动的数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13890 2026-06-29 cs.HC 版本更新 80%

Workshop Paper: An empirical study to understand how students use ChatGPT for writing essays and how it affects their ownership

研讨会论文:一项关于学生如何使用ChatGPT撰写论文及其如何影响论文所有权的实证研究

Andrew Jelson, Sang Won Lee

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 通过用户研究记录学生与ChatGPT的交互过程,分析查询与回复,探讨AI辅助写作对写作教育和评估的影响。

Comments 5 pages, 2 figures, submitted and accepted to ACM CHI Workshop In2Writing in 2024, Please see full paper at CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19652 2026-06-29 cs.CR 版本更新 80%

A Plug-and-Play Method for Improving Imperceptibility and Capacity in Practical Generative Text Steganography

一种提高实用生成式文本隐写术不可感知性和容量的即插即用方法

Kaiyi Pang

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出FreStega方法,通过重构语言模型概率分布,在自回归生成隐写文本时动态调整token概率,同时提升不可感知性和容量(容量提升15.41%),无需牺牲文本质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27672 2026-06-29 cs.LG 新提交 79%

Are Time-Series Foundation Models Ready for E-Nose Data? An Empirical Assessment of Their Embeddings

时间序列基础模型是否准备好处理电子鼻数据?对其嵌入的经验评估

Taeyeong Choi, Mohammed Kamruzzaman

机构 * Department of Information Technology(信息科技系) Department of Agricultural and Biological Engineering(农业与生物工程系) Kennesaw State University(凯斯沃州立大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 本文系统评估了Chronos-2和MOMENT等时间序列基础模型在电子鼻数据上的嵌入表示,发现微调是必要步骤,且融合专用模型表示可提升气体识别和浓度预测性能。

Comments Submitted to IEEE SENSORS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27500 2026-06-29 cs.CV cs.CL 新提交 79%

Aloe-Vision: Robust Vision-Language Models for Healthcare

Aloe-Vision: 面向医疗保健的鲁棒视觉-语言模型

Jaume Guasch-Martí, Enrique Lopez-Cuena, Martín Suárez-Fernández, Jordi Bayarri-Planas, Anna Arias-Duart, Dario Garcia-Gasulla

机构 * Barcelona Supercomputing Center (BSC)(巴塞罗那超级计算中心(BSC))

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 提出Aloe-Vision系列医疗LVLM,通过大规模高质量多模态数据微调,在保持通用能力的同时提升医疗任务性能,并引入低污染基准CareQA-Vision,揭示当前模型在临床环境中的鲁棒性挑战。

Comments MIDL 2026

Journal ref Proceedings of Machine Learning Research, Vol. 315, pp. 2404-2426, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18610 2026-06-29 cs.RO cs.CV 新提交 78%

SC3-Eval: Evaluating Robot Foundation Models via Self-Consistent Video Generation

SC3-Eval: 通过自洽视频生成评估机器人基础模型

Wei-Cheng Tseng, Gashon Hussein, Yuzhu Dong, Allen Z. Ren, Lucy X. Shi, XuDong Wang, Sergey Levine, Zhaoshuo Li, Jinwei Gu, Florian Shkurti, Ming-Yu Liu, Quan Vuong

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) NVIDIA(英伟达) Physical Intelligence Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校) Allen Institute for AI(艾伦人工智能研究所)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 提出SC3-Eval方法,利用前向-反向动力学一致性、跨视角一致性和测试时一致性,将预训练视频基础模型转化为准确的策略评估器,在7个真实世界策略上达到0.929的皮尔逊相关系数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10764 2026-06-29 cs.CV 版本更新 78%

SurgXBench: Explainable Vision-Language Model Benchmark for Surgery

SurgXBench: 可解释的视觉-语言模型手术基准

Jiajun Cheng, Xianwu Zhao, Sainan Liu, Xiaofan Yu, Ravi Prakash, Patrick J. Codd, Jonathan Elliott Katz, Shan Lin

机构 * Arizona State University(亚利桑那州立大学) Intel Labs(英特尔实验室) Duke University(杜克大学) University of Miami(迈阿密大学) University of California, Merced(加州大学默塞德分校)

专题命中 评测与基准 :language model(title,abstract)

AI总结 针对手术视觉-语言模型(VLM)泛化能力不足的问题,提出SurgXBench基准,在零样本设置下评估多个先进VLM在器械与动作分类任务上的表现,并集成可解释AI分析模型注意力与因果解释,揭示模型依赖弱上下文线索而非临床相关证据的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏