arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-03 至 2026-07-03 共收录 347 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 93 篇

2607.01305 2026-07-03 cs.CR cs.AI cs.LG 新提交 79%

Generative AI and Federated Learning for Intrusion Detection Systems: A Survey

生成式人工智能与联邦学习在入侵检测系统中的应用:综述

Jiefei Liu, Abu Saleh Md Tayeen, Pratyay Kumar, Qixu Gong, Wenbin Jiang, Huiping Cao, Satyajayant Misra, Jayashree Harikumar

机构 * Department of Computer Science, New Mexico State University(新墨西哥州立大学计算机科学系) University of Hartford(哈特福德大学) DEVCOM Analysis Center(DEVCOM分析中心)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了生成式AI和联邦学习在入侵检测中的应用,涵盖模型分类、任务目标及集成方法,并讨论了数据质量、对抗风险等挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20459 2026-07-03 cs.AI cs.CL 版本更新 79%

PreScience: A Dataset and Benchmark for Scientific Forecasting

PreScience:一个用于科学预测的数据集和基准

Anirudh Ajith, Amanpreet Singh, Jay DeYoung, Nadav Kunievsky, Austin C. Kozlowski, Oyvind Tafjord, James Evans, Daniel S. Weld, Tom Hope, Doug Downey

机构 * Allen Institute for Artificial Intelligence(Allen人工智能研究所) Knowledge Lab, University of Chicago(芝加哥大学知识实验室) School of Computer Science and Engineering, Hebrew University of Jerusalem(耶路撒冷希伯来大学计算机科学与工程学院) Northwestern University(西北大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出PreScience数据集和基准,包含98K篇AI论文及关联数据,设计7项预测任务,开发基线方法及LACER评估指标,发现合成论文多样性低于人类。

Comments 11 pages (70 with bibliography and appendix), 3 figures (14 with appendix), 5 tables (18 with appendix), 1 algorithm in appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01753 2026-07-03 cs.CV q-bio.QM 新提交 78%

The Turning Point of 3D Plant Phenotyping: 3D Foundation Models Enable Minute-to-Second Cross-Crop Reconstruction and Beyond

3D植物表型分析的转折点:3D基础模型实现分钟到秒级的跨作物重建及更多

Hanyue Jia, Wei Zhou, Wenbo Zhou, Yanan Li, Hao Lu, Tingting Wu

机构 * Northwest A&F University(西北农林科技大学) Huazhong University of Science and Technology(华中科技大学) Wuhan Institute of Technology(武汉工程大学)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 提出基于3D基础模型的跨作物表型分析框架,用前馈几何恢复替代COLMAP,结合3D高斯泼溅实现少视图重建,将重建时间从6.52分钟降至1.58秒,保持高质量与高精度。

Comments 39 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01442 2026-07-03 cs.CR cs.CV 新提交 78%

From Forgeries to Foundation Models: A Systematic Survey of Identity Document Attack and Detection

从伪造到基础模型:身份证件攻击与检测的系统性综述

Gourab Das, Pavan Kumar C, Raghavendra Ramachandra

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文系统综述了身份证件伪造攻击(物理呈现、数字注入、生成式合成)及检测方法,揭示了基准与现实间的差距,并发现最强模型在零样本场景下APCER超25%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23172 2026-07-03 eess.IV 新提交 78%

A Benchmark of (MRI-) Foundation Models to Predict IDH Mutational Status in Glioma

(MRI)基础模型预测胶质瘤IDH突变状态的基准测试

Nathan Hollet, Elise Robinson, Efthymios Georgiou, Ekin Ermis, Uri Nahum, Sarah Brüningk

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本研究比较了四种图像基础模型和基于影像组学的基线方法在预测胶质瘤IDH突变状态上的性能,发现影像组学基础模型TabPFN表现最佳,而图像基础模型在跨队列迁移中性能下降,但BiomedCLIP在外部队列中AUROC最高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03030 2026-07-03 cs.CV 版本更新 78%

BRIGHT: A Collaborative Generalist-Specialist Foundation Model for Breast Pathology

BRIGHT:用于乳腺病理的协作式通用-专科基础模型

Xiaojing Guo, Jiatai Lin, Yumian Jia, Jingqi Huang, Zeyan Xu, Weidong Li, Longfei Wang, Jingjing Chen, Qin Li, Weiwei Wang, Lifang Cui, Wen Yue, Zhiqiang Cheng, Xiaolong Wei, Jianzhong Yu, Xia Jin, Baizhou Li, Honghong Shen, Jing Li, Chunlan Li, Yanfen Cui, Yi Dai, Yiling Yang, Xiaolong Qian, Liu Yang, Yang Yang, Guangshen Gao, Yaqing Li, Lili Zhai, Chenying Liu, Tianhua Zhang, Zhenwei Shi, Cheng Lu, Xingchen Zhou, Jing Xu, Miaoqing Zhao, Fang Mei, Jiaojiao Zhou, Ning Mao, Fangfang Liu, Chu Han, Zaiyi Liu

机构 * Department of Breast Pathology and Laboratory, Tianjin Medical University Cancer Institute & Hospital, National Clinical Research Center for Cancer, Key Laboratory of Breast Cancer Prevention and Therapy, Tianjin Medical University, Ministry of Education, Tianjin’s Clinical Research Center for Cancer, West Huanhu Road, Tianjin, China(天津医科大学肿瘤医院乳腺病理科及实验室,国家癌症临床研究中心,天津医科大学乳腺癌预防与治疗重点实验室,天津医科大学,教育部,天津癌症临床研究中心,西湖南路,天津,中国) Guangdong Provincial Key Laboratory of Artificial Intelligence in Medical Image Analysis and Application, Guangdong Provincial People’s Hospital (Guangdong Academy of Medical Sciences), Southern Medical University, Guangzhou, China(广东省人工智能在医学影像分析与应用重点实验室,广东省人民医院(广东省医学科学院),南方医科大学,广州,中国)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 提出BRIGHT,首个针对乳腺病理的基础模型,采用通用-专科协作框架,在5.1万张全切片图像上训练,在25项内部验证任务中均达最优性能,优于5个通用模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20274 2026-07-03 cs.CV 版本更新 78%

SCLARO: A Dataset for Grounded Scenario-Level Scene Understanding and ScenarioCLIP for Benchmarking

SCLARO:面向场景级场景理解的数据集及用于基准测试的ScenarioCLIP

Advik Sinha, Saurabh Atreya, Aashutosh A, Sk Aziz Ali, Abhijit Das

机构 * Machine Intelligence Group, Department of CS&IS, Birla Institute of Technology and Science, Pilani – Hyderabad Campus(人工智能组,计算机科学与信息系,比拉理工学院和科学学院,比拉-海得拉巴校区)

专题命中 评测与基准 :language model(title,abstract)

AI总结 提出SCLARO数据集(615,805张图像,含动作、对象和关系标注)及ScenarioCLIP模型,通过解耦编码器和知识蒸馏联合编码场景上下文、对象和关系,在零样本检索等任务上优于先前方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02407 2026-07-03 cs.AI cs.CV 新提交 77%

Text-Driven 3D Indoor Scene Synthesis in Non-Manhattan Environments

非曼哈顿环境下的文本驱动3D室内场景合成

Xianhui Meng, Zirui Song, Yuchen Zhang, Li Zhang, Yongxuan Lv, Xiuying Chen, Kun Wang, Yan Luo, Kai Chen, Hangjun Ye, Long Chen, Jun Liu, Xiaoshuai Hao

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对非曼哈顿环境中现有方法难以建模非正交空间关系导致几何违规和物理保真度低的问题,提出SPG-Layout框架,利用物体分布统计先验和层次化布局策略,实现语义真实感与物理合理性的平衡优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01852 2026-07-03 cs.IR cs.AI cs.CL 新提交 73%

Evaluating Chunking Strategies for Retrieval-Augmented Generation on Academic Texts

评估学术文本中检索增强生成的文本分块策略

Valentin J. J. Kreileder, Johannes Reisinger, Andreas Fischer

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究在检索增强生成系统中,基于聚类的语义分块是否优于固定大小和递归分块,通过RAGAs框架在长结构化学术论文上评估检索和答案质量,发现聚类分块未超越简单策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17450 2026-07-03 cs.SE cs.AI cs.CL cs.CR 版本更新 73%

ContraFix: Skill-Enhanced Contrastive Runtime Analysis for Vulnerability Repair

ContraFix:通过差分运行时证据和技能重用进行代理漏洞修复

Simiao Liu, Fang Liu, Peiding Wang, Taichuan Li, Yinghao Zhu, Xiaoli Lian, Li Zhang

机构 * Beihang University(北京航空航天大学) The University of Hong Kong(香港大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出ContraFix框架,通过差分运行时证据和可重用的修复技能,解决大型语言模型代理在自动漏洞修复中的语义误解问题,实现了在SEC-Bench和PatchEval上的高准确率。

Comments Code: https://figshare.com/s/f173c78e44bca88ebaea

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16674 2026-07-03 cs.CV cs.AI cs.CL 版本更新 73%

MedRepBench: A Comprehensive Benchmark for Medical Report Interpretation

MedRepBench:医学报告解读的综合基准

Fangxin Shang, Yuan Xia, Dalu Yang, Yahui Wang, Binglin Yang

机构 * Baidu Inc.(百度公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出MedRepBench基准,包含1925张去标识中文医学报告图像,评估端到端视觉语言模型在报告字段结构化提取和患者友好解释上的性能,并提供GRPO对齐基线提升字段召回率6%。

Comments ECCV 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02141 2026-07-03 cs.AI 新提交 70%

A$^{2}$utoLPBench: An Auto-Generated, Agent-Friendly LP Benchmark via Inverse-KKT Construction

A$^{2}$utoLPBench:通过逆KKT构造自动生成的、智能体友好的线性规划基准

Shuo Ren, Yaohui Han, Yifan Shi, Libo Shen, Haodong Lu, Dongfang Wu, Rongliang Fu, Bei Yu, Tsung-Yi Ho

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出A$^{2}$utoLPBench,一种通过逆KKT条件自动生成线性规划文本问题的基准,提供无限新问题、难度可控、答案正确且防数据泄露。

Comments 25 pages and 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01883 2026-07-03 cs.CL 新提交 70%

PairCoder++: Pair Programming as a Universal Paradigm for Verified Code-Driven Multimodal and Structured-Artifact Generation

PairCoder++:结对编程作为验证代码驱动的多模态与结构化工件生成的通用范式

Junhao Chen, Xiang Li, Mingjin Chen, Boran Zhang, Henghaofan Zhang, Yibin Xu, Yuehan Cui, Fangsheng Weng, Fei Ma, Qi Tian, Ruqi Huang, Hao Zhao

机构 * THU(清华大学) PKU(北京大学) PolyU, Hong Kong(香港理工大学) USTC(中国科学技术大学) UESTC(电子科技大学) Tongji University(同济大学) Tianjin University(天津大学) Independent Researcher(独立研究者) Guangming Lab(光明实验室) BAAI(北京智源人工智能研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出PairCoder框架,通过驱动者和导航者两个智能体结对编程,利用工具链反馈验证代码生成,在17个基准测试中显著提升可验证工件的生成质量。

Comments Accepted by ACL 2026. Project Page: https://yisuanwang.github.io/PairCoder/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01280 2026-07-03 cs.LG cs.PL 新提交 70%

Fixed-Set Robustness in Programming by Example: Example Corruption and Semantic Partition Recovery

编程示例中的固定集鲁棒性:示例损坏与语义分区恢复

Yuan Si, Jialu Zhang

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 研究编程示例系统中对抗性示例损坏的鲁棒性,提出版本空间分区聚合(VPA)防御方法,实验表明低裕度任务易受攻击,VPA仅在语义分区投票裕度存在时有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01252 2026-07-03 cs.CY cs.AI 新提交 70%

How Indian Dermatologists are Utilizing Artificial Intelligence for Clinical Practice and Workflow Management: A Nationwide Survey with a Special Focus on atopic dermatitis

印度皮肤科医生如何将人工智能用于临床实践和工作流程管理:一项以特应性皮炎为重点的全国性调查

Dipayan Sengupta, Saumya Panda, Sandipan Dhar, Dipankar De, Deepika Pandhi, Narayanan B

机构 * Charnock Hospital, Kolkata, India(科钦医院,加尔各答,印度) Department of Dermatology, Jagannath Gupta Institute of Medical Sciences and Hospital, Kolkata, India(皮肤科部,贾亚纳塔·古普塔医学科学与医院,加尔各答,印度) Department of Pediatric Dermatology, Institute of Child Health, Kolkata-700017, India(儿科皮肤科部,儿童健康研究所,加尔各答-700017,印度) Department of Dermatology, Venereology, and Leprology, Postgraduate Institute of Medical Education and Research, Chandigarh-160012, India(皮肤科、性病学和麻风病学部,医学教育与研究研究生院,昌迪加尔-160012,印度) Department of Dermatology and STD, University College of Medical Sciences & GTBH, University of Delhi, Delhi-110095, India(皮肤科和性传播疾病部,医学科学大学及GTBH,德里大学,德里-110095,印度) Department of DVL, Sree Balaji Medical College and Hospital, Chennai, India(DVL部,Sree Balaji医学院和医院,钦奈,印度)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 通过全国性调查,发现印度皮肤科医生主要使用通用大语言模型处理认知和行政任务,而临床需求集中于慢性病管理和特应性皮炎工作流支持,提示临床监督下的工作流工具可能比独立诊断应用更有用。

Comments 28 pages, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03305 2026-07-03 cs.AI 版本更新 70%

The Reliability Gap in Benchmark Auditing: Distribution Shift and Scale as Failure Modes of Contamination Detection

基准审计中的可靠性差距:分布偏移和规模作为污染检测的失败模式

Wojciech Zarzecki, Jan Dubiński, Sebastian Cygert

机构 * NASK National Research Institute(国家研究 institute) Warsaw University of Technology(华沙技术大学) Gdańsk University of Technology(格但喀大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 研究基准污染检测方法在分布偏移和规模约束下的可靠性,发现三种主流方法在335次评估中仅199次正确,揭示了受控验证与实际审计之间的系统性可靠性差距。

Comments accepted to ECML PKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19127 2026-07-03 cs.CL 版本更新 70%

AgenticRAGTracer: A Hop-Aware Benchmark for Diagnosing Multi-Step Retrieval Reasoning in Agentic RAG

AgenticRAGTracer:用于诊断Agentic RAG中多步检索推理的跳数感知基准

Qijie You, Wenkai Yu, Wentao Zhang

机构 * University of Science and Technology Beijing(北京科技大学) Peking University(北京大学) Zhongguancun Academy(中关村学院) Beijing Key Laboratory of Data Intelligence and Security (Peking University)(北京市数据智能与安全重点实验室(北京大学))

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出首个由大语言模型自动构建的Agentic RAG基准AgenticRAGTracer,包含1305个跨领域数据点,支持逐跳验证,揭示模型在多步推理中推理链扭曲的问题。

Comments Accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23128 2026-07-03 cs.HC cs.AI cs.MA 版本更新 70%

It's a TRAP! Task-Redirecting Agent Persuasion Benchmark for Web Agents

这是一个陷阱!面向网络代理的任务重定向说服基准

Karolina Korgul, Yushi Yang, Arkadiusz Drohomirecki, Piotr Błaszczyk, Will Howard, Lukas Aichberger, Chris Russell, Philip H. S. Torr, Adam Mahdi, Adel Bibi

机构 * University of Cambridge(剑桥大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出TRAP基准,评估大型语言模型驱动的网络代理在动态网页中易受提示注入攻击的程度,发现平均25%的任务中代理被重定向,揭示了心理驱动的系统漏洞。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01390 2026-07-03 cs.CV cs.AI cs.MM 版本更新 70%

SEPS: Semantic-enhanced Patch Slimming Framework for fine-grained cross-modal alignment

SEPS:面向细粒度跨模态对齐的语义增强补丁精简框架

Xinyu Mao, Junsi Li, Haoji Zhang, Yu Liang, Ming Sun

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出SEPS框架,通过两阶段机制整合稠密与稀疏文本语义,识别显著视觉补丁,并利用相关性感知选择与均值计算突出关键补丁-词对应,提升跨模态相似度评估,在Flickr30K和MS-COCO上rSum提升23%-86%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02294 2026-07-03 cs.SE 新提交 67%

Coding Agents Are Guessing: Measuring Action-Boundary Violations in Underspecified DevOps Instructions

编码代理在猜测:测量欠指定DevOps指令中的动作边界违规

Zimo Ji, Zekai Zhang, Congying Xu, Zongjie Li, Yudong Gao, Shuai Wang, Shing-Chi Cheung

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出UnderSpecBench基准,通过69个任务族和2208个提示变体,评估编码代理在欠指定DevOps指令下的动作边界违规,发现55.8-67.8%的运行至少违反一个边界,表明完成度评估高估了安全自主性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02083 2026-07-03 cs.CV 新提交 67%

DeepGaze3.5-VL: Modeling Scanpaths via Autoregressive Token Prediction

DeepGaze3.5-VL: 通过自回归标记预测建模扫描路径

Susmit Agrawal, Matthias Bethge, Matthias Kümmerer

机构 * IMPRS-IS

专题命中 评测与基准 :language model(abstract);prompting(abstract)

AI总结 将扫描路径预测建模为离散序列任务,利用视觉语言模型的预训练表示,通过简单提示实现个性化偏置和任务特定目标,在MIT1003上信息增益达2.18比特,比DeepGaze III提升46%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01667 2026-07-03 cs.CV 新提交 67%

Temporal and Cross-Modal Alignment for Enhanced Audiovisual Video Captioning

增强视听视频字幕的时间与跨模态对齐

Chen Zhao, Jiajun Ma, Qilong Huang, Tiehan Fan, Hongyu Li, Zhuoliang Kang, Xiaoming Wei, Jian Yang, Ying Tai

机构 * Nanjing University, State Key Laboratory for Novel Software Technology(南京大学,计算机软件新技术国家重点实验室) Meituan(美团)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出TCA-Captioner框架,通过观察-检查-纠正迭代策略和密集交互数据集,解决视听字幕中的模态分离与时间不一致问题,实现精准的视听绑定与因果动态建模。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01597 2026-07-03 cs.SE 新提交 67%

A Single Patch Is Not Enough: Deterministic Fusion of Repair Candidates

单个补丁不够:修复候选的确定性融合

Boyang Yang, Xiangliang Hu, Luyao Ren, Yanjun Chen, Bach Le, Tegawendé F. Bissyandé, Haoye Tian

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 针对代码修复中候选补丁池的“pass@k到pass@1”差距,提出PatchFusion方法,通过确定性原子证据融合选择并构造最终补丁,无需测试结果,在三个基准上优于现有选择器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01460 2026-07-03 cs.CY cs.SI 新提交 67%

Social-Annotate: Self-Healing Browser Extension to Annotate and Collect Social Media Data

Social-Annotate: 用于标注和收集社交媒体数据的自愈浏览器扩展

Ali Najafi, Ismail Uluturk, Onur Varol

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出Social-Annotate浏览器扩展,通过注入可定制表单实现在线平台直接数据收集,并集成大语言模型驱动的自愈代理以应对界面变化,支持12个平台,降低数据收集和维护成本。

Comments 13 pages, 3 figures, 1 SI-table, 2 SI-figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00551 2026-07-03 econ.GN q-fin.EC 新提交 67%

Talking Politics with Artificial Intelligence

与人工智能谈论政治

Ziwen Zu

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 基于430万条人机对话数据,发现政治内容占3.9%,用户主要寻求信息而非表达观点;2024年美国大选结果公布后,美国用户的情感表达和意识形态极端性增加,表明AI对话是政治中介而非公共广场。

Comments 58 pages, 15 figures, 21 tables; includes appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22645 2026-07-03 cs.IR cs.CY 新提交 67%

All Relations Lead to Rome: Automated Knowledge Graph Creation and Question Generation

所有关系通向罗马:自动化知识图谱构建与问题生成

Matthijs Jansen op de Haar, Tobias Stähle, Lorenzo Gatti

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出ARLtR框架,联合构建知识图谱、嵌入和基于事实的问答对,实现符号图与稠密检索的统一表示,并以罗马帝国历史数据集验证。

Comments 10 pages, 5 figures, version one

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08711 2026-07-03 cs.CV 版本更新 67%

TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions

TimeChat-Captioner: 用时间感知和结构化的音视频字幕脚本化多场景视频

Linli Yao, Yuancheng Wei, Yaojie Zhang, Lei Li, Xinlong Chen, Feifan Song, Ziyue Wang, Kun Ouyang, Yuanxin Liu, Lingpeng Kong, Qi Liu, Pengfei Wan, Kun Gai, Yuanxing Zhang, Xu Sun

机构 * South China University of Technology(华南理工大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 评测与基准 :SFT(abstract,abstract_cn)

AI总结 提出Omni密集描述任务,通过六维结构模式生成带时间戳的类脚本描述,构建OmniDCBench基准和SodaM评估指标,训练TimeChat-Captioner-7B模型,在音视频推理和时间定位任务上超越Gemini-2.5-Pro。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09446 2026-07-03 cs.CV 版本更新 67%

Defect-aware Hybrid Prompt Optimization via Progressive Tuning for Zero-Shot Multi-type Anomaly Detection and Segmentation

基于渐进调优的缺陷感知混合提示优化用于零样本多类型异常检测与分割

Nadeem Nazer, Hongkuan Zhou, Lavdim Halilaj, Ylli Sadikaj, Steffen Staab

机构 * Corporate Research, Robert Bosch GmbH(罗伯特·博世集团企业研究部) Otto-von-Guericke-University(奥托·冯·格里克大学) Institute for Artificial Intelligence, University of Stuttgart(斯图加特大学人工智能研究所) Faculty of Computer Science, UniVie Doctoral School Computer Science, University of Vienna(维也纳大学计算机科学系) University of Southampton(南安普顿大学)

专题命中 评测与基准 :language model(abstract);prompting(abstract)

AI总结 提出DAPO框架,通过混合提示机制结合可读缺陷描述与可学习嵌入,对齐异常视觉特征与文本语义,在零样本多类型异常检测与分割任务中平均提升AUROC 3.6%和5.2%。

Journal ref European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02469 2026-07-03 cs.SE cs.AI cs.CL 新提交 62%

TestEvo-Bench: An Executable and Live Benchmark for Test and Code Co-Evolution

TestEvo-Bench:一个可执行且动态的测试与代码协同演化基准

Jiale Amber Wang, Kaiyuan Wang, Pengyu Nie

专题命中 评测与基准 :foundation model(abstract);分类 cs.CL、cs.AI

AI总结 提出TestEvo-Bench基准,包含测试生成和更新两类任务,基于真实提交历史并支持执行指标,评估自动化代理在代码变更后同步调整测试的能力。

Comments TestEvo-Bench leaderboard and data explorer are hosted at https://www.testevo-bench.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01973 2026-07-03 cs.CV cs.AI cs.LG 新提交 62%

Assessing VLM Reliability for Medical Image Quality Evaluation Under Corruption and Bias

评估视觉语言模型在图像退化与偏差下进行医学图像质量评估的可靠性

Sofiane Ouaari, Kevin Vorwalder, Nico Pfeifer

机构 * University of Tuebingen(图宾根大学) Institute for Bioinformatics and Medical Informatics (IBMI), University of Tuebingen(图宾根大学生物信息学与医学信息学研究所)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 研究视觉语言模型在医学图像质量评估中,面对图像退化(如像素化)和文本属性偏差时的可靠性,发现像素化显著降低性能,而文本属性(如机构声望)引入偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏