arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2707 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2707 篇

2608.15456 2026-08-18 cs.CV 新提交 78%

AlignJEPA: Predictive Vision-Language Alignment for Remote Sensing Foundation Models

AlignJEPA:面向遥感基础模型的预测性视觉-语言对齐

Md Aminur Hossain, Omkumar Vaghasiya, Rajeev Ranjan Dwivedi, Vinod Kurmi, Biplab Banerjee

机构 * Space Applications Centre, ISRO(印度空间研究组织空间应用中心) Indian Institute of Science Education and Research (IISER) Bhopal(印度科学教育与研究学院(博帕尔)) Indian Institute of Technology Bombay(印度理工学院孟买分校)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 该研究针对遥感基础模型与自然语言对齐不足的问题,提出受JEPA启发的AlignJEPA框架,采用轻量级预测对齐网络,结合语义预测与双向对比检索,实现了参数高效的视觉-语言对齐。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14260 2026-08-17 eess.IV cs.MM 新提交 78%

Personalized Digital Semantic Communication for Image Transmission with Vision-Language Models

基于视觉语言模型的图像传输个性化数字语义通信

Nan Li, Li Zhou, Haijun Wang, Jun Xiong, Haitao Zhao, Jibo Wei

专题命中 评测与基准 :language model(title,abstract)

AI总结 针对现有语义通信方案忽略接收端依赖语义的问题,提出整合VLM与LDM的PDSC框架,构建容量受限的个性化语义率失真问题,实验证实其在带宽受限场景下的源语义一致性与个性化表现优于CDDM、MoS等基线。

Comments Accepted by IEEE GLOBECOM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14262 2026-08-17 cs.CV 新提交 78%

On the Robustness of Temporal Vision-Language Models for Surgical Endoscopy Videos

手术内窥镜视频的时间视觉语言模型的鲁棒性研究

Darakshan Rashid, Raza Imam, Ufaq Khan, Muhammad Bilal, Shazad Ashraf, Dwarikanath Mahapatra, Mohammad Yaqub, Muhammad Haris Khan, Imran Razzak, Brejesh Lall, Lena Maier-Hein, Yutong Xie

机构 * Indian Institute of Technology Delhi(印度理工学院德里分校) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) Birmingham City University(伯明翰城市大学) University Hospitals Birmingham(伯明翰大学医院) Khalifa University(哈利法大学) German Cancer Research Center (DKFZ)(德国癌症研究中心)

专题命中 评测与基准 :language model(title,abstract)

AI总结 该研究针对手术内窥镜视频的时间视觉语言模型,构建Endo-C6基准测试其鲁棒性,提出RobustEndoCLIP,可提升模型在内窥镜损坏下的性能与鲁棒性。

Comments Accepted to MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13455 2026-08-14 cs.CV 新提交 78%

Evaluation of Clinically Steerable Retinal Image Generation from Foundation Model Latent Spaces

基于基础模型潜在空间的临床可操控视网膜图像生成评估

Zuzanna A. Wakefield-Skórniewska, Bartłomiej W. Papież

机构 * Nuffield Department of Population Health, University of Oxford(牛津大学纳菲尔德人口健康系) University of Oxford(牛津大学)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 该研究评估了四种视网膜基础模型的可控图像生成能力,发现其在自身框架内生成的视网膜图像优于传统潜在扩散,但与真实图像存在表征差距,需进一步对齐。

Comments MICCAI 2026 Workshop SASHIMI Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13309 2026-08-14 cs.CV 新提交 78%

How Good are Foundation Models in Longitudinal MRI Disease Progression Reasoning?

基础模型在纵向MRI疾病进展推理中的表现如何?

Wafa Al Ghallabi, Ritesh Thawkar, Sara Ghaboura, Omkar Thawakar, Numan Saeed, Dana Al Nuaimi, Ajnas Alkatheeri, Salman Khan, Fahad Shahbaz Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Department of Health Abu Dhabi(阿布扎比卫生部) Fatima College of Health Sciences(法蒂玛健康科学学院) Linköping University(林雪平大学)

专题命中 评测与基准 :foundation model(title);language model(abstract)

AI总结 该研究推出Time-Aware Multi-View MRI基准,评估16个视觉-语言模型在纵向MRI疾病进展推理中的表现,发现模型在变化方向识别等方面存在缺陷,多视角输入对模型性能有特定影响。

Comments Accepted at MICCAI 2026 (Early Accept). 11 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11564 2026-08-13 cs.CV cs.RO 新提交 78%

Repurposing RGB-based Foundation Model for Depth Estimation on Thermal Images Using Hierarchical Supervision

利用分层监督将基于RGB的基础模型重新用于热图像的深度估计

Jie Hong, Tingtian Li, Xuesong Li, Xiao Li

机构 * The University of Hong Kong(香港大学) Commonwealth Scientific and Industrial Research Organisation (CSIRO)(英联邦科学与工业研究组织)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 针对热图像深度估计中RGB基础模型分层表示利用不足的问题,提出RGB-HS框架,通过分层监督和基于图像质量的标记加权对齐,在基准上实现了有竞争力的性能。

Comments Accepted in IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05389 2026-08-07 cs.CV 新提交 78%

Text-Guided Refinement of Multi-sequence Glioma Subregion Segmentation with a Vision-Language Foundation Model

基于视觉语言基础模型的文本引导多序列胶质瘤亚区分割细化

Zach Eidex, Yu-nong Lin, Mojtaba Safari, Sean Pitroda, Ralph Weichselbaum, Zhen Tian, Xiaofeng Yang

机构 * Emory University School of Medicine(埃默里大学医学院) The University of Chicago(芝加哥大学) Winship Cancer Institute(温希普癌症研究所)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 该研究开发基于VoxTell的轻量级框架,用3D视觉语言基础模型实现文本引导的胶质瘤亚区分割细化,在BraTS-GLI及跨数据集测试中提升了分割的DSC指标,支持作为临床医生在环工具的进一步评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04910 2026-08-06 cs.HC 新提交 78%

AutoCue: Multimodal LLM-Assisted Externalization of Implicit Inputs as Instructional Visual Cues in Screencast Tutorials

AutoCue:多模态大语言模型辅助将隐式输入外部化为录屏教程中的教学视觉提示

Shengyang Luo, Shengyao Luo, Xiaolei Guo, Fengze Zhang, James Liang, Yingjie Victor Chen

专题命中 评测与基准 :LLM(title,abstract)

AI总结 AutoCue是多模态大语言模型辅助的教程增强流水线,可将录屏教程中隐式输入外部化为视觉提示,在Autodesk Maya上的评估显示其能缩短任务时间、减少交互中断并提升学习者体验

Comments Accepted to Graphics Interface 2026 (GI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04106 2026-08-06 cs.CV eess.IV 新提交 78%

LoRetta: A Foundation Model and Extensive Dataset for Global-Scale Remote Sensing Dense Image Matching

LoRetta:面向全球尺度遥感密集图像匹配的基础模型与大规模数据集

Siwei Yu, Han Guo, Zhenwei Shi, Zhengxia Zou

机构 * Beihang University(北京航空航天大学)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 针对全球尺度遥感密集图像匹配的挑战,本文提出结合可匹配性感知仿射定位与引导式密集配准的基础模型LoRetta,并构建含原生可匹配性标签的LEVIR-GM基准,实验表明其性能优于现有模型且迁移性良好。

Comments 17 pages, 12 figures, 6 tables. Submitted to IEEE Transactions on Pattern Analysis and Machine Intelligence. Project page: https://siweiyu.com/work/loretta/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04042 2026-08-06 cs.RO 新提交 78%

Kitchen Robotic Manipulation utilizing Foundation Models

基于基础模型的厨房机器人操作

Myung-Hwan Jeon, Sankalp Yamsani, Joohyung Kim

机构 * Kumoh National Institute of Technology(金乌国立技术大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本研究提出一种整合多种基础模型的模块化厨房机器人感知流水线,经评估优化后可在杂乱遮挡场景下实现89.12%的ADI,无需环境重训练即可完成餐具处理等家庭操作任务。

Comments Intelligent Service Robotics (ISR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03959 2026-08-05 physics.ao-ph 新提交 78%

Prithvi-Precip: Integrating Satellite Observations into an Atmospheric AI Foundation Model for Precipitation Forecasting

Prithvi-Precip:将卫星观测数据整合进大气AI基础模型用于降水预报

Simon Pfreundschuh, Christian D. Kummerow, Johannes Schmude, Sujit Roy, Rahul Ramachandran, Tsengdar Lee, Valentine Anantharaj, Katherine H. Breen

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本研究基于Prithvi-WxC基础模型开发Prithvi-Precip,通过采用卫星降水训练目标、直接同化卫星观测数据及自回归滚动训练,大幅提升了中期降水预报精度,优于Goddard地球观测系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02300 2026-08-04 cs.CV 新提交 78%

A General-Purpose VLM Can Teach an Astronomy Foundation Model to Better Recognize Galaxy Morphology

通用视觉语言模型(VLM)可指导天文基础模型更好地识别星系形态

Dichang Zhang, Jiaqi Deng, Yixuan Shao, Yuanpeng Liu, Jiali Cui, Zhiqiang Lao, Heather Yu, Liang Peng, Simon Birrer, Dimitris Samaras

机构 * Stony Brook University(石溪大学) University of Technology Sydney(悉尼科技大学) Futurewei Technologies(华为主机技术公司)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 该研究提出用通用视觉语言模型(VLM)作为弱监督教师,指导天文基础模型Zoobot提升星系形态识别性能,可高效适配未来大型天文巡天任务。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01661 2026-08-04 cs.CV 新提交 78%

FairForensics: Seeing Expressions and Parsing Demographics via Vision-Language Modeling for Generalizable Fair Deepfake Detection

FairForensics:基于视觉-语言建模的通用公平深度伪造检测——表情感知与人口统计解析

Yaning Zhang, Jiao Wu, Zan Gao, Linlin Shen

机构 * Shenzhen University(深圳大学) Shandong Artificial Intelligence Institute(山东省人工智能研究院) Qilu University of Technology (Shandong Academy of Sciences)(齐鲁工业大学(山东省科学院)) Tianjin University of Technology(天津理工大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文构建人口统计平衡的深度伪造检测基准,提出FairForensics视觉-语言模型,通过表情感知与人口统计正则化实现通用公平检测,在基准上达到泛化与公平性的SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00925 2026-08-04 cs.CV 新提交 78%

Look Up and Look Back: Hidden Attention and Latent Orientation in a Frozen Foundation Model for Panoramic SLAM

观察与回溯:用于全景SLAM的冻结基础模型中的隐式注意力与潜在方向

Zhuang Xiong, Guohao Zhang, Chen Zhang, Zheyu Jiang, Yuchao Mei, Qingshan Xu, Wenbing Tao

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 该研究针对全景SLAM的相机倾斜、尺度漂移等问题,基于冻结全景几何基础模型的隐式线索提出HALO-SLAM,在五个基准的125个序列上实现100%序列成功率,ATE显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00884 2026-08-04 cs.SE 新提交 78%

Documentation vs. Code Patterns: What Drives LLM-Based Exception Oracle Generation?

文档与代码模式:什么驱动基于大语言模型的异常预言生成?

Soneya Binta Hossain, Matthew B. Dwyer, Tasfia Tasnim

专题命中 评测与基准 :LLM(title,abstract)

AI总结 该研究通过干预式与归因引导的替换消融实验,发现基于大语言模型的异常预言生成(TOG)的高准确率多源于捷径信号而非结构化异常文档,挑战了准确率反映语义稳健性的假设,提出需从证据依据角度评估TOG系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28211 2026-07-31 cs.CV 新提交 78%

Scaling Vision-Language Models Is Not Enough to Mitigate Bias

扩大视觉-语言模型规模不足以缓解偏见

Ioannis Sarridis, Ioannis Kompatsiaris, Symeon Papadopoulos

机构 * Information Technologies Institute, CERTH(CERTH信息技术研究所)

专题命中 评测与基准 :language model(title,abstract)

AI总结 该研究通过对194个视觉-语言模型的大规模实证分析,发现扩大模型规模无法缓解偏见,训练数据属性对偏见鲁棒性更关键,架构选择效果依赖基准特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26536 2026-07-30 cs.CV 新提交 78%

TPCD: Tone-Pressure Contrastive Decoding and the Label-Free Gating Bottleneck in Vision-Language Models

TPCD:音调-压力对比解码与视觉语言模型中的无标签门控瓶颈

Jinkun Zhao, Kui Zhang, Wenjun Wu

机构 * Beihang University(北京航空航天大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文提出TPCD方法,利用压力诱导分布作为对比解码负分支,结合门控缓解视觉语言模型受高压提示时的不合理承诺问题,在多个基准测试中显著降低攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25640 2026-07-29 cs.IR 新提交 78%

LLM-as-a-Judge for Evaluating System Responses in Conversational Music Recommendation

大语言模型作为评估对话式音乐推荐系统响应的评判器

Seungheon Doh, Bruno Sguerra, Sergio Oramas, Elena V. Epure, Juhan Nam

专题命中 评测与基准 :LLM(title,abstract)

AI总结 研究对话式音乐推荐系统中用大语言模型评估系统响应的可靠性,通过抽取会话、用四个指令微调的大语言模型生成候选响应,收集领域专家评分并分析,发现其与人工评估适度正相关且优于基线,还分析了性能随模型规模等的变化。

Comments Accepted for publication at the 20th ACM Conference on Recommender Systems (ACM-RecSys 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25572 2026-07-29 cs.CR 新提交 78%

Mapping CVEs to MITRE ATT&CK Techniques: A Curated Gold-Set Classifier and the Limits of LLM-Assisted Label Expansion

将通用漏洞披露(CVE)映射到MITRE ATT&CK技术:一个精心策划的黄金集分类器和大语言模型辅助标签扩展的局限性

Cédric Bonhomme, Alexandre Dulaunoy

专题命中 评测与基准 :LLM(title,abstract)

AI总结 研究从自由文本漏洞描述映射CVE到MITRE ATT&CK技术,训练多标签分类器提升召回率等指标。探讨大语言模型辅助标签扩展,发现其受评估噪声影响,无法可靠改进,分类器受标签质量而非数据集大小限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20584 2026-07-24 eess.IV 新提交 78%

HistoFID- Calibrating Frechet-distance evaluation across pathology foundation models

HistoFID-校准跨病理学基础模型的弗雷歇距离评估

Swapnil Bhat, Devansh Lalwani, Maulik Shah, Sheena Alphones, Rimlee Dutta, Nikita Mulchandani, Roshani Gala, Jay Mehta

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 研究数字病理学中用组织学基础模型取代 Inception 网络后 FID 结果受影响的问题,通过特定比率恢复可比性,划分编码器组,揭示其对生成模型评估结论的影响,还评估了 TuroCompress 编解码器并发布相关资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21455 2026-07-24 cs.NI 新提交 78%

Out-of-Distribution Detection in Wireless Multimodal Foundation Models for 6G ISAC

6G智能感知与通信无线多模态基础模型中的分布外检测

Mohammad Farzanullah, Akram Bin Sediq, Ali Afana, Melike Erol-Kantarci

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 研究6G智能感知与通信中无线多模态基础模型的分布外检测问题,提出WMFM - OOD框架,通过构建基站原型和温度缩放概率评分机制区分异常,在DeepVerse6G数据集验证,显著优于基线,提升检测灵敏度,保障网络可靠性。

Comments presented at IEEE VTC 2026 Fall, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21220 2026-07-24 cs.NE 新提交 78%

Search Hardness-Aware LLM-Based Problem Formulation for Expensive Simulation-Driven Design

用于昂贵的仿真驱动设计的搜索硬度感知基于大语言模型的问题公式化

Yuchen Li, Handing Wang, Bing Xue, Mengjie Zhang

专题命中 评测与基准 :LLM(title,abstract)

AI总结 针对昂贵仿真驱动设计中公式对搜索效率的影响问题,提出SHA-PF框架,基于搜索硬度定义公式搜索目标并评分,通过大语言模型相关方法搜索公式空间,实验表明该框架发现的公式能显著减少评估次数以达设计要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21065 2026-07-24 cs.CV 新提交 78%

Do Pathology Vision-Language Models Truly See Pathology?

病理学视觉语言模型真的能‘看到’病理学吗?

Chengyang Zhang, Wenchuan Zhang, Bo Li, Xinyu Liu, Jiaming Yang, Mengran Li, Chenxun Deng, Jie Chen, Yang Zhang, Wei Ju, Yuhao Yi, Hong Bu, Jiancheng Lv

专题命中 评测与基准 :language model(title,abstract)

AI总结 研究病理学视觉语言模型评估中被忽视的问题,提出含多类型样本的PathBind基准,通过对多个VLMs评估发现,当前病理学VLMs在答案性能与视觉语义绑定间有显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19829 2026-07-23 cs.CR 新提交 78%

DARWIN: Evolving Jailbreak Adversary and Guardrail for LLM Safety Evaluation and Protection

达尔文:为大语言模型安全评估与保护演化越狱对手及防护措施

Weiwei Qi, Zefeng Wu, Zhilin Guo, Tianhang Zheng, Chaochao Lu, Liang He, Zhan Qin, Kui Ren

专题命中 评测与基准 :LLM(title,abstract)

AI总结 针对现有大语言模型安全评估与防御方法的静态局限,提出达尔文演化攻击-防御框架,含通过策略发现等扩展能力的达尔文攻击及从新对抗样本中迭代学习的达尔文防护,在攻击成功率和防御召回率上表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19077 2026-07-22 cs.CV 新提交 78%

Context-structured Video Anomaly Detection with Large Vision-Language Models

基于大型视觉语言模型的上下文结构视频异常检测

Dongjun Kim, Changjae Oh, Andrea Cavallaro, Jeonghoon Mo

专题命中 评测与基准 :language model(title,abstract)

AI总结 研究视频异常检测难题,提出CSI-VAD方法,将视频分解为环境、对象、时间三个上下文并分别推理,免训练且不依赖文本提示和数据集调整,实验证明该方法优于基线并具竞争力。

Comments Accepted at AVSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16967 2026-07-21 eess.AS 新提交 78%

An Audio Language Model-Based Voice Concept Bottleneck Framework for Interpretable Health Assessment

基于音频语言模型的可解释健康评估语音概念瓶颈框架

Yu-Wen Chen, Julia Hirschberg

专题命中 评测与基准 :language model(title,abstract)

AI总结 研究针对语音健康评估中概念瓶颈框架应用有限的问题,提出基于音频语言模型的语音概念瓶颈框架,经微调ALM提取离散可解释分数用于轻量级分类器,在抑郁症和构音障碍评估任务中表现出色,优于相关基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17227 2026-07-21 q-bio.GN q-bio.CB 新提交 78%

Harmonised benchmarking of foundation models for single-cell and spatial transcriptomics reveals context-dependent generalisation

单细胞和空间转录组学基础模型的统一基准测试揭示了上下文相关的泛化能力

Sally Chen, Roxana Zahedi, Lucy Chhuo, Ricky Nguyen, Marjan BaghGolshani, Amin Beheshti, Mark Grosser, Min Yang, Nona Farbehi, Nigel Lovell, Ahmadreza Argha, Fatemeh Vafaee, Youqiong Ye, Hamid Alinejad-Rokny

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 研究单细胞和空间转录组学基础模型通用性,用统一框架对六个模型进行基准测试,评估多项任务,发现模型性能有条件性,无模型主导,排名随多种因素变化,为模型选择提供指导并提出评判模型新依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17957 2026-07-21 cs.SE 新提交 78%

DepRepair: LLM-Based Source-Code Repair for Dependency Breaking Changes

DepRepair:基于大语言模型的针对依赖项破坏更改的源代码修复

Shenghao Yang, Bo Lu, Yaochen Liu, Yu Kang, Qiongfang Zhang, Chetan Bansal, Saravan Rajmohan, Minghua Ma

专题命中 评测与基准 :LLM(title,abstract)

AI总结 研究软件项目因第三方库更新致依赖项破坏更改的问题,提出DepRepair单调用大语言模型方法,通过证据过滤器、用法定位器和子类别感知指南,基于结构化上游证据修复,在DepBench基准测试中取得高可执行通过率。

Comments 10 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17171 2026-07-21 cs.RO 新提交 78%

VIDAR: Visual-Inertial Dense Alignment and Reconstruction via a Geometric Foundation Model

VIDAR:通过几何基础模型实现视觉惯性密集对齐与重建

Diyari Mohammed Salih, Lingxiang Hu, Naima AitOufroukh-Mammar, Fabien Bonardi

机构 * IBISC Laboratory, Université d’Évry Paris-Saclay, Université Paris-Saclay(IBISC实验室,埃夫里-巴黎萨克雷大学,巴黎萨克雷大学)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 研究针对单目基础模型缺乏稳定度量尺度的问题,提出VIDAR框架,结合SVO+IMU里程计与深度任意模型3,利用视觉惯性前端作度量锚点,经姿态注入等方法,在EuRoC和TUM RGB-D数据集上实现度量密集单目重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16024 2026-07-20 cs.SE 新提交 78%

DiffTestGen: Change-Directed LLM-Based Testing for Exposing Behavioral Differences

DiffTestGen:基于大语言模型的变更导向测试以揭示行为差异

Huimin Hu, Cristian Cadar, Michael Pradel

专题命中 评测与基准 :LLM(title,abstract)

AI总结 研究如何确保软件行为变化符合预期,提出基于大语言模型的DiffTestGen方法,利用静态调用图分析等确定入口点并改进联合覆盖指标,实验表明该方法能有效揭示行为差异、提高覆盖率并检测回归错误。

详情

展开后加载摘要…

URL PDF HTML 收藏