arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1309 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 1309 篇

2603.00190 2026-07-07 cs.LG cs.AI 版本更新 81%

OSF: On Pre-training and Scaling of Sleep Foundation Models

OSF:关于睡眠基础模型的预训练和扩展

Zitao Shuai, Zongzhe Xu, David Yang, Wei Wang, Yuzhe Yang

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Emory University(埃默里大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 为填补睡眠基础模型预训练和扩展理解空白,创建睡眠记录语料库及基准,评估预训练目标,发现关键结论,引入OSF家族模型取得多样任务最优性能并揭示其特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18253 2026-07-07 cs.CL cs.AI 版本更新 81%

BoRP: Bootstrapped Regression Probing for Scalable and Human-Aligned LLM Evaluation

BoRP:用于可扩展且符合人类偏好的大语言模型评估的自训练回归探测

Peng Sun, Xiangyu Zhang, Duan Wu, Lu Tan, Jian Lin, He Yang, Qi Qian, Yikai Wang

机构 * Qwen Business Unit of Alibaba(阿里巴巴Qwen业务单元)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 研究针对开放式对话AI用户满意度评估难题,提出BoRP框架。利用大语言模型潜在空间几何属性,通过极化指数自训练机制自动生成评分准则,用偏最小二乘法映射隐藏状态到连续分数,提升评估准确性与效率。

Comments This is a pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09945 2026-07-03 cs.CV cs.AI cs.CL 版本更新 81%

Cross-Cultural Value Attribution in Large Vision-Language Models

跨文化价值观意识在大型视觉-语言模型中的体现

Phillip Howard, Xin Su, Kathleen C. Fraser

机构 * Thoughtworks University of Ottawa(渥太华大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了图像中文化背景如何影响大型视觉-语言模型对人物道德、伦理和政治价值观的判断,通过多维分析揭示模型对文化价值观差异的认知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03981 2026-07-01 cs.LG cs.AI econ.EM 版本更新 81%

DeXposure-FM: A Time-series, Graph Foundation Model for Credit Exposures and Stability on Decentralized Financial Networks

DeXposure-FM:面向去中心化金融网络信用暴露与稳定性的时序图基础模型

Aijie Shu, Wenbin Wu, Gbenga Ibikunle, Fengxiang He

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出首个用于DeFi网络协议间信用暴露度量与预测的时序图基础模型DeXposure-FM,采用图表格编码器与多任务头,在4300+协议、602条区块链的数据上训练,优于现有方法,并支持宏观审慎监测与压力测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14968 2026-06-18 cs.LG cs.AI 版本更新 81%

InstructTime++: Time Series Classification with Multimodal Language Modeling via Implicit Feature Enhancement

InstructTime++: 通过隐式特征增强的多模态语言建模进行时间序列分类

Mingyue Cheng, Xiaoyu Tao, Huajian Zhang, Qi Liu, Zhiding Liu, Yucong Luo, Yiheng Chen, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(中国科学技术大学认知智能国家重点实验室)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出将时间序列分类转化为多模态生成任务,通过离散化模块和对齐投影层弥合模态差距,并利用隐式特征建模提升语言模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01095 2026-06-16 cs.CV cs.AI cs.LG 版本更新 81%

CycliST: A Video Language Model Benchmark for Reasoning on Cyclical State Transitions

CycliST:用于循环状态转换推理的视频语言模型基准

Simon Kohaut, Daniel Ochs, Shun Zhang, Benedict Flade, Julian Eggert, Kristian Kersting, Devendra Singh Dhami

机构 * Artificial Intelligence and Machine Learning Lab, TU Darmstadt(人工智能与机器学习实验室,图腾斯达特技术大学) Konrad Zuse School of Excellence in Learning and Intelligent Systems (ELIZA)(Konrad Zuse 学校(ELIZA)) Honda Research Institute Europe GmbH, Offenbach, Germany(本田欧洲研究院,奥芬巴赫,德国) Uncertainty in Artificial Intelligence Group, TU Eindhoven(人工智能不确定性小组,埃因霍温技术大学) Hessian Center for AI (hessian.AI)(黑森人工智能中心(hessian.AI)) Center for Cognitive Science(认知科学中心) German Center for Artificial Intelligence (DFKI)(德国人工智能中心(DFKI))

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出CycliST基准,通过合成视频评估视频语言模型对循环状态转换的文本推理能力,揭示现有模型在检测循环模式、时间理解和定量分析方面的局限。

Comments Published in the Journal of Data-centric Machine Learning Research (DMLR); https://openreview.net/forum?id=l03g53HUL2

Journal ref Journal of Data-centric Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00947 2026-06-15 cs.LG cs.AI 版本更新 81%

Silent Failures in Federated Personalization of Foundation Models

联邦基础模型个性化中的静默失败

YongKyung Oh, Alex Bui

机构 * Medical & Imaging Informatics (MII) Group, University of California, Los Angeles (UCLA)(医学与影像信息学(MII)组,加州大学洛杉矶分校(UCLA))

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出联邦基础模型个性化中因隐私约束导致的一类信任失败——静默失败,包括偏差放大、公平性崩溃和对齐侵蚀,并引入六种静默失败模式的分类法,强调隐私保护训练不足以保障可信部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18347 2026-06-09 cs.CL cs.AI 版本更新 81%

Multilingual Training and Evaluation Resources for Vision-Language Models

面向视觉语言模型的多语言训练和评估资源

Daniela Baiamonte, Elena Fano, Matteo Gabburo, Stefano Simonazzi, Leonardo Rigutini, Andrea Zugarini

机构 * Villanova.ai Aithlas

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出跨五种欧洲语言的视觉语言模型训练与评估资源,通过再生与翻译方法生成高质量多语言数据,验证多语言数据在非英语基准上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02600 2026-06-08 cs.LG cs.AI 版本更新 81%

Step-Wise Refusal Dynamics in Autoregressive and Diffusion Language Models

自回归与扩散语言模型中的逐步拒绝动态

Eliron Rahimi, Elad Hirshel, Rom Himelstein, Amit LeVi, Avi Mendelson, Chaim Baskin

机构 * Department of Computer Science, Technion – Israel Institute of Technology(技术学院计算机科学系,以色列技术学院) INSIGHT Lab, School of Electrical and Computer Engineering, Ben-Gurion University of the Negev, Israel(内斯坦实验室,贝内-加隆大学内加尔分校,以色列) Computer Science Department, University of Haifa, Haifa, Israel(海法大学计算机科学系,海法,以色列)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究扩散语言模型(DLM)与自回归(AR)模型在拒绝有害生成行为上的差异,发现扩散重掩码机制可促进恢复,提出逐步拒绝内部动态(SRI)信号,并基于此构建无需修改推理的越狱检测器。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04564 2026-06-29 cs.LG 版本更新 80%

SurvPFN: Towards Foundation Models for Survival Predictions

SurvPFN:面向生存预测的基础模型

Samuel Böhm, Lennart Purucker, Frank Hutter, Pascal Schlosser

机构 * University of Freiburg(弗赖堡大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 提出SurvPFN,一种基于先验数据拟合网络(PFN)的生存预测模型,通过合成数据预训练和删失负对数似然损失,无需逐数据集拟合即可在真实任务中与经典和深度生存基线竞争。

Comments 10 pages, 1 figure. Accepted to "Foundation Models for Structured Data" Workshop at the International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02078 2026-08-17 cs.RO 版本更新 80%

Genie Sim 3.0: A High-Fidelity Comprehensive Simulation Platform for Humanoid Robot

Genie Sim 3.0:人形机器人综合仿真平台

Chenghao Yin, Da Huang, Di Yang, Jichao Wang, Nanshu Zhao, Chen Xu, Wenjun Sun, Linjie Hou, Zhijun Li, Junhui Wu, Zhaobo Liu, Zhen Xiao, Sheng Zhang, Lei Bao, Rui Feng, Zhenquan Pang, Jiayu Li, Qian Wang, Maoqing Yao

机构 * AgibotTech(Agibot科技)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 Genie Sim 3.0通过高保真场景生成和开放数据集,提升机器人学习模型的泛化能力与仿真到现实的迁移效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22928 2026-08-12 cs.CR 版本更新 80%

SoK: The Attack Surface of Agentic AI - Tools and Autonomy

SoK:代理AI的攻击面——工具与自主性

Ali Dehghantanha, Sajad Homayoun

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文系统分析了代理AI的安全风险,提出攻击分类与评估指标,探讨防御措施及开放研究挑战,帮助研究人员和工程师应对代理AI的安全威胁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12727 2026-08-12 cs.IR 版本更新 80%

Training Dense Retrievers with Multiple Positive Passages

利用多正例段落训练密集检索器

Benben Wang, Minghao Tang, Hengran Zhang, Jiafeng Guo, Keping Bi

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出利用多正例段落训练检索器,通过统一对比学习框架分析不同优化目标,发现LSEPair在鲁棒性和性能上表现优异,同时揭示了不同目标对正样本质量的敏感性。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07018 2026-08-11 cs.HC 版本更新 80%

Designing Youth Social Media through Problem Space Attunement

青少年社交媒体设计中的问题空间调适

JaeWon Kim

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 本文通过三种问题空间失调(概念性、定义性、评价性)分析青少年社交媒体设计中的权力失衡,并提出虚构探究工作坊、Discord异步社区和LLM代理模拟沙盒等干预方法,以建立以青少年为中心的关系支持型社交媒体设计准则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12738 2026-08-10 cs.CV 版本更新 80%

Direct Visual Grounding by Directing Attention of Visual Tokens

通过引导视觉令牌注意力实现直接视觉 grounding

Parsa Esmaeilkhani, Longin Jan Latecki

机构 * Temple University(特拉华大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract,abstract_cn)

AI总结 该研究针对VLMs中视觉令牌注意力不足的问题,提出KL注意力损失,结合下一个令牌预测损失,在多个视觉任务上取得显著提升,还引入了用于评估VLMs线条追踪能力的新数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24093 2026-08-06 q-bio.QM cs.DB 版本更新 80%

TCellAlign: Cross-study T-cell Populations Alignment with Nomenclature-Guided Multi-Agent Workflow

TCellAlign:使用命名法引导的多智能体工作流程进行跨研究 T 细胞群体对齐

Pengyu Xie, Rongjia Zhou, Zhilin Ou, Junyuan Zhang, Xiang Zhou, Xiaobo Sun, Jiaying Lu, Wenjing Ma

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 该研究针对跨研究 T 细胞群体对齐难题,提出 TCellAlign 多智能体框架,含文献检索等模块,能保留原始术语与证据并生成标准化标签。构建基准数据集,实验表明其在语义一致性等方面表现出色,助力 T 细胞相关知识整合与模型发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17529 2026-08-06 cs.SE 版本更新 80%

Automated Logging Is Language-Sensitive: A Multilingual Benchmark and Empirical Study of LLMs

单语言证据不足以支持自动化日志记录:一个多语言基准和基于LLM的实证研究

Renyi Zhong, Yichen Li, Yulun Wu, Jinxi Kuang, Yintong Huo, Michael R. Lyu

专题命中 评测与基准 :LLM(title_cn);large language model(abstract);language model(abstract)

AI总结 本文通过多语言基准MultiLogBench研究自动化日志记录的跨语言有效性,发现框架锚点匹配是最敏感的组件,模型排名在顶级稳定,但需多语言验证以确保鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14137 2026-08-06 cs.CL cs.AI cs.LG 版本更新 80%

From Feelings to Metrics: Understanding and Formalizing How Users Vibe-Test LLMs

从感受至指标:理解并形式化用户如何通过 vibes 测试 LLMs

Itay Itzhak, Eliya Habba, Gabriel Stanovsky, Yonatan Belinkov

机构 * Technion – Israel Institute of Technology(技术离子-以色列理工学院) The Hebrew University of Jerusalem(耶路撒冷希伯来大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究用户通过非正式经验评估LLM的方式,并形式化该过程以支持系统分析,通过个性化测试和用户感知标准改进模型评估。

Comments Published at COLM 2026. 50 pages, 20 figures. Code and data at https://technion-cs-nlp.github.io/vibe-testing-llms

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13040 2026-08-05 cs.RO 版本更新 80%

RoboProcessBench: Benchmarking Process-Aware Understanding in Vision-Language Robotic Manipulation

RoboProcessBench:视觉语言机器人操作中的过程感知理解基准测试

Dayu Xia, Yue Shi, Yao Mu, Huiting Ji, Chaofan Ma, Yingjie Zhou, Hua Chen, Yang Liu, Jiezhang Cao, Guangtao Zhai

机构 * Shanghai AI Laboratory(上海人工智能实验室) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) China University of Mining Technology(中国矿业大学)

专题命中 评测与基准 :SFT(abstract,abstract_cn);language model(abstract);post-training(abstract)

AI总结 提出RoboProcessBench基准,通过静态监控和动态推理两个维度、12个诊断问题家族,评估视觉语言模型在机器人操作中的过程感知理解能力,并基于58k问答对数据集验证了当前模型的局限性及后训练的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03188 2026-08-04 cs.CR 版本更新 80%

Dependency-Aware Privacy for Multi-turn Agents

多轮智能体的依赖感知隐私保护

Divyam Anshumaan, Sarthak Choudhary, Nils Palumbo, Somesh Jha

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 针对多轮 LLM 智能体交互的隐私泄露问题,提出 RootGuard 方法,通过一次清理根值并确定性计算后续发布,在多轮交互中提升隐私-效用权衡,医疗数据实验显示其误差远低于独立噪声方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10046 2026-08-03 cs.SE 版本更新 80%

Automated Table Reproduction via Code Generation

Artisan: 自动化代理评估

Doehyun Baek, Michael Pradel

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 Artisan通过自动化LLM代理生成重现脚本,提升软件工程研究结果的可重复性,生成44/60个有效脚本并发现20个新错误。

Comments Accepted at ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04569 2026-07-29 eess.SY cs.SY 版本更新 80%

LLMs for Agentic Home Energy Management

用于智能家庭能源管理的大语言模型

Sokipriala Jonah, Queen Moses, Abiola Babatunde, Michael Ajao-Olarinoye, Daniel Bammeke

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究家庭能源管理系统中,大语言模型智能体能否为多设备家庭能源调度提供自然语言接口。通过工具调用ReAct智能体及相关数据,对三个商业模型进行基准测试,结果显示模型表现各异,能实现高调度成功率和接近最优性。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14718 2026-07-28 cs.DB cs.HC 版本更新 80%

Natural Language Interfaces for Databases: What Changes for SQL-Literate Users?

数据库的自然语言接口:对用户有何改变?

Panos Ipeirotis, Haotian Zheng

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 研究比较基于GPT-4o的NLIDB SQL-LLM与传统SQL平台Snowflake,发现接口改变工作类型非工作量,SQL-LLM用户查询速度快但准确性低,熟悉SQL的参与者转向自然语言后仍有验证负担。

Comments 26 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11666 2026-07-24 cs.CL cs.AI cs.LG 版本更新 80%

Playing Along: Learning a Double-Agent Defender for Belief Steering via Theory of Mind

扮演:通过理论思维学习双代理守护者以实现信念引导

Hanqi Xiao, Vaidehi Patil, Zaid Khan, Hyunji Lee, Elias Stengel-Eskin, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出ToM-SB挑战,通过强化学习训练双代理模型以提升信念引导和理论思维能力,结果显示结合两者奖励的模型在对抗任务中表现更优。

Comments First two authors contributed equally. Code: https://github.com/The-Inscrutable-X/AIDoubleAgentDefenders

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12069 2026-07-20 cs.CL cs.AI cs.LG 版本更新 80%

Robust Explanations for User Trust in Enterprise NLP Systems

企业NLP系统中用户信任的鲁棒解释

Guilin Zhang, Kai Zhao, Jeffrey Friedman, Xu Chu, Amine Anoun, Jerry Ting

机构 * Workday AI

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种统一的黑盒鲁棒性评估框架,用于评估token级解释的鲁棒性,通过留一法遮挡和现实扰动测试,发现解码器LLM比编码器基线更稳定,且模型规模越大稳定性越强,同时建立了鲁棒性与推理成本的实用权衡曲线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15045 2026-07-08 eess.AS 版本更新 80%

LLMs and Speech: Integration vs. Combination

大语言模型与语音:整合与结合

Robin Schmitt, Albert Zeyer, Mohammad Zeineldeen, Ralf Schlüter, Hermann Ney

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文研究如何有效利用预训练大语言模型进行自动语音识别,比较了将语音模型与大语言模型紧密整合与传统浅层融合方法的优劣,探讨了多种优化策略及联合识别技术。

Comments Submitted to SLT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18542 2026-07-08 cs.CR cs.AI cs.CL cs.LG 版本更新 80%

SecureCode: A Production-Grade Multi-Turn Dataset for Training Security-Aware Code Generation Models

SecureCode:用于训练安全意识代码生成模型的生产级多轮数据集

Scott Thornton

专题命中 评测与基准 :LLM(abstract,abstract_cn);instruction tuning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对AI编码助手生成漏洞代码问题,提出SecureCode数据集,涵盖网络应用安全和AI/ML安全领域,有特定对话结构,经质量保证,发布统一数据集、开源模型及评估框架,是首个提供相关覆盖的公共数据集。

Comments 30 pages, 12 figures, 10 tables. Dataset available at https://huggingface.co/datasets/scthornton/securecode. Code and validation tools at https://github.com/scthornton/securecode

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17360 2026-07-03 cs.CV 版本更新 80%

Omni-DuplexEval: Evaluating Real-time Duplex Omni-modal Interaction

Omni-DuplexEval: 评估实时双工全模交互

Chaoqun He, Mingyang Xiang, Yingjing Xu, Bokai Xu, Junbo Cui, Jie Zhou, Yuan Yao, Lijie Wen

机构 * Tsinghua University(清华大学) Tongji University(同济大学) ModelBest Inc.(ModelBest公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出Omni-DuplexEval基准,用于系统评估实时双工交互能力,通过两个互补场景评估模型生成连续响应和主动提醒的能力,并揭示现有模型在平衡响应及时性和内容连贯性方面的局限性。

Comments 21 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22659 2026-07-03 cs.SE 版本更新 80%

RealBench: A Repo-Level Code Generation Benchmark Aligned with Real-World Software Development Practices

RealBench: 一个与真实世界软件开发实践对齐的仓库级代码生成基准测试

Jia Li, Hongyi Deng, Yiran Zhang, Kechi Zhang, Tianqi Shao, Tiankuo Zhao, Weinan Wang, Zhi Jin, Ge Li, Yang Liu, Yingtao Fang, Yihong Dong

专题命中 评测与基准 :LLM(summary_cn);large language model(abstract);language model(abstract)

AI总结 RealBench通过结合自然语言需求和UML图,评估LLM在结构化设计下的代码生成能力,揭示了LLM在仓库级代码生成中的性能差距和优化策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01148 2026-07-03 cs.SE 版本更新 80%

Automatically Enhancing the Quality of Android App Bug Reports

为Android应用程序自动生成高质量的缺陷报告

Antu Saha, Atish Kumar Dipongkor, Sam Bennett, Kevin Moran, Andrian Marcus, Oscar Chaparro

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 本文提出通过提供具体应用相关信息帮助LLM自动生成清晰详细的缺陷报告,提出BugScribe方法,通过评估显示其生成的报告质量更高且更准确。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏