arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2611 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2611 篇

2606.13348 2026-06-12 cs.CL cs.AI 新提交 87%

IVIE: A Neuro-symbolic Approach to Incremental and Validated Generation of Interactive Fiction Worlds

IVIE:一种用于增量且经过验证的交互式小说世界生成的神经符号方法

Micaela Vaucher, Santiago Silveira, Santiago Góngora, Luis Chiruzzo

机构 * Instituto de Computación, Facultad de Ingeniería, Universidad de la República(乌拉圭共和国大学工程学院计算机研究所)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出IVIE神经符号方法,结合LLM的创造力与符号验证的连贯性,通过四阶段增量生成管道构建可玩的交互式小说世界,人类评估显示其生成沉浸式、主题连贯的世界,平衡了灵活性与叙事一致性。

Comments 10 pages, 3 figures. To appear in the Proceedings of the 16th International Conference on Computational Creativity (ICCC'26), June 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10460 2026-06-10 cs.CL cs.AI 新提交 87%

LakeQA: An Exploratory QA Benchmark over a Million-Scale Data Lake

LakeQA:百万级数据湖上的探索性问答基准

Haonan Wang, Jiaxiang Liu, Yurong Liu, Austin Senna Wijaya, Tianle Zhou, Eden Wu, Yijia Chen, Wanting You, Reya Vir, Daniela Pinto, Grace Fan, Yusen Zhang, Juliana Freire, Eugene Wu

机构 * Columbia University(哥伦比亚大学) New York University(纽约大学) Barnard College(巴纳德学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出LakeQA基准,要求LLM在9.5TB异构数据湖中搜索并多跳推理,GPT-5.2仅达18.37%精确匹配,挑战性强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10254 2026-06-10 cs.AI cs.CL 新提交 87%

RealMath-Eval: Why SOTA Judges Struggle with Real Human Reasoning

RealMath-Eval:为何SOTA裁判难以应对真实人类推理

Yiteng Mao, Kenan Xu, Yijia Lyu, Wenhao Li, Jianlong Chen, Xiangfeng Wang

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) East China Normal University(华东师范大学) New York University(纽约大学) Tongji University(同济大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出RealMath-Eval基准,评估LLM裁判对真实学生数学解答的评分能力,发现与人类评分存在高均方误差,而合成数据上表现更好,揭示评估差距源于人类错误空间的多样性和高信息熵。

Comments Code available at https://github.com/RicharMd/RealMath-Eval , Data available at https://huggingface.co/datasets/RicharMd/RealMath-Eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10928 2026-06-10 cs.CE cs.AI cs.LG physics.comp-ph 新提交 87%

A Constrained Natural-Language Interface for Variational Multi-Physics Finite Element Simulations in FEniCS

FEniCS中变分多物理场有限元模拟的受约束自然语言接口

Nilay Upadhyay, Wesley F. Reinhart

机构 * Department of Engineering Science and Mechanics, The Pennsylvania State University(工程科学与力学系,宾夕法尼亚州立大学) Department of Materials Science and Engineering, The Pennsylvania State University(材料科学与工程系,宾夕法尼亚州立大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出一种受约束的自然语言接口,将LLM限制在前端任务(解析提示、生成Gmsh代码),后端使用确定性模板求解器,在基准测试中实现100%解析率和90%几何生成成功率。

Comments 23 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08769 2026-06-09 cs.CL cs.AI 新提交 87%

RadOT-Eval: Auditable Structured-Evidence Transport for Radiology Report Evaluation

RadOT-Eval:用于放射学报告评估的可审计结构化证据传输

Weixin Liu, Juming Xiong, Yang Li, Qingyuan Song, Susannah Rose, Murat Kantarcioglu, Bradley Malin, Zhijun Yin

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出RadOT-Eval框架,通过最优传输对齐结构化临床证据,在独立测试集上实现与错误负担的高斯皮尔曼相关,优于标准指标和基于LLM的评估器。

Comments 10 pages, 1 figure, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10285 2026-06-10 cs.CL 新提交 87%

OpenRTLSet: A Fully Open-Source Dataset for Large Language Model-based Verilog Module Design

OpenRTLSet: 基于大语言模型的Verilog模块设计的完全开源数据集

Jinghua Wang, Lily Jiaxin Wan, Sanjana Pingali, Scott Smith, Manvi Jha, Shalini Sivakumar, Xing Zhao, Kaiwen Cao, Deming Chen

机构 * UIUC-ChenLab(UIUC-陈实验室)

专题命中 评测与基准 :language model(title,abstract);large language model(title);分类 cs.CL;LLM(journal_ref)

AI总结 提出最大完全开源硬件设计数据集OpenRTLSet,包含13万+多样Verilog代码样本,结合GitHub代码、VHDL和C/C++翻译,利用DeepSeek-R1生成自然语言描述,支持多种语言模型微调,证明开源方法在硬件设计中的优越性。

Comments Accepted by ICLAD'25

Journal ref 2025 IEEE International Conference on LLM-Aided Design (ICLAD), Stanford, CA, USA, 2025, pp. 212-218

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04341 2026-08-06 cs.MA 新提交 87%

Continuous Improvement and Parallel Autonomous Exploration: An LLM-Agent Framework for Searching Large Solution Spaces

持续改进与并行自主探索:用于搜索大型解空间的大语言模型智能体框架

Dulmini Hettiarachchi, Andre Rusli, Julio Christian Young, Sho Akiyama

专题命中 评测与基准 :LLM(title,summary_cn)

AI总结 该研究提出一种LLM智能体框架,含持续改进奖励循环与并行自主探索机制,在产品到目录匹配任务中,5个并行智能体的合格覆盖度较单智能体及基线显著提升。

Comments 5 pages, ACM KDD'26 Workshop on SciSoc Agents & LLMs

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04270 2026-08-06 cs.SE cs.MA 新提交 87%

CURATE: Leveraging LLM Agents to Compose, Catalog, and Deploy Reproducible Workflows

CURATE:利用大语言模型智能体构建、编目和部署可复现工作流

Nolan Cutler, Chia-Chen Kuo, Nanda Velugoti, Kathryn Newhart, Renato Figueiredo

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 该研究提出CURATE多智能体系统,覆盖工作流全生命周期,通过模块目录支持FAIR原则,用Claude Opus 4.8原型验证,完成6项含基准工作流复现及环境工程工作流开发的实验。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03078 2026-08-05 cs.CV 新提交 87%

LDU-Bench: Multimodal LLM Evaluation for Lithography Defect Understanding under Layout-Varying Circuit Backgrounds

LDU-Bench:面向不同布局电路背景下光刻缺陷理解的多模态大语言模型评估基准

Huanglong Ji, Botong Zhao, Shujing Lv, Yue Lv

专题命中 评测与基准 :LLM(title);large language model(abstract,abstract_cn);language model(abstract,abstract_cn)

AI总结 本文提出LDU-Bench这一多模态基准,将光刻审查工作流程分解为四项任务,评估发现现有多模态大语言模型的缺陷分类能力无法稳定迁移至下游审查阶段,为工业MLLM评估提供了统一平台。

Comments 12 pages, 3 figures, and 5 tables, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02693 2026-08-05 cs.SE cs.CR 新提交 87%

PRWeaver: Evaluating LLM-Based Code Auditors against Long-Horizon Malicious Pull Requests

PRWeaver:针对基于大语言模型的代码审计工具对抗长周期恶意拉取请求的评估

Yuekun Wang, Mingfei Cheng, Xiaofei Xie

专题命中 评测与基准 :LLM(title,summary_cn)

AI总结 该研究提出PRWeaver基准,评估基于LLM的代码审计工具对长周期恶意PR的可靠性,发现特定评审策略会降低检测率,为优化代码审计工具提供了依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00012 2026-08-04 cs.CL cs.AI cs.CY cs.LG 新提交 87%

Obshazard-bench: Benchmarking Multimodal Foundation Models for Real-Time Disaster Intelligence from Raw Earth Observation Streams

Obshazard-bench:面向原始地球观测流的实时灾害情报多模态基础模型基准测试

Fengxiang Wang, Qiuyang Yu, Yueying Li, Mingshuo Chen, Chengchi Fei, Kaiyi Xu, Lixin Gu, Wangxu Wei, Junchao Gong, Lipeng Ma, Jiong Wang, Fenghua Ling, Wenlong Zhang, Xue Yang, Wenjing Yang, Ben Fei, Long Lan

机构 * National University of Defense Technology(国防科技大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究推出Obshazard-bench基准测试,评估多模态基础模型的实时灾害情报能力,发现现有模型在将原始多通道物理观测转化为符合决策需求的灾害推理方面存在显著局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27942 2026-07-31 cs.MA 新提交 87%

Scaling LLM-Driven Multi-Agent Systems: Design Principles and Architectural Scalability Analysis

扩展大语言模型驱动的多智能体系统:设计原则与架构可扩展性分析

Linus Sander, Fengjunjie Pan, Vahid Zolfaghari, Andre Schamschurko, Nenad Petrovic, Alois Knoll

专题命中 评测与基准 :LLM(title,summary_cn)

AI总结 该研究提炼出可扩展多智能体系统的四项设计原则,构建参考架构并在基准任务上评估,发现LLM超能力阈值时扩展可提升准确率但成本近似线性增长,性能在中等复杂度达峰,一致性是核心挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27294 2026-07-31 cs.SE 新提交 87%

AgentS4D: Benchmarking Runtime Risks across the Execution Lifecycle of LLM-Based Workspace Agents

AgentS4D:基于大语言模型的工作空间智能体执行生命周期内运行时风险基准

Jiajun Zhou, Zhaoxuan Ke, Jihang Ye, Xuanze Chen, Shanqing Yu, Qi Xuan

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究推出AgentS4D基准,评估20种智能体配置在328个风险案例中的表现,发现任务完成不代表安全,需跨风险条件完整评估智能体配置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24174 2026-07-28 cs.CR 新提交 87%

Just Testing, Move Along: Evasion of LLM-based System Log Interpretation by Prompt Injection

只是测试,继续前进:通过提示注入规避基于大语言模型的系统日志解释

Max Landauer, Florian Skopik, Markus Wurzenberger, Franciszek Górski, Mateusz Krzysztoń

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究基于大语言模型的系统日志解释中提示注入攻击问题,提出评估框架,利用真实攻击日志痕迹创建对抗示例,证明攻击可致恶意日志误分类,且LLMs解释含对抗指标可用于检测攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23515 2026-07-28 cs.RO 新提交 87%

LEACL: LLM-Enhanced Automatic Curriculum Learning for Reinforcement Learning in Long-Horizon Manipulation Tasks

LEACL:用于长时程操作任务强化学习的大语言模型增强自动课程学习

Faraz Heravi, James Ouyang, Zifan Xu, Arjun Kumar, Yoonchang Sung, Peter Stone

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Nanyang Technological University(南洋理工大学) Sony AI(索尼人工智能)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 针对长时程操作任务强化学习挑战,提出LEACL框架,结合大语言模型与自动课程学习,用大语言模型分解任务并生成规范,由自动课程学习算法仅依稀疏奖励信号指导学习,在相关任务上取得更好渐近性能。

Comments 8 pages, 4 figures, Published in the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19682 2026-07-23 cs.SE 新提交 87%

Context Matters: Improving the Practical Reliability of LLM-Based Unit Test Generation

上下文很重要:提高基于大语言模型的单元测试生成的实际可靠性

Junjie Chen, Ziqi Wang, Lin Yang, Chen Yang, Xiao Chu, Jianyi Zhou, Guangtai Liang, Qianxiang Wang, Dong Wang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究基于大语言模型的单元测试生成在实际应用中的问题,提出上下文感知工作流程CATGen,通过明确依赖、稳定框架、静态分析等改进设计,经评估在实际项目和基准测试中提升编译成功率与覆盖率,减少生成时间和消耗。

Comments 23 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18108 2026-07-21 cs.CR 新提交 87%

GARAGE: Characterizing the Automation Boundary in LLM-based Attack Graph Generation

GARAGE:基于大语言模型的攻击图生成中自动化边界的特征描述

Daekwon Pi, Sangho Lee, Young Hun Lee, Huy Kang Kim

专题命中 评测与基准 :LLM(title,summary_cn)

AI总结 研究针对现代车辆安全CTI合成难题,提出GARAGE框架,通过RAG技术将碎片化CTI转化为特定领域知识库用于攻击图生成,经实验验证能准确转移安全知识,还可作为TARA支持工具提供性价比分析以指导在各LLM层级部署。

Comments 22 pages, 10 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09091 2026-07-13 cs.CV 新提交 87%

Beyond Time Shifts: Adapting Omni-LLM as a Reference-Free Evaluator for Generative Audio-Visual Models

超越时间偏移:将全能语言模型(Omni-LLM)适配为生成式视听模型的无参考评估器

Yijie Qian, Juncheng Wang, Chao Xu, Huihan Wang, Yuxiang Feng, Yang Liu, Baigui Sun, Yong Liu, Shujun Wang

机构 * Zhejiang University(浙江大学) The Hong Kong Polytechnic University(香港理工大学) IROOTECH TECHNOLOGY(易路泰克科技)

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 研究针对视听生成模型跨模态同步评估难题,提出框架解决人类与自动化评估指标的矛盾。通过引入数据集、适配模型及提出优化方法,实现先进的人类偏好对齐,建立标准化基准推动评估从信号相关性到因果关系发展。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07481 2026-07-09 cs.SE 新提交 87%

The Poisoned Chalice of LLM Evaluation Report

大语言模型评估报告的毒圣杯

Jonathan Katzy, Ali Al-Kaswan, Razvan Mihai Popescu, Zhou Yang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 研究大语言模型评估中因数据污染致结果不可靠的问题,通过举办竞赛将污染检测设为白盒成员推理任务,提供相关资源,报告竞赛设置与结果,推动软件工程中可信大语言模型评估社区发展。

Comments Report of the competition hosted at FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05290 2026-07-07 cs.CV 新提交 87%

ChatImage: Navigating Long-Form LLM Answers through Interactive Images

ChatImage:通过交互式图像导航大语言模型的长文本回答

Wencan Jiang, Jiangning Zhang, Yong Liu

机构 * Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 针对LLM长文本答案难以细粒度浏览的问题,ChatImage将其转为带点击热点的交互图像,支持局部查询,提升内容与交互区域的一致性,还开源实现并发布多格式评测基准。

Comments Project:https://wencanjiang.github.io/ChatImage

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31314 2026-07-01 eess.SY cs.SY 新提交 87%

A Novel Method for Differential-Algebraic Dynamic Model Discovery in Power Systems: An LLM-Based Multi-Agent Collaborative Framework

一种电力系统微分代数动态模型发现的新方法:基于LLM的多智能体协作框架

Xinming Wang, Fan Tang, Yingli Wei, Yakun He, Zhe Liu, Ping Jiang, Haoyu Wu, Zihan Guo, Chao Shen

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 针对电力系统强非线性、多时间尺度耦合及黑箱控制逻辑导致的模型发现难题,提出基于大语言模型的多智能体协作框架,通过并行生成候选方程结构并联合恢复状态动态、代数约束和关键中间变量,在同步发电机和构网型逆变器案例中优于单智能体方法和传统符号回归。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20138 2026-06-19 cs.AI cs.CL cs.HC cs.LG 新提交 87%

Learning to Prompt: Improving Student Engagement with Adaptive LLM-based High-School Tutoring

学习提示:基于自适应LLM的高中辅导提升学生参与度

Po-Chin Chang, Nicholas Hogan, Aske Plaat, Michiel T. van der Meer

机构 * Leiden University(莱顿大学) FutureWhiz

专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出一种基于14个教学特征的主题感知提示路由模型,通过模拟训练和在线A/B测试,在高中辅导中实现自适应策略切换,提高教学效率并减少交互轮次。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20394 2026-06-19 cs.RO math.OC 新提交 87%

Agentic AutoResearch forSpace Autonomy: An Auditable, LLM-Driven Research Agent for Aerospace Control Problems

面向空间自主性的智能体自动研究:用于航空航天控制问题的可审计、LLM驱动的研究代理

Amit Jain, Richard Linares

机构 * Department of Aeronautics and Astronautics(航空航天学系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出AutoResearch框架,利用大语言模型作为离线研究代理,自动迭代开发航天控制策略,并通过内置可信层审计结果,消除种子噪声影响,在交会和对接问题上验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17573 2026-06-17 cs.OS cs.CR 新提交 87%

Cordon: Semantic Transactions for Tool-Using LLM Agents

Cordon: 工具使用型LLM代理的语义事务

Zheng Chen, Hanqing Liu, Duling Xu, Dong Dong, Jialin Li, Bangzheng Pu, Jidong Zhai

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 提出Cordon事务运行时系统,通过语义事务边界实现多步代理工作流的提交、回滚、恢复和审计,减少不可逆效应失败并暴露跨步违规。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11375 2026-06-11 cs.CL cs.AI cs.LG 新提交 87%

When Probing Accuracy Saturates, Fragility Resolves: A Complementary Metric for LLM Pre-Training Analysis

当探测精度饱和时,脆弱性揭示问题:LLM预训练分析的互补度量

Orion Reblitz-Richardson

机构 * Distiller Labs

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对线性探测在预训练中精度快速饱和的问题,提出脆弱性度量,通过激活噪声水平衡量探测鲁棒性,揭示精度无法捕捉的表示结构演化。

Comments 22 pages, 5 figures. Code and datasets at https://github.com/deepsteer/deepsteer

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07085 2026-06-08 cs.SE 新提交 87%

Porting Declarative UI to HarmonyOS: A Heuristic-guided LLM Approach

将声明式UI移植到鸿蒙:一种启发式引导的LLM方法

Kunwu Zheng, Pengyu Xue, Zhen Yang, Xiran Lyu, Peishi Lai, Mengying Zhao, Yutian Tang, Huizhi Zhang, Xianhang Li, Linhao Wu, Chengyi Wang

专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract)

AI总结 针对鸿蒙系统从Android/iOS迁移声明式UI的需求,提出ArkTrans方法,通过启发式构建骨架和模式匹配修复语法错误,实现高编译成功率和视觉保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14161 2026-08-17 cs.AI 新提交 86%

BiasTrace: Linking Reasoning Behaviours to Biased Outputs in LLMs

BiasTrace:将大语言模型(LLM)中的推理行为与有偏输出关联起来

Varsha Ramineni, Hossein A. Rahmani, Jerome Ramos, Karin Sevegnani, Emine Yilmaz

机构 * University College London(伦敦大学学院) NVIDIA(英伟达)

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.AI

AI总结 本研究提出BiasTrace标注方案,将LLM的推理行为与有偏输出关联,构建大型标注数据集,发现有偏输出多源于微妙推理行为,且该方案可提升偏见检测与推理时缓解效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12894 2026-08-14 cs.CL 新提交 86%

BavGround: A Benchmark for Regional Cultural Grounding and Dialect Competence in Bavarian

BavGround:巴伐利亚区域文化接地与方言能力基准

Jophin John, Michael Hoffmann, Jan Fillies, Michael A. Hedderich, Barbara Plank

机构 * Stanford University(斯坦福大学) Freie Universität Berlin(柏林自由大学) Center for Information and Language Processing, LMU Munich(慕尼黑大学信息与语言处理中心) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Leibniz Supercomputing Centre (LRZ)(莱布尼茨超级计算中心)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 该研究推出BavGround基准,评估LLM的巴伐利亚区域文化接地与方言能力,发现多语言模型在巴伐利亚语及源接地问题上表现欠佳,且评估协议会显著影响结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12340 2026-08-14 cs.CL 新提交 86%

Class-Structure Preservation Beats Diversity: A Comprehensive Benchmark of Text Augmentation Methods for Imbalanced Text Classification

类结构保留优于多样性:不平衡文本分类的文本增强方法综合基准测试

Keito Inoshita

机构 * Faculty of Business and Commerce, Kansai University(关西大学商学部)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究构建含11种增强方法的基准,在7个数据集上测试后发现,基于LLM的增强性能不优于经典的EmbSMOTE,类结构保真度而非表面多样性是关键,建议检索式过采样作为不平衡多分类默认方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12004 2026-08-13 cs.SE cs.AI 新提交 86%

RealisticTritonBench: A Benchmark for Triton-Kernel Generation in Real-World AI Frameworks

RealisticTritonBench:面向真实世界AI框架的Triton内核生成基准测试

Jinjun Huang, Zhongzhen Wen, Tongtong Xu, Meng Yan, Xin Xia, Zhongxin Liu

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出RealisticTritonBench基准,解决现有Triton内核生成基准的局限,评估发现领先LLM在真实世界Triton内核生成任务上仍表现不佳。

Comments Accepted by ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏