arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-10 至 2026-04-10 共收录 307 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 51 篇

2512.12623 2026-04-10 cs.CV cs.CL 70%

Reasoning Within the Mind: Dynamic Multimodal Interleaving in Latent Space

思维中的推理:潜在空间中的动态多模态交错

Chengzhi Liu, Yuzhe Yang, Yue Fan, Qingyue Wei, Sheng Liu, Xin Eric Wang

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) Stanford University(斯坦福大学) University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出DMLR框架,通过动态潜在策略梯度优化和视觉注入策略,在潜在空间中实现视觉与文本的动态交错推理,提升多模态推理性能并保持高效推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12374 2026-04-10 cs.SE cs.AI 70%

Beyond Final Code: A Process-Oriented Error Analysis of Software Development Agents in Real-World GitHub Scenarios

超越最终代码:对现实世界GitHub场景中软件开发代理的过程导向错误分析

Zhi Chen, Wei Ma, Lingxiao Jiang

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过分析3977个解决阶段轨迹和3931个测试阶段日志,揭示了软件开发代理在解决GitHub问题时的错误模式,发现Python执行错误与较低的解决率和更高的推理开销相关,并识别了影响基准公平性的三个bug。

Comments Paper accepted at ICSE 2026, Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07551 2026-04-10 cs.CR cs.AI 70%

MCP-DPT: A Defense-Placement Taxonomy and Coverage Analysis for Model Context Protocol Security

MCP-DPT:模型上下文协议安全的防御放置分类与覆盖分析

Mehrdad Rostamzadeh, Sidhant Narula, Nahom Birhan, Mohammad Ghasemigol, Daniel Takabi

机构 * Old Dominion University(老道明大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出MCP-DPT框架,分析模型上下文协议的安全性,识别防御点并揭示架构不匹配导致的安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07468 2026-04-10 cs.AI 70%

M-ArtAgent: Evidence-Based Multimodal Agent for Implicit Art Influence Discovery

M-ArtAgent:基于证据的多模态代理用于隐式艺术影响发现

Hanyi Liu, Zhonghao Jiu, Minghao Wang, Yuhang Xie, Heran Yang

机构 * China Electronics Technology Group Co., Ltd.(中国电子科技集团有限公司) School of Information Science and Engineering, Southeast University(东南大学信息科学与工程学院) Department of Chemical and Biological Engineering, Hong Kong University of Science and Technology(香港科技大学化学与生物工程系) University of California San Diego(加州大学圣迭戈分校) Northeastern University(东北大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出M-ArtAgent,通过概率裁决框架解决隐式艺术影响发现问题,结合多模态感知与领域约束的反驳机制,实现83.7%的F1分数和0.910的ROC-AUC。

Comments 13 pages, 5 figures, submitted to IEEE Access

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07424 2026-04-10 cs.AI cs.CY cs.MA 70%

An Analysis of Artificial Intelligence Adoption in NIH-Funded Research

NIH资助研究中人工智能采纳的分析

Navapat Nananukul, Mayank Kejriwal

机构 * Information Sciences Institute, University of Southern California(南加州大学信息科学研究所)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文分析了NIH资助研究中AI的采纳情况,提出了一种人机协同的方法来大规模分类和总结研究描述,发现AI在NIH portfolio中占比15.9%,存在研究到应用的差距,且健康不平等研究严重不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08102 2026-04-10 cs.SE 67%

Test-Oriented Programming: rethinking coding for the GenAI era

面向生成式AI时代的测试导向编程:重新思考编程方式

Jorge Melegati

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出测试导向编程 paradigm,通过自然语言生成测试代码替代传统生产代码,利用 LLM 生成程序并评估其可行性。

Comments Accepted as a poster in the 48th International Conference on Software Engineering (ICSE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08068 2026-04-10 cs.CV 67%

Brain3D: EEG-to-3D Decoding of Visual Representations via Multimodal Reasoning

Brain3D: 通过多模态推理实现EEG到3D视觉表示的解码

Emanuele Balloni, Emanuele Frontoni, Chiara Matti, Marina Paolanti, Roberto Pierdicca, Emiliano Santarnecchi

机构 * Università Politecnica delle Marche(马尔凯理工大学) University of Macerata(马切拉塔大学) Horizon Intelligence Labs(地平线智能实验室) Harvard Medical School(哈佛医学院) Massachusetts General Hospital(麻省总医院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出Brain3D,通过多模态推理实现EEG到3D解码,分阶段生成3D网格,提升神经解码的几何理解与应用性。

Comments 17 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11724 2026-04-10 cs.SE 67%

WebTestPilot: Agentic End-to-End Web Testing against Natural Language Specification by Inferring Oracles with Symbolized GUI Elements

WebTestPilot: 通过符号化GUI元素推断或acles实现基于自然语言规范的端到端Web测试

Xiwen Teoh, Yun Lin, Duc-Minh Nguyen, Ruofei Ren, Wenjie Zhang, Jin Song Dong

专题命中 推理与问题求解 :LLM(abstract);language model(abstract)

AI总结 WebTestPilot通过符号化GUI元素推断隐式或acles,解决自然语言规范下的端到端Web测试中的隐式或acles推断和概率推理挑战,实现99%的任务完成率和高精度召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07455 2026-04-10 cs.AI cs.LG cs.LO 62%

Munkres' General Topology Autoformalized in Isabelle/HOL

Munkres泛拓扑论在Isabelle/HOL中的自动形式化

Dustin Bryant, Jonathan Julián Huerta y Munive, Cezary Kaliszyk, Josef Urban

机构 * Independent(独立研究者) Aalborg University(奥尔堡大学) University of Melbourne(墨尔本大学) AI4REASON and University of Gothenburg / Chalmers University(AI4REASON 和哥德堡大学 / 查尔姆斯理工大学)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 本研究利用LLM辅助在Isabelle/HOL中自动形式化Munkres泛拓扑教材,生成85000余行代码,涵盖39章节,证明包括Tychonoff定理等核心结果,方法结合声明性证明与sledgehammer工具,展现高效形式化潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08065 2026-04-10 cs.LG 57%

Multimodal Latent Reasoning via Predictive Embeddings

通过预测嵌入进行多模态潜在推理

Ashutosh Adhikari, Mirella Lapata

专题命中 推理与问题求解 :language model(abstract);分类 cs.LG

AI总结 本文提出Pearl框架,通过学习专家工具使用轨迹在潜在空间中进行多模态推理,无需显式调用工具,优于传统重建方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07957 2026-04-10 cs.AI cs.CV cs.RO 57%

WorldMAP: Bootstrapping Vision-Language Navigation Trajectory Prediction with Generative World Models

WorldMAP: 通过生成世界模型提升视觉-语言导航轨迹预测

Hongjin Chen, Shangyun Jiang, Tonghua Su, Chen Gao, Xinlei Chen, Yong Li, Zhibo Chen

机构 * Harbin Institute of Technology(哈尔滨工业大学) Shandong University(山东大学) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) Zhongguancun Academy(中关村学院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 WorldMAP通过生成世界模型与教师-学生框架,将生成的未来场景转化为语义空间结构和规划监督,提升导航轨迹预测的稳定性与准确性,取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07667 2026-04-10 cs.AI cs.MA cs.SI 57%

From Debate to Decision: Conformal Social Choice for Safe Multi-Agent Deliberation

从辩论到决策:用于安全多智能体辩论的符合社会选择

Mengdie Flora Wang, Haochen Xie, Guanghui Wang, Aijing Gao, Guang Yang, Ziyuan Li, Qucy Wei Qiu, Fangwei Han, Hengzhi Qiu, Yajing Huang, Bing Zhu, Jae Oh Woo

机构 * AWS Generative AI Innovation Center(AWS生成式AI创新中心) HSBC Holdings Plc., HSBC Technology Center, China(汇丰控股有限公司,汇丰科技中心,中国)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 本文提出Conformal Social Choice方法,通过后处理层将辩论输出转化为校准的行动与升级决策,确保正确答案的概率覆盖,提升多智能体辩论的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07518 2026-04-10 cs.CL 57%

Decompose, Look, and Reason: Reinforced Latent Reasoning for VLMs

分解、观察与推理:用于视觉语言模型的强化潜在推理

Mengdan Zhu, Senhao Cheng, Liang Zhao

机构 * Emory University(埃默里大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 本文提出DLR框架,通过动态分解查询、提取连续视觉潜在表示和基于 grounded rationales 推理,提升视觉语言模型在复杂视觉推理中的表现,实验表明其优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13235 2026-04-10 cs.AI cs.CV 57%

Lang2Act: Fine-Grained Visual Reasoning through Self-Emergent Linguistic Toolchains

Lang2Act: 通过自涌现语言工具链实现细粒度视觉推理

Yuqi Xiong, Chunyi Peng, Zhipeng Xu, Zhenghao Liu, Zulong Chen, Yukun Yan, Shuo Wang, Yu Gu, Ge Yu

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系) Alibaba Group, Hangzhou, China(阿里巴巴集团)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 Lang2Act通过自涌现语言工具链提升视觉感知与推理能力,采用强化学习框架优化VLMs的视觉感知和下游任务性能,实验显示其在视觉感知能力上有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08209 2026-04-10 cs.CV 50%

OmniJigsaw: Enhancing Omni-Modal Reasoning via Modality-Orchestrated Reordering

OmniJigsaw:通过模态协调重排序增强多模态推理

Yiduo Jia, Muzhi Zhu, Hao Zhong, Mingyu Liu, Yuling Xi, Hao Chen, Bin Qin, Yongjie Yang, Zhenbo Luo, Chunhua Shen

机构 * Zhejiang University(浙江大学) Xiaomi Inc.(小米公司)

专题命中 推理与问题求解 :post-training(abstract)

AI总结 OmniJigsaw通过模态协调重排序任务提升多模态推理能力,采用三重策略实现跨模态整合,并通过两级数据过滤提升模型适应性,验证了其在多模态自监督学习中的有效性。

Comments Project page: https://aim-uofa.github.io/OmniJigsaw/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07774 2026-04-10 cs.RO cs.CV 50%

RoboAgent: Chaining Basic Capabilities for Embodied Task Planning

RoboAgent: 通过基本能力串联实现具身任务规划

Peiran Xu, Jiaqi Zheng, Yadong Mu

机构 * Peking University(北京大学) XYZ Embodied AI(XYZ具身智能)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出RoboAgent,通过串联基本能力实现具身任务规划,利用单个VLM构建能力驱动的规划框架,结合多阶段训练方法提升规划效果。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07419 2026-04-10 cs.IR 50%

ReAlign: Optimizing the Visual Document Retriever with Reasoning-Guided Fine-Grained Alignment

ReAlign:通过推理引导的细粒度对齐优化视觉文档检索

Hao Yang, Yifan Ji, Zhipeng Xu, Zhenghao Liu, Yukun Yan, Zulong Chen, Shuo Wang, Yu Gu, Ge Yu

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出ReAlign方法,利用VLM推理能力生成细粒度视觉描述作为监督信号,提升视觉文档检索性能,实验表明在不同领域数据集上均取得2%的相对提升。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 70 篇

2604.07369 2026-04-10 cs.LG cs.AI 91%

The Role of Emotional Stimuli and Intensity in Shaping Large Language Model Behavior

情绪刺激与强度在塑造大语言模型行为中的作用

Ameen Patel, Felix Lee, Kyle Liang, Joseph Thomas

机构 * Irvington High School(欧文顿高中) Glen A. Wilson High School(格伦·A·威尔逊高中) Del Norte High School(德尔诺特高中) California High School(加利福尼亚高中)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文研究了四种情绪在情感提示中的影响,发现积极情绪刺激提升模型准确性并降低毒性,但会增加顺从行为。

Journal ref Poster Presentation at AACL Student Research Workshop 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08293 2026-04-10 cs.SE cs.AI 89%

CIAO - Code In Architecture Out - Automated Software Architecture Documentation with Large Language Models

CIAO - 代码输入,架构输出 - 利用大语言模型实现自动化软件架构文档生成

Marco De Luca, Tiziano Santilli, Domenico Amalfitano, Anna Rita Fasolino, Patrizio Pelliccione

机构 * University of Naples Federico II(那不勒斯腓特烈二世大学) University of Southern Denmark(南丹麦大学) Gran Sasso Science Institute(格兰萨索科学研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出CIAO方法,利用大语言模型从GitHub仓库自动生成系统级架构文档,基于ISO/IEC/IEEE标准模板,评估显示文档被开发者认为有价值且准确,但存在图表质量和高层次上下文建模的局限。

Comments Manuscript accepted for the 23rd International Conference on Software Architecture (ICSA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22416 2026-04-10 cs.CL cs.IR 89%

Hallucination Detection and Evaluation of Large Language Model

大语言模型的幻觉检测与评估

Chenggong Zhang, Haopeng Wang, Hexi Meng

机构 * Department of Electrical and Computer Engineering, University of California, Los Angeles(加州大学洛杉矶分校电气与计算机工程系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出HHEM模型,通过轻量级分类框架有效检测大语言模型幻觉,提升效率并保持高准确率,通过对比分析不同模型的检测效果,发现HHEM在时间与准确性上表现优异,但总结任务中存在局部幻觉问题,引入分段检索并分析模型规模与幻觉的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07273 2026-04-10 stat.ME stat.AP 89%

Impact of Label Noise from Large Language Models Generated Annotations on Evaluation of Diagnostic Model Performance

大型语言模型生成标注的标签噪声对诊断模型性能评估的影响

Mohammadreza Chavoshi, Hari Trivedi, Janice Newsome, Aawez Mansuri, Chiratidzo Rudado Sanyika, Rohan Satya Isaac, Frank Li, Theo Dapamede, Judy Gichoya

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文研究了大型语言模型生成的标签噪声对诊断模型性能评估的影响,通过模拟框架分析了标签误差对模型表现的敏感性,并指出在不同疾病患病率下,标签质量对性能估计的系统性偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07705 2026-04-10 cs.RO 89%

Vision-Language Navigation for Aerial Robots: Towards the Era of Large Language Models

面向大语言模型时代的空中机器人视觉-语言导航

Xingyu Xia, Lekai Zhou, Yujie Tang, Xiaozhou Zhu, Hai Zhu, Wen Yao

机构 * Defense Innovation Institute, Chinese Academy of Military Sciences(军事科学院国防创新研究院) Intelligent Game and Decision Laboratory(智能博弈与决策实验室) Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文综述了空中机器人视觉-语言导航领域,分析了大语言模型与视觉-语言模型的整合,归纳了五类架构方法,指出了评估体系的不足,并提出了七个开放性问题。

Comments 28 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.02781 2026-04-10 cs.LG cs.AI 88%

An Automated Survey of Generative Artificial Intelligence: Large Language Models, Architectures, Protocols, and Applications

生成人工智能的自动化调查:大型语言模型、架构、协议和应用

Eduardo C. Garrido-Merchán, Álvaro López López

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文调查了生成人工智能领域,重点分析了前沿大型语言模型的架构、训练方法和性能,涵盖多个模型家族及部署协议,总结了各行业应用案例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07749 2026-04-10 cs.CL 88%

Beyond Social Pressure: Benchmarking Epistemic Attack in Large Language Models

超越社会压力:大型语言模型中知识攻击的基准测试

Steven Au, Sujit Noronha

机构 * Independent Researcher(独立研究员)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出PPT-Bench基准测试,用于评估大型语言模型中的知识攻击,通过不同压力类型测试模型在面对知识、价值观或身份挑战时的一致性与反应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07363 2026-04-10 cs.LG 88%

Benchmark Shadows: Data Alignment, Parameter Footprints, and Generalization in Large Language Models

基准阴影:大型语言模型中的数据对齐、参数足迹与泛化

Hongjian Zou, Yidan Wang, Qi Ding, Yixuan Liao, Xiaoxin Chen

机构 * Vivo AI Lab, Shenzhen, China(维沃人工智能实验室,深圳,中国) Hong Kong University of Science and Technology, Hong Kong, China(香港科技大学,香港,中国)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文研究了大型语言模型中基准表现与广度能力之间的差异,通过数据干预发现数据分布影响参数适应与泛化能力,提出参数空间诊断方法揭示不同训练模式的结构特征。

Comments 28 pages, 26 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18472 2026-04-10 cs.AI cs.CV 88%

Cognitive Mismatch in Multimodal Large Language Models for Discrete Symbol Understanding

多模态大语言模型在离散符号理解中的认知不匹配

Yinghui Li, Jiayi Kuang, Peng Xing, Daixian Liu, Yongheng Zhang, Junnan Dong, Shu-Yu Guo, Yangning Li, Qingyu Zhou, Wenhao Jiang, Hai-Tao Zheng, Ying Shen, Liang Lin, Philip S. Yu

机构 * Tsinghua University(清华大学) Sun Yat-sen University(中山大学) Independent Researcher(独立研究员) The Hong Kong Polytechnic University(香港理工大学) Guangdong Laboratory of AI and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 研究发现多模态大语言模型在离散符号识别上表现欠佳,而在复杂推理任务上表现较好,揭示了当前系统依赖语言先验而非稳健视觉基础的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07054 2026-04-10 cs.CL 87%

Sell More, Play Less: Benchmarking LLM Realistic Selling Skill

多卖少玩:LLM真实销售技能基准测试

Xuanbo Su, Wenhao Hu, Haibo Su, Yunzhang Chen, Le Zhan, Yanqi Yang, Leo Huang

机构 * SF Express(顺丰速运)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出SalesLLM基准测试,通过30,074个剧本配置和1,805个多轮场景评估大语言模型的销售能力,采用自动评估流程和用户模型CustomerLM提升模拟真实性,实验显示LLM在销售任务上的表现差异显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02711 2026-04-10 eess.SP 87%

Foundation Models Defining A New Era In Sensor-based Human Activity Recognition: A Survey And Outlook

基于传感器的人类活动识别的基石模型:一种综述与展望

Sizhen Bian, Mengxi Liu, Lala Shakti Swarup Ray, Bo Zhou, Bin Guo, Zhiwen Yu, Thomas Ploetz, Paul Lukowicz, Siyu Yuan, Vitor Fortes Rey

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文综述了基于传感器的人类活动识别中的基石模型,分析了九种技术轴上的设计模式与权衡,并探讨了数据整理、多模态对齐、个性化、隐私和负责任部署等开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08381 2026-04-10 cs.CL cs.AI 86%

A GAN and LLM-Driven Data Augmentation Framework for Dynamic Linguistic Pattern Modeling in Chinese Sarcasm Detection

一种基于GAN和LLM的数据增强框架用于中文讽刺检测中的动态语言模式建模

Wenxian Wang, Xiaohu Luo, Junfeng Hao, Xiaoming Gu, Xingshu Chen, Zhu Wang, Haizhou Wang

机构 * School of Cyber Science and Engineering, Sichuan University(四川大学网络空间安全学院) State Key Laboratory of Fluid Power and Mechatronic Systems, Zhejiang University(浙江大学流体动力与机电系统国家重点实验室) Law School, Sichuan University(四川大学法学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于GAN和LLM的数据增强框架,动态建模用户语言模式以提升中文讽刺检测效果,通过合成SinaSarc数据集并扩展BERT架构,实验表明模型在非讽刺和讽刺类别中均取得最高F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07494 2026-04-10 cs.SE cs.AI cs.LG 86%

Triage: Routing Software Engineering Tasks to Cost-Effective LLM Tiers via Code Quality Signals

Triage: 通过代码质量信号将软件工程任务路由到成本效益高的LLM层级

Lech Madeyski

机构 * Wroclaw University of Science and Technology(弗罗茨瓦夫理工大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 Triage利用代码健康度指标作为路由信号,将任务分配到最便宜的模型层级,通过分析代码质量与模型层级成本的关系,提升任务处理效率。

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏