arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1309 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 1309 篇

2602.01910 2026-08-14 cs.AI 版本更新 85%

DomusFM: A Foundation Model for Event-Based Behavioral Monitoring in Smart-Homes

DomusFM: 一个面向智能家居传感器数据的基础模型

Michele Fiori, Gabriele Civitarese, Flora D. Salim, Claudio Bettini

机构 * University of Milan(米兰大学) University of New South Wales(新南威尔士大学)

专题命中 评测与基准 :foundation model(title,abstract);LLM(abstract_cn);language model(abstract);分类 cs.AI

AI总结 DomusFM是首个专为智能家居传感器数据设计的基础模型,通过自监督双对比学习范式实现语义和时间依赖性的建模,有效提升活动识别任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09900 2026-08-13 cs.CL 版本更新 85%

Decoding-Level Taboo: A Diagnostic Stress Test for LLM Robustness

解码层面禁忌:大语言模型鲁棒性的诊断压力测试

Tadanobu Chuyo Kamijo, Ori Rottenstreich, Javier Conde, Gonzalo Martínez, Pedro Reviriego

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出Decoding-Level Taboo这一零提示诊断压力测试,通过干预logit空间迫使大语言模型偏离标称路径,评估发现其鲁棒性与参数规模、指令对齐正相关,该测试还可用于生成合成数据集等场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05353 2026-08-12 cs.CL 版本更新 85%

Evidence Lock Before Commitment: A Frozen Interface Degrades LLM-as-Judge Evaluation

提交前的证据锁定:冻结界面会降低“大模型作为评判者”的评估效果

Divyansh Singh

机构 * University of Florida(佛罗里达大学)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL

AI总结 该研究测试了证据锁定等不同LLM-as-Judge评估方案,发现证据锁定会降低与人类偏好的一致性、增加答案顺序不一致性,而结构化证据引出效果接近标准评判,持久化证据可支持审计但不应替代源答案。

Comments Withdrawn due to an error identified in the code during debugging. The error affects the reported results

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12843 2026-08-11 cs.CL 版本更新 85%

Growing Pains: Extensible and Efficient LLM Benchmarking Via Fixed Parameter Calibration

成长之痛:通过固定参数校准实现可扩展且高效的LLM基准测试

Eliya Habba, Itay Itzhak, Asaf Yehudai, Yotam Perlitz, Elron Bandel, Michal Shmueli-Scheuer, Leshem Choshen, Gabriel Stanovsky

机构 * The Hebrew University of Jerusalem(海法大学) IBM Research(IBM研究院) MIT(麻省理工学院) Technion(技术学院) Allen Institute for AI(人工智能研究院)

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);分类 cs.CL

AI总结 本文提出基于多维项目反应理论的框架,利用锚定项目校准新基准,保持原有参数固定,实现随时间扩展基准测试的同时保持评分可比性,且评估成本恒定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18852 2026-08-11 cs.CL 版本更新 85%

FanarGuard: A Culturally-Aware Moderation Filter for Arabic Language Models

FanarGuard: 一种文化感知的阿拉伯语言模型审查过滤器

Masoomali Fatehkia, Enes Altinisik, Husrev Taha Sencar

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 FanarGuard是一种双语审查过滤器,通过评估阿拉伯语和英语中的安全性和文化对齐性,提升内容审查的准确性与文化敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28956 2026-08-05 cs.AI 版本更新 85%

MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations

MerchantBench:面向电商运营中长期一致性的大语言模型智能体基准测试

Qiming Shi, Yulong Tao, Linbo Jin, Zhaolu Kang, Yibo Dou, Jiawen Zhu, Tianjun Pan, Shaokang Fu, Chengyu Wang, Siyue Li, Yaping Cheng, Di Weng, Chengfu Huo

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究推出MerchantBench电商运营基准测试,通过365天订单级模拟评估大语言模型智能体的中长期一致性,发现其与人类参与者存在显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02277 2026-08-04 cs.CR cs.AI 版本更新 85%

Quantifying Frontier LLM Capabilities for Container Sandbox Escape

量化前沿大语言模型突破容器沙盒的能力

Rahul Marchand, Art O Cathain, Jerome Wynne, Philippos Maximos Giavridis, Stuart Jennings, Freddy Tuxworth, Tolga H. Dur, Sam Deverett, John Wilkinson, Jason Gwartz, Harry Coppock

机构 * University of Oxford(牛津大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型突破容器沙盒的能力,通过引入SANDBOXESCAPEBENCH基准,利用嵌套沙盒架构和CTF评估,涵盖多种逃逸机制,发现添加漏洞时大语言模型能识别利用,证明此类评估对保障沙盒封装高性能模型的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03711 2026-08-04 cs.AR cs.LG 版本更新 85%

A Survey of Circuit Foundation Model: Foundation AI Models for VLSI Circuit Design and EDA

电路基础模型综述:用于VLSI电路设计和EDA的基础AI模型

Wenji Fang, Jing Wang, Yao Lu, Shang Liu, Yuchao Wu, Yuzhe Ma, Zhiyao Xie

机构 * Hong Kong University of Science and Technology(香港理工大学)

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文综述电路基础模型(CFMs),涵盖130余篇2022年后工作,分为编码器(预测任务)和解码器(生成任务)两类,讨论其输入模态、架构、预训练策略及下游应用。

Comments Published in ACM TODAES

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24649 2026-08-03 cs.AI 版本更新 85%

Reason-Mediated Behavioral Models for Auditing LLM Social Simulators

用于审计大语言模型社会模拟器的基于推理的行为模型

Atharva Pandey, Gautam Jajoo

机构 * Kairosity

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型作为社会模拟器的评估问题,通过防晒霜概念测试将人类理由映射到推理状态Z,发现人类理由能提升购买意图预测,大语言模型模拟理由较脆弱,贡献了社会模拟器评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08334 2026-07-30 cs.CL 版本更新 85%

CustomerSim: Benchmarking and Aligning Multimodal Language Models as Retail User Simulators

SalesSim:多模态语言模型作为零售用户模拟器的基准测试与对齐

Yada Pruksachatkun, Yixin Wan, Xingrun Chen, Kai-Wei Chang, Chien-Sheng Wu

机构 * Salesforce Research(Salesforce研究院) University of California Los Angeles(加州大学洛杉矶分校)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);prompting(abstract);分类 cs.CL

AI总结 SalesSim通过多轮多模态对话评估多模态大语言模型在模拟真实用户行为中的能力,发现模型在词汇多样性及决策一致性方面存在不足,并提出UserGRPO方法提升对话流畅度与决策对齐度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16617 2026-07-27 cs.SE cs.AI 版本更新 85%

DataFlow-Harness: A Grounded Code-Agent Platform for Constructing Editable LLM Data Pipelines

DataFlow-Harness:用于构建可编辑大语言模型数据管道的基础代码代理平台

Runming He, Zhen Hao Wong, Hao Liang, Zimo Meng, Chengyu Shen, Xiaochen Ma, Wentao Zhang

机构 * Peking University(北京大学) Institute for Advanced Algorithms Research(先进算法研究所) Zhongguancun Academy(中关村学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大语言模型数据处理工作流中编码代理脚本无法自动转化为可编辑工件的问题,提出DataFlow-Harness平台,通过类型化增量突变引导构建DAG,结合多种技术,在数据工程基准测试中取得高通过率,降低成本和延迟。

Comments 13 pages, 2 figures, and 5 tables. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28965 2026-07-22 cs.AI 版本更新 85%

Frontier LLM-based agents can overcome the ontology curation bottleneck for natural phenotypes

基于前沿LLM的智能体可以克服自然表型的本体策展瓶颈

James P. Balhoff, Hilmar Lapp

机构 * Renaissance Computing Institute, University of North Carolina(北卡罗来纳大学雷丁计算研究所) Neuromatch, USA(美国Neuromatch)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文使用前沿大型语言模型作为智能体策展人,在自包含工作空间中利用本体和注释指南进行表型注释,其性能达到人类策展人之间的变异性范围,显著优于传统NLP工具。

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01549 2026-07-21 cs.CL cs.SE 版本更新 85%

Octopus: On-device language model for function calling of software APIs

章鱼:用于软件API函数调用的设备端语言模型

Wei Chen, Zhiyuan Li, Mingyuan Ma

机构 * Stanford University(斯坦福大学) Harvard University(哈佛大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL

AI总结 研究利用设备端大语言模型调用软件API,通过编译数据集微调不同参数模型,提升其API交互能力,提出条件掩码技术和新基准,经微调的Octopus模型在API调用上性能超GPT-4,推动自动化软件开发和API集成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17930 2026-07-17 cs.AI 版本更新 85%

How Inference Compute Shapes Frontier LLM Evaluation

推理计算如何塑造前沿LLM评估

Jessica McFadyen, Ole Jorgensen, Harry Coppock, Kevin Wei, Cozmin Ududec

机构 * UK AI Security Institute(英国人工智能安全研究所)

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);分类 cs.AI

AI总结 通过控制推理计算量(如token预算、上下文压缩和重复提交)评估12个前沿语言模型,发现更大计算量显著提升性能,固定预算评估低估模型能力,且不同基准对推理扩展方法敏感。

Comments 34 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17331 2026-07-07 cs.HC cs.AI 版本更新 85%

Exploring Context-aware and LLM-driven Locomotion for Immersive Virtual Reality

探索用于沉浸式虚拟现实的上下文感知和大语言模型驱动的移动

Suleyman Ozdel, Kadir Burak Buldu, Enkelejda Kasneci, Efe Bozkir

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Human-Centered Technologies for Learning(以人为本的学习技术)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究提出由大语言模型驱动的移动技术,让用户用自然语言在虚拟环境中导航。通过评估三种移动方法,结合眼动追踪数据分析和标准化问卷,发现该方法有潜力成为可行的免手持替代方案,能促进虚拟空间免手持移动。

Comments 28 pages. To appear in the Proceedings of the ACM on Human-Computer Interaction (PACM HCI), Vol. 10, No. 5; presented at the 28th ACM International Conference on Mobile Human-Computer Interaction (MobileHCI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15476 2026-07-07 cs.CR cs.AI 版本更新 85%

SoK: Systematizing LLM Prompt Security: Taxonomies, Datasets, and Unified Evaluation of Attacks and Defenses

知识梳理:系统化大语言模型提示安全:分类法、数据集以及攻击与防御的统一评估

Hanbin Hong, Shuang Wu, Shuya Feng, Nima Naderloui, Shenao Yan, Jingyu Zhang, Ali Arastehfard, Heqing Huang, Yuan Hong

机构 * University of Connecticut(康涅狄格大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Independent(独立研究者)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型提示安全问题,提出相关分类法,形式化评估元数据,发布模块化平台,通过匹配评估揭示多种因素对安全结论有重大影响,支持可重复、成本感知且基于分类法的评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17442 2026-07-01 cs.CV cs.AI 版本更新 85%

REMSA: Foundation Model Selection for Remote Sensing via a Constraint-Aware Agent

REMSA:通过约束感知代理进行遥感基础模型选择

Binger Chen, Tacettin Emre Bök, Behnood Rasti, Volker Markl, Begüm Demir

机构 * Humboldt-Universität zu Berlin(柏林洪堡大学) U AI(5U AI) Technische Universität Berlin & BIFOLD(柏林工业大学 & BIFOLD)

专题命中 评测与基准 :foundation model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出REMSA,一种基于结构化数据库RS-FMD的约束感知代理,通过自然语言查询自动选择遥感基础模型,结合元数据检索与上下文学习,在专家评估基准中优于多种基线。

Comments Code and data available at https://github.com/be-chen/REMSA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12966 2026-06-10 cs.CL cs.SE 版本更新 85%

ProbeLLM: Automating Principled Diagnosis of LLM Failures

ProbeLLM:自动化的大语言模型故障原则性诊断

Yue Huang, Zhengzhe Jiang, Yuchen Ma, Yu Jiang, Xiangqi Wang, Yujun Zhou, Yuexing Hao, Kehan Guo, Pin-Yu Chen, Stefan Feuerriegel, Xiangliang Zhang

机构 * University of Notre Dame(诺丁汉大学) LMU Munich(慕尼黑大学) Massachusetts Institute of Technology(麻省理工学院) IBM Research(IBM研究院)

专题命中 评测与基准 :LLM(title,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出ProbeLLM框架,通过分层蒙特卡洛树搜索在全局探索与局部细化间分配预算,结合工具增强生成与验证,将故障发现从孤立案例提升为结构化故障模式,揭示更广泛、清晰、细粒度的故障景观。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22888 2026-07-30 cs.CL cs.AI 版本更新 85%

DialectLLM: A Dialect-Aware Dialog[ue] Generation Framework Beyond Standard American English

DialectLLM:一种超越标准美式英语的方言感知对话生成框架

Jio Oh, Paul Vicinanza, Thomas Butler, Steven Euijong Whang, Dezhi Hong, Amani Namboori

机构 * KAIST(韩国科学技术院) Amazon(亚马逊)

专题命中 评测与基准 :LLM(summary_cn,abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 DialectLLM通过生成多方言对话数据,解决LLM对非标准方言识别不足的问题,验证了方言特征对生成质量的影响,展示了其在对话生成中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02951 2026-07-14 cs.CL cs.AI 版本更新 85%

How Annotation Trains Annotators: Competence Development in Social Influence Recognition

标注如何训练标注者:社会影响识别中的能力发展

Maciej Markiewicz, Beata Bajcar, Wiktoria Mieleszczenko-Kowszewicz, Aleksander Szczęsny, Tomasz Adamczyk, Grzegorz Chodak, Karolina Ostrowska, Aleksandra Sawczuk, Jolanta Babiak, Jagoda Szklarczyk, Przemysław Kazienko

机构 * Wrocław University of Science and Technology(弗罗茨瓦夫科技大学) University of Silesia in Katowice(卡托维兹西里西亚大学) SWPS University(SWPS大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了标注过程中标注者能力的变化,通过分析25名标注者对1021条对话的标注,发现标注者自我感知能力提升,专家组效果更显著,影响了基于其标注数据训练的LLM性能。

Comments Accepted to AIED 2026 (27th Conference on Artificial Intelligence in Education)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04484 2026-07-03 cs.CL cs.AI 版本更新 85%

Psychological Steering in LLMs: An Evaluation of Effectiveness and Trustworthiness

LLMs中的心理引导:有效性与可信度评估

Amin Banayeeanzade, Ala N. Tak, Fatemeh Bahrani, Anahita Bolourani, Leonardo Blas, Emilio Ferrara, Jonathan Gratch, Sai Praneeth Karimireddy

专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 提出PsySET基准,评估提示、微调和表示工程等策略在控制LLM情绪和人格方面的效果与可信度,发现提示有效但强度控制有限,向量注入控制更精细但输出质量略降,且情绪引导可能产生副作用。

Comments Accepted at ACL 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27914 2026-06-10 cs.CL cs.AI 版本更新 85%

Does Capability Transfer to Subjective Behavior -- and Would Our Instruments Tell Us? A Self-Evolving, Trust-by-Construction Evaluation Paradigm

让结果说话:LLM行为基准测试的复制优先范式

Yuming, Huang, Yao Liu, Pengjie Ding, Lei Wang, Junchen Wan

机构 * Cylingo team(Cylingo团队)

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.CL、cs.AI

AI总结 提出复制优先范式,通过可靠性、跨仪器复制、历史足迹校准和预注册预测四个正交属性验证LLM行为评估工具,并在情感陪伴任务中测试,发现聚合分数掩盖的模型退化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04123 2026-06-08 cs.CY cs.AI cs.LG cs.SE 版本更新 85%

Measuring Agents in Production

生产环境中的智能体测量

Melissa Z. Pan, Negar Arabzadeh, Riccardo Cogo, Yuxuan Zhu, Alexander Xiong, Lakshya A Agrawal, Huanzhi Mao, Emma Shen, Sid Pallerla, Liana Patel, Shu Liu, Tianneng Shi, Xiaoyuan Liu, Jared Quincy Davis, Emmanuele Lacavalla, Alessandro Basile, Shuyi Yang, Paul Castro, Daniel Kang, Koushik Sen, Dawn Song, Joseph E. Gonzalez, Ion Stoica, Matei Zaharia, Marquita Ellis

机构 * University of California at Berkeley(加州大学伯克利分校) IBM Research(IBM研究院) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stanford University(斯坦福大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 通过对86个已部署系统的调查和20个案例研究,发现生产环境中的LLM智能体主要采用简单可控的方法,可靠性是首要挑战,并依赖系统级设计和人工评估。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026) as Oral Presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03508 2026-08-14 cs.CV 版本更新 85%

From Multi-Resolution Cells to Gigapixel Whole Slide Images Foundation Model for Computational Pathology

从多分辨率细胞到千兆像素全切片图像:用于计算病理学的基础模型

Basit Alawode, Moshira Ali Abdalla, Dwarikanath Mahapatra, Muzammal Naseer, Sajid Javed

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract)

AI总结 针对现有计算病理学模型泛化性受限的问题,提出多分辨率金字塔Transformer(MRPT),经多分辨率自监督预训练后,在34个数据集的多项任务中性能优于同类模型与多模态大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25005 2026-08-14 cs.SE 版本更新 85%

Error Understanding in Program Code: A Systematic Study of LLM-DL Combinations for Multi-label Classification

利用LLM-DL进行程序代码错误理解的多标签分类

Md Faizul Ibne Amin, Yutaka Watanobe, Md. Mostafizer Rahman, Daniel M. Muepu, Md. Shahajada Mia

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本文提出一种结合预训练语义编码器与高效递归解码器的多标签错误分类框架,通过实验验证其在编程教育和软件工程领域的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23999 2026-08-11 cs.CR 版本更新 85%

ContainmentBench: Trace-Based Evaluation of Post-Exposure Containment in Tool-Using LLM Agents

ContainmentBench:基于跟踪的工具使用大型语言模型代理注入后遏制评估

Wenhao Lan, Shan Li, Meiqi Wu, Xinhua Lai, Junbin Yang, Haihua Shen

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究针对工具使用的大型语言模型代理注入后遏制评估问题,引入ContainmentBench基准,分别测量端点策略合规性等。通过对Qwen2.5 - 7B - Instruct研究发现,终端策略标签不充分,评估应分别报告多方面证据,还给出不同策略的工作流程完成率等结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11183 2026-08-06 cs.CL cs.AI cs.LG 版本更新 85%

Amplitude-Only FFN Intervention for Tool-Structured LLM Inference Method: Gated Evaluation Protocol, and Cross-Model Empirical Results

用于工具结构化大语言模型推理方法的仅幅度前馈网络干预:门控评估协议及跨模型实证结果

Sheng Xu, Zhen Chen, Junhua Wang, Boyuan Huang, Ke Jia, Jiadun Zhu, Yiming Xu

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究推理时FFN干预改善大语言模型结构化输出,提出无损的幅度门控方法,定义细粒度干预系统和评估协议。在多个模型上实验,AG在工具结构化任务中效果最佳,不同AG变体各有优劣,确定工具结构化推理是FFN级推理优化首要目标。

Comments 30 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12281 2026-07-21 cs.CV 版本更新 85%

Cognitive-YOLO: LLM-Driven Architecture Synthesis from First Principles of Data for Object Detection

认知YOLO:基于数据第一性原理的大语言模型驱动的架构合成用于目标检测

Jiahao Zhao

机构 * Xi’an University of Posts and Telecommunications(西安邮电大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 针对通用目标检测算法在垂直场景的问题,认知YOLO利用大语言模型与自主智能体协作,构建“分析-合成-编译”管道,合成轻量级模型,显著压缩参数数量,在mAP@0.5:0.95上表现良好,平衡了模型紧凑性和特征表示能力。

Comments 11 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14835 2026-07-20 cs.IR 版本更新 85%

LLM-Based Re-Ranking for Real Estate Search

基于大语言模型的房地产搜索重排

Nkateko Ntimane, Rafael Guedes, Tiago Cunha, Pedro Nogueira

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 针对拉丁美洲住房市场搜索难题及用户期望变化,提出基于大语言模型的重排器,依用户对话意图重排候选房源,构建评估数据集并验证,提升了搜索重排质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10002 2026-07-07 cs.CL cs.AI cs.LG 版本更新 85%

SpreadsheetArena: Decomposing Preference in LLM Generation of Spreadsheet Workbooks

电子表格竞技场:在大型语言模型生成电子表格工作簿中分解偏好

Srivatsa Kundurthy, Clara Na, Michael Handley, Zach Kirshner, Chen Bo Calvin Zhang, Manasi Sharma, Emma Strubell, John Ling

专题命中 评测与基准 :LLM(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究端到端电子表格生成任务,介绍SpreadsheetArena平台通过大型语言模型生成的工作簿的盲选成对偏好投票评估模型,指出该任务挑战机遇,发布数据集以助进一步研究。

Comments 35 pages. ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏