arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2611 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2611 篇

2607.28307 2026-07-31 cs.SE cs.AI 新提交 89%

From Textual Requirements to Microservice Architectures - A Comprehensive Evaluation of LLM-Based Design Synthesis

从文本需求到微服务架构 —— 基于大语言模型的设计合成综合评估

Danyllo Albuquerque, José Renan, Guillermo Rodríguez, Guillermo Rodríguez, Emanuel Dantas, Ademar França, Mirko Perkusich, Kyller Gorgônio, Angelo Perkusich

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究探讨OpenAI o3能否仅从文本需求生成微服务架构,经实验发现少样本提示下其服务识别与通信恢复的一致性优于零样本,为需求驱动的架构合成提供了潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08117 2026-07-10 cs.CL 新提交 89%

COALA: Robust Contextualized Speech-augmented Language Modeling for ASR via Contrastive Regularizer and Biasing Score Estimation

COALA:通过对比正则化器和偏差分数估计实现用于ASR的鲁棒上下文语音增强语言建模

Jhih-Rong Guo, Bi-Cheng Yan, Tien-Hong Lo, Berlin Chen

机构 * National Taiwan Normal University(国立台湾师范大学)

专题命中 评测与基准 :SLM(summary_cn,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究旨在增强复杂多实体场景中的语音增强语言模型,提出COALA框架,通过将SLM潜在表示映射到判别空间量化匹配强度,并解决训练崩溃问题,在LibriSpeech基准上实现了卓越的上下文偏差性能。

Comments Accepted at INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01293 2026-07-03 cs.CL 新提交 89%

RuleChef: Grounding LLM Task Knowledge in Human-Editable Rules

RuleChef:将LLM任务知识扎根于可人工编辑的规则

Ádám Kovács, Nadia Verdha, Gábor Recski

机构 * KR Labs(KR实验室) TU Wien(维也纳工业大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出RuleChef框架,利用大语言模型为NLP任务生成可执行规则,并通过示例和人工反馈迭代优化,最终得到快速、确定且可检查的规则系统。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31630 2026-07-01 cs.LG 新提交 89%

Calibration, Not Compilation: Detecting and Repairing Misspecified Probabilistic Programs Written by Language Models

校准,而非编译:检测和修复语言模型编写的错误指定概率程序

Jian Xu, Delu Zeng, John Paisley, Qibin Zhao

机构 * RIKEN iTHEMS RIKEN AIP South China University of Technology(南方科技大学) Columbia University(哥伦比亚大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文提出用贝叶斯工作流(后验预测检查、模拟校准等)作为验证器,检测和修复LLM编写的概率程序中的统计错误,在检测(AUC 0.97)和修复(显著优于单元测试反馈)上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28061 2026-06-29 cs.CR cs.AI 新提交 89%

ToolPrivacyBench: Benchmarking Purpose-Bound Privacy in Tool-Using LLM Agents

ToolPrivacyBench: 对使用工具的LLM代理进行目的绑定隐私基准测试

Shijing Hu, Liang Liu, Zhu Meng, Zhicheng Zhao

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing(北京未来区块链与隐私计算先进创新中心)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对现有评估忽略多工具轨迹中目的绑定信息流的问题,提出ToolPrivacyBench基准,通过策略知识库审计工具参数和后端日志,评估任务完成与隐私过度披露,发现成功执行任务可能伴随不必要的隐私泄露。

Comments 24 pages, 7 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21844 2026-06-23 cs.CL cs.CY 新提交 89%

Inverse Turing Bench: Evaluating Language Models as Judges of Human vs. AI Dialogue

逆图灵基准:评估语言模型作为人类与AI对话的裁判

William Hager, Ishika Rathi, Masum Hasan, Cameron Jones

机构 * University of Rochester(罗切斯特大学) Stony Brook University(石溪大学) Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title);prompting(abstract);分类 cs.CL

AI总结 提出逆图灵基准,评估LLM区分人类与AI多轮对话的能力,发现GPTZero、Claude Opus-4.6和GPT-5.5准确率最高,统计方法有语义盲点而语义方法易受角色提示影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11976 2026-06-11 cs.SE cs.AI 新提交 89%

Exploration Structure in LLM Agents for Multi-File Change Localization

LLM代理中的探索结构用于多文件变更定位

Akeela Darryl Fattha, Kia Ying Chua, Lingxiao Jiang, Laura Wynter

机构 * School of Computing and Information Systems, Singapore Management University(计算与信息系统学院,新加坡国立管理学院)

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);分类 cs.AI

AI总结 针对多子系统变更场景,提出非线性、领域范围的并行代理探索结构,在SWE Bench Pro基准上,小规模Haiku类模型通过领域代理并行生成实现高微F1分数,优于线性顺序探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11625 2026-06-11 cs.LG 新提交 89%

TimeRouter: Efficient and Adaptive Routing of Time-Series Foundation Models

TimeRouter: 时间序列基础模型的高效自适应路由

Kanghui Ning, Yushan Jiang, Kashif Rasul, Anderson Schneider, Yuriy Nevmyvaka, Dongjin Song

机构 * University of Connecticut(康涅狄格大学) Salesforce AI Research JP Morgan AI Research(摩根大通人工智能研究院)

专题命中 评测与基准 :LLM(summary_cn,abstract);foundation model(title,abstract);分类 cs.LG

AI总结 提出TimeRouter框架,通过轻量判别路由、选择性门控和集成回退实现时间序列基础模型的自适应选择,无需LLM推理,在GIFT-EVAL榜单取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12342 2026-08-14 cs.CL cs.LG 新提交 88%

Are Large Language Models Reliable Reviewers? A Benchmark for Error Detection in Financial Documents

大语言模型是可靠的评审者吗?面向金融文档错误检测的基准测试

Ying He, Zhouhong Gu, Zhecheng Hu, Yubo Zhou, Hao Shen, Jiaqing Liang, Zhaoqian Dai, Shuguang Ma, Fei Yu, Yanghua Xiao, Zhixu Li

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) School of Data Science, Fudan University(复旦大学数据科学学院) Ant Group(蚂蚁集团) School of Information and School of Smart Governance, Renmin University of China(中国人民大学信息学院与智慧治理学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文构建首个金融错误检测基准FinED-Bench,评估发现当前LLMs难胜任高复杂度金融文档错误检测任务,监督微调可提升弱模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08652 2026-08-11 cs.LG cs.AI 新提交 88%

LegoLM: Structured Weight Sharing for Large Language Models

LegoLM:面向大语言模型的结构化权重共享压缩框架

Joseph Bingham

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 LegoLM针对大语言模型全局权重共享的两种失效模式,提出三种无数据适配策略,在GPT-2 small和Mistral-7B上实现优于PTQ-8bit的压缩效果与精度,证实选择性替换是核心机制。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07535 2026-08-11 cs.LG cs.AI cs.CY 新提交 88%

Evolving Safety Landscape of Multi-modal Large Language Models: A Survey of Emerging Threats and Safeguards

多模态大语言模型的演进安全态势:新兴威胁与防护措施综述

Xi Li, Shu Zhao, Xiaohan Zou, Fei Zhao, Fuxiao Liu, Yusen Zhang, Cheng Han, Yushun Dong, Jiaqi Wang

机构 * University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) NVIDIA(英伟达公司) Penn State University(宾夕法尼亚州立大学) Columbia University(哥伦比亚大学) University of Missouri-Kansas City(密苏里大学堪萨斯分校) Florida State University(佛罗里达州立大学) Auburn University(奥本大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本综述针对多模态大语言模型(MLLMs)的新型安全威胁,提出多模态安全威胁分类法,梳理安全策略进展,探讨未来安全机制的研究方向。

Comments Accepted at the ICLR 2026 Workshop on Principled Design for Trustworthy AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20476 2026-07-24 cs.AI cs.CL 新提交 88%

Benchmarking Large Language Models on Multi-Sensor Physical Hazard Assessment

在多传感器物理危害评估中对大语言模型进行基准测试

Faizan Iqbal

机构 * Lovely Professional University(可爱专业大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究五个大语言模型对多传感器物理危害数据的评估,通过1800次API调用测试60个场景,发现模型在多传感器场景表现不佳,单传感器场景表现良好,且结构化表格格式优势不明显,为从业者提供了模型应用参考。

Comments 14 pages, 6 figures. Benchmark dataset, evaluation code, and raw results publicly available at: https://github.com/Faizaniqbal52/PhysicalHazardBenchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20454 2026-07-24 cs.CL cs.AI 新提交 88%

Response drift across frontier large language models

前沿大语言模型中的响应漂移

Mohammed Aledhari, Ali Aledhari, Fatimah Aledhari, Gowtham Venkat Eathamokkala, Mohamed Rahouti

机构 * University of North Texas(北德克萨斯大学) Fordham University(福特汉姆大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究前沿大语言模型的响应漂移问题,通过47名参与者对十个模型的62个多领域问题进行盲测评估,发现各模型漂移程度不同,依赖领域和问题,且自动指标解释方差低,揭示需以人类评估了解漂移情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16777 2026-07-21 cs.CL cs.AI 新提交 88%

JOR-Bench: Japanese Operations Research Benchmarks for Large Language Models

JOR-Bench:用于大语言模型的日语运筹学基准测试

Yuu Jinnai

机构 * CyberAgent

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 JOR-Bench是用于评估大语言模型解决运筹学问题能力的日语基准测试集,涵盖多种规划问题。通过评估七个LLMs的英文和日语版本,发现多语言模型的OR制定能力语言中立,但存在跨语言差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15414 2026-07-20 cs.LG cs.AI q-fin.CP 新提交 88%

AI Trading: Evaluating Large Language Models for Technical Market Analysis

人工智能交易:评估用于技术市场分析的大语言模型

Geofrey Ntale

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文系统比较评估五个大语言模型用于技术市场分析的能力,涵盖四项任务,采用多种定量指标。实验发现GPT-4 Turbo在通用模型中年化回报和夏普比率最高,FinGPT经领域微调表现出色,二者均超标准普尔500指数基准,还识别出模型存在的问题及得出相关结论。

Comments Master's research paper, Georgia Institute of Technology. 31 pages, 4 figures

Journal ref Georgia Institute of Technology, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06940 2026-07-09 cs.CL cs.AI 新提交 88%

Comprehensive Evaluation of Large Language Model Responses: A Multi-Factor Scoring System

大语言模型回答的综合评估:一种多因素评分系统

Yiming Gai, Junde Lu, Xuefei Huang

机构 * School of Computer Science and Engineering, Beihang University, Beijing, China(北京航空航天大学计算机科学与工程学院) Data Science and Intelligent Computing Laboratory, Hangzhou International Innovation Institute, Beihang University, Hangzhou, Zhejiang(北京航空航天大学杭州国际创新研究院数据科学与智能计算实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型回答质量评估,提出多因素评分范式,融合准确性等多方面因素,通过图形用户界面可视化结果,在TruthfulQA数据集上评估揭示模型优缺点,为知识工程和模型优化提供新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01548 2026-07-03 cs.LG cs.AI 新提交 88%

Evolutionary Feature Engineering for Structured Data

结构化数据的进化特征工程

Ege Onur Taga, Yilin Zhuang, M. Emrullah Ildiz, Petros Mol, Abhimanyu Das, Karthik Duraisamy, Samet Oymak

机构 * University of Michigan(密歇根大学) Google Research(谷歌研究院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 提出基于LLM进化的特征工程框架EFE,通过Python程序表示变换,利用数据集上下文和验证集性能反馈优化,在时间序列和表格预测任务中提升准确性和可解释性。

Comments 9 page main content, 41 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19788 2026-06-19 cs.AI cs.CL 新提交 88%

CombEval: A Framework for Evaluating Combinatorial Counting in Large Language Models

CombEval:评估大语言模型中组合计数的框架

Yuxu Zhou, Ondřej Kuželka, Yuyi Wang, Yuanhong Wang, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Czech Technical University in Prague(捷克布拉格理工大学) CRRC Zhuzhou Institute(中车株洲研究所) Tengen Intelligence Institute(天元智能研究院) International Center of Future Science, Jilin University(吉林大学未来科学国际合作中心) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE(教育部知识驱动人机智能工程研究中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 提出CombEval动态基准,通过类型化Cofola规范生成组合计数问题,评估11个大语言模型在直接和代码增强设置下的表现,发现模型在有序对象、不可区分元素、相对位置约束和嵌套对象依赖上存在脆弱性。

Comments under review. Code: https://github.com/YuxuZhou-CN/combination-problem-generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17474 2026-06-17 cs.CL cs.AI 新提交 88%

AIPatient Arena: EHR-grounded evaluation of large language models in end-to-end clinical consultation workflows

AIPatient Arena:基于电子健康记录的大语言模型在端到端临床咨询工作流中的评估

Jiahui Niu, Huizi Yu, Wenkong Wang, Guangxin Dai, Jingxian He, Xiang Li, Zhiying Liang, Xinxin Lin, Kent CY So, Bryan YP Yan, Yun Kwok Wing, Yanqiu Xing, Xin Ma, Lizhou Fan

机构 * School of Control Science and Engineering, Shandong University(控制科学与工程学院,山东大学) Key Laboratory of Machine Intelligence and System Control, Shandong University(机器智能与系统控制重点实验室,山东大学) Department of Medicine and Therapeutics, The Chinese University of Hong Kong(医学与治疗学系,香港中文大学) Department of Geriatric Medicine, Qilu Hospital of Shandong University(老年医学科,山东大学齐鲁医院) Department of Psychiatry, The Chinese University of Hong Kong(精神病学系,香港中文大学) Li Chiu Kong Family Sleep Assessment Unit, Department of Psychiatry, Faculty of Medicine, The Chinese University of Hong Kong(李秋虹家庭睡眠评估单元,精神病学系,医学院,香港中文大学) Li Ka Shing Institute of Health Sciences, Faculty of Medicine, The Chinese University of Hong Kong(李嘉诚健康科学研究院,医学院,香港中文大学) Gerald Choa Neuroscience Institute, Department of Medicine and Therapeutics, The Chinese University of Hong Kong(Gerald Choa 神经科学研究所,医学与治疗学系,香港中文大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 提出AIPatient Arena框架,通过电子健康记录构建患者知识图谱,在多轮医患交互中评估大语言模型的八项临床能力,发现模型在信息覆盖、诊断推理等方面存在不足,强调过程评估的重要性。

Comments 49 pages, 12 figues, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16240 2026-06-16 cs.CL cs.LG 新提交 88%

Creative Collision: Directorial Persona Steering and Competition in Large Language Models

创意碰撞:大型语言模型中的导演人格引导与竞争

Subramanyam Sahoo, Justin Shenk

机构 * AI Safety Camp(AI安全训练营)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 研究通过叠加两种语义相反的导演人格向量(斯皮尔伯格与斯科塞斯)来引导语言模型生成,发现斯皮尔伯格向量主导道德倾向,中间点提升连贯性,且两者在特定层共享道德基调基底。

Comments Accepted at ICML 2026 Workshop on Human-AI Co-Creativity

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08381 2026-06-09 cs.CL cs.AI 新提交 88%

Auditing Proprietary Alignment in Large Language Models: A Comparative Framework Without a Ground-Truth Standard

审计大型语言模型中的专有对齐:一种无需真实标准的比较框架

Alireza Arbabi, Florian Kerschbaum

机构 * University of Waterloo(滑铁卢大学) Vector Institute(向量研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 提出一种统计框架,通过比较目标模型与基线模型在共享语义空间中的响应偏差,检测黑盒语言模型中的专有对齐行为,无需真实标准即可实现外部审计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07696 2026-06-09 cs.LG cs.AI 新提交 88%

Adversarial Robustness of Activation Steering in Large Language Models

大型语言模型中激活引导的对抗鲁棒性

Kien Le, Thai Le

机构 * Independent Researcher(独立研究员) Indiana University(印第安纳大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 研究激活引导在对抗性文本扰动下的鲁棒性,发现所有方法、模型和设置中方向鲁棒性下降高达64%,置信度崩溃,层选择脆弱,揭示其结构性脆弱性。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10213 2026-08-12 cs.CE 新提交 88%

VeriFin: A Neurosymbolic Framework for Verifying LLM-Generated Financial Claims

VeriFin:用于验证大语言模型生成的财务声明的神经符号框架

Bethel Hall, Sachi Shome, William Eiers

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 研究针对LLM生成财务声明易出错的问题,提出神经符号框架VeriFin,基于XBRL事实与Z3验证,在XBRLFiling和FinanceBench基准上实现零错误接受,还可通过求解器反馈提升修复效果。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04302 2026-08-06 cs.CV cs.IR cs.MM 新提交 88%

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models

CLIP-CC-Bench:评估视频语言模型中的段落级视频描述

Mukhtiar Ali, Harsh Dubey, Sugam Mishra, Chulwoo Pack

机构 * South Dakota State University(南达科他州立大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title,abstract)

AI总结 CLIP-CC-Bench是针对视频语言模型的长篇段落级视频描述评估套件,采用多LLM嵌入模型集成与粗细粒度语义匹配方法,评估17种模型填补了现有短片段基准的空白。

Comments Accepted and presented at EvalMG 2026, the Second Workshop on Evaluation for Multimodal Generation, co-located with ACM SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29252 2026-08-03 cs.CL cs.AI cs.LG 新提交 88%

CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation

CalibratedRubric:面向开放式大语言模型评估的任务自适应评分规则库

Mengting Chen, Yanshu Sun, Wanting Liang, Beidi Luan, Rui Sun, Dezhi Chen, Jing Li, Zuo Bai

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 CalibratedRubric是结合特定类型评分、贝叶斯过滤与IRT的任务自适应框架,可提升开放式LLM评估的人工-黄金标准一致性与排序保真度,减少所需评分规则数量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20485 2026-07-24 cs.AI cs.CL cs.LG 新提交 88%

Expectation Alignment of Language Models for Real-World User Expectations

语言模型与现实世界用户期望的期望对齐

Miaomiao Li, Yang Wang, Bin Liang, Shudong Liu, Zhiwei Zhang, Kam-Fai Wong

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究LLMs是否满足用户期望,提出提取期望程序并引入ExpectBench基准,分析发现LLMs存在问题,进而提出LENS框架,可让模型内化期望以生成更契合的响应,凸显明确建模用户期望对实现现实人机对齐的重要性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10080 2026-07-14 cs.IR 新提交 88%

The Effect of Multi-Lingual and Keyword Adversarial Injection on LLM Relevance Judgment

多语言和关键词对抗性注入对大语言模型相关性判断的影响

Nguyen Khoi Vo, Duy Duong Tuong, Oleg Zendel, Mark Sanderson

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究跨语言提示注入攻击对基于大语言模型的相关性判断的影响,利用TREC数据集和开放权重模型在多语言环境下研究不同注入策略,发现多语言查询注入有效且能绕过现有防御,凸显当前防御差距,强调需更强大评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04061 2026-07-07 cs.CL cs.AI cs.LG stat.ML 新提交 88%

Telescope: Improving Zero Shot Detection of LLM Generated Content By Measuring Token Repetition Probability

望远镜:通过测量令牌重复概率改进大语言模型生成内容的零样本检测

Christopher Nassif, Josh F. Cooper

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究区分大语言模型生成文本与人类写作的难题,提出用望远镜困惑度衡量模型令牌重复,揭示该特征在预训练早期出现,能有效进行零样本检测,性能优于其他方法。

Comments 50 pages, ICML, 20 figures, Equal contribution

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00939 2026-07-02 cs.SE quant-ph 新提交 88%

Leveraging LLM-Based Agentic Systems to Generate Quantum Applications for Test Optimization

利用基于LLM的代理系统生成量子应用以优化测试

Ming Tao, Yuechen Li, Tao Yue, Man Zhang, Aitor Arrieta Marcos

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出QPipe,一种基于大语言模型的多代理架构,自动将自然语言需求转化为可执行的量子应用工作流,在测试优化问题上实现高编译率和执行率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27619 2026-06-29 cs.AI cs.CL cs.HC cs.IR cs.LG 新提交 88%

DysLexLens: A Low-Resource LLM Framework for Analysing Dyslexic Learners Insights from Online Forums

DysLexLens:面向低资源场景的LLM框架,用于分析在线论坛中阅读障碍学习者的见解

Dana Rezazadegan, Atie Kia, Phongpadid Nandavong, Dominique Carlon, Jeremy Nguyen, Abhik Banerjee, James Marshall, Anthony McCosker, Yong-Bin Kang

机构 * Swinburne University of Technology(斯威本科技大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出DysLexLens框架,通过字典过滤、知识图谱推理和评估机制,从低资源论坛数据中分析阅读障碍学习者对AI工具的使用体验。

详情

展开后加载摘要…

URL PDF HTML 收藏