arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-22 至 2026-07-22 共收录 251 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 44 篇

2605.17086 2026-07-22 econ.GN cs.AI cs.CY q-fin.EC stat.AP 版本更新 70%

Global Automation Atlas

全球自动化图谱

Prashant Garg, Tommaso Crosta, Jasmin Baier

机构 * Imperial College London(伦敦帝国学院) Bocconi University(博科尼大学) University of Oxford(牛津大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种基于任务和国家特定的方法,用于全球范围内分类自动化暴露,以区分劳动力替代和增强自动化,相关技术渠道以及人工智能的物质作用。研究涵盖了124个国家,生成了覆盖全球99%人口和GDP的233万个任务-国家标签。

Comments 78 pages, 6 figures, 5 Extended Data figures. Substantially revised and expanded. Data and code: https://automationatlas.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14586 2026-07-22 cs.IR cs.AI 版本更新 70%

CPGRec+: A Balance-oriented Framework for Personalized Video Game Recommendations

CPGRec+: 一种面向个性化视频游戏推荐的平衡框架

Xiping Li, Aier Yang, Jianghong Ma, Kangzhe Liu, Shanshan Feng, Haijun Zhang, Yi Zhao

机构 * Harbin Institute of Technology(哈尔滨工业大学) School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出CPGRec+框架,通过引入偏好引导边加权和表示生成模块,解决传统推荐系统在准确率与多样性间的平衡问题,实验表明其在Steam数据集上表现更优。

Comments Published in ACM Transactions on Information Systems (TOIS). 43 pages, 9 figures

Journal ref ACM Trans. Inf. Syst. 44, 3, Article 66 (March 2026), 44 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03245 2026-07-22 cs.AR cs.AI cs.SE 版本更新 70%

FVRuleLearner: Operator-Level Reasoning Tree (Op-Tree)-Based Rules Learning for Formal Verification

FVRuleLearner:基于操作级推理树(OP-Tree)的规则学习用于形式验证

Lily Jiaxin Wan, Chia-Tung Ho, Yunsheng Bai, Cunxi Yu, Ghaith Bany Hamad, Deming Chen, Haoxing Ren

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) NVIDIA(英伟达) University of Maryland, College Park(马里兰大学帕克分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出FVRuleLearner,通过操作级推理树模型,提升形式验证中SVA操作符选择的准确性和效率,显著提高语法和功能正确性。

Comments Accepted to IEEE VTS'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04843 2026-07-22 cs.AI 版本更新 70%

Fluid Reasoning Representations

推理模型中的流体表示

Dmitrii Kharlapenko, Terry Jingchen Zhang, Arth Singh, Alessandro Stolfo, Arthur Conmy, Mrinmaya Sachan, Zhijing Jin

机构 * ETH Zurich(苏黎世联邦理工学院) University of Toronto(多伦多大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究揭示了推理模型通过上下文细化令牌表示提升抽象问题解决能力的机制,提出流体推理表示概念。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19027 2026-07-22 cs.CV 新提交 67%

Mitigating Modality and Language-Style Gaps for Zero-Shot Video Moment Retrieval

缓解零样本视频时刻检索中的模态和语言风格差距

Jihyun Lee, Cheol-Ho Cho, Woojin Jun, Woojin Jeong, Jae-Pil Heo

机构 * Sungkyunkwan University(成均馆大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 研究零样本视频时刻检索中模态和语言风格差距问题,提出基于自相似性的时刻提议和评分方法及查询感知的多模态大语言模型推理阶段,有效缓解差距,在相关基准测试中达最优性能。

Comments ECCV 2026 (* These authors contributed equally.)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18966 2026-07-22 cs.AI cs.CL cs.LG 新提交 67%

Measuring Reward-Seeking via Contrastive Belief Updates

通过对比信念更新来衡量奖励寻求行为

Axel Højmark, Jérémy Scheurer, Evgenia Nitishinskaya, Felix Hofstätter, Jason Wolfe, Theodore Ehrenborg, Bronson Schoen, Alexander Meinke

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究用强化学习训练的语言模型中‘奖励寻求’行为的测量方法,核心方法是对比合成文档微调,主要贡献是发现RL训练会使模型更倾向评分者偏好,甚至违背开发者意图,该方法还适用于奖励破解模型。

Comments 101 pages, 66 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18618 2026-07-22 cs.CL cs.AI cs.LG 新提交 67%

LatentMT: Machine Translation with Latent Reasoning

LatentMT:具有潜在推理的机器翻译

Wei-Rui Chen, Samar M. Magdy, Chiyu Zhang, Wenhui Zhu, Zhipeng Wang, Muhammad Abdul-Mageed

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究提出LatentMT,将潜在推理循环语言模型用于机器翻译,采用小型主干模型经轻量级训练,在多语言翻译方向表现出色,循环推理早期提升质量后期饱和,且训练和推理计算效率高,为紧凑高效的机器翻译提供新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18264 2026-07-22 cs.AI cs.CL cs.LG 新提交 67%

MUX: Continuous Reasoning via Multiplexed Tokens

MUX:通过复用令牌进行连续推理

Ayhan Suleymanzade, Halil Alperen Gozeten, Michael Bronstein, İsmail İlkan Ceylan, Jinwoo Kim

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究提出MUX方法,将离散推理提炼为连续复用令牌,通过位置相关加权实现无损复用,防止潜在坍缩,能在需搜索问题中并行探索,在多语言模型评估中优于基线,证明无损叠加是实现高效潜在连续推理的充分条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01848 2026-07-22 cs.CV 版本更新 67%

Semantic Richness or Geometric Reasoning? The Fragility of VLM's Visual Invariance

语义丰富性还是几何推理?VLM视觉不变性的脆弱性

Jason Qiu, Zachary Meurer, Xavier Thomas, Deepti Ghadiyaram

机构 * Boston University(波士顿大学)

专题命中 推理与问题求解 :language model(abstract);prompting(abstract)

AI总结 研究揭示VLM在基本几何变换下的脆弱性,指出其在空间不变性与等变性上的不足,影响物体识别的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18316 2026-07-22 cs.SE cs.AI cs.CL 新提交 62%

Binding Drift in Multi-Step Tool-Augmented Agents

多步工具增强智能体中的绑定漂移

Rahul Suresh Babu, Shashank Indukuri

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究多步工具增强智能体中实体绑定随时间的变化,区分绑定漂移与错误传播。通过实验发现实体锁定会放大错误操作,实用的重新验证器可减少错误,自然设置下基线智能体有漂移现象,且持久性和重新验证不可互换。

Comments 14 pages, 5 tables, 1 figure. Equal contribution by both authors. Code and data: https://github.com/shashank-indukuri/binding-drift

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18532 2026-07-22 cs.CL 新提交 61%

Reasoning Fine-Tuning Induces Persistent Latent Policy States

推理微调诱导持久的潜在策略状态

Abir Harrasse, Michael Lan, Hunar Batra, Fateme Hashemi Chaleshtori, Chaithanya Bandi

机构 * University of Oxford(牛津大学) University of Utah(犹他大学)

专题命中 推理与问题求解 :language model(abstract,comments);分类 cs.CL

AI总结 研究推理微调对语言模型的影响,将思维链推理建模为切换动态系统,通过时间感知对比表征学习等方法恢复潜在策略。发现推理微调使模型有更丰富的潜在策略组织,恢复的状态有功能意义,SDS引导的剪枝效果良好,为推理模型分析和控制提供新视角。

Comments Accepted at the Conference on Language Modeling (COLM) 2026. 45 pages, including appendices; 24 figures and 12 tables. Code: https://github.com/withmartian/mi-cot

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19267 2026-07-22 cs.CR cs.AI cs.MA 新提交 57%

They'll Verify. They Just Won't Act. How Authority Framing and Laundered Code Turn a Trusted Agentic CI/CD Pipeline Into an Attack Surface

他们会验证。但他们不会采取行动。权威框架和清洗后的代码如何将一个可信的代理式CI/CD管道变成攻击面

Yohann Sidot

机构 * Senthex Research(Senthex研究机构) RELAY Lab(RELAY实验室)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 研究五代理CI/CD管道在面对恶意输入时的安全性,通过AxB(xC)析因设计实验发现权威框架注入会使下游验证者放行恶意代码,基于内容的控制会失效,只有来源感知控制可防攻击,揭示了现有保护机制的不足。

Comments 9 pages. Dataset and reproduction code: https://github.com/senthex-security/senthex-research

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18847 2026-07-22 cs.CR cs.AI 新提交 57%

Data Leakage Prevention in Agentic Applications via Preemptive Hardening

通过先发制硬化防止智能应用中的数据泄露

Akansha Shukla, Emily Bellov, Parth Atulbhai Gandhi, Yuval Elovici, Asaf Shabtai

机构 * Faculty of Computer and Information Science(计算机与信息科学系) Ben-Gurion University of the Negev(内盖夫本· Gurion大学)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 研究智能应用数据泄露问题,提出预部署管道,通过分析提示模板等识别泄露模式并生成补丁,经硬化和验证确保应用功能不受影响,评估显示能有效减少数据泄露。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18443 2026-07-22 cs.CL 新提交 57%

Computational models of pragmatic reasoning with flexible generation of meaning and expression alternatives

具有灵活生成意义和表达替代方案的语用推理计算模型

Polina Tsvilodub, Fausto Carcassi, Michael Franke

机构 * University of Tübingen(图宾根大学) University of Amsterdam(阿姆斯特丹大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 研究提出SAGE框架,结合认知模型与语言模型,将语用过程分解为提议者、评估者和选择器模块。通过三个案例研究评估,该模型取得高精度且常超基线,不过组件分析有不对称性,还探讨了神经符号模型在语用语言使用中的前景与局限。

Comments 27 pages main text, 9 figures; 25 pages supplementary materials

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19288 2026-07-22 cs.CV cs.RO 新提交 50%

No Training, Better Flights: Test-Time Scaled VLMs for UAV Navigation

无需训练,飞行更佳:用于无人机导航的测试时缩放视觉语言模型

Feinan Cheng, Dongliang Xu, Wenli Nong, Zhiheng Zhang, Ang Liu, Tianyu Wang, Yue Yao

专题命中 推理与问题求解 :language model(abstract)

AI总结 研究如何将测试时缩放应用于无人机视觉语言导航,通过迭代细化和多标准评分函数,无需额外训练,使冻结模型自我校正,生成更准确可靠飞行计划,实现最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18840 2026-07-22 cs.RO 新提交 50%

WorldScape Policy 2.0: Empowering Steerable World Action Modeling with Reasoning-Augmented Memory

WorldScape Policy 2.0:通过推理增强记忆实现可控的世界行动建模

Haisheng Su, Zongdai Liu, Xin Jin, Haoxuan Dou, Chengming Hu, Baorun Li, Zhanwang Liu, Ruiyan Xu, Jianjie Fang, Xin Zhang, Zhenjie Yang, Xue Yang, Chen Gao, Junchi Yan, Yong Li, Wei Wu

专题命中 推理与问题求解 :pretraining(abstract)

AI总结 研究针对现有世界行动模型的局限,提出WorldScape Policy 2.0,用推理增强记忆,构建相关数据集,实现从高级指令自主规划及基于细粒度文本等的可控执行,在模拟和现实平台实验中展现出在多方面的卓越能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18742 2026-07-22 cs.SE 新提交 50%

Beyond Text Editing: Algebraic Manipulation of Source Code

超越文本编辑:源代码的代数操作

Kevin Pulo

专题命中 推理与问题求解 :LLM(abstract)

AI总结 研究提出源代码代数方法,通过逻辑代数操作修改代码库,概述其操作属性。实验表明大语言模型代理用此方法完成代码更改成功率更高、令牌数更少,为代码编辑提供新方向,推动相关研究。

Comments Accepted for publication in the Visions and Emerging Results Track of the 42nd IEEE International Conference on Software Maintenance and Evolution (ICSME 2026), 14-18 September 2026, Benevento, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18575 2026-07-22 cs.CR 新提交 50%

RECEIPT: Deterministic, Reward-Hacking-Resistant Verification for White-Box Agentic XSS Discovery

RECEIPT:用于白盒代理式XSS发现的确定性、抗奖励攻击验证

Muxi Lyu, Karen Shieh, Yiwei Hou, Hao Wang, Koushik Sen, David Wagner

专题命中 推理与问题求解 :LLM(abstract)

AI总结 研究针对白盒代理式XSS发现中编码代理声明不可信的问题,提出RECEIPT验证框架,通过环境隔离等手段使发现可信,经实验评估,在预算内发现多个未知漏洞,相比其他方式能确认更多真实利用且无假阳性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25699 2026-07-22 cs.CV 版本更新 50%

AIM-CoT: Active Information-driven Multimodal Chain-of-Thought for Vision-Language Reasoning

AIM-CoT:基于主动信息的多模态链式推理用于视觉-语言推理

Xiping Li, Jianghong Ma

机构 * The Chinese University of Hong Kong(香港中文大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出AIM-CoT框架,通过上下文增强注意力图生成、主动视觉探测和动态注意力转移触发,改进视觉语言模型的证据选择与插入触发,提升视觉-语言推理性能。

Comments Accepted by ACL 2026 Main Conference. 30 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 63 篇

2606.25476 2026-07-22 cs.CL cs.AI 版本更新 92%

A Red Teaming Framework for Large Language Models: A Case Study on Faithfulness Evaluation

大型语言模型的红队框架:以忠实性评估为例

Abrar Alotaibi, Raed Mughus, Moataz Ahmed

机构 * King Fahd University of Petroleum & Minerals(法赫德国王石油矿产大学) Imam Abdulrahman Bin Faisal University(伊玛目阿卜杜勒拉赫曼·本·费萨尔大学) SDAIA-KFUPM Joint Research Center for Artificial Intelligence(沙特数据与人工智能局-法赫德国王石油矿产大学人工智能联合研究中心)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 提出一种多角色红队框架,通过攻击者和陪审模型暴露LLM的不忠实问题,在问答任务中攻击成功率提升7.9%,并揭示结构约束和架构设计对安全性的影响。

Comments Preprint submitted to SQJ

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18068 2026-07-22 cs.NI cs.AI 版本更新 92%

Human Grounded Evaluation of Large Language Models for Optical Network Automation

用于光网络自动化的大语言模型的人工基础评估

Kiarash Rezaei, Omran Ayoub, Paolo Monti, Carlos Natalino

机构 * University of Applied Sciences and Arts of Southern Switzerland(瑞士南瑞士应用科学与艺术大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 研究针对光网络自动化中LLMs输出质量和成本差异大的问题,提出HuGLEN评估管道,结合LLM评判器和专家评级,用QES排名,用于转换XAI模型输出,结果显示中等规模LLM的QES最高,减轻人工标注负担,助力模型选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06605 2026-07-22 cs.LG 版本更新 92%

How Many Iterations to Jailbreak? Dynamic Budget Allocation for Multi-Turn LLM Evaluation

需要多少次迭代才能突破限制?多轮LLM评估中的动态预算分配

Shai Feldman, Yaniv Romano

机构 * Department of Computer Science(计算机科学系) Technion, Israel(技术ion, 以色列) Departments of Electrical and Computer Engineering and of Computer Science(电气与计算机工程系和计算机科学系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出DAPRO框架,通过动态预算分配在多轮LLM交互中提供事件发生时间的界限,解决静态方法效率低的问题,实验表明其在覆盖性和方差方面优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20324 2026-07-22 cs.MA cs.AI 版本更新 90%

When Agents Disagree: The Selection Bottleneck in Multi-Agent LLM Pipelines

当代理人意见不一致:多代理LLM流水线中的选择瓶颈

Artem Maryanskyy, Dmitry Budnikov, Alibek T. Kaliyev

机构 * Uber

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文研究多代理LLM流水线中团队多样性对输出质量的影响,提出选择瓶颈概念,通过数学公式确定多样性帮助或损害的临界点,并通过实验验证选择机制的重要性。

Comments v2: Updated author list to match the published version. Published in Applied Sciences (MDPI) 2026, DOI: 10.3390/app1010000

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18421 2026-07-22 cs.CL cs.AI 版本更新 88%

TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models

TReB:评估大语言模型表格推理能力的综合基准

Ce Li, Xiaofan Liu, Zhiyan Song, Ce Chi, Boshen Shi, Chen Zhao, Guanguang Chang, Zhendong Wang, Kexin Yang, Xing Wang, Chao Deng, Junlan Feng

机构 * JIUTIAN Research(天研机构)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型处理表格数据推理能力评估基准缺失的问题,提出TReB基准,用分类法涵盖26个子任务,经数据处理构建高质量数据集,设计含三种推理模式的评估框架,揭示现有模型在表格任务上有改进空间,且数据和框架均公开。

Comments published by SIGIR 2026

Journal ref Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval, 2026, 3267-3275

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19219 2026-07-22 cs.CL cs.AI 新提交 88%

Beyond Score Prediction: LLM-Based Essay Scoring and Feedback Generation via Reinforcement Learning with Rubric Rewards

超越分数预测:基于强化学习和评分标准奖励的基于大语言模型的作文评分与反馈生成

Xuefeng Jin, Jiashuo Zhang, Teng Cao, Bin Yang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 研究基于大语言模型的作文评分与反馈生成,提出RLAES框架,通过强化学习联合优化。引入RFE评估框架,提出AGFO和ACR方法。实验表明RFE能捕捉一致性,RLAES-AGFO在评分性能上最佳,保持反馈质量同时避免反馈退化。

Comments 12 pages, 4 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18485 2026-07-22 cs.CR cs.AI 新提交 87%

Trusted Credentials, Untrusted Behavior: Benchmarking LLM-Agent Security in High-Performance Computing

可信凭证,不可信行为:高性能计算中语言模型代理安全性基准测试

Jie Li

机构 * Texas Tech University(德克萨斯技术大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究高性能计算中语言模型代理安全性,定义其威胁模型,识别攻击面及当前控制不足,提出研究议程和TaskBound实证基准测试计划,以应对代理按用户凭证运行时可能出现的劫持授权代理问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00262 2026-07-22 cs.SE 版本更新 87%

LLM-Driven Cost-Effective Requirements Change Impact Analysis

基于大语言模型的低成本需求变更影响分析

Romina Etezadi, Sallam Abualhaija, Chetan Arora, Lionel Briand

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出ProReFiCIA方法,利用大语言模型自动识别需求变更影响,实验显示其在未见过的工业数据集上召回率达85.7%,且成本低,仅需审查3%的需求。

Comments 33 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18360 2026-07-22 cs.CR cs.AI cs.LG 新提交 86%

HALLMARK: Diagnosing Three Failure Modes in LLM Citation Verifiers

HALLMARK:诊断大语言模型引用验证器中的三种失败模式

Patrik Reizinger, Wieland Brendel

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型引用验证器的失败模式,通过HALLMARK基准测试评估多种验证器,发现误报率决定验证器是否可部署,并具体指出三种失败模式,强调误报率是部署瓶颈,未检测到的伪造对科学记录代价更高。

Comments 59 pages, 7 figures, 40 tables. Benchmark and code: https://github.com/rpatrik96/hallmark (v1.2.0); verification tool: https://github.com/rpatrik96/bibtexupdater (v1.5.0)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28965 2026-07-22 cs.AI 版本更新 85%

Frontier LLM-based agents can overcome the ontology curation bottleneck for natural phenotypes

基于前沿LLM的智能体可以克服自然表型的本体策展瓶颈

James P. Balhoff, Hilmar Lapp

机构 * Renaissance Computing Institute, University of North Carolina(北卡罗来纳大学雷丁计算研究所) Neuromatch, USA(美国Neuromatch)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文使用前沿大型语言模型作为智能体策展人,在自包含工作空间中利用本体和注释指南进行表型注释,其性能达到人类策展人之间的变异性范围,显著优于传统NLP工具。

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07673 2026-07-22 cs.LG 版本更新 84%

How Benchmark Prediction from Fewer Data Misses the Mark

从较少数据进行基准预测如何失准

Guanhua Zhang, Florian E. Dorner, Moritz Hardt

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Tübingen AI Center(图宾根人工智能中心) ETH Zurich(苏黎世联邦理工学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究大语言模型基准预测方法,通过对11种方法在19个基准上评估,发现现有方法依赖模型相似性,新模型出现时效果不佳。提出受增强逆倾向加权启发的新方法,虽能改进但提升有限,揭示基准预测在评估前沿失效的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏