arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-20 至 2026-08-20 共收录 283 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 40 篇

2608.18105 2026-08-20 cs.CL cs.AI cs.LG 新提交 75%

StocksTalk: A Voice-Enabled Conversational Agent for Structured Query Generation over Web Data

StocksTalk:一种面向网络数据结构化查询生成的语音赋能对话智能体

Akshat Parmar, Vikranth Udandarao, Abhay Shakya, Tanmay Hire, Avinash Anand, Rajiv Ratn Shah, Daniel Wang Zhengkui

机构 * IIIT-Delhi(德里印度信息技术学院) Singapore Institute of Technology(新加坡理工学院)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 StocksTalk是一种语音赋能对话系统,可将口语化金融请求转为结构化查询,通过多模块提升准确性,为股票筛选决策提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17253 2026-08-20 cs.LG cs.AI cs.CV 版本更新 73%

Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL

Co-RL:多智能体强化学习中多样群体涌现的无监督推理

Yunhao Yang, Yuexin Bian, Yunjie Tian, Di Fu, Tianjin Huang, Yuanyuan Shi, Ziang Xiao, Nuno Vasconcelos, Yijiang Li

机构 * University of Exeter(埃克塞特大学) ByteDance(字节跳动) Johns Hopkins University(约翰斯·霍普金斯大学) UC San Diego(加州大学圣迭戈分校)

专题命中 推理与问题求解 :LLM(abstract_cn);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出Co-RL框架,通过参数不共享的多智能体协作训练,利用同伴奖励减少对真实标注的依赖,提升纯文本及多模态任务的推理性能,缓解训练崩溃与响应同质化问题。

Comments 30 pages, 5 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18682 2026-08-20 cs.AI 新提交 70%

RTPO: Reverse-Turn Policy Optimization for Stabilizing Agentic RL Training

RTPO:用于稳定智能体强化学习训练的反向回合策略优化

Yugu Li, Jimmy Cao, Jianglin Qiao, Siyi Hu

机构 * Adelaide University(阿德莱德大学) The University of Sydney(悉尼大学) Curtin University(科廷大学) School of CSIT(计算机科学与信息技术学院) ACFR(澳大利亚空间研究中心) School of EECMS(电子工程、计算机与数学科学学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对多回合智能体RL训练不稳定问题,提出RTPO方法,通过反向回合策略优化消除上下文不匹配与异步漂移,实验显示其较基线提升21.50%、10.76%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18534 2026-08-20 cs.AI cs.IR 新提交 70%

FinRCA-Bench: Benchmarking Evidence Retrieval and Reasoning for Financial AI Systems

FinRCA-Bench:面向金融AI系统的证据检索与推理基准

Pratik Ghawate

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究推出FinRCA-Bench基准,评估金融AI系统的证据检索与推理,发现检索架构影响性能,正确根本原因标签是可审计诊断的弱代理。

Comments 19 pages, 4 figures, 7 tables. Code and data: this https URL (https://github.com/PratikGhawate/FinRCA-AI-Bench)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18078 2026-08-20 cs.AI 新提交 70%

Position: Collusion Risks Among AI Reasoning Agents Justify Certification Requirements for Making Market Decisions

立场:AI推理智能体间的合谋风险证明其在制定市场决策时需满足认证要求

Matthew Riemer, Tommaso Tosato, Amin Memarian, Maximilian Puelma Touzel, Glen Berseth, Irina Rish, Guillaume Dumas

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究指出具备思维链推理能力的AI智能体易出现合谋倾向,提出需对其进行行为认证,实验显示DeepSeek-R1智能体在伯特兰寡头定价场景中存在默契合谋,且其思维链可被隐蔽引导至合谋或竞争状态。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06185 2026-08-20 cs.AI cs.CV 版本更新 70%

Event-Causal RAG: A Retrieval-Augmented Generation Framework for Long Video Reasoning in Complex Scenarios

事件因果RAG:一种用于长视频复杂场景中长视频推理的检索增强生成框架

Peizheng Yan, Yu Zhao, Liang Xie, Juntong Qi, Mingming Wang, Erwei Yin

机构 * Tianjin Key Lab of Intelligent Unmanned Swarm Tech & System(天津智能集群技术与系统重点实验室) Tianjin University(天津大学) Institute of Computing and Intelligence(计算与智能研究所) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Tianjin Artificial Intelligence Innovation Center(天津人工智能创新中心) Defense Innovation Institute Academy of Military Sciences(国防科技创新研究院) School of Future Technology(未来技术学院) Shanghai University(上海大学)

专题命中 推理与问题求解 :language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 本文提出Event-Causal RAG框架,通过事件因果图和双存储记忆实现长视频推理,优于传统方法,在多事件整合和因果推理任务中表现更优,同时提升内存效率和流式性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18822 2026-08-20 cs.SE 新提交 67%

Contract-Aware Rescue of a Drifted Isabelle Development: The Double-Tank Case Study

感知契约的漂移Isabelle开发修复:双水箱案例研究

Jim Woodcock, Gabriel Leite, Augusto Sampaio, Ran Wei

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 针对Isabelle开发漂移问题,以双水箱控制器案例为研究对象,用CAPRI工具重构修复了10个义务,完成部分验证工作,为交互式定理证明器的开发维护提供了实践参考。

Comments 15 pages. Submitted to Formal Methods for Autonomous Systems 2026 (FMAS 2026). Reproducibility artefact: DOI https://doi.org/10.5281/zenodo.21981425

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18602 2026-08-20 cs.CV 新提交 67%

Teach a Molmo2Fish: Towards interactive fish tracking with natural language guidance

Teach a Molmo2Fish:面向自然语言引导的交互式鱼类追踪

Kai Van Brunt (1), Justin Kay (1), Sara Beery (1) ((1) Massachusetts Institute of Technology)

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本研究针对声呐鱼类追踪数据集定制了多模态大语言模型工具Molmo2Fish,通过交互式预测修正工作流开展实验,发现其在鱼类追踪和轨迹修正上性能良好,但自然语言引导的融入仍需提升。

Comments 29 pages, 6 figures, to be published in Third Workshop on Computer Vision for Ecology at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16794 2026-08-20 cs.RO cs.AI cs.CL 版本更新 62%

Neurosymbolic Embodied Agents

神经符号具身智能体

Mohammad Albinhassan, Yuming Feng, Alessandra Russo, Pranava Madhyastha

机构 * Imperial College London(帝国理工学院) Johns Hopkins University(约翰斯·霍普金斯大学) City, University of London(伦敦城市大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出一种神经符号具身智能体,将长周期家庭任务分解为视觉探索与符号规划,在VirtualHome、ALFWorld基准测试中表现优异,约束与搜索结合可大幅提升任务解决率,且无需专门训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18878 2026-08-20 cs.AI cs.MA 新提交 57%

DentAgent: Evidence-Centric Multi-Agent Coordination for Multimodal Dental Reasoning

DentAgent:以证据为中心的多智能体协调的多模态牙科推理框架

Zijie Meng, Xiwei Dai, Yixuan Tang, Jin Hao, Yang Feng, Fudong Zhu, Xiaoqiang Liu, Shaosheng Cao, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) Angelalign Technology Inc.(时代天使科技有限公司) Peking University(北京大学) Tsinghua University(清华大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 针对现有牙科AI系统模态或任务局限及证据不可追溯问题,提出以证据为中心的多智能体框架DentAgent,经四个基准测试,其多标签诊断性能超越资深专家17.3个百分点,可用于多模态牙科推理及人群口腔健康评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18242 2026-08-20 cs.LG 新提交 57%

ClosureBench: A Constructive Benchmark for Compositional Graph Reasoning

ClosureBench:面向组合图推理的构造式基准

Stefano Goria (AIM Research Lab)

机构 * AIM Research Lab(AIM研究实验室)

专题命中 推理与问题求解 :pretraining(abstract);分类 cs.LG

AI总结 本研究推出ClosureBench基准,评估不同规模模型在组合图推理任务的表现,发现模型存在记忆效应、组合推理瓶颈,微调输出程序的模型可提升性能。

Comments 30 pages, 5 figures, 11 tables. Code and data: this https URL (https://github.com/egolabs-ai/closurebench)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18111 2026-08-20 cs.AI 新提交 57%

Solving Is Not Drawing: A Benchmark for Diagrammatic Reasoning in Olympiad Geometry

求解不等于绘图:奥林匹克几何图解推理基准

Hsien Xin Peng, Anthony Kim, Alvin Li, Calvin Supasanya, Shivank Garg, Kevin Zhu

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.AI

AI总结 该研究针对基础模型图解推理能力评估缺口,构建含954道奥林匹克几何题的基准,发现模型求解与绘图能力存在显著差距,绘图平均编译成功率仅36.14%。

Comments ICML 2026, AI4MATH Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03115 2026-08-20 cs.CL cs.SD 版本更新 57%

Listening or Reading? Evaluating Speech Awareness in Chain-of-Thought Speech-to-Text Translation

聆听还是阅读?评估思维链语音到文本翻译中的语音感知能力

Jacobo Romero-Díaz, Gerard I. Gállego, Oriol Pareras, Federico Costa, Javier Hernando, Cristina España-Bonet

机构 * Barcelona Supercomputing Center, Spain(巴塞罗那超级计算中心) Universitat Politècnica de Catalunya, Spain(加泰罗尼亚理工大学) DFKI GmbH, Saarland Informatics Campus, Saarbrücken, Germany(DFKI GmbH萨尔兰信息技术校区)

专题命中 推理与问题求解 :prompting(abstract);分类 cs.CL

AI总结 该研究评估CoT式S2TT系统的语音感知能力,发现其仍依赖转录文本,未充分利用语音,需构建明确整合声学信息的翻译架构。

Comments Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19164 2026-08-20 cs.CY cs.HC 新提交 50%

LearnAI: Just-in-Time AI Co-Creation Across Disciplines at a University

LearnAI:大学跨学科即时AI协同创作

Weihao Qu, Ling Zheng, Chris Buzaid, Daniel Crawford

专题命中 推理与问题求解 :prompting(abstract)

AI总结 该研究提出LearnAI两层AI协同创作框架,试点后发现其能帮助不同能力学习者转变对AI的认知,贡献了可实用的AI教育框架及初步证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18833 2026-08-20 cs.CV 新提交 50%

EVADE: Evidence-Verified Agentic Diagnosis with Escape

EVADE:带弃权机制的证据验证智能诊断方法

Mohaimenul Azam Khan Raiaan, Nur Mohammad Fahad

机构 * Monash University(莫纳什大学) Murdoch University(默多克大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 该研究针对医学VLMs不可靠问题,提出无需训练的EVADE方法,通过跨图像视图验证一致性并引入弃权机制,在多医学VQA数据集上提升了校准度与选择性风险,同时维持了准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19008 2026-08-20 physics.ao-ph 新提交 50%

Extremes on Rewind: Generating 1,000-Member Ensembles Initialized at a Final Condition

回溯极端事件:在最终状态条件下初始化生成1000成员集合

Jerry Lin, Mu-Ting Chien, Mansi Sakarvadia, Elizabeth A. Barnes

专题命中 推理与问题求解 :foundation model(abstract)

AI总结 本研究使用非自回归基础模型cBottle-video生成1000成员集合,针对三个极端事件验证了终点约束集合的多样性与有效性,为罕见高影响事件的情景规划提供了高效方案。

Comments 38 pages, 21 figures; includes 17 pages of Supporting Information with 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16094 2026-08-20 cs.CV 版本更新 50%

How Do VLMs Fail? Vision-Operation Misalignment in Compositional VQA

视觉语言模型如何失败?组合式视觉问答中的视觉-操作不对齐

Navya Gupta, Bingjie Xu, Avinash Anand, Timothy Liu, Zhengchen Zhang

机构 * Singapore Institute of Technology(新加坡科技学院) NVIDIA(英伟达)

专题命中 推理与问题求解 :language model(abstract)

AI总结 研究组合式视觉问答中视觉语言模型失败的机制,引入以操作为中心的框架分解失败模式,揭示四种失败模式及传播路径,表明不同失败类型需不同纠正策略,为提升模型可靠性提供基础。

Comments Accepted at ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21064 2026-08-20 cs.CV 版本更新 50%

2Xplat: Decoupling Geometry and Appearance Modeling for Feed-Forward 3D Gaussian Splatting

2Xplat:两个专家胜过一个通才

Hwasik Jeong, Seungryong Lee, Gyeongjin Kang, Seungkwon Yang, Xiangyu Sun, Seungtae Nam, Eunbyung Park

机构 * Yonsei University(延世大学) Sungkyunkwan University(成均馆大学)

专题命中 推理与问题求解 :foundation model(abstract)

AI总结 本文提出2Xplat框架,通过分离几何估计与高斯生成,改进3DGS生成效果,证明模块化设计在复杂3D建模中的优势。

Comments Project page: this https URL (https://hwasikjeong.github.io/2Xplat)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 72 篇

2608.18300 2026-08-20 cs.AI 新提交 92%

The Lifecycle of LLM-as-a-Judge for Large-Scale Recommendation Explanations

用于大规模推荐解释的LLM评判模型的生命周期

Emma Yanyang Kong, JJ Tan, Ishan Gupta, Lars Olds, Claire Campbell, David Fagnan, Veli Balin, Rohan Gosain, Louis Garcia, Minsu Jang

机构 * Netflix(网飞公司)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出用于Netflix大规模推荐解释评估的LLM评判模型生命周期框架,经五周A/B测试证实,其对齐的解释可提升会员对新颖内容的观看及浏览到播放会话量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15232 2026-08-20 cs.SE 版本更新 91%

When Agents Fail: A Comprehensive Study of Bugs in LLM Agents with Automated Labeling

当代理失效:对LLM代理中bug的全面研究与自动化标记

Niful Islam, Ragib Shahriar Ayon, Deepak George Thomas, Shibbir Ahmed, Mohammad Wardat

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文通过分析1187个bug相关帖子和代码片段,研究LLM代理中的bug类型、根本原因及影响,并构建BugReAct代理自动标记bug。

Comments Accepted at ISSRE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02592 2026-08-20 cs.CY 版本更新 91%

AI Fact-Checking in the Wild: A Field Evaluation of LLM-Written Community Notes on X

在野中的AI事实核查:在X平台上的LLM生成社区笔记现场评估

Haiwen Li, Michiel A. Bakker

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文首次在X平台现场评估LLM生成的社区笔记,通过三个月的测试发现LLM笔记在不同政治立场的评价者中获得更高正面评分,证明其在事实核查中的广泛适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04156 2026-08-20 cs.AI cs.LG 版本更新 91%

BrainBench: Benchmarking Large Language Models for Comprehensive EEG Understanding

BrainBench:面向全面脑电理解的大语言模型基准测试

Yangxuan Zhou, Yuning Chen, Chen Wu, Jiquan Wang, Shijian Li, Gang Pan, Sha Zhao

机构 * Zhejiang University(浙江大学) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 该研究推出BrainBench基准测试,涵盖4个子集共17个数据集等,评估大语言模型在两种范式下的脑电理解能力,为相关研究提供可复现测试平台。

Comments 51 pages,28 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18940 2026-08-20 cs.LG cs.AI cs.CE cs.CL 新提交 90%

Training Chemical Plausibility-Aware Large Language Models for Single-Step Retrosynthesis

面向单步逆合成的化学合理性感知大语言模型训练

Bogdan Zagribelnyy, Ivan Ilin, Nikita Bondarev, Maksim Kuznetsov, Mathieu Reymond, Vladimir Aladinskiy, Alex Aliper, Alex Zhavoronkov

机构 * Insilico Medicine AI Limited(英矽智能人工智能有限公司) Insilico Medicine Canada Inc.(英矽智能加拿大公司) Insilico Medicine Hong Kong Ltd.(英矽智能香港有限公司)

专题命中 评测与基准 :language model(title,abstract);large language model(title);LLM(abstract);prompting(abstract)

AI总结 该研究针对单步逆合成的一对多特性,提出Top-K提示范式,构建超大规模反应数据集训练C3LM,结合特定奖励机制在基准上达最优性能,为逆合成系统提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18768 2026-08-20 cs.CL 新提交 90%

Readable, Faithful, Used: Three Dissociable Properties of Demographic Identity in a Language Model

可读、忠实、可用:语言模型中人口统计身份的三个可分离属性

Fathin Difa Robbani

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 该研究探究LLM中人口统计身份的三个可分离属性,通过对Mistral-7B等模型的分析,发现可读、忠实、可用三者分离,为LLM模拟人群的相关辩论提供了新视角。

Comments 30 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18490 2026-08-20 cs.MA 新提交 89%

Bayesian Partner Modelling enables Adaptive Replanning for LLM Coordination

贝叶斯伙伴建模支持大语言模型协同的自适应重规划

Harsh Goel, Aditya Sai Ellendula, Vaishnav Tadiparthi, Ehsan Moradi Pari, Hossein Nourkhiz Mahjoub, Sandeep P. Chinchali

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对LLM多智能体协作中伙伴策略变化导致的重规划问题,提出BayesBeliefAgent方法,在Overcooked环境中显著缩小信念-行动差距并减少重规划次数。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17326 2026-08-20 cs.HC 版本更新 89%

Procedural Collapse: A Structural Account of Disengagement in LLM-Assisted Writing

程序崩溃:大语言模型辅助写作中脱离的结构解释

JaeWon Kim, Katelyn X. Mei

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文针对学生使用LLM写作时脱离的问题,提出结构层面解释,指出当前界面引发程序崩溃,给出分解式交互等设计方向以支持AI辅助写作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00020 2026-08-20 cs.AR cs.AI 版本更新 89%

Large Language Model for Verilog Code Generation: Literature Review and the Road Ahead

用于Verilog代码生成的大型语言模型:文献综述与未来方向

Guang Yang, Wei Zheng, Xiang Chen, Dong Liang, Peng Hu, Yukui Yang, Shaohang Peng, Zhenghan Li, Jiahui Feng, Xiao Wei, Kexin Sun, Deyuan Ma, Haotian Cheng, Yiheng Shen, Xing Hu, Terry Yue Zhuo, David Lo

机构 * Zhejiang University \& Northwestern Polytechnical University China Northwestern Polytechnical University China Nantong University China Zhejiang University China Monash University Australia Singapore Management University Singapore Zhejiang University \& Northwestern Polytechnical University Northwestern Polytechnical University Nantong University Zhejiang University Monash University Singapore Management University

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文综述了LLMs在Verilog代码生成中的应用,分析了现有方法的有效性、局限性及未来研究方向。

Comments Accept in ACM Computing Surveys

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18158 2026-08-20 cs.CL cs.AI 新提交 88%

When Do LLMs Actually Help? Evaluating LLMs as Data Quality Annotators

大语言模型(LLM)何时真正有用?评估LLM作为数据质量标注者的表现

Praphulla Lal Shrestha

专题命中 评测与基准 :LLM(title_cn,summary_cn);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本研究对比测试LLM与基于规则方法在两项电商数据质量任务中的表现,发现LLM在需背景知识的任务中更具优势,且判断高度一致,小型样本提示评估可能存在误导。

Comments 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18107 2026-08-20 cs.CL cs.AI 新提交 88%

Institutional Prestige as Geographic Bias in Large Language Models: Evidence from Three Factorial Experiments with Bootstrap Confidence Intervals

大型语言模型中作为地理偏见的机构声望:来自三项带自助法置信区间的析因实验的证据

Maikel Leyva-Vazquez, Florentin Smarandache

机构 * Universidad Bolivariana del Ecuador(厄瓜多尔玻利瓦尔大学) Universidad de Guayaquil(瓜亚基尔大学) University of New Mexico(新墨西哥大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究通过三项带自助法置信区间的析因实验,发现大型语言模型在候选人评估中存在机构声望、期刊声望及国籍相关的偏见,期刊声望影响远大于机构声望,还证实了发表于《自然》的救助效应。

Comments 11 pages, 3 figures. Extended English version of an earlier two-study Spanish-language paper published in Neutrosophic Computing and Machine Learning (2026); this version adds Study 3 (journal x institution prestige) and bootstrap confidence intervals throughout

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25681 2026-08-20 cs.CL 版本更新 88%

Self-Improvement of Large Language Models: A Technical Overview and Future Outlook

大语言模型的自我提升:技术概述与未来展望

Haoyan Yang, Mario Xerri, Solha Park, Huajian Zhang, Yiyang Feng, Sai Akhil Kogilathota, Jiawei Zhou

机构 * Zesearch NLP Lab, Stony Brook University(石溪大学 Zesearch NLP 实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL;LLM(comments)

AI总结 本文探讨大语言模型的自我提升技术,提出闭环生命周期框架,分析各组件方法并讨论未来研究方向。

Comments Accepted by TMLR and awarded the Survey Certification; 128 pages, 12 figures, and 14 tables. Github Repo: this https URL (https://github.com/Zesearch/self-improvement-llm)

详情

展开后加载摘要…

URL PDF HTML 收藏