arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-17 至 2026-08-17 共收录 252 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 44 篇

2602.09430 2026-08-17 cs.RO cs.AI 版本更新 70%

AtomBridge: Agentic VLA Inference Plugin for Long-Horizon Tasks in Scientific Experiments

Sci-VLA:用于科学实验中长周期任务的代理VLA推理插件

Yiwen Pang, Bo Zhou, Changjin Li, Xuanhao Wang, Shengxiang Xu, Deng-Bao Wang, Peng Cheng, Shimin Di, Jingkuan Song, Min-Ling Zhang

机构 * School of Computer Science and Engineering & School of Software Engineering & School of Artificial Intelligence, Southeast University, Nanjing, China(计算机科学与工程学院、软件工程学院、人工智能学院,东南大学,南京,中国) Pattern Learning and Mining Lab, Southeast University, Nanjing, China(模式学习与挖掘实验室,东南大学,南京,中国)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出了一种基于大语言模型的代理VLA推理插件,用于提升科学实验中长周期任务的执行效率和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13030 2026-08-17 cs.CR cs.MA cs.NI 版本更新 67%

InterSAGE: The Secure and Verifiable Interoperability Protocol for An Internet of Agents

InterSAGE:面向智能体互联网的安全可互操作且可验证的协议

Zhenhua Zou, Sheng Guo, Qiuyang Zhan, Lepeng Zhao, Shuo Li, Zhuotao Liu

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 针对现有智能体互操作协议缺失安全底层的问题,提出InterSAGE四层协议套件,补充MCP等通信协议,经对比验证其为首个统一实现四大安全特性的架构。

Comments 35 pages, 4 figures, 7 tables. Positioning paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11693 2026-08-17 cs.AR 版本更新 67%

Spec Sheets Are Not Kernels: An ISA- and Source-Level Audit of INT8 Availability on NVIDIA Blackwell Ultra

规格表并非内核:对NVIDIA Blackwell Ultra上INT8可用性的ISA与源代码级审计

Teng-Ruei Chen

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 本文审计发现,NVIDIA Blackwell Ultra(B300)的INT8支持在ISA、CUTLASS内核库、vLLM和SGLang四层栈中被分层撤回,名义存在的INT8格式实际无法部署,凸显量化格式可用性是全栈属性。

Comments 8 pages (IEEEtran two-column), 2 figures, 3 tables. All sources pinned to commits/digests with access dates; no performance measurements (companion measurement study in preparation). v2: bibliography only -- 15 refs recited to their peer-reviewed venues, author dashes suppressed, artifact URL added; no technical changes

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13124 2026-08-17 cs.LG cs.AI cs.CL 版本更新 67%

ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation

ShortOPD:通过短到长的策略蒸馏恢复剪枝后的语言模型

Qingyu Zhang, Qianhao Yuan, Hongyu Lin, Yaojie Lu, Xianpei Han, Le Sun, Ming Xu, Jiarui Li

机构 * ByteDance(字节跳动) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 效率与部署 :SFT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究结构化剪枝在语言模型自由形式生成任务中存在的问题,提出ShortOPD方法,通过短到长的策略蒸馏,检测重复后缀,合理分配展开预算,有效提升压缩模型分数,减少训练时间和展开令牌,推动结构化剪枝接近可部署的生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13596 2026-08-17 cs.LG cs.AI 新提交 62%

Training-Free Knowledge Transfer Across Model Scales through Activation-Guided Pruning

通过激活引导剪枝实现跨模型规模的无训练知识迁移

Jiahe Fan, Si Chen, Yinghao Hou, Aiyuan Zhang, Hong Xie

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出激活剪枝融合框架APM,通过激活引导选择源模型的显著组件并注入目标模型,无需训练和显式语义对齐,在16个基准上将3B目标模型平均准确率从55.5%提升至60.6%。

Comments 9 pages, 3 figures, and 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13341 2026-08-17 cs.LG cs.AI 版本更新 62%

Simulation-to-real transfer learning for infrared spectroscopic chemical sensing and analysis from molecules to complex samples

面向红外光谱化学传感与分析的仿真到真实迁移学习:从分子到复杂样品

Yusen Tan, Yixuan Chen, Zheng Fang, Pan Liu, Yifan Li, Qinyu Guo, Zhedong Lin, Yuqiang Li, Xiangxiang Zeng, Tong Wang, Jun Xia

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Jilin University(吉林大学) University of Auckland(奥克兰大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Hunan University(湖南大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对红外光谱化学传感的迁移难题,提出超1亿参数的红外光谱基础模型UltraIR,经6000万仿真光谱预训练后,在多类化学分析任务中性能优于基线,且适配性与数据效率优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13793 2026-08-17 stat.ML cs.LG stat.ME 新提交 57%

On the Brittleness of Maximum Likelihood Estimation for Gaussian Process Hyperparameter Optimization

高斯过程超参数优化的最大似然估计的脆弱性

Tyler R. Johnson, Kian Ben-Jacob, Christopher P. Muller, Ramin Bostanabad

专题命中 效率与部署 :foundation model(abstract);分类 cs.LG

AI总结 本文针对高斯过程超参数优化场景,评估最大似然估计的脆弱性,提出实用解决方案,其在贝叶斯优化等任务中有效,构建的高斯过程可在多方面超越表格基础模型。

Comments 26 pages, 10 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14379 2026-08-17 cs.RO cs.AI 新提交 57%

Reflex: Enabling Fast and Predictive Vision-Language-Action Models for Reaction-Critical Manipulation

Reflex:面向反应关键型操作的快速且可预测的视觉-语言-动作模型

Yuxuan Chen, Wanruo Zhang, Xiao Li

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与部署 :pretraining(abstract);分类 cs.AI

AI总结 针对现有VLA模型忽略动态交互场景的问题,提出面向反应关键型操作的ReflexBench基准与无需大规模机器人数据预训练的ReflexVLA模型,其可提升动态操作性能并保持静态操作精度。

Comments 8 pages, 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14149 2026-08-17 cs.AI cs.CR 新提交 57%

QuaSAR: Quantization Compensation via Stable Activation-Aware Rank Truncation

QuaSAR: 基于稳定激活感知秩截断的量化补偿

Lin-Fa Lee, Yi-Yu Chang, Kuo-Hei Yeh

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 效率与部署 :post-training(abstract);分类 cs.AI

AI总结 本文针对低比特量化后训练方法中门控机制误删可补偿层的问题,提出无参数截断伪逆求解器,在ViT-B模型上实现了优于现有方法的精度,且在模型规模与精度间取得良好平衡。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06452 2026-08-17 cs.CL 版本更新 57%

Learning to Interrupt in Language-based Multi-agent Communication

语言基多智能体通信中的中断学习

Danqing Wang, Da Yin, Ruta Desai, Lei Li, Asli Celikyilmaz, Ansong Ni

机构 * CMU(卡内基梅隆大学) Meta FAIR

专题命中 效率与部署 :LLM(abstract);分类 cs.CL

AI总结 本文提出一种可中断的通信框架,通过学习预测合适的中断点,减少通信成本,提升多智能体任务性能。

Comments Accepted in CoLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28026 2026-08-17 cs.AI 版本更新 57%

BUZZY: Contrastive Scoring to Mitigate Text-Induced Bias in Multimodal Multiple-Choice QA

当选择成为先验:用于科学图表多选问答的对比解码

Taeyun Roh, Suhyeong Park, Dongyoung Lee, Eunyeong Jo, Wonjune Jang, Junha Jung, Jaewoo Kang

机构 * Korea University(高丽大学) Konkuk University(建国大学) Myongji University(明知大学) AIGEN Sciences

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 本文提出SCICON方法,通过对比文本和图像信息,减少选择偏差,提升科学图表多选问答的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14542 2026-08-17 stat.ME stat.ML 新提交 50%

Generation-Powered Inference for Distribution-Valued Outcomes

面向分布值结果的生成驱动推断

Yijiao Zhang, Hongzhe Li

专题命中 效率与部署 :foundation model(abstract)

AI总结 该研究提出生成驱动推断(GPI)框架,用于利用辅助生成模型改进分布值参数的推断,经模拟和K562细胞的Perturb-seq研究验证,其效率更高且在模型误设下表现稳健。

Comments 36 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11903 2026-08-17 eess.IV cs.CV cs.MM 版本更新 50%

Learning Perceptual Representations for Gaming NR-VQA with Multi-Task FR Signals

学习用于游戏NR-VQA的多任务FR信号感知表示

Yu-Chih Chen, Michael Wang, Chieh-Dun Wen, Kai-Siang Ma, Avinab Saha, Li-Heng Chen, Alan Bovik

机构 * National Yang Ming Chiao Tung University The University of Texas at Austin Netflix Inc.

专题命中 效率与部署 :pretraining(abstract)

AI总结 本文提出MTL-VQA,通过多任务学习框架利用全参考信号学习感知特征,有效提升游戏视频无参考质量评估的性能。

Comments 6 pages, 2 figures, IEEE ICIP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 领域大模型 26 篇

2608.14071 2026-08-17 cs.AI 新提交 92%

Scaling Domain Data Repetition in LLM Pretraining

扩展大语言模型预训练中的领域数据重复策略

Jingwei Li, Xinran Gu, Rui Dai, Xintong Hao, Chengyin Xu, Yan Wu, Shuran Zheng, Jingzhao Zhang

专题命中 领域大模型 :LLM(title,summary_cn);pretraining(title);large language model(abstract);language model(abstract)

AI总结 本文研究LLM预训练中领域数据重复的权衡,发现最优重复次数与模型规模弱相关、与领域验证损失强负相关,小代理模型的重复次数可用于估计大模型的情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14527 2026-08-17 cs.DC cs.SE 新提交 91%

Validating LLM-Modernized Scientific Software Through Differential Fault Injection

通过差分故障注入验证大语言模型(LLM)现代化的科学软件

Evan Coleman, Yuzhong Shen, Masha Sosonkina, Peng Xu

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本研究提出差分故障注入验证方法,以GAMESS为对象测试LLM现代化科学软件的正确性,发现转换后积分核与原始核一致,还暴露了精度降低时的并行死锁等问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21339 2026-08-17 cs.SE cs.PL 版本更新 91%

KBSpec: LLM-driven Formal Specification Generation with Evolving Domain Knowledge Base

KBSpec:基于演化领域知识库的LLM驱动形式化规约生成

Wenhan Wang, Zeyu Sun

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出KBSpec方法,利用外部官方文档和内部验证器反馈的双源知识增强LLM,通过自演化知识库持续更新成功轨迹,无需调参或标注数据,在JML规约生成上验证通过率提升10-25%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29668 2026-08-17 cs.AI cs.CL 版本更新 90%

GRASP: Gated Regression-Aware Skill Proposer for Self-Improving LLM Agents

GRASP: 门控回归感知技能提议器用于自我改进的LLM智能体

Johannes Moll, Jean-Philippe Corbeil, Jiazhen Pan, Martin Hadamitzky, Daniel Rueckert, Lisa Adams, Keno Bressem

机构 * Technical University of Munich and TUM University Hospital(慕尼黑技术大学及慕尼黑大学医院) Microsoft Healthcare & Life Sciences(微软医疗与生命科学)

专题命中 领域大模型 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出GRASP方法,通过门控回归感知技能库编辑,在硬回归预算下确保每次技能更新带来净改进,显著提升LLM智能体在结构化环境中的操作可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14732 2026-08-17 cs.LG cs.AI cs.CV eess.IV 版本更新 90%

INFORM-CT: INtegrating LLMs and VLMs FOR Incidental Findings Management in Abdominal CT

INFORM-CT:整合LLM和VLM用于腹部CT的偶发发现管理

Idan Tankel, Nir Mazor, Rafi Brada, Christina LeBedis, Guy ben-Yosef

机构 * GE Healthcare Technology and Innovation Center(GE医疗技术与创新中心) Boston Medical Center(波士顿医疗中心)

专题命中 领域大模型 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于LLM和VLM的计划-执行框架,用于提高腹部CT偶发发现的检测、分类和报告效率与精度,通过自动化流程提升临床应用效果。

Comments Spotlight presentation at the 9th International Conference on Medical Imaging with Deep Learning (MIDL) 2026 Additional code and implementation details available at this https URL (https://idan-tankel.github.io/InformCT_ProjectPage/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01826 2026-08-17 cs.CL cs.AI 版本更新 90%

Leveraging Few-Shot Learning and Large Language Models for Analyzing Blood Pressure Variations Across Biological Sex from Scientific Literature

利用小样本学习与大语言模型从科学文献中分析不同生物性别间的血压差异

Yuting Guo, Seyedeh Somayyeh Mousavi, Reza Sameni, Abeed Sarker

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本研究利用小样本学习、LLaMA3及GPT-3.5等大语言模型,从PubMed文献中提取血压相关信息,分析不同生物性别间的血压差异,生成可视化图表开展研究。

Comments Accepted by the journal of Computers in Biology and Medicine

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08636 2026-08-17 cs.CL cs.AI cs.DL cs.IR 版本更新 88%

Enhancing Scientific Named Entity Recognition via Large Language Models: A Type-driven Multi-task Learning Approach

基于大语言模型增强科学命名实体识别:一种类型驱动的多任务学习方法

Tong Bao, Yi Zhao, Heng Zhang, Chengzhi Zhang

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究针对LLMs处理SciNER时因实体类型过多导致准确率低的问题,提出类型驱动的多任务学习方法TdSciNER,通过实体类型筛选、多任务学习和示例选择策略提升性能,相关方法在三个数据集上达到与全监督模型相当的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13786 2026-08-17 cs.IR cs.AI cs.CL 新提交 87%

Do AI chatbots find what experts would? Effects of model, user role, and sample size on study retrieval for medical questions

AI聊天机器人能否找到专家会选择的研究?模型、用户角色和样本量对医学问题研究检索的影响

Qingfang Liu, Qiao Jin, Joe D. Menke, Thorsten Kahnt, Zhiyong Lu

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究评估Claude Sonnet 5、Gemini 3.1 Pro、ChatGPT GPT-5.5三款LLM聊天机器人在模拟三种用户角色下的医学研究检索表现,发现其召回率因模型、角色差异显著,且存在偏向大样本临床试验的偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13889 2026-08-17 cs.CV 新提交 86%

Consensus-gated Multi-Agent Neural Architecture Search for Seismic Fault Segmentation

面向地震断层分割的共识门控多智能体神经架构搜索

Shehram Baig, Ahmad Mustafa

机构 * Information Technology University (ITU)(信息技术大学(ITU)) King Fahd University of Petroleum and Minerals(法赫德国王石油与矿业大学)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出共识门控多智能体NAS系统,利用三个LLM达成共识搜索架构,发现参数42.5万的\textit{ours}模型,在Thebe断层数据集上性能优于多个基准模型,成本低、效率高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14286 2026-08-17 cs.CV cs.AI cs.CL 新提交 84%

Seeing Red, Thinking Bad: Color Bias in Vision Language Models

看到红色,想到负面:视觉语言模型中的颜色偏差

Kohsuke Ide, Ryousuke Yamada, Yoshihiro Fukuhara, Hirokatsu Kataoka, Yutaka Satoh

机构 * National Institute of Advanced Industrial Science and Technology (AIST)(日本产业技术综合研究所) University of Tsukuba(筑波大学) University of Technology Nuremberg(纽伦堡工业大学) University of Oxford(牛津大学)

专题命中 领域大模型 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究发现VLMs存在颜色偏差,通过引入Stealth Visual Prompts控制文本视觉风格,发现颜色、对比度会影响VLMs的情感预测和VQA输出,其行为与视觉编码器潜在表示变化相关。

Comments 15 pages. Accepted to ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01189 2026-08-17 cs.AI 版本更新 81%

NEURON: A Neuro-symbolic System for Grounded Clinical Explainability

NEURON:一种面向临床可解释性的神经符号系统

Anuradha Chandrasekaran, Dimitrios Zikos, Mutlu Mete, Alan Pang, Brady D. Lund, Kewei Sha

机构 * University of North Texas(北卡罗来纳大学达顿分校) Texas Tech University Health Sciences Center(德克萨斯农工大学健康科学中心)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 NEURON结合医学本体和机器学习模型,提升预测可靠性与临床可解释性,通过RAG层生成自然语言解释,在MIMIC-IV数据集上提升AUC至0.84-0.88。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14273 2026-08-17 cs.HC 新提交 80%

Designing Mobile and Wearable Sensor-Fused Conversational Agents for Health and Wellbeing

面向健康与福祉的移动及可穿戴传感器融合对话智能体设计

Hansoo Lee, Pablo Fonseca, Md Haseen Akhtar

专题命中 领域大模型 :LLM(summary_cn,abstract)

AI总结 本教程面向健康领域,旨在教授参与者使用WSDWAS工具,将可穿戴传感器数据与LLM驱动的对话智能体结合,实现从被动监测到可操作福祉对话的转变。

Comments 6 pages, 3 figures. Accepted as a Tutorial at the 28th International Conference on Mobile Human-Computer Interaction (MobileHCI '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13587 2026-08-17 cs.HC 新提交 80%

Student-ChatGPT Interaction Visible: Designing a Teacher Dashboard for EFL Writing Education

学生与ChatGPT交互可视化:为英语作为外语写作教育设计教师仪表盘

Minsun Kim, Seon Gyeom Kim, Suyoun Lee, Yoosang Yoon, Junho Myung, Haneul Yoo, Jieun Han, Hyunseung Lim, Yoonsu Kim, So-Yeon Ahn, Juho Kim, Alice Oh, Hwajung Hong, Tak Yeon Lee

专题命中 领域大模型 :LLM(summary_cn,abstract)

AI总结 该研究设计了用于EFL写作教育的Prompt Analytics Dashboard,可追踪学生与LLM的交互,经教师测试后能降低监控负担并优化干预时机。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12498 2026-08-17 cs.CV 版本更新 78%

NAST: Improving Negation Handling in Medical Vision-Language Models through Negation-Aware Selective Training

针对医学视觉-语言模型中否定处理改进的分层微调

Ali Abbasi, Mehdi Taghipour, Rahmatollah Beheshti

机构 * University of Delaware(德克萨斯大学)

专题命中 领域大模型 :language model(title,abstract)

AI总结 本研究提出NAST方法,通过因果追溯效应调节逐层梯度更新,提升医学视觉-语言模型对否定处理的识别能力,同时保持一般视觉-语言对齐。

Comments 16 pages, 6 figures. Accepted to MLHC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14068 2026-08-17 cs.IR cs.AI 新提交 77%

MACS: A Hybrid Multi-Agent Framework for Reliable Conversational E-Commerce Recommendation

MACS:面向可靠会话式电商推荐的混合多智能体框架

Juli Huang, Hannah Clay, Sajjad Beygi, Thomas Sarda, Negin Golrezaei, Amin Saberi

专题命中 领域大模型 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对固定目录场景下会话式电商推荐的可靠性问题,提出混合多智能体框架MACS,其在单轮、多轮基准测试中均展现出更强的约束合规性与推荐性能。

Comments 9 pages, 2 figures, 8 tables. Will be presenting at Stanford Trust&Safety Conference, already presented at Stanford Market AI Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14128 2026-08-17 cs.SE 新提交 75%

DepWareTrans: Dependency-Aware Incremental Repository Migration across Co-executable Languages

DepWareTrans:跨可共执行语言的依赖感知增量仓库迁移

Sivajeet Chand, Alexander Pretschner, Steve Haupt, Derui Zhu, Sushant Kumar Pandey

专题命中 领域大模型 :LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出依赖感知增量迁移框架,构建依赖图分组文件进行批量翻译,在 STAR 仓库等上实现 100% 编译和测试成功率,提升仓库级代码翻译的可扩展性与可靠性。

Comments Accepted for publication in the Industry Showcase Track of the 41st IEEE/ACM International Conference on Automated Software Engineering, which will take place in Munich, Germany during October 12-16, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14354 2026-08-17 cs.AI 新提交 70%

ScienceFlow: A long-horizon agent for ML research, scientific discovery and beyond

ScienceFlow:面向机器学习研究、科学发现及更广泛领域的长时智能体

Mingming Zhao, Jiqian Dong, Kangping Xu, Zadid Hasan, Chengrui Fan, Shan Jiang, Shuai Mao, Ting Lingya, Linyi Zou, Tailin Zhou, Yun Hin Chan, Wenkai Zhang, Zhanhong Zhou, Guowei Huang, Hongliang Li, Wenjing Cun, Zhitang Chen, Mingxuan Yuan, Yanhui Geng

机构 * Noah’s Ark Lab, Huawei(华为诺亚方舟实验室)

专题命中 领域大模型 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 ScienceFlow是一款端到端自主研究智能体框架,通过ESTRA机制与证据感知执行控制器实现长时研究的状态管理与资源分配,在24小时预算内的MLE-bench基准测试中取得70.22%的Any-Medal最优分数,为长时自主研究提供了有效方案。

详情

展开后加载摘要…

URL PDF HTML 收藏