arXivDaily arXiv每日学术速递 周一至周五更新
紧急更新!大量爬虫把网站搞的很不稳定,部分功能限制为登录后才能使用,如高级检索等
全部学科分类 2496
2609.01607 2026-09-02 cs.CV 新提交

Uncovering Understanding-Generation Synergy in Native Unified Multimodal Models: From Representation, Task to System

揭示原生统一多模态模型中的理解-生成协同效应:从表示、任务到系统

Penghao Wu, Haiwen Diao, Weichen Fan, Lewei Lu, Dahua Lin, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(新加坡南洋理工大学S-Lab) SenseTime Research(商汤科技研究院)

AI总结 本文研究无预训练视觉先验的原生统一多模态模型,从表示、任务、系统层面揭示视觉理解与生成的协同效应,发现适当设计可将二者共存转化为协同,且端到端模型优于规划器-执行器流水线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01604 2026-09-02 cs.CL cs.LG 新提交

Beyond Scores: Understanding LLM-as-a-Judge Mechanisms in Summarization Evaluation

超越分数:理解摘要评估中的大语言模型作为评判者的机制

Himil Vasava, Ming Jiang

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

AI总结 该研究针对LLM作为评判者的摘要评估机制,通过多组实验分析了Themis和Prometheus等模型的评估流水线结构及微调的作用,并发布了相关代码与数据。

Comments Accepted at EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01600 2026-09-02 cs.CL cs.AI 新提交

CordisBench: Can Language Models Reason About Component Lifecycles in Dynamic Agent Harnesses?

CordisBench:语言模型能否推理动态智能体框架中的组件生命周期?

Damien Sileo, Dimitri Kachler

机构 * Univ. Lille(里尔大学) Inria(法国国家信息与自动化研究所) CNRS(法国国家科学研究中心) Centrale Lille(里尔中央理工学院) UMR 9189 - CRIStAL

AI总结 本研究推出1200题的CordisBench基准,评估语言模型对动态智能体框架组件生命周期的推理能力,发现模型在多交互场景下可靠性下降,额外推理可提升性能但成本较高,且存在可替代的低成本参考语义。

Comments 13 pages, 6 figures, 5 tables. Code: this https URL (https://github.com/sileod/cordis-bench); Data: this https URL (https://huggingface.co/datasets/sileod/cordis-bench)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01598 2026-09-02 cs.CV 新提交

UI-VISA: U-Net Initialized Vascular Image Segmentation Architecture

UI-VISA:U-Net初始化血管图像分割架构

Asees Kaur, Suzanne S. Sindi, Erica M. Rutter

机构 * University of California, Merced(加州大学默塞德分校)

AI总结 本文提出UI-VISA混合分割架构,结合U-Net与区域生长算法优势,在26幅DSA图像的5折交叉验证中,其clDice提升具统计学显著性,可更精准分割血管结构。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01597 2026-09-02 cs.CL cs.AI 新提交

The Rise of Verbal Reinforcement Learning

语言强化学习的兴起

Kshitij Tayal, Arun Sharma, Genta Indra Winata, Anirban Das, Sambit Sahu

机构 * Capital One University of Minnesota(明尼苏达大学)

AI总结 该文提出语言强化学习(VRL)范式,围绕语言反馈的生效时机与修改对象划分三大支柱,阐述其对智能体开发的重塑作用及相关挑战机遇。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01596 2026-09-02 cs.RO cs.LG 新提交

Facet-0: A Robotic Foundation Model for Contact-Rich Precise Manipulation

Facet-0:面向接触丰富型精密操作的机器人基础模型

Haoyuan Deng, Haichao Liu, Wenkai Guo, Yuan Ling, Zaijia Yang, Yuanjiang Xue, Haosheng Sun, Liangzi Wang, Ziwei Wang

机构 * Nanyang Technological University(南洋理工大学)

AI总结 本文提出机器人基础模型Facet-0,通过联合动作-力提议等技术,在ManuFacet-1K上训练后,五项亚毫米计算机装配任务平均成功率达82%,远超基线的15%,实现精密接触型机器人装配。

Comments Project page: this https URL (https://pine-lab-ntu.github.io/facet-0/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01591 2026-09-02 cs.CL 新提交

StudentSim: Training LLM-based Student Simulators

StudentSim:基于大语言模型的学生模拟器训练框架

Ke Yang, Chenglong Wang, Michel Galley, Chandan Singh, Jeevana Priya Inala, ChengXiang Zhai, Jianfeng Gao

机构 * Microsoft Research(微软研究院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本研究提出 StudentSim 框架,结合标准化评估协议 StudentSimEval,在国际象棋、写作、数学领域训练出优于 GPT-5.4 的学生模拟器,用作奖励模型可生成更优质的个性化辅导系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01587 2026-09-02 cs.LG cs.CL 新提交

The Structure of Quantization Damage in LLMs: Why the Next Bit Should Be Spent Globally

大语言模型(LLM)中量化损伤的结构:为何应将下一位精度预算用于全局分配

Jundong Hu, Shekar Ramachandran

机构 * PayPal AI(PayPal人工智能部门)

AI总结 本研究通过因果混合精度干预探究LLM量化损伤的结构,发现精度恢复多为分散式,全局分配精度预算比局部修复关键层性能更优,需用因果干预验证量化损伤的定位。

Comments Preprint. Under review at a NeurIPS 2026 workshop. 11 pages, 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01584 2026-09-02 cs.CV 新提交

A Benchmark for Vehicle Attribute Classification in Cross-Domain Surveillance Scenarios

跨域监控场景下车辆属性分类的基准测试集

Sergio M. Silva Jr., Otavio T. Remer, Gabriel E. Lima, Lucas Wojcik, Rayson Laroca, David Menotti

机构 * Federal University of Paraná(巴拉那联邦大学) Pontifical Catholic University of Paraná(巴拉那天主教大学)

AI总结 本文提出UVIB基准测试集,评估跨域监控场景下车辆属性分类的三项任务,测试四类模型后发现域偏移影响更大,凸显需开发评估操作鲁棒性的基准测试集。

Comments Accepted for presentation at the 2026 Conference on Graphics, Patterns and Images (SIBGRAPI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01582 2026-09-02 cs.CV 新提交

SpatialGuard: Harness-Guided Verifiable Spatial Reasoning for Text-to-Image Generation

SpatialGuard:基于布局管控的可验证空间推理文本到图像生成方法

Ziyun Qian, Zizhi Chen, Yizhou Liu, Mingyang Sun, Dingkang Yang, Lihua Zhang

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) Fysics Intelligence Technologies Co., Ltd. (Fysics AI)(Fysics智能科技有限公司(Fysics AI))

AI总结 SpatialGuard是一种结构化布局引导框架,通过布局管控器实现可验证的空间推理,提升了复杂3D空间文本到图像生成的空间保真度,达到当前最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01579 2026-09-02 cs.RO 新提交

SG-AMP: Scene-Graph-Guided Active Perception and Semantics-Aware Motion Planning for Pepper Plants

SG-AMP:面向辣椒植株的场景图引导主动感知与语义感知运动规划

Rohit Menon, Shiva Rudra Lolla, Niklas Mueller-Goldingen, Gokul Chenchani, Ribana Roscher, Maren Bennewitz

机构 * University of Bonn(波恩大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究所) Center for Robotics(机器人中心)

AI总结 该研究提出SG-AMP算法,集成多模块技术实现辣椒植株的主动感知与运动规划,在辣椒数据集上取得了语义mIoU等指标的良好表现,且输入条件不确定性优化了NYUv2相关指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01575 2026-09-02 cs.CL 新提交

Closing Cost-Quality Gap in Document VLMs: Difficulty-Aware Data Curation and Quality-Adjusted Deployment Economics

缩小文档视觉语言模型(VLM)的成本-质量差距:难度感知数据整理与质量调整的部署经济学

Maksim Evdokimov, Matvey Ivanov, Dmitrii Tsiupin, Olga Tsymboi, Anatolii Potapov, Aleksandr Ivanov

机构 * T-Tech

AI总结 该研究针对受监管行业文档结构化字段提取的高成本问题,提出基于混合专家VLM的文档理解系统,通过难度感知数据整理与质量调整部署,实现成本大幅降低且性能领先可部署基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01573 2026-09-02 cs.CL cs.AI cs.LG 新提交

Scaling Near-Optimal SFT-RL Annotation Budget Allocation from Small to Large LLMs

将近最优SFT-RL标注预算分配从小型大语言模型扩展至大型大语言模型

Jingtan Wang, Arun Verma, Xiaoqiang Lin, Zhengyuan Liu, Nancy F. Chen, Daniela Rus, Bryan Kian Hsiang Low

机构 * National University of Singapore(新加坡国立大学) Agency for Science, Technology, and Research (A*STAR)(新加坡科技研究局) Singapore-MIT Alliance for Research and Technology Centre(新加坡-麻省理工研究与技术联盟中心)

AI总结 该研究提出近最优区域框架,发现SFT-RL的近最优区域可从小型代理模型迁移至大型LLM,据此提出无需大规模搜索的实用标注预算分配策略,且结果在多任务、多模型及不同RL方法中一致。

Comments Accepted at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01572 2026-09-02 cs.CL 新提交

From Production Traffic to Post-Training: Building a Self-Hosted LLM That Covers the Corporate Request Mix

从生产流量到后训练:构建覆盖企业请求组合的自托管大语言模型(LLM)

Olga Tsymboi, Dmitrii Stoianov, Ramil Latypov, Danil Taranets, Daniil Dryabin, Mikhail Gashkov, Viktor Zelenkovskiy, Aleksandr Fida, Gleb Alektorov, Nikita Gulyakov, Arthur Babkin, Aleksandr Medvedev, Pavel Gein, Anatolii Potapov

机构 * T-Tech

AI总结 针对企业自托管LLM的GPU池碎片化问题,通过分维度训练GRPO专家并经SLERP合并,构建的单模型可整合50%平台流量,性能优于大7倍的基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01567 2026-09-02 cs.AI cs.CL cs.LG 新提交

Selective Agent Guidance via Entropy: Learning Autonomous Policies from Imperfect VLM Teachers

基于熵的智能体选择性引导:从不完美的VLM教师学习自主策略

Matteo Merler, Giovanni Bonetta, Davide Zago, Rossella Cancelliere, Bernardo Magnini

机构 * Fondazione Bruno Kessler(布鲁诺·凯塞勒基金会) University of Torino(都灵大学)

AI总结 该研究提出SAGE框架,仅在智能体不确定时查询VLM教师,将引导提炼为轻量级RL策略,在稀疏奖励任务中学习的策略优于无引导RL,还减少了VLM使用量。

Comments 9 pages, 3 figures, 4 tables in the main text, 27 pages, 4 figures, 9 tables including Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01564 2026-09-02 cs.CL cs.AI 新提交

From Confusion to Clarity: Confusion-Aware Retrieval and Knowledge Injection for Text Classification

从混淆到清晰:面向文本分类的混淆感知检索与知识注入

Manish Gupta, Chaitanya Giri, Jayasimha Talur

机构 * Amazon(亚马逊)

AI总结 针对LLM在文本分类中区分相似标签的难题,提出混淆感知检索与知识注入框架,无需微调即可生成可迁移规则,在多个基准上显著提升Macro F1。

Comments EMNLP 2026 (Industry Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01563 2026-09-02 cs.CL 新提交

A systematic Approach to constructing a Chance-and-Risk Matrix for Semiconductor Supply Chains

构建半导体供应链机会与风险矩阵的系统方法

Ema Salkić, Alexander Fichtl, Philipp Ulrich, Hans Ehm, Marta Bonik, Georg Groh

机构 * Infineon Technologies AG(英飞凌科技股份公司)

AI总结 针对半导体供应链风险情报提取与排序的需求,提出端到端流程,结合LLMs与三层排序机制处理五家企业文档,生成高有效率的风险机会矩阵,识别贸易限制为主要风险。

Comments Copyright 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting/republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01560 2026-09-02 cs.CV cs.AI 新提交

H3-World: Turning Language Understanding into World Control

H3-World:将语言理解转化为世界控制

Danze Chen, Zeqing Wang, Ziyue Lin, Xingyi Yang, Yeying Jin

机构 * Tencent(腾讯) National University of Singapore(新加坡国立大学) The Hong Kong Polytechnic University(香港理工大学)

AI总结 H3-World是复用大型视频生成器语义表示的高效框架,仅需少量样本与参数,即可将语言接口转化为精确的交互式世界控制,且能泛化到未见场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01558 2026-09-02 cs.LG 新提交

Gradient-Update Mismatch: Rethinking Conflict-Free Training of Physics-Informed Neural Networks

梯度更新不匹配:重新思考物理信息神经网络的无冲突训练

Jing Xiao, Xinhai Chen, Qinglin Wang, Menghan Jia, Zhiquan Lai, Dongsheng Li, Jie Liu, Tiejun Li

机构 * National University of Defense Technology(国防科技大学) School of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机学院)

AI总结 该研究针对物理信息神经网络(PINNs)训练中存在的梯度更新不匹配(GUM)问题,提出梯度更新对齐(GUA)方法,可实现无冲突更新并提升性能,大幅降低相对$L_2$误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01556 2026-09-02 cs.LG cs.AI cs.IR 新提交

Retrieved but not ranked: surface-form bias in structural retrieval, from mathematics to agent trajectories

检索但未排序:结构检索中的表面形式偏差——从数学到智能体轨迹

Nabira Rashid, Manolis Kellis

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Mantis(曼蒂斯(机构名))

AI总结 该研究在数学和智能体轨迹领域发现嵌入检索存在表面形式偏差,LLM重排序器可部分缓解此偏差,而词汇重排序器的效果随领域变化,下游实验显示求解器准确率存在瓶颈。

Comments 18 pages, 3 figures, code at this https URL (https://github.com/nabirarashid/structural-retrieval)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01554 2026-09-02 cs.CV cs.AI 新提交

BS: Take the Hint - Interactive Multitracer PET/CT Lesion Segmentation with a Scribble-Conditioned ResEnc U-Net

BS:接受提示——基于涂鸦条件残差编码U-Net的交互式多示踪剂PET/CT病灶分割

Marven Sherif, Amgad Elmasry, Youssef Ghazal, Ayman Elghotni (Brightskies)

机构 * Brightskies

AI总结 本研究提出基于涂鸦条件残差编码U-Net的交互式多示踪剂PET/CT病灶分割方案,经五折交叉验证,交互修正可大幅提升分割性能,缩小模型间差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01552 2026-09-02 cs.AI cs.LG 新提交

Can LLMs Discover Scientific Laws in Real and Parallel Worlds?

大型语言模型(LLM)能否在真实世界与平行世界中发现科学定律?

Yiming Huang, Ziche Liu, Zhuohang Wu, Yiqian Wang, Junxia Cui, Xinkai Zou, Linjun Mao, Nan Huang, Naicheng Yu, Kaijie Zhu, Yue Ma, Kun Zhou, Letian Peng, Jingbo Shang

机构 * University of California San Diego(加州大学圣地亚哥分校) University of California, Irvine(加州大学欧文分校) Cushing Academy(卡欣学院) University of California, Santa Barbara(加州大学圣巴巴拉分校)

AI总结 本研究推出科学定律发现基准SCILAWS-BENCH,通过真实与平行双设置评估LLM的科学定律发现能力,发现预测拟合与科学有效性背离、记忆影响公式复现及存在选择瓶颈等现象,为相关评估提供新视角。

Comments 42 pages, 16 figures. Project page: this https URL (https://yiyihum.github.io/SciLaws-Bench/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01551 2026-09-02 cs.CV 新提交

What, Where, and How: Probing Spatiotemporal Representations in Video Foundation Models

是什么、在哪里、如何:探究视频基础模型中的时空表征

Sharon S. Musa, Fereshteh Forghani, Harrish Thasarathan, Sonia Joseph, Matthew Kowal, Konstantinos G. Derpanis

机构 * Lassonde School of Engineering(拉桑德工程学院) York University(约克大学) Vector Institute(矢量研究院) FAIR, Meta Superintelligence Labs(Meta超级智能实验室FAIR) Mila(米拉研究院) McGill University(麦吉尔大学) Goodfire AI(Goodfire人工智能公司)

AI总结 本研究通过分层分析V-JEPA 2和VideoMAE-v2,探究其时空表征的编码内容、位置与几何组织,发现相机运动编码特性并应用几何样条引导实现更优的视频插值。

Comments Interactive visualizations are available at this https URL (https://vid-rep-pca.netlify.app/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01550 2026-09-02 cs.LG cs.AI 新提交

A Mathematical Theory of Reusable Neural Bases for Network Compression

用于网络压缩的可复用神经基的数学理论

Binshuai Wang

机构 * The George Washington University(乔治·华盛顿大学)

AI总结 针对大型AI模型的内存瓶颈,提出线性可复用神经基架构,通过共享神经基的线性组合实现高压缩率,实验显示其收敛更快、损失更低且训练稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01549 2026-09-02 cs.LG 新提交

NashDreamer: Model-Based Reinforcement Learning for Zero-Sum Imperfect-Information Games

NashDreamer:用于零和非完全信息博弈的基于模型的强化学习

Tomáš Holeček, Viliam Lisý

机构 * Artificial Intelligence Center(人工智能中心) Faculty of Electrical Engineering, Czech Technical University in Prague(布拉格捷克技术大学电气工程学院)

AI总结 本文针对基于模型的强化学习在零和非完全信息博弈中应用不足的问题,提出NashDreamer框架,引入MARSSM模型,经四基准游戏验证可提升样本效率,并分析了Dreamer系列算法的后验崩溃问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01548 2026-09-02 cs.CL 新提交

SDARE-Bench: Evaluating Large Language Models on Conversational Stigma Detection and Response in Dyadic and Group Dialogue

SDARE-Bench:评估大型语言模型在二元与群体对话中的对话式污名检测与响应能力

Stephanie Fong, Yiwen Jiang, Zimu Wang, Hongxi Yang, Yaling Shen, Hiu Weh Naomi Chow, Heung Ying Lai, Xiangyu Zhao, Qingyang Xu, Zhongxing Xu, Jiahe Liu, Guilherme C. Oliveira, Vincent Lee, Zongyuan Ge, Dominic Dwyer

机构 * Monash University(莫纳什大学) University of Liverpool(利物浦大学) University of Edinburgh(爱丁堡大学) Federation University(联邦大学) Orygen, The University of Melbourne(墨尔本大学下属Orygen机构)

AI总结 研究人员构建首个场景式基准SDARE-Bench,评估8个LLMs在二元与群体对话中的污名检测和响应能力,发现LLMs对污名识别差、群体场景污名表达率达97.5%,污名响应是其安全漏洞。

Comments Paper accepted at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01537 2026-09-02 cs.LG 新提交

Quantum Sparse Autoencoders for Q-Matrix Estimation in Cognitive Diagnosis

用于认知诊断中Q矩阵估计的量子稀疏自编码器

Arif Hassan Zidan, Yi Pan, Bowen Guo, Xiang Li, Yu Bao, Yingfeng Wang, Tianming Liu, Wei Zhang

机构 * School of Computer and Cyber Sciences, Augusta University(奥古斯塔大学计算机与网络科学学院) School of Computing, University of Georgia(佐治亚大学计算学院) Department of Graduate Psychology, James Madison University(詹姆斯麦迪逊大学研究生心理学系) Department of Computer Science and Engineering, University of Tennessee at Chattanooga(田纳西大学查塔努加分校计算机科学与工程系) Department of Radiology, Massachusetts General Hospital, Harvard Medical School(哈佛医学院麻省总医院放射科)

AI总结 本研究首次将量子机器学习应用于认知诊断的Q矩阵估计,提出量子稀疏自编码器,经60个模拟及9个真实测评数据集测试,其相比经典自编码器更稳定、在多数真实数据集上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01532 2026-09-02 cs.CL 新提交

Knowledge Distillation During Mid-Training Favors Reasoning over Factual Recall

训练中期的知识蒸馏更利于推理而非事实回忆

Jacqueline He, Howard Yen, Shuyue Stella Li, Margaret Li, Hanqing Zeng, Yinglong Xia, Benyu Zhang, Zhuokai Zhao, Qiang Zhang, Pang Wei Koh, Luke Zettlemoyer, Wen-tau Yih

机构 * Meta AI University of Washington(华盛顿大学) Princeton University(普林斯顿大学)

AI总结 该研究发现训练中期的前向KD会减缓事实回忆但提升推理,提出Switch Distillation方法,在保留高推理和知识性能的同时维持大部分事实回忆,优于现有蒸馏目标。

Comments 33 pages, 13 figures, 9 tables. Code is publicly available at this https URL (https://github.com/facebookresearch/midtraining-distillation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01530 2026-09-02 cs.CV 新提交

Revisiting Cross-View Completion: Self-Supervised Pre-Training via Reconstruction Error Comparison

重新审视跨视图补全:基于重构误差对比的自监督预训练

Thibaut Loiseau, Guillaume Bourmaud, Vincent Lepetit

机构 * LIGM, Ecole Nationale des Ponts et Chaussées, IP Paris, Univ Gustave Eiffel, CNRS(LIGM实验室、巴黎国立路桥学校、巴黎IP大学、古斯塔夫·埃菲尔大学、法国国家科学研究中心) Univ. Bordeaux, CNRS, Bordeaux INP, IMS(波尔多大学、法国国家科学研究中心、波尔多国立综合理工学院、IMS研究所)

AI总结 本研究提出Gekko模型,通过重构误差对比实现跨视图补全的自监督预训练,无需3D标注即可提升多3D视觉任务性能,且可直接从原始视频训练,效果优于现有方法。

Comments Project page: this https URL (https://thibautloiseau.github.io/projects/gekko)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01526 2026-09-02 cs.AI 新提交

EvoSCM: Scientific Belief Revision Through Causal Model Evolution and Experimentation

EvoSCM:通过因果模型演化与实验进行科学信念修正

Qing Zhao, Haowei Li, Weijian Deng, Pengxu Wei, Liang Lin

机构 * Sun Yat-sen University(中山大学) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

AI总结 EvoSCM 为科学智能体配备可演化的结构因果模型,通过封闭发现循环修正信念,在 DiscoverPhysics 基准上优于基线,提升科学发现的准确性与实验交互效率。

Comments This is a preliminary version, with further details and results to follow

详情

展开后加载摘要…

URL PDF HTML 收藏