arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-30 至 2026-07-30 共收录 312 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 84 篇

2607.27100 2026-07-30 cs.CY 新提交 90%

Can Large Language Models Represent Urban Publics? Behavioral Replication and Population Mismatch in an Affordable-Housing Experiment

大语言模型能否代表城市公众?经济适用房实验中的行为复制与人口匹配问题

Yuxuan Cai, Yequan Hu, Hongqian Li, Zhanghong Ju, Shuying Guo

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 该研究以美国经济适用房调查实验对比8款开放权重LLMs与843名受访者,发现LLMs虽能近似部分总体对比,却无法保留人口结构、组内异质性等关键特征,城市规划的模型评估需测试空间与社会结构的模拟保留情况。

Comments Yuxuan Cai and Yequan Hu contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26849 2026-07-30 cs.CR cs.LG 新提交 90%

ToxScreen: Detecting Whether an LLM Has Been Poisoned

ToxScreen:检测大语言模型是否被植入后门

Anthony Hughes, Nicole Xing, Collin Francel, Andy Kim, Andrew Draganov

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出ToxScreen基准,研究现实条件下防御者能否恢复LLM的后门触发器,发现令牌查找方法可有效恢复触发器,且易越狱模型是有用信号,相关模型与代码已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26724 2026-07-30 cs.AI 新提交 90%

UrbanDS: A Graph-Guided LLM Multi-Agent System for Data-Intensive Urban Tasks

UrbanDS:一种用于数据密集型城市任务的图引导大语言模型多智能体系统

Zhilun Zhou, Jianghao Yu, Yuming Lin, yongjun yang, Sun Yongquan, Depeng Jin, Yong Li

机构 * Tsinghua University(清华大学) Jiangmen Municipal Smart Social Governance Technology Innovation Center(江门市智慧社会治理技术创新中心)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究针对数据密集型城市任务中现有LLM智能体依赖有限数据集的问题,提出图引导多智能体系统UrbanDS,构建基准UrbanDS-Bench验证其性能,该系统已在武汉东西湖城市平台落地应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13317 2026-07-30 cs.CL 版本更新 90%

SkillCAT: Contrastive, Assessment-Augmented and Topology-AwareSkill Self-Evolution for LLM Agents

SkillCAT: 面向LLM智能体的对比评估与拓扑感知技能自进化

Kunfeng Chen, Qihuang Zhong, Juhua Liu, Bo Du

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) School of Computer Science, Fudan University(复旦大学计算机学院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 提出SkillCAT框架,通过对比因果提取、评估增强进化和拓扑感知任务执行三阶段,实现无需训练的LLM智能体技能自进化,在多个基准上平均提升高达40.40%。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11325 2026-07-30 cs.IR cs.AI 版本更新 90%

Structured Belief State and the First Precision-Aware Benchmark for LLM Memory Retrieval

结构化信念状态与首个面向LLM记忆检索的精度感知基准

Jeffrey Flynt

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 针对现有LLM记忆系统基准仅评估答案质量而忽略检索精度的问题,提出独立于生成模型的检索精度基准PrecisionMemBench和结构化信念存储系统Tenure,实现89/89测试案例通过且平均精度1.0。

Comments v4 removes duplicate prose and adds external adoption

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25094 2026-07-30 cs.CL cs.AI 版本更新 90%

Evaluating Communicative Belief Updates in Large Language Models via Implicature Recognition and Cancellation

通过含义识别和取消评估大语言模型中的交际信念更新

Cesare Spinoso-Di Piano, Verna Dankers, Marius Mosbach, Jackie Chi Kit Cheung

机构 * Mila - Quebec AI Institute & McGill University(米拉 - 魁北克人工智能研究所和麦吉尔大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究通过创建首个专家注释的含义取消数据集,评估大语言模型识别和理解潜在信念及更新的能力,发现其落后于人类,成功可能源于依赖先验信念,失败取决于类型和形式,表明当前LLMs未达人类水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26397 2026-07-30 cs.CL cs.LG q-bio.QM 新提交 88%

Knowledge before Reasoning: EC-Reason-Bench, a Training-Free Diagnostic Benchmark for LLM Enzyme Classification

推理前的知识:EC-Reason-Bench,一种用于大语言模型酶分类的无训练诊断基准

Linyu Li, Zhi Jin, Yichi Zhang, Dongming Jin, Yuanpeng He, Huanyao Zhang, Xuan Zhang, Gadeng Luosang, Nyima Tashi

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL、cs.LG

AI总结 该研究针对通用LLM酶分类中EC编号二至四级准确率近乎为零的问题,提出无训练诊断基准EC-Reason-Bench,分解四个维度评估,发现外部知识优先于推理等关键结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01240 2026-07-30 cs.CL cs.AI 版本更新 88%

Prompt Framing Distorts Count Based Evaluation of LLM Error Detection: Evidence from Numeric Anchoring

提示框架扭曲了基于计数的LLM错误检测评估:来自数字锚定的证据

Dekun Yang

机构 * Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文发现基于计数的F1分数可能因提示中的数字锚定而虚高,与跨度定位能力脱节,提出ErrorBench压力测试协议,并建议评估时应避免预置错误计数并报告跨度感知指标。

Comments 15 pages, 6 figures, 12 tables. Preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15846 2026-07-30 cs.CV 版本更新 88%

A Closer Look at Dynamic Scene Graph Generation In the Era of Multimodal Large Language Models

多模态大语言模型时代的动态场景图生成研究

Xuanming Cui, Jaiminkumar Ashokbhai Bhoi, Chionh Wei Peng, Adriel Kuek, Ser Nam Lim

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本研究针对多模态大语言模型时代动态场景图生成的局限,从任务设置优化评估指标、基于MLLM改进模型设计,在多个数据集上实现了最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26791 2026-07-30 cs.CR cs.AI cs.CL 新提交 87%

SecRespond: Benchmarking AI Agents for Real-World Post-Compromise Incident Response

SecRespond:面向真实入侵后事件响应的AI智能体基准测试集

Lehan Wang, Boli Chen, Ruixue Ding, Pengjun Xie, Jinwei Huang, Zhendong Liu, Shuo Wang, Tao Lei, Xin Ouyang, Xiaomeng Li

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究人员推出首个入侵后事件响应AI智能体基准测试集SecRespond,评估23种前沿LLM在10个靶场的表现,发现现有智能体难以及时发现隐蔽入侵并制定全面修复计划,存在根本瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26643 2026-07-30 cs.AI cs.LG 新提交 87%

Rethinking Self-Evolution: A Constrained Exploration-Exploitation Process for Mitigating Skill Overfitting

重新思考自进化:缓解技能过拟合的约束探索-利用过程

Hongqiang Lin, Chao Liu, Xiaofan Bai, Xuan Jin, Yuhong Li, Nenggan Zheng, Xipeng Cao

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对LLM智能体技能过拟合问题,提出SkillBoost三阶段框架,在23种模型-基准配置上达SOTA性能,优化后技能可跨智能体复用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26066 2026-07-30 cs.CL cs.AI cs.DL 新提交 87%

Do Methods Support the Claims? Intra-Paper Verification for Peer Review

方法是否支持其主张?用于同行评审的论文内部验证

Ranjitha Shivaprasad Ballakuraya, Arash Mahyari, Ashok Srinivasan

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对现有 LLM 评审系统忽视论文内部主张与方法学证据不匹配的问题,提出 intra-paper claim verification 框架,经实验验证其生成的评审意见与人类评审关注点高度契合。

Comments 9 pages, 8 figures. Source code, prompts, evaluation materials, and supporting data available at https://github.com/Ranjitha2493/intra-paper-claim-method-verification

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26710 2026-07-30 cs.LG 新提交 86%

PowerAtlas: Towards Electricity-Computing Co-Scheduling for Power Systems

PowerAtlas:面向电力系统的电-计算协同调度

Kaiwen Jiang, Siya Xu, Ziyue Zhu, Chao Yang, Anh Tuan Luu, Haoran Luo

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) State Grid Liaoning Electric Power Co., Ltd.(国网辽宁省电力有限公司) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 PowerAtlas是用于电-计算协同调度的LLM智能体框架,整合多类约束生成可行方案,构建含2000个实例的ECBench基准,在11种LLM上验证了有效性。

Comments 17 pages, 9 figures, 5 tables. Code: https://github.com/JAVA-Jiang/PowerAtlas

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26314 2026-07-30 cs.CR cs.AI 新提交 86%

StealthBench: Measuring Operational Stealth in Autonomous Offensive-Security Agents

StealthBench:衡量自主进攻性安全智能体的操作隐蔽性

Ads Dawson, Adrian Wood

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究人员推出StealthBench基准,通过含三个LLM的评判小组评估自主进攻性安全智能体的OPSEC表现,发现无模型安全成功率超54%,证实OPSEC失败具系统性,该基准用于支持相关智能体开发与监控。

Comments 29 pages, 9 tables, 1 figure, 2 appendices. Code: https://github.com/GangGreenTemperTatum/stealthbench Dataset: https://huggingface.co/datasets/0xmoose/stealthbench Website: https://stealthbench.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26212 2026-07-30 cs.SE cs.AI 新提交 86%

Multi-Agent Debate Strategies: Survey, Taxonomy, and Challenges

多智能体辩论策略:综述、分类与挑战

Quim Motger, Marc Oriol, Jordi Marco, Xavier Franch

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.AI

AI总结 本文通过对141项多智能体辩论研究的系统综述,提出三维分类法,揭示领域默认采用狭窄设计模式的问题,将分类法定位为研究图谱与基准框架,未来拟形式化为可执行规范以优化辩论配置。

Comments Under review at ACM Computing Surveys

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26067 2026-07-30 cs.CY cs.AI 新提交 86%

The Easy Trap: Why LLMs Underestimate Misconception-Driven Difficulty

易陷阱:为何大语言模型低估由误解驱动的难度

Amanda La Hadi, Muhammad Johan Alibasa, Guanliang Chen, A. Taufiq Asyhari

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究发现,用于教育评估难度估计的LLM会系统性低估由学习者误解驱动的数学题难度,提出“易陷阱”现象,其仅能捕捉难度大致排序,无法反映学生实际认知难度。

Comments This paper poster presented on 19th Educational Data Mining Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08334 2026-07-30 cs.CL 版本更新 85%

CustomerSim: Benchmarking and Aligning Multimodal Language Models as Retail User Simulators

SalesSim:多模态语言模型作为零售用户模拟器的基准测试与对齐

Yada Pruksachatkun, Yixin Wan, Xingrun Chen, Kai-Wei Chang, Chien-Sheng Wu

机构 * Salesforce Research(Salesforce研究院) University of California Los Angeles(加州大学洛杉矶分校)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);prompting(abstract);分类 cs.CL

AI总结 SalesSim通过多轮多模态对话评估多模态大语言模型在模拟真实用户行为中的能力,发现模型在词汇多样性及决策一致性方面存在不足,并提出UserGRPO方法提升对话流畅度与决策对齐度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22888 2026-07-30 cs.CL cs.AI 版本更新 85%

DialectLLM: A Dialect-Aware Dialog[ue] Generation Framework Beyond Standard American English

DialectLLM:一种超越标准美式英语的方言感知对话生成框架

Jio Oh, Paul Vicinanza, Thomas Butler, Steven Euijong Whang, Dezhi Hong, Amani Namboori

机构 * KAIST(韩国科学技术院) Amazon(亚马逊)

专题命中 评测与基准 :LLM(summary_cn,abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 DialectLLM通过生成多方言对话数据,解决LLM对非标准方言识别不足的问题,验证了方言特征对生成质量的影响,展示了其在对话生成中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27066 2026-07-30 cs.CV cs.AI 新提交 84%

SciFigAlign: Scoring Scientific Figures by Fine-tuned Alignment of Visuals with Manuscript Evidence

SciFigAlign:通过微调视觉内容与稿件证据的对齐来对科学图表进行评分

Chuanzhi Xu, Zihan Deng, Huiqi Liang, Chengkun Yue, Zhanlin Cui, Pengfei Ye, Weidong Cai

专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.AI

AI总结 本文构建了含3857张科学图表的标注数据集,提出基于稿件证据的多模态评分器SciFigAlign,其在测试集上的MAE为0.3524,相对最佳LLM基准降低59%误差,证实需视觉与稿件证据的学习对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08543 2026-07-30 cs.CV cs.AI cs.CL cs.CY 版本更新 84%

VideoNorms: Benchmarking Cultural Awareness of Video Language Models

VideoNorms:视频语言模型文化意识基准测试

Nikhil Reddy Varimalla, Yunfei Xu, Meng Fan Wang, Arkadiy Saakyan, Smaranda Muresan

机构 * Department of Computer Science, Columbia University(哥伦比亚大学计算机科学系)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究推出VideoNorms数据集评估VideoLLMs的文化规范意识,发现模型中文表现逊于英文、提供非语言证据更困难,视频模态必要且规模扩大无分类分数提升,成果助力文化导向的视频模型训练与评估。

Comments 29 pages, 6 figures, 19 tables. IC2S2 2026, C3NLP@ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27136 2026-07-30 cs.IR 新提交 83%

KAMR: Grounding Generation via Knowledge-Aligned Multi-hop Retrieval

KAMR:基于知识对齐多跳检索的接地生成

Xiaochen Wang, Yuan Zhong, Haoyu Wang, Ting Wang, Fenglong Ma

专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(abstract)

AI总结 该研究针对多跳检索中三元组排序与监督缺失问题,提出KAMR知识对齐多跳检索器,通过构建部分对齐数据集优化对比目标,在多基准与LLM主干上提升了多跳检索和下游问答性能。

Comments Accepted by COLM'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15684 2026-07-30 cs.CR cs.AI 版本更新 83%

State-Dependent Safety Failures in Multi-Turn Language Model Interaction

多轮语言模型交互中的状态依赖性安全故障

Pengcheng Li, Jie Zhang, Tianwei Zhang, Han Qiu, Zhang kejun, Weiming Zhang, Nenghai Yu, Wenbo Zhou

机构 * School of Cyber Science and Technology, University of Science and Technology of China, China(中国科学技术大学信息科学与技术学院) Nanyang Technological University, Singapore(南洋理工大学) Tsinghua University, Beijing, China(清华大学) Beijing Electronic Science and Technology Institute, Beijing, China(北京电子科技研究所)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 本文从状态空间视角研究多轮交互中的安全故障,提出STAR框架分析对话历史作为状态转移操作,揭示对齐模型在多轮交互中安全边界穿越的机制。

Comments 9 pages, accepted at the International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16111 2026-07-30 stat.AP cs.AI 版本更新 83%

Calibrate Globally, Measure Everywhere: Scaling LLM-Based Prevalence Measurement Across A/B Experiments

基于代理的大规模A/B测试预估测量

Zehao Xu, Tony Paek, Kevin O'Sullivan, Attila Dobi

机构 * Pinterest, Inc.(Pinterest公司)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于代理的普及率测量框架,通过离线校准和日志数据实现大规模A/B测试中的高效普及率估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26060 2026-07-30 cs.CL cs.AI 新提交 82%

Large-Scale ChatBot Validation Through Customer Digital Twin Simulations

基于客户数字孪生模拟的大规模聊天机器人验证

Cristovao Iglesias, Devesh Batra, Alankar Atreya, Stefan Wagner, Robert Hankache, Patrick Sinclair, Giulio Pelosio, Michael McMillan, Greig A. Cowan, Raad Khraishi

机构 * leading UK bank(英国领先银行)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于合成客户智能体(SCA)数字孪生的两部分验证方法,用于解决银行等领域LLM聊天机器人的大规模安全验证问题,已成功应用于英国某头部银行的客户聊天机器人验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01527 2026-07-30 cs.SE cs.AI cs.LG 版本更新 82%

REAP: Automatic Curation of Coding Agent Benchmarks from Interactive Production Usage

REAP:从交互生产使用自动整理编码代理基准

Smriti Jha, Matteo Paltenghi, Chandra Maddila, Vijayaraghavan Murali, Shubham Ugare, Satish Chandra

机构 * Meta, USA(Meta公司)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 REAP通过自动化流程从真实开发者与代理交互中构建生产基准,解决评估信号不可靠问题,通过LLM分类和多轮稳定性检查确保基准可信。

Comments Accepted at ASE 2026 Industry Showcase

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26244 2026-07-30 cs.SE 新提交 82%

Do Code Language Models Use Tests? A Behavioral and Representational Study of Test-Driven Code Generation

代码语言模型是否利用测试?测试驱动代码生成的行为与表征研究

Yunhao Liang, Chengguang Gan, Ruixuan Ying, Hanjun Wei, Zhe Cui, Shiwen Ni

专题命中 评测与基准 :language model(title,abstract);large language model(abstract)

AI总结 该研究以Qwen2.5-Coder-7B和Qwen3.6-27B为对象,针对多个代码生成任务探究代码语言模型对测试的利用情况,发现测试通过语义引导和上下文扰动影响模型,仅表征变化不代表有效利用测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25987 2026-07-30 cs.CR cs.SE 版本更新 82%

IH-Benchmark: A Conflict-Centered Benchmark for Instruction-Hierarchy Robustness in LLM Applications

\textsc{IH - 基准测试}:用于大语言模型应用中指令层次鲁棒性的以冲突为中心的基准测试

Conor McCauley, Zeliang Kan, Jason Martin

专题命中 评测与基准 :LLM(title,abstract);language model(abstract)

AI总结 研究大语言模型接收到不同优先级冲突指令时遵循哪个的问题,提出IH - 基准测试,基于人工分类法构建,用统一协议评估,涵盖多种设置。通过对37个模型评估发现指令层次鲁棒性非单一能力,需多方面评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27030 2026-07-30 cs.CR cs.LG 新提交 81%

HoF-Bench: Rediscovering Real AI-Discovered CVEs Without Frontier Models

HoF-Bench:无需前沿模型即可重新发现真实AI发现的CVE

Petr Simecek, Elnaz Babayeva, Jiri Balhar, Michal Bida, Michal Buran, Vaclav Cadek, Luigino Camastra, Tomas Dulka, Michal Janocko, Tomas Klohna, Pavel Kohout, Ondrej Kokes, Adam Krivka, Jakub Kubik, Patrik Mada, Igor Morgenstern, Marek Pavelka, Joshua Rogers, Petr Stastny, Jan Tattermusch, Dmitrijs Trizna, Martin Votruba, Guido Vranken, Jakub Zikl, Evelina Gabasova, Stanislav Fort

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.LG

AI总结 HoF-Bench基准基于AISLE公开的95个AI发现的CVE构建,可用于对比不同模型的漏洞检测能力,极简LLM分析器在严格协议下可重新发现68%的CVE,所有模型未发现的CVE集中在C基础设施代码中。

Comments 15 pages, 6 figures. Benchmark repository: https://github.com/weareaisle/HoF-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26820 2026-07-30 cs.LG cs.CR 新提交 81%

Forecasting Trajectory-Level Safety Risks in Black-Box Multi-Turn Interactions

黑盒多轮交互中轨迹级安全风险预测

Shi Lin, Peng Qian, Dinghao Liu, Renjie Sun, Sifan Wu, Dezhang Kong, Chenpei Wang, Xun Wang

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出 Recast 框架,通过双尺度轨迹视图建模风险演变,可提前2.41轮预测88.3%的安全故障,误报率12.3%,实现轨迹级安全风险预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26367 2026-07-30 cs.AI 新提交 81%

Exploring Structures in Physics Problems: Can AI Agents Discover Statistical Mechanical Mappings?

探索物理问题中的结构:AI智能体能否发现统计力学映射?

Wanyu Zhao, Wanbing Zhao

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本研究以StatMechBench-v0为基准,评估基于LLM的“提出-验证-修正”智能体发现统计力学映射的能力,揭示其推理局限并提出验证栈的设计方向。

Comments Accepted to the AID-Wild workshop at CAIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏