arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-06 至 2026-08-06 共收录 49 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 5 篇

2608.01207 2026-08-06 cs.CV cs.AI 版本更新 81%

It's the Decoding Format, Not the Perturbation: Auditing Consistency-Based Selection for Vision-Language Test-Time Scaling

是解码格式,而非扰动:审计视觉语言模型测试时扩展的基于一致性的选择

Puzhuo Zheng, Hasan Kurban

专题命中 数学推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 该研究发现视觉语言模型测试时的选择效果由解码格式而非扰动决定,提出的扰动基选择(Pgs)在控制格式后无显著收益,说明其无法作为有效选择信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02087 2026-08-06 cs.AI cs.CL cs.LG 版本更新 67%

Instruction-Conditioned Exploration for Reinforcement Learning with Self-Distillation to an Unconditioned Policy

基于非对称强化学习与自蒸馏的指令条件探索

Jim Dilkes, Vahid Yazdanpanah, Sebastian Stein

机构 * University of Southampton(南安普顿大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究针对LLM强化学习中的探索挑战,提出指令条件探索(ICE)方法,结合非对称RL/SD训练目标,使Qwen3-1.7B数学推理性能提升5.0%且长上下文下仍有效。

Comments Submitted to ACL Rolling Review (ARR) May 2026 cycle. OpenReview submission record at https://openreview.net/forum?id=PV945lekMa

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10367 2026-08-06 cs.CL cs.AI 版本更新 62%

Large-Small Model Collaboration for Enhancing Edge-Deployed Small Models

用于增强边缘部署小模型的大小模型协作

Peigen Liu, Yijiang Fan, Zixuan Xu, Yuren Mao, Longbin Lai, Ying Zhang

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出自适应边缘-云框架G-Boost,通过动态选择推理或对数融合的协作方式,提升边缘部署小语言模型的任务性能,在两个数学推理数据集上优于多种基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04721 2026-08-06 cs.AI 版本更新 57%

AI Assistance Reduces Persistence and Hurts Independent Performance

人工智能辅助降低坚持性并损害独立表现

Grace Liu, Brian Christian, Tsvetomira Dumbalska, Michiel A. Bakker, Rachit Dubey

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Oxford(牛津大学) Massachusetts Institute of Technology(麻省理工学院) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 研究发现人工智能辅助虽短期提升表现,但降低用户坚持性并损害独立完成任务的能力,尤其在数学推理和阅读理解等任务中表现显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19058 2026-08-06 cs.CL 版本更新 57%

MathDebugger: Detecting and Diagnosing Errors in Synthetic Mathematical Data

MathDebugger:检测与诊断合成数学数据中的错误

Hao Liang, Meiyi Qiang, Yuying Li, Zefeng He, Xiaochen Ma, Ruichuan An, Yongzhen Guo, Zhengzhou Zhu, Bin Cui, Wentao Zhang

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 MathDebugger是用于评估模型检测诊断合成数学数据错误的基准,含6000个标注实例,评估发现模型在该任务上表现不足,错误类型信息可提升修正效果,为数学数据质量控制提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 1 篇

2509.26368 2026-08-06 cs.NI 版本更新 50%

Introducing Large Language Models into the Design Flow of Time-Sensitive Networking

将大语言模型引入时间敏感网络的设计流程

Rubi Debnath, Luxi Zhao, Mohammadreza Barzegaran, Paul Pop, Sebastian Steinhorst

专题命中 代码与定理证明 :planning(abstract)

AI总结 针对配置优化TSN网络的挑战,通过跨模型案例研究评估现有大语言模型能力,提出LLM辅助编排框架,介绍构建模块与管道,分析实际部署机会与局限,为评估LLM辅助TSN编排可行性提供路线图。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 4 篇

2508.00285 2026-08-06 cs.CL 版本更新 83%

Enhancing Trustworthy Clinical Diagnosis Decision-Making in Large Language Models via Etiology-Aware Attention Supervision

通过病因感知注意力监督增强大型语言模型在临床诊断决策中的可信性

Peixian Li, Yu Tian, Ruiqi Tu, Chengkai Wu, Jingjing Ren, Jingsong Li

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL

AI总结 该研究提出病因感知注意力监督框架,通过引入临床病因模式对大型语言模型进行参数高效微调,在两类诊断队列上提升了诊断准确率与注意力聚焦性,增强了模型临床诊断的可信性。

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03808 2026-08-06 cs.CV cs.LG 版本更新 77%

From Brute Force to Semantic Insight: Performance-Guided Data Transformation Design with LLMs

从暴力到语义洞察:基于LLM的性能引导数据转换设计

Usha Shrestha, Dmitry Ignatov, Radu Timofte

机构 * Computer Vision Lab, CAIDAS & IFI, University of Würzburg(计算机视觉实验室、CAIDAS与IFI、乌尔姆大学)

专题命中 逻辑推理 :chain-of-thought(abstract,abstract_cn);reasoning(abstract);分类 cs.LG

AI总结 本文提出了一种基于LLM的性能引导数据转换设计方法,通过经验反馈实现闭环优化,减少穷举搜索需求,提升代码生成的准确性与任务对齐性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12480 2026-08-06 cs.AI cs.LG cs.MA 版本更新 62%

The Yokai Learning Environment: Tracking Beliefs Over Space and Time

Yokai 学习环境:在空间和时间上跟踪信念

Constantin Ruhdorfer, Matteo Bortoletto, Johannes Forkel, Jakob Foerster, Andreas Bulling

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 Yokai学习环境通过跟踪和更新信念来实现有效合作,挑战现有ZSC方法的泛化能力。

Comments RLC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03147 2026-08-06 cs.CV 版本更新 50%

CROSS: Cascaded Distillation and Dual-Constraint Grounding for Remote Sensing Referring Segmentation

CROSS:用于遥感指称分割的级联蒸馏与双约束 grounding

Tingzhang Luo, Ruizhong Liu, Yichao Liu, Cheng Fan, Yu Liu, Jianyuan Guo

专题命中 逻辑推理 :reasoning(abstract)

AI总结 针对遥感指称分割中架构弱耦合与语义偏差问题,本文提出CROSS范式,通过LGCD与PSCL实现性能突破,成为RRSIS的稳健新方案。

Comments Accepted at the European Conference on Computer Vision (ECCV) 2026. 20 pages, 6 figures, and 5 tables. Tingzhang Luo and Ruizhong Liu contributed equally. Jianyuan Guo is the corresponding author. Project page: https://clarence-cv.github.io/CROSS/

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 9 篇

2510.21084 2026-08-06 cs.CL cs.AI 版本更新 81%

MediRec: Enhancing Chinese Medication Recommendation with Explainable Clinical Reasoning

代谢性疾病出院药物推荐中的大型语言模型应用

Juntao Li, Haobin Yuan, Ling Luo, Yuanyuan Sun, Jian Wang, Hongfei Lin

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大型语言模型在中文代谢性疾病出院药物推荐中的应用,评估了多种LLM家族的性能,发现监督微调虽提升效果,但仍有改进空间。

Comments Accepted by NLPCC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12735 2026-08-06 cs.CV 版本更新 78%

AffectAgent: Collaborative Multi-Agent Reasoning for Retrieval-Augmented Multimodal Emotion Recognition

AffectAgent:协同多智能体推理用于检索增强的多模态情感识别

Zeheng Wang, Zitong Yu, Yijie Zhu, Bo Zhao, Haochen Liang, Taorui Wang, Wei Xia, Jiayu Zhang, Zhishu Liu, Hui Ma, Fei Ma, Qi Tian

机构 * Great Bay University(大湾大学) Guangming Laboratory(光明实验室)

专题命中 规划推理 :reasoning(title,abstract)

AI总结 本文提出AffectAgent,通过协同多智能体推理框架,解决多模态情感识别中的模态模糊和复杂情感依赖问题,引入MB-MoE和RAAF提升表现。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28566 2026-08-06 cs.AI cs.LG 版本更新 73%

Tree of Thoughts as a Classical Heuristic Search Problem: Formal Foundations and Design Patterns

思维树作为经典启发式搜索问题:形式化基础与设计模式

Guni Sharon

机构 * Guni Sharon

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文通过经典启发式搜索术语统一分类法,将基于LLM的推理映射到搜索组件,并识别出系统搜索和前瞻性策略两种设计模式。

Comments Extended version of the SoCS 2026 paper. Includes appendices omitted from the proceedings version

Journal ref Proceedings of the Nineteenth International Symposium on Combinatorial Search (SoCS 2026), AAAI Press, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03589 2026-08-06 cs.DB cs.LG 版本更新 70%

stratum: A System Infrastructure for Massive Agent-Centric ML Workloads

stratum: 一种支持大规模基于代理的机器学习工作负载的系统基础设施

Arnab Phani, Elias Strauss, Sebastian Schelter

机构 * BIFOLD & TU Berlin(BIFOLD与柏林技术大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 stratum是一种支持大规模基于代理的机器学习工作负载的系统基础设施,通过解耦流水线执行与规划推理,提升大规模代理流水线搜索效率。

Comments Accepted at PVLDB 2026 (Vol. 19, No. 11). Artifact available on GitHub

Journal ref Proc. VLDB Endow. 19(11): 3799-3806, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27882 2026-08-06 cs.CL cs.AI 版本更新 62%

VibeSearchBench: Benchmarking Long-horizon Proactive Search in the Wild

VibeSearchBench:野外长期主动搜索的基准测试

Xiaohongshu Inc

机构 * Xiaohongshu Dots Studio & Unipat AI(小红书 dots 飞 studios 与 Unipat AI)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对现有搜索基准中查询过于明确、单轮交互和固定模式评估导致用户体验与评估结果差距的问题,提出VibeSearch范式并构建VibeSearchBench基准,通过渐进式用户模拟和图匹配评估框架测试前沿模型,发现所有模型在长期上下文推理、主动意图激发和结构化知识构建方面仍存在显著不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03545 2026-08-06 cs.CL 版本更新 57%

Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning

Hi-TTRL:利用提示调控测试时强化学习的共识

Kunbin Xu, Xingzuo Li, Xuefeng Bai, Kehai Chen

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 该研究针对测试时强化学习(TTRL)中共识强度不当导致的问题,提出 Hi-TTRL 框架,通过 MCMC 提示采样器调控共识强度,提升了 TTRL 的性能。

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23299 2026-08-06 cs.LG 版本更新 57%

GRIMIP: A General Framework for Instance-Specific Configuration of MIP Solvers Using LLMs

GRIMIP:一种使用LLM进行MIP求解器实例特定配置的通用框架

Yidong Luo, Xuemin Chen, Chenguang Wang, Fangzhou Zhu, Tao Zhong, Tianshu Yu

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)理工学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 提出GRIMIP框架,结合大语言模型的语义推理与贝叶斯优化的高效搜索,为混合整数规划求解器配置超参数,在MIPLIB等基准上实现超过40%的原始对偶积分减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06708 2026-08-06 cs.CL 版本更新 57%

Signal-Driven Observation for Long-Horizon Web Agents

信号驱动观测:面向长程任务的Web智能体

Shubham Gaur, Ian Lane

机构 * University of Cambridge(剑桥大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 提出信号驱动观测(SDO)方法,通过专用子调用读取完整DOM但仅返回任务相关元素,并由轻量信号检测器触发重新调用,解决长程Web智能体中上下文退化问题。

Comments 10 pages, 1 figure. Accepted to the Failure Modes in Agentic AI (FAGEN) Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09207 2026-08-06 cs.DC 版本更新 50%

Bidirectional Resource Scheduling for Disaggregated and Asynchronous RL Post-Training

用于解耦和异步强化学习后训练的双向资源调度

Zhiqiang Tan, Maoxin Wang, Sijie Wang, Yiming Yin, Qiang Wang, Xiaowen Chu, Shaohuai Shi

专题命中 规划推理 :reasoning(abstract)

AI总结 本文针对不同RL设置和工作负载下资源常空闲的问题,提出BiDiRL架构,通过开发热切换运行时、基于时间性能建模的规划器及双向调度器,减少资源空闲,在32-GPU测试平台上显著提高RL训练吞吐量。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视觉空间推理 3 篇

2603.06140 2026-08-06 cs.CV cs.AI 版本更新 79%

Place-it-R1: Unlocking Environment-aware Reasoning Potential of MLLM for Video Object Insertion

Place-it-R1: 解锁多模态大语言模型在视频物体插入中的环境感知推理潜力

Bohai Gu, Taiyi Wu, Dazhao Du, Jian Liu, Shuai Yang, Xiaotong Zhao, Alan Zhao, Song Guo

机构 * HKUST(香港科技大学) Tencent Video(腾讯视频) Peking University(北京大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 Place-it-R1通过多模态大语言模型的环境感知推理能力,实现物理一致的视频物体插入,提供两种模式以平衡保真度与合理性。

Comments https://nevsnev.github.io/Place-it-R1/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26738 2026-08-06 cs.CV cs.AI cs.CL 版本更新 62%

SleepVLM: A Rule-Grounded Vision-Language Model for Auditable Sleep Staging

SleepVLM:基于视觉语言模型的可解释且规则驱动的睡眠分期

Guifeng Deng, Pan Wang, Mengfan Niu, Jiquan Wang, Shuying Rao, Junyi Xie, Xi'ang Chen, Sha Zhao, Gang Pan, Wanjun Guo, Tao Li, Haiteng Jiang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出SleepVLM,一种基于规则驱动的视觉语言模型,通过多通道PSG波形图像进行睡眠分期,并生成符合AASM评分标准的临床可读解释,在保持高准确率的同时提升可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19418 2026-08-06 cs.CV cs.AI cs.LG 版本更新 62%

Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens

链式视觉思维:通过连续视觉标记教学VLMs更好地看到和思考

Yiming Qin, Bomin Wei, Jiaxin Ge, Konstantinos Kallidromitis, Stephanie Fu, Trevor Darrell, XuDong Wang

机构 * UC Berkeley(加州大学伯克利分校) UCLA(洛杉矶大学) Panasonic AI Research(松下人工智能研究)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 COVT通过连续视觉标记提升VLMs的视觉推理能力,使模型在多个基准测试中性能提升3%-16%。

Comments Project page: https://wakalsprojectpage.github.io/covt-website/

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 测试时计算 2 篇

2603.14294 2026-08-06 cs.CV cs.AI cs.LG cs.RO 版本更新 62%

Seeking Physics in Diffusion Noise

在扩散噪声中寻求物理规律

Chujun Tang, Lei Zhong, Fangqiang Ding

机构 * Brown University(布朗大学) University of Edinburgh(爱丁堡大学) MIT(麻省理工学院)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 研究通过分析预训练扩散变换器的中间去噪表示,发现物理合理与不合理视频在中层特征空间部分可分离,提出渐进轨迹选择策略提升物理一致性并降低推理成本。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21343 2026-08-06 cs.CV 版本更新 50%

Latent Denoising Improves Visual Alignment in Large Multimodal Models

潜在去噪提升大多模态模型的视觉对齐

Dhruv Parikh, Jacob Fein-Ashley, Rajgopal Kannan, Viktor Prasanna

机构 * University of Southern California(南加州大学) DEVCOM ARL Army Research Office(DEVCOM ARL陆军研究办公室)

专题命中 测试时计算 :reasoning(abstract)

AI总结 本文提出通过潜在去噪框架改进大多模态模型的内部视觉特征对齐和多模态理解,采用掩码和高斯噪声混合腐蚀视觉token,并利用解码器恢复教师特征,提升模型在分布偏移下的鲁棒性。

Comments ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 复杂问题求解 6 篇

2604.23054 2026-08-06 cs.CL cs.AI cs.LG 版本更新 67%

DeepImagine: Clinical Trial Outcome Prediction via Stepwise Local Counterfactual Imaginations

DeepImagine: 通过连续反事实想象学习生物医学推理

Youze Zheng, Jianyou Wang, Yuhan Chen, Matthew Feng, Longtian Bao, Hanyuan Zhang, Maxim Khan, Aditya K. Sehgal, Christopher D. Rosin, Umber Dube, Ramamohan Paturi

机构 * Laboratory for Emerging Intelligence, University of California, San Diego(新兴智能实验室,加州大学圣地亚哥分校) Department of Dermatology, University of California, San Diego(皮肤科系,加州大学圣地亚哥分校) University of Chicago(芝加哥大学) Elsevier(艾尔斯特出版社)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出DeepImagine框架,通过连续反事实想象训练语言模型进行生物医学推理,利用反事实对偶和强化学习提升临床试验预测性能,展示模型在生物医学领域的可解释性改进。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10599 2026-08-06 cs.CL cs.AI cs.LG 版本更新 67%

Emergence of Hierarchical Emotion Organization in Large Language Models

大型语言模型中层级情感组织的涌现

Maya Okawa, Bo Zhao, Eric J. Bigelow, Rose Yu, Tomer Ullman, Ekdeep Singh Lubana, Hidenori Tanaka

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) University of Washington(华盛顿大学) University of Tokyo(东京大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 受情感轮理论启发,分析大型语言模型输出中情感状态间的概率依赖关系,发现模型自然形成与人类心理模型一致的层级情感树,且更大模型发展出更复杂的层级结构,同时揭示社会经济角色在情感识别中的系统性偏差。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06506 2026-08-06 cs.CL cs.AI cs.LG cs.MA 版本更新 67%

Pun Intended: Multi-Agent Translation of Wordplay with Contrastive Learning and Phonetic-Semantic Embeddings for CLEF JOKER 2025 Task 2

并非双关:结合对比学习与音义嵌入的多智能体双关语翻译方法,用于CLEF JOKER 2025任务2

Russell Taylor, Benjamin Herbert, Michael Sana

机构 * Georgia Institute of Technology(佐治亚理工学院) Peoples' Friendship University of Russia (RUDN University)(俄罗斯人民友谊大学) Joint Institute for Nuclear Research(联合核子研究中心) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) University of Skövde(斯德哥尔摩大学)

专题命中 复杂问题求解 :chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究针对跨语言双关语翻译难题,提出结合对比学习、音义嵌入与多智能体生成器-判别器框架的三阶段方法,在CLEF JOKER 2025任务2竞赛中获第一、第二名,推动了双关语翻译研究。

Journal ref CEUR Workshop Proceedings, Vol-4038, pp. 2870-2888, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03079 2026-08-06 cs.CL 版本更新 57%

Learning to Diagnose and Correct Moral Errors: Beyond Shallow Heuristics in Moral Alignment

学习诊断和纠正错误:大型语言模型中的道德敏感性获取

Bocheng Chen, Xi Chen, Han Zi, Haitao Mao, Zimo Qi, Xitong Zhang, Kristen Johnson, Guangliang Liu

机构 * University of Mississippi(密西根州立大学) Nanyang Technological University(南洋理工大学) Northeastern University(东北大学) AWS AI Labs(AWS AI实验室) Johns Hopkins University(约翰霍普金斯大学) Qualcomm(高通) Michigan State University(密西根州立大学) Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 提出一种实用推理方法,通过让大型语言模型诊断和纠正道德错误来获取道德敏感性,并在多个任务上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.04214 2026-08-06 cs.DB cs.AI cs.PL 版本更新 57%

On The Suitability of Differential Dataflow For Datalog Interpretation In Highly Dynamic Settings

差分数据流在高度动态场景下 Datalog 解释的适用性研究

Bruno Rucy Carneiro Alves de Lima, Merlin Kramer, Kalmer Apinis

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文研究差分数据流在高度动态场景下 Datalog 解释的适用性,通过对比三种 Datalog 实现的物化效率,为增强动态数据环境中 Datalog 驱动的计算提供了路线图。

Comments 8 pages, AICCC 2023

Journal ref Proceedings of the 2023 6th Artificial Intelligence and Cloud Computing Conference (AICCC 2023), Kyoto, Japan, December 2023, pp. 218-225. ACM, New York, NY, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25465 2026-08-06 cs.SE 版本更新 50%

BloomAPR: A Bloom's Taxonomy-based Framework for Assessing the Capabilities of LLM-Powered APR Solutions

BloomAPR:基于布鲁姆教育目标分类学的框架,用于评估大语言模型驱动的自动程序修复(APR)方案的能力

Yinghang Ma, Jiho Shin, Leuson Da Silva, Zhen Ming, Jiang, Song Wang, Foutse Khomh, Shin Hwei Tan

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 BloomAPR是基于布鲁姆教育目标分类学的动态评估框架,评估了ChatRepair、CigaR等APR方案在不同LLM及布鲁姆分类层级下的漏洞修复能力,发现其存在性能差异并指出基准演进的必要性。

Comments 22 pages, 7 figures, Manuscript submitted to ACM Transactions on Software Engineering and Methodology

详情

展开后加载摘要…

URL PDF HTML 收藏