arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 969 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 969 篇

2608.06961 2026-08-10 cs.AI cs.LG 新提交 62%

CAi Copilot: Reducing Operational Workload in Molecular Design through Intent-Driven Agentic Workflows

CAi Copilot:通过意图驱动的智能体工作流减少分子设计中的操作工作量

Zhu Wang, Jiangyu Chen, Yingjun Shang, Yuhui Yao, Laiao Lu, Tianfan Fu, Na Zou

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Nanjing University(南京大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 CAi Copilot是面向专家的意图驱动智能体,通过三层架构整合分子设计分散工具,在45项任务中整体性能最优,得分84.59,可将设计意图转化为可追溯工作流。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06501 2026-08-10 cs.AI cs.CL cs.MM 新提交 62%

Can MLLMs Decode the Creative Leap? Introducing C4 for Cross-Concept Understanding

多模态大语言模型(MLLMs)能否解码创造性飞跃?推出面向跨概念理解的C4框架

Ming Wang, Yuqing Zhang, Tingna Xie, Xiangju Li, Xiaocui Yang, Daling Wang, Shi Feng, Yifei Zhang

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) School of Computing and Information Systems, Singapore Management University(新加坡管理大学计算与信息系统学院) School of Computer Science and Engineering, Shandong University of Science and Technology(山东科技大学计算机科学与工程学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究推出受认知启发的C4成语跨概念创造力评估框架,构建含884个案例的C4-Eval集,评估10款MLLMs发现闭源模型准确率最高达50.7%,揭示当前MLLMs创造性解码能力存在显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06310 2026-08-07 cs.LG cs.CL 新提交 62%

RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction

RRC:基于排序的奖励构造解锁LLM强化学习中的生成式奖励模型

Chenglong Wang, Ziming Zhu, Yifu Huo, Bei Li, Qiaozhi He, Yan Ding, Xiaoyang Hao, Yuxin Gao, Tianhua Zhou, Xiaojia Chang, Tongran Liu, Jingbo Zhu

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) NiuTrans Research(NiuTrans研究院) Institute of Psychology, CAS(中国科学院心理研究所) Kunming University of Science and Technology(昆明理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本研究针对生成式奖励模型在LLM强化学习中潜力未充分发挥的问题,提出RRC方法,通过两种互补策略提升RL训练效果,在多基准上取得一致增益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05729 2026-08-07 cs.AI cs.CL cs.CV cs.HC 新提交 62%

Unified Agent: Managing Interactions across Devices

统一智能体:管理跨设备交互

Xinshuang Liu, Runfa Blark Li, Shaoxiu Wei, Xin Lin, Truong Nguyen

机构 * University of California, San Diego(加利福尼亚大学圣迭戈分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文针对现有智能体跨设备交互场景的不足,提出带紧凑状态设计的统一智能体,构建对应基准数据集,其性能显著优于多种现有设计,且在不同MLLM设置下表现鲁棒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05170 2026-08-07 cs.CL cs.AI 新提交 62%

DREAM: LLM-based Dynamic Role-playing via Event-Aware Memory Graph

DREAM:基于大语言模型的事件感知记忆图动态角色扮演

Zhihao Xiao, Mengting Li, Xintao Wang, Linfeng Li, Limin Shui, Mengqi Ji, Borui Cai

机构 * Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院) School of Computer Science, Fudan University(复旦大学计算机科学技术学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 DREAM是一种受ABC认知模型启发的结构化记忆框架,通过EMG提升角色扮演智能体的时间与因果连贯性,在CoSER、LIFECHOICE和TCM上取得最优性能。

Comments Accepted at KDD 2026. Camera-ready version to appear. 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04317 2026-08-06 cs.CR cs.AI cs.LG cs.MA 新提交 62%

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)

三叉戟:如何突破深度强化学习网络防御(智能体式)

Ryozo Masukawa, Ian Bryant, Armita Kazeminajafabadi, Sanggeon Yun, Hyunwoo Oh, SungHeon Jeong, Nathaniel D. Bastian, Mahdi Imani, Mohsen Imani

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对DRL网络防御对自适应威胁鲁棒性不足的问题,提出Trident智能体式LLM红队框架,通过含三类组件的设计,发现现有防御存在根本性脆弱性,大幅降低蓝方防御性能并揭示新兴行为。

Comments code: https://anonymous.4open.science/r/Trident-A934

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04075 2026-08-06 cs.LG cs.AI 新提交 62%

Spatiotemporal Graph Transformer for Traffic Intelligence in Edge Computing

面向边缘计算中交通智能的时空图Transformer

Laha Ale, Letian Lin, Na Cao, Zheng Ma, Peng Yu

机构 * School of Computing and Artificial Intelligence, Southwest Jiaotong University(西南交通大学计算与人工智能学院) SWJTU-Leeds Joint School, Southwest Jiaotong University(西南交通大学-利兹学院) State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications(北京邮电大学网络与交换技术国家重点实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对边缘计算中流量预测的非平稳长程建模难题,提出时空图Transformer框架,经真实蜂窝网络数据集验证,其性能优于GCN-RNN等基线模型,可支撑主动资源管理。

Comments 12 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03842 2026-08-05 cs.CL cs.LG 新提交 62%

Sensitivity, Causality, and Repair Dissociate: A Layer-Wise Analysis of Perturbation Robustness and Its Scaling

敏感性、因果性与修复能力的分离:扰动鲁棒性的逐层分析及其缩放规律

Nathan Labiosa, David Buff, Ena Nayak, Erica Donno

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 该研究分析了语言模型的扰动鲁棒性,发现敏感性、因果性、补偿能力三种层映射分离,识别两种传播机制,提出级联中断机制,给出实用指导并指出方法学警示。

Comments 29 pages, 18 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03803 2026-08-05 cs.CL cs.LG 新提交 62%

M-GATE: Multilingual Grammar, Accuracy in Translation, and Efficiency Benchmark for Large Language Models

M-GATE:面向大语言模型的多语言语法、翻译准确性与效率基准

Tomáš Burkert, Angelika Peljak-Łapińska, David Zelený

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本研究推出多语言基准M-GATE,评估50余种模型的80余种配置,发现翻译与语法能力分离,低资源语言惩罚随模型迭代缩小,推理对翻译提升显著。

Comments 45 pages (97 incl. appendices), 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03794 2026-08-05 cs.DB cs.AI cs.CL 新提交 62%

Evaluating LLMs in Database Scenarios: A Lifecycle Benchmark for Assessing Their Potential in Core Database Tasks

评估数据库场景下的大语言模型:用于评估其在核心数据库任务中潜力的生命周期基准

Shunfan Zheng, Dongsheng Shi, Yue Li, Xin Yi, Linlin Wang, Gerard de Melo

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究针对现有LLM数据库评估基准仅聚焦Text-to-SQL任务的缺陷,推出覆盖数据库全生命周期的DBLifeBench基准,还提出Progressive-Text2SQL任务,发现专用Text-to-SQL模型在非编码阶段存在灾难性遗忘,为全栈数据库智能构建奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01012 2026-08-04 cs.CL cs.AI 新提交 62%

MedUPS: Towards Diagnostic Assistance in Uncommon Medical Cases with Large Language Models

MedUPS:利用大语言模型辅助罕见医疗病例的诊断

Ofir Ben Shoham, Oriel Perets, Nir Grinberg, Nadav Rappoport

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出MedUPS对齐框架及MedUPSQA数据集,通过强化学习使大语言模型对齐临床中游决策,提升了不同规模模型的下一步临床决策准确率,且小模型表现优于部分大模型。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00473 2026-08-04 cs.CV cs.AI cs.CL 新提交 62%

CrossProjection: Geometric Grounding Beyond Viewpoint Change in Architectural Drawings

CrossProjection:建筑图纸中超越视角变化的几何定位

Kaho Li, Pengyu Zeng, Yuqin Dai, Jun Yin, Tianjing Feng, Shuai Lu

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) University College London(伦敦大学学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出CrossProjection方法评估视觉语言模型在异构建筑视图间的几何定位能力,发现模型在自由几何定位上性能脆弱,仅封闭选择成功不代表具备可靠几何定位能力。

Comments Initial controlled diagnostic study on 23 natural drawing sets and three VLMs; broader model, building, repeated-inference, and human coverage is planned for a subsequent version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00355 2026-08-04 cs.CL cs.LG 新提交 62%

CurveShift: Is Agent Progress Scalar? Separating Level from Shape

CurveShift:智能体的进展是标量吗?区分水平与形态

Hanwen Xing, Pengyun Wang, BingXu Meng, Kumail Alhamoud, Xiang Li, Jicheng Wang, Xin Yu, Xinyang Han, Xiaomin Li, Philip Torr, Yuexing Hao

机构 * University of Southern California(南加利福尼亚大学) University of Chicago(芝加哥大学) University of California, Berkeley(加利福尼亚大学伯克利分校) Massachusetts Institute of Technology(麻省理工学院) Stanford University(斯坦福大学) University of California, Davis(加利福尼亚大学戴维斯分校) Pennsylvania State University(宾夕法尼亚州立大学) Harvard University(哈佛大学) University of Oxford(牛津大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对大型语言模型进展的标量总结问题,通过LiveCodeBench基准分离混淆,发现2024年9月后发布的模型在竞赛编程难任务上有超出预期的增益,发布了相关数据集与代码。

Comments 25 pages, 4 figures, 7 tables. Data and code: https://github.com/harvenstar/CurveShift

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29066 2026-08-03 cs.CL cs.AI 新提交 62%

Semantics of Subterfuge: Benchmarking Legal Deception Detection Against General-domain State-of-the-Art

欺骗的语义:针对通用领域最先进模型的法律欺骗检测基准测试

Theekshana Samaradiwakara, Nisansa de Silva, George C. Lobb

机构 * University of Moratuwa(莫拉图瓦大学) The Law Office of George C. Lobb(乔治·C·洛布律师事务所)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文针对法律领域的自动欺骗检测,对比了微调Transformer模型与大型语言模型在通用和法律数据集上的表现,发现领域敏感性显著,思维链提示效果逊于直接分类,强调需开发适配法律领域的可解释系统。

Comments 5 pages paper

Journal ref ICAIL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28319 2026-07-31 cs.CL cs.CY cs.LG 新提交 62%

Fairness Pruning: Locating Demographic Bias in GLU-MLP Layers via Differential Activations

公平剪枝:通过差分激活定位GLU-MLP层中的人口统计偏差

Pere Martra, Eugenio Martínez Cámara, Alfonso Ureña López

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出Fairness Pruning方法,通过最小对比提示对与激活捕获定位LLM的GLU-MLP层中人口统计偏差神经元,经实验验证该方法可针对性调控偏差且对模型能力影响极小。

Comments 15 pages, 3 figures, 9 tables. Code and datasets publicly available

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28074 2026-07-31 cs.AI cs.LG 新提交 62%

Echoverse: Deep, Evolving Environments for Training Computer-Use Agents at Scale

Echoverse:用于大规模训练计算机使用智能体的深度演化环境

Yash Pandya, Sahil Gupta, Sarthak Harne, Archana Yadav, Kavyansh Chourasia, Hussein Mozannar, Vibhav Vineet, Sara Abdali, Corby Rosset, Yash Lara, Ahmed Awadallah, Ece Kamar, Akshay Nambi

机构 * Microsoft Research(微软研究院)

专题命中 推理评测 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 Echoverse是用于大规模训练计算机使用智能体的深度演化环境,其协同演化循环可提升智能体性能,经12个环境训练后9B模型准确率大幅提升,还发布了基准环境与代码

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27654 2026-07-31 cs.CL cs.AI 新提交 62%

From Single- to Cross-Document: Benchmarking Multi-Granularity Event Analysis of Large Language Models

从单文档到跨文档:大语言模型多粒度事件分析的基准测试

Tao Wen, Shuai Shao, Pei Ke, Xu Han, Jie Zou, Guannan Li, Tao Tian, Jinjie Qiu, Lan Wang, Ke Qin

机构 * University of Electronic Science and Technology of China(电子科技大学) Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文推出MiGUE-Bench基准及MiGUE-Pipeline框架,通过四项核心任务评估LLMs多粒度事件分析能力,明确其能力边界与缺陷,为该领域改进提供方向。

Comments 9 pages. Published in the Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR 2026)

Journal ref Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR '26), pp. 3464-3472, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27420 2026-07-31 cs.AI cs.CL 新提交 62%

Dimensionality and Measurement Precision in HLE's Multiple-Choice Subset

HLE多项选择子集的维度与测量精度

Mayank Sharma, Savira Nadela, Tyler Matteson

机构 * Stanford University(斯坦福大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究评估29个LLM在HLE多项选择子集上的表现,发现HLE仅测量单一一般推理因素,其领域子分数不具区分能力,且对前沿模型的区分能力有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26886 2026-07-30 cs.CV cs.AI cs.CL cs.CY 新提交 62%

Hearsay: Vision-Language Medical Diagnoses Without an Image

Hearsay:无需图像的视觉-语言医学诊断

Siddharth Vohra

机构 * Carnegie Mellon University(卡内基梅隆大学) Amazon Web Services AI Native(亚马逊网络服务AI原生部门)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究发现前沿视觉-语言模型在无图像时会基于人口统计学特征编造医学诊断,存在不同失败模式,提出需直接审计其结构化输出通道并将探针词敏感性作为核心评估维度。

Comments Peer-reviewed and presented at the 1st Workshop on Toward Trustworthy Vision-Language Models in the Wild (TrustVLM), co-located with ACM ICMR 2026, Amsterdam. Non-archival workshop. Reviews public on OpenReview. 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26455 2026-07-30 cs.CL cs.AI 新提交 62%

ForgetBench: Benchmarking Forgetting Dynamics of Long-Term Parametric Memory in Language Models

ForgetBench:语言模型中长期参数记忆的遗忘动态基准测试

Ruxi Gu, Zhenliang Zhang, Wei Wang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出ForgetBench基准测试,通过两种评估范式与统一分析框架,揭示现有LLMs在长期知识保留与泛化间难以平衡的问题,为未来模型记忆机制优化提供方向。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26317 2026-07-30 cs.CY cs.AI cs.CL 新提交 62%

Aligning LLM-Simulated and Human Examinees for Psychometric Calibration: A Cognitive Diagnostic Profiling Approach

对齐大语言模型模拟与人类应试者的心理测量校准:一种认知诊断画像方法

Wenjie Zhou, Yunting Liu, Renjiao Tang, Mark Wilson

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出认知诊断画像(CDP)零样本框架,优化LLM模拟应试者的心理测量对齐,在Tatsuoka分数减法数据集上提升了能力分布、掌握画像及题目难度与人类的匹配度,助力LLM模拟应试者用于测试开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25066 2026-07-29 cs.AI cs.CL 新提交 62%

Addressable Recall Compaction for Long Context-Window Control in AI Agents

用于人工智能代理中长上下文窗口控制的可寻址召回压缩

Thang Dang, Yuma Ichikawa, Sakina Fatima, Koichi Shirahata

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究针对长时程语言模型代理上下文窗口超界问题,提出ARC框架,将存档与活动上下文分离,以ID可寻址日志存储工具观察结果,压缩时替换旧观察结果。实验表明该方法能提高信息保留和服务效率。

Comments 20 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24814 2026-07-29 cs.AI cs.LG q-bio.OT 新提交 62%

Aletheia: An Offline-First Clinical Decision Support System for Differential Diagnosis in Low-Resource Healthcare Settings

Aletheia:用于低资源医疗环境中鉴别诊断的离线优先临床决策支持系统

Joseph Walusimbi, Ann Move Oguti, Abubakhari Sserwadda, Precious Boss Kasasira, Charles Brian Okoboi

机构 * Soroti University(索罗蒂大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对撒哈拉以南非洲低资源医疗环境,提出基于Qwen2.5 - 3B - Instruct并经QLoRA微调的Aletheia临床决策支持系统,评估显示其在诊断准确率等指标上表现良好,证明在无云设施的资源受限环境初级保健层部署大语言模型临床推理的可行性。

Comments 8 pages, 11 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24772 2026-07-29 cs.AI cs.CL 新提交 62%

RSMeM: Knowledge-Enhanced Memory Evolution for Remote Sensing Agents with Systematic Evaluation

RSMeM:用于遥感智能体的知识增强记忆进化及系统评估

Bingxian Wu, Yu Zhang, Zonghao Guo, Tang Liu, Chen Qian, Yuxiang Lu, Xingbo Du, Yanghao Li, Yidan Zhang, Chi Chen, Ling Yao, Maosong Sun

专题命中 推理评测 :planning(abstract);分类 cs.CL、cs.AI

AI总结 研究针对现有遥感智能体问题,提出RSMeM机制,通过分层知识基础和失败感知经验提炼两个组件,迭代吸收领域知识转化为执行经验,经实验验证能提升工具使用性能和答案质量,具有强大知识密度。

Comments Accepted to ACL 2026 Main. Code: https://github.com/AI9Stars/RSMeM

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24371 2026-07-28 cs.CL cs.AI 新提交 62%

Closed-Loop Validation-Repair for Healthcare Interoperability: A Multi-Model Study of Schema Compliance in Clinical LLMs

医疗保健互操作性的闭环验证修复:临床大语言模型中模式合规性的多模型研究

Jianru Shen

机构 * University of Montana(蒙大拿大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究医疗大语言模型集成到电子健康记录系统面临的模式不合规问题,通过在多场景下部署三个开源模型并评估,发现模式不合规具有一致性,验证 - 修复框架可有效提高合规率,为医疗互操作性提供保障。

Comments Accepted at the 2026 IEEE International Conference on Systems, Man, and Cybernetics (SMC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23915 2026-07-28 cs.CL cs.AI 新提交 62%

Understanding Tone-Dependent Inference Cost in Large Language Models

理解大语言模型中与语气相关的推理成本

Akhil Kumar, Om Dobariya

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究提示语气对大语言模型答案准确性及推理成本的影响,通过在MMLU数据集上对七种语气进行实验,发现输出令牌长度变化超准确性变化,不同模型在不同语气下有不同表现,揭示语气对答案质量和推理资源消耗的作用。

Comments 16 pages, 1 figure, 9-page Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23514 2026-07-28 cs.CL cs.AI cs.MM 新提交 62%

Novel Claim or Déjà Vu? Rethinking "Contamination-Free'' Dynamic Evaluation for Multimodal Automated Fact-Checking

新主张还是似曾相识?重新思考多模态自动事实核查的“无污染”动态评估

Haorui He, Xinwen Chen, Dacheng Wen, Reynold Cheng, Francis C. M. Lau, Yupeng Li

机构 * Hong Kong Baptist University(香港浸会大学) The University of Hong Kong(香港大学) Beijing Normal-Hong Kong Baptist University(北京师范大学-香港浸会大学联合国际学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究多模态自动事实核查中基准的污染风险,通过实证研究静态和动态基准,发现动态评估虽能减少但不能消除污染,新主张可多种方式验证,污染会致性能膨胀和排名扭曲,为可信评估提供实用指南。

Comments Accepted at ACM Multimedia (ACM MM), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22592 2026-07-28 cs.AI cs.CL cs.IR 新提交 62%

Structure Over Scale: Schema-Constrained Causal Graphs for RAG

结构跨越尺度:用于检索增强生成的模式约束因果图

Marc Saouda, Rajprakash Bale, Eren Aldis, Cloves Almeida

机构 * Boston Consulting Group(波士顿咨询集团)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究针对GraphRAG问题,提出HCG-RAG,用模式约束因果图取代开放式提取,构建紧凑两层图。该方法成本低,答案质量优,在医学等基准测试中表现出色,对比实验显示因果图作为检索过滤器有优势,表明图内容比节点数量更重要。

Comments 26 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22153 2026-07-27 cs.AI cs.LG 新提交 62%

Industrial Tokenization for LLM-Based Health Intelligence: A Federated Architecture for Industrial Evidence Integration

基于大语言模型的工业健康智能的工业令牌化:一种用于工业证据集成的联邦架构

Deshui Li, Xiao-Ming Yuan, Zishun Wang

机构 * Mingyang Smart Energy Co., Ltd.(明阳智慧能源集团股份有限公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究工业健康管理中异构信息源集成问题,提出工业令牌化概念及联邦架构,将特定源分析输出转为工业令牌,以实现跨源推理。给出基于振动诊断输出等的端到端诊断令牌路径,定位工业令牌化为语义接口。

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20908 2026-07-24 cs.LG cs.AI 新提交 62%

Multi-turn RL with Structural and Performance Aware Rewards for CUDA Kernel Generation

用于 CUDA 内核生成的具有结构和性能感知奖励的多轮强化学习

Quazi Ishtiaque Mahmud, Nesreen K. Ahmed, Ali Jannesari

机构 * Iowa State University(爱荷华州立大学) Cisco AI Research(思科人工智能研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对 CUDA 内核生成,提出 CudaPerf 框架,结合可验证执行奖励与结构代码感知奖励,分离线排序和在线训练两阶段,利用执行反馈迭代细化,通过实验证明其显著优于基线,在加速和正确性上有大幅提升。

详情

展开后加载摘要…

URL PDF HTML 收藏