arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-21 至 2026-08-21 共收录 88 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 5 篇

2602.07442 2026-08-21 cs.HC cs.IR 版本更新 91%

EchoTrace: Diagnosing Recursive Risks in LLM-Powered Recommender Systems

循环中的回声:在LLM推荐系统中反馈循环下的风险诊断

Donguk Park, Dongwon Lee, Yeon-Chang Lee

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出了一种角色感知的诊断框架,用于分析LLM推荐系统中反馈循环下的系统性风险,包括偏见、幻觉和自我强化的暴露模式。

Comments Accepted by ACM CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00691 2026-08-21 cs.CV 版本更新 82%

Silhouette-based Gait Foundation Model

基于轮廓的步态基础模型

Dingqiang Ye, Chao Fan, Kartik Narayan, Bingzhe Wu, Chengwen Luo, Jianqiang Li, Vishal M. Patel

机构 * Johns Hopkins University(约翰霍普金斯大学) Shenzhen University(深圳大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 FoundationGait是首个可扩展的自监督预训练框架,用于步态理解,通过大规模预训练在多个数据集上实现稳健的步态识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21489 2026-08-21 cs.LG 版本更新 79%

GraphPFN: A Prior-Data Fitted Graph Foundation Model

GraphPFN:一种先验数据拟合的图基础模型

Dmitry Eremeev, Oleg Platonov, Gleb Bazhenov, Artem Babenko, Liudmila Prokhorenkova

机构 * HSE University(莫斯科国立高等经济学院) Yandex Research(Yandex研究院)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG

AI总结 针对图基础模型的可迁移性和数据稀缺问题,提出GraphPFN,基于先验数据拟合网络框架,设计多级随机块模型和优先连接过程生成合成图,结合图感知结构化因果模型生成属性,并扩展LimiX模型以融合图邻域聚合层,在节点级任务上实现上下文学习和微调的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09921 2026-08-21 cs.AI 版本更新 57%

GENCO - A Unified Neural Solver Embedded in a Development Framework for Steady-State Grid Analysis

GENCO — 嵌入开发框架的稳态电网分析统一神经求解器

Alban Puech, Matteo Mazzonelli, Tamara R. Govindasamy, Mangaliso Mngomezulu, Héctor Maeso-García, Thomas Tolhurst, Javad Bayazi, Ali Moeini, Naomi Simumba, Celia Cintas, David Nelischer, Romeo Kienzler, Jonas Weiss, Anna Varbella, Florian Dörfler, Gabriela Hug, Martin Mevissen, Juan Bernabé-Moreno, François Mirallès, Hendrik F. Hamann, Etienne Vos, Thomas Brunschwiler

机构 * IBM Research(IBM研究院) Hydro-Québec Research Institute(魁北克水电研究院) ETH Zurich(苏黎世联邦理工学院) Stony Brook University(石溪大学) Brookhaven National Laboratory(布鲁克海文国家实验室)

专题命中 预训练与数据 :foundation model(abstract);分类 cs.AI

AI总结 研究人员推出统一神经求解器GENCO及开源GridFM开发框架,其可处理电网PF、OPF、SE任务,在基准测试中提速显著且性能优于经典求解器,降低电网分析门槛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07459 2026-08-21 cs.LG q-bio.QM 版本更新 57%

ProteinZero: Self-Improving Protein Generation via Online Reinforcement Learning

ProteinZero:通过在线强化学习实现自我改进的蛋白质生成

Ziwen Wang, Jiajun Fan, Ruihan Guo, Thao Nguyen, Heng Ji, Ge Liu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 ProteinZero通过在线强化学习实现蛋白质生成模型的自我改进,提升设计成功率与多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 4 篇

2608.15949 2026-08-21 cs.IR cs.AI cs.CL cs.LG 版本更新 94%

Ask to Be Sure: Informative Interactions for Confident Multi-Turn LLM Recommendation

为确认而提问:用于自信多轮大语言模型推荐的信息交互

Cedar Site Bai, Zhenyu Liao, Duanshun Li, Sheikh Sarwar, Huiyuan Chen, Yuan Chen, Changhe Yuan, Haiyang Zhang, Qilin Qi

专题命中 指令微调 :LLM(title,summary_cn);SFT(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 该研究针对多轮LLM推荐中有效挖掘用户偏好的挑战,提出以推荐熵降为奖励的方法微调LLM,结合SFT与DPO在INSPIRED、ReDial数据集上提升了推荐质量与对话效率。

Comments CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08022 2026-08-21 cs.CL cs.AI 版本更新 90%

DiverValue-Bench: A Benchmark and Fine-Tuning Framework for Aligning Large Language Models with Diverse Human Values

DiverValue-Bench:用于使大语言模型与多元人类价值观对齐的基准及微调框架

Yao Liang, Dongcheng Zhao, Feifei Zhao, Guobin Shen, Yuwei Wang, Dongqi Liang, Yi Zeng

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);preference optimization(abstract);分类 cs.CL、cs.AI

AI总结 该研究推出覆盖74个国家/地区的人群感知基准DiverValue-Bench,发现现有LLMs存在地理与人口统计学价值观对齐差异,结合LoRA与DPO的轻量微调可提升对齐效果,为全球公平AI开发提供实用基础。

Comments 11 pages, 5 figures. Accepted to IJCAI-ECAI 2026 (Human-Centred AI Special Track). v2: Updated to the camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07267 2026-08-21 cs.AI cs.CV cs.RO 版本更新 70%

WNM-3D: A World Navigation Model with 3D Scene Conditioning for Closed-Loop VLN

WNM-3D:一种用于闭环视觉语言导航的带3D场景条件的世界导航模型

Yuehao Huang, Yunzi Wu, Xiaotao Zhang, Xinhai Li, Jiankun Dong, Jiajun Lv, Chi Zhang, Chenjia Bai, Yong Liu, Xuelong Li

专题命中 指令微调 :language model(abstract);SFT(abstract);分类 cs.AI

AI总结 该研究提出带3D场景条件的WNM-3D模型,通过几何编码器与适配器整合场景上下文,经多阶段训练后在GN-Bench等数据集上的闭环导航性能优于同类模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17034 2026-08-21 cs.LG 版本更新 57%

Agents unlock new capabilities through Switching LoRA Adapters as a Tool (SLAaaT)

智能体通过切换LoRA适配器作为工具(SLAaaT)解锁新能力

Kenneth Ge

专题命中 指令微调 :post-training(abstract);分类 cs.LG

AI总结 该研究针对后训练导致的灾难性遗忘问题,提出让智能体在轨迹中途切换专用LoRA适配器的SLAaaT方法,实验显示其可解决新问题、自主切换策略且能力损耗低,在任务能力和token使用上优于生成子智能体的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 后训练与偏好优化 2 篇

2608.11922 2026-08-21 cs.CL cs.IR cs.LG 版本更新 90%

LODESTAR: Robust Entropy-Based Answer Selection in Retrieval-Augmented Generation for Question Answering -- Directing Frozen-LLM Entropy with a Reinforcement-Learned Prompt Polarizer under Misleading Passages

LODESTAR:可信赖熵是被引导的,而非仅被测量——强化偏振器防止冻结型大语言模型(LLM)被错误证据误导而自信出错

Hung-Chun Hsu, Po-Jen Ko, Che-Cheng Wu, Li-Yang Chang, Chuan-Ju Wang

专题命中 后训练与偏好优化 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 LODESTAR是首个通过强化学习训练偏振器、依据第三方冻结型LLM的不确定性评分文本干预的方法,可提升检索增强问答的F1值等指标,减少模型读取误导性段落的概率。

Comments 28 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18607 2026-08-21 cs.CV 版本更新 50%

VA-Judger: Reward Modeling from Human Preference Feedback for Joint Video-Audio Generation

VA-Judger:用于联合视频-音频生成的人类偏好反馈奖励建模

Yinming Huang, Shuyuan Tu, Xi Yan, Zihan Yang, Jianhua Han, Xu Hang, Yu-Gang Jiang, Zuxuan Wu

机构 * Shanghai Innovation Institution(上海创新研究院) Fudan University(复旦大学) Yinwang Intelligent Technology Co., Ltd(音网智能科技有限公司)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本研究针对联合视频-音频生成的奖励信号问题,构建了VAPref-10K数据集与VA-Judger-Bench基准,提出思维链全奖励模型VA-Judger,其在预测人类偏好及提升生成质量上均优于基线方法。

Comments 19 pages, 7 figures, 8 tables. Code: this https URL (https://github.com/ShareLab-SII/VA-Judger)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长上下文与记忆 4 篇

2508.00554 2026-08-21 q-fin.TR cs.CL q-fin.CP 版本更新 86%

ContestTrade: A Multi-Agent Trading System Based on Internal Contest Mechanism

ContestTrade:一种基于内部竞争机制的多智能体交易系统

Li Zhao, Rui Sun, Zuoyou Jiang, Bo Yang, Yuxiao Bai, Mengting Chen, Jing Li, Zuo Bai

机构 * Stepfun FinStep

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对基于LLM的智能体在金融交易中决策受市场信息影响的问题,提出ContestTrade多智能体交易系统,通过“量化 - 预测 - 分配”竞争机制及两个专业团队协作,在A股回测中取得较好收益和风险调整绩效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01548 2026-08-21 cs.AI cs.LG 版本更新 81%

LLM Capability Limits: Static Emergence and Dynamic Boundary Control

涌现不变性:从符号化思维到结构控制

Yi Liu

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究形式化了语言为核心的智能的限制,提出动态边界控制框架,通过DeepSeek V4-Flash实验验证其可提升大语言模型的推理性能,组织了大语言模型的涌现限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10828 2026-08-21 cs.AI 版本更新 70%

The First Drop of Ink: Nonlinear Impact of Distracting Information in Long-Context Reasoning

第一滴墨水:误导信息在长上下文推理中的非线性影响

Muhan Gao, Zih-Ching Chen, Kuan-Hao Huang

机构 * Department of Computer Science Engineering, Texas A\&M University, College Station, TX, USA NVIDIA AI Technology Center, NVIDIA Corporation, Santa Clara, CA, USA

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究探讨了误导信息在长上下文推理中的非线性影响,发现误导信息比例增加时,性能在初期急剧下降,后续变化较小。通过理论和实证分析,揭示了误导信息对注意力的 disproportionate 影响,并指出过滤收益主要来自减少上下文长度而非去除误导信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12616 2026-08-21 cs.AI cs.MM 版本更新 57%

Every Picture Tells a Dangerous Story: Memory-Augmented Multi-Agent Jailbreak Attacks on VLMs

每幅画都讲述一个危险的故事:基于内存增强的多智能体 jailbreak 攻击 VLMs

Jianhao Chen, Shiqin Wang, Haoyang Chen, Hanjie Zhao, Haozhe Liang, Zheng Wang, Tieyun Qian

机构 * Wuhan University(武汉大学) Zhongguancun Academy(中关村学院) Tianjin University(天津大学) University of the Chinese Academy of Sciences(中国科学院大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI

AI总结 本文提出MemJack框架,通过视觉语义引导多智能体协作,利用迭代空域投影过滤器提升对VLMs的攻击成功率,实验表明其在COCO数据集上达到71.48%的攻击成功率。

Comments This work was accepted by WISE2026. 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 推理与问题求解 16 篇

2510.03519 2026-08-21 cs.CL cs.AI 版本更新 92%

TS-Reasoner: Aligning Time Series Foundation Models with LLM Reasoning

TS-Reasoner:将时间序列基础模型与大语言模型推理能力对齐

Fangxu Yu, Hongyu Zhao, Tianyi Zhou

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 推理与问题求解 :LLM(title,abstract);foundation model(title,abstract);large language model(abstract);language model(abstract)

AI总结 TS-Reasoner通过两阶段训练将时间序列基础模型与大语言模型对齐,在多个基准上性能优于同类模型且数据效率更高,解决了时间序列模型推理能力不足的问题。

Comments Accepted to Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17546 2026-08-21 cs.SE 版本更新 89%

REST API Testing with Verified LLM-Inferred Dependencies and Response-Driven Refinement

基于经验证的LLM推断依赖关系与响应驱动优化的REST API测试

Tu Nguyen, Thanh Nguyen, Huy Nguyen, Viet Nguyen, Tien N. Nguyen, Vu Nguyen

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 本文提出APIPilot框架,通过执行验证LLM推断的REST API依赖关系,结合响应驱动优化,在16个真实API上实现高覆盖率与成功率,优于现有基线。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19009 2026-08-21 cs.CL 版本更新 88%

Grading the Graders: Verification Autonomy Levels (L0-L5) for LLM Reasoning

评估评估者:面向大语言模型推理的验证自主等级(L0-L5)

Yajie Yin

专题命中 推理与问题求解 :LLM(title,abstract);language model(abstract,comments);large language model(abstract);分类 cs.CL

AI总结 该研究提出验证自主等级(VAL)元标准,解决验证领域的等级概念混淆,明确不同验证方案的完备性边界,相关代码与评估材料已公开。

Comments v2: reproducibility study (kappa~0.8), agent-security case (PPMF), anchor semantics, 15+ fixes. Code and data: this https URL (https://github.com/1549080929-debug/math_agent) Keywords: LLM verification; verification autonomy; completeness; ground truth; trustworthy AI Writing and implementation assisted by an AI language model; all experiments, data, and research decisions are the author's own

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14497 2026-08-21 cs.CV 版本更新 88%

Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation

通过自我场景增强在多模态大语言模型中强化自我中心空间感知

Chi Kit Wong, Ye Pan, Yuanhuiyi Lyu, Xu Zheng, Zidong Cao, Lutao Jiang, Zixin Zhang, Huiyu Zhou, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Guangxi Zhuang Autonomous Region Information Center(广西壮族自治区信息中心) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 研究如何强化多模态大语言模型的自我中心空间感知,提出自我场景增强框架ESA,利用自我元素图作为中间表示,通过视觉基础模型增强空间感知,在EgoTextVQA基准上取得显著性能提升。

Comments 14 pages, 8 figures. Chi Kit Wong and Ye Pan contributed equally. Code: this https URL (https://github.com/Chikit-WONG/spatialGraph)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29786 2026-08-21 cs.CV cs.RO 版本更新 83%

OP3DSG: Open-Vocabulary Part-Aware 3D Scene Graph Generation for Real-World Environments

OP3DSG:面向真实环境的开放词汇部件感知3D场景图生成

Yirum Kim, Ue-Hwan Kim

机构 * Gwangju Institute of Science and Technology(全州科学技术院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);foundation model(abstract)

AI总结 提出OP3DSG框架,通过部件感知检测与融合、几何初始化先验图及LLM精炼,实现开放词汇下对象、交互部件、空间/功能关系及可供性的统一建模,在UniGraph3D基准上达到最优性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24960 2026-08-21 cs.CL cs.AI cs.LG 版本更新 83%

Investigating the Interplay between Contextual and Parametric Chain-of-Thought Faithfulness under Optimization

探究优化下上下文与参数化思维链忠实性之间的相互作用

Jingyi Sun, Qianli Wang, Pepa Atanasova, Nils Feldhus, Isabelle Augenstein

机构 * University of Copenhagen(哥本哈根大学) Technische Universität Berlin(柏林技术大学) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) BIFOLD – Berlin Institute for the Foundations of Learning and Data(BIFOLD – 柏林学习与数据基础研究院)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过提出统一偏好对齐接口FaithMate,研究上下文与参数化两种思维链忠实性范式在优化下的相互作用,发现两者正相关但不对称,且上下文忠实性指标间存在权衡。

Comments The first two authors contributed equally and share first-authorship

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05616 2026-08-21 cs.AI cond-mat.mtrl-sci physics.comp-ph 版本更新 81%

Toward Greater Autonomy in Materials Discovery Agents: Unifying Planning, Physics, and Scientists

迈向材料发现智能体的更高自主性:统一规划、物理与科学家

Lianhao Zhou, Hongyi Ling, Keqiang Yan, Kaiji Zhao, Xiaoning Qian, Raymundo Arróyave, Xiaofeng Qian, Shuiwang Ji

机构 * Department of Computer Science and Engineering, Texas A&M University(计算机科学与工程系,德克萨斯A&M大学) Department of Materials Science and Engineering, Texas A&M University(材料科学与工程系,德克萨斯A&M大学) Department of Electrical and Computer Engineering, Texas A&M University(电气与计算机工程系,德克萨斯A&M大学) Computing and Data Sciences, Brookhaven National Laboratory(布鲁赫斯国家实验室计算与数据科学部) Department of Physics and Astronomy, Texas A&M University(物理与天文学系,德克萨斯A&M大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);foundation model(abstract);language agent(abstract)

AI总结 该研究提出MAPPS智能体框架,通过统一规划、物理与科学家实现更高自主性,在MP-20数据集上使材料发现相关指标提升5倍,是自主材料发现的潜力框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09774 2026-08-21 cs.CR 版本更新 80%

QRS: A Rule-Synthesizing Neuro-Symbolic Triad for Autonomous Vulnerability Discovery

QRS:一种用于自主漏洞发现的神经符号三元组规则生成器

George Tsigkourakos, Constantinos Patsakis

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 QRS通过神经符号方法生成代码查询,发现超出预定义模式的漏洞,显著降低假阳性,并在低开销下发现高严重性漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21596 2026-08-21 cs.AI 版本更新 72%

FlowEvo: Self-Evolving Agents through the Co-Evolution of Workflows and Executable Skills

FlowEvo:通过工作流和可执行技能的协同进化实现自我进化的智能体

Zeyu Ren, Ling Yue, Ran Li, Yishu Wang, Shengxiang Xu, Hanmo Liu, Shaowu Pan, Shimin Di

机构 * Southeast University(东南大学) Rensselaer Polytechnic Institute(伦斯勒理工学院) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理与问题求解 :language model(abstract,comments);large language model(abstract);分类 cs.AI

AI总结 研究旨在让大型语言模型智能体通过工作流解决复杂任务。提出FlowEvo框架,通过工作流到技能编译、技能到工作流反馈、技能管理三个机制,使智能体无需更新模型参数积累完善能力,实验显示其在基准测试中精度-成本权衡优,各机制有贡献。

Comments Published as a conference paper at the Conference on Language Modeling (COLM) 2026. 25 pages, 3 figures, 16 tables. Code: this https URL (https://github.com/DEFENSE-SEU/FlowEvo)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15654 2026-08-21 cs.RO cs.AI 版本更新 70%

PO-PDDL: Learning Symbolic POMDPs from Visual Demonstrations for Robot Planning Under Uncertainty

PO-PDDL: 从视觉演示中学习符号化POMDP以实现不确定性下的机器人规划

Wenjing Tang, Xuanjin Jin, Yuan Liu, Renming Huang, Cewu Lu, Panpan Cai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出PO-PDDL符号化POMDP框架,通过从机器人执行视频中重建潜在状态轨迹、识别部分可观测性并学习随机转移与观测模型,实现不确定性下的鲁棒任务规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02794 2026-08-21 cs.AI 版本更新 70%

CharTool: Tool-Integrated Visual Reasoning for Chart Understanding

CharTool: 集成工具的视觉推理用于图表理解

Situo Zhang, Yifan Zhang, Zichen Zhu, Da Ma, Lei Pan, Danyang Zhang, Zihan Zhao, Lu Chen, Kai Yu

机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院X-LANCE实验室) Jiangsu Key Lab of Language Computing(江苏省语言计算重点实验室) Suzhou Laboratory(苏州实验室) AISpeech Co., Ltd.(思必驰科技股份有限公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出CharTool,通过集成工具提升多模态大语言模型对图表的理解能力,通过双重数据管道和代理强化学习,在六个图表基准测试中取得显著提升。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12682 2026-08-21 cs.AI 版本更新 70%

GridCodex: A RAG-Driven AI Framework for Power Grid Code Reasoning and Compliance

GridCodex:一种用于电网规则推理与合规性的RAG驱动AI框架

Jinquan Shi, Yingying Cheng, Fan Zhang, Miao Jiang, Jun Lin, Yanbai Shen

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对电网规则缺乏自动化解读的问题,提出结合大语言模型、RAG及RAPTOR的GridCodex框架,经验证其答案质量提升26.4%、召回率超10倍,可助力电网合规性提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09276 2026-08-21 cs.CL cs.LG 版本更新 62%

Verifiably grounded machine interpretation of lunar geology

月球地质学的可验证机器解释

Tom Sander, Kay Wohlfarth, Christian Wöhler

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本研究将地质知识推理方法嵌入多模态视觉-语言架构,构建可验证的月球地质学机器解释模型,结合开卷检索解决数值年龄定年依赖记忆先验的问题,明确自动地质推理的必要架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11907 2026-08-21 cs.CV cs.AI 版本更新 57%

A Model-Internal Protocol for Assessing Multimodal Models as Integrated Systems

你能看到你所绘制的内容吗?面向统一多模态模型整体评估的语义闭环框架

Hao Zhang, Jiaxin Qi, Zhijiang Tang, Jianqiang Huang

机构 * Hangzhou Institute for Advanced Study(杭州高等研究院) University of Chinese Academy of Sciences(中国科学院大学) Computer Network Information Center(计算机网络信息中心) Chinese Academy of Sciences(中国科学院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本研究针对统一多模态模型的系统级评估缺口,提出无标注的SGU语义闭环框架,通过感知-生成-推理流程评估模型综合能力,发现高性能模型存在自生成上下文推理局限,为下一代模型开发提供基准基础。

Comments 21 pages, 8 figures, 12 tables. Title updated; author contribution and corresponding-author notes added. Hao Zhang and Jiaxin Qi contributed equally; Jianqiang Huang is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17417 2026-08-21 cs.LG physics.chem-ph physics.comp-ph quant-ph 版本更新 57%

Grounded verification of chemical and materials reasoning: detection is the bottleneck

化学与材料推理的有根据验证:检测是瓶颈

Can Polat, Mustafa Kurban, Erchin Serpedin, Hasan Kurban

专题命中 推理与问题求解 :language model(abstract);分类 cs.LG

AI总结 研究针对大语言模型在化学推理中虚构对象的问题,提出分层验证器,通过与数据库核对及门控校正减少公式错误,检索次数大幅减少,修复成功率高,但检测召回率是瓶颈,基于事实验证可提高答案质量,长尾错误处提升明显。

详情

展开后加载摘要…

URL PDF HTML 收藏