arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-07 至 2026-08-07 共收录 122 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 36 篇

2608.03070 2026-08-07 cs.CR cs.AI cs.CL 版本更新 62%

AI Security Leaderboard: Methodology, Results and Minimal Standard

AI安全排行榜:方法、结果与最低标准

Jasper Timm, Lukas Struppek, Ziwei Xu, Grace Cheong, Oscar Mata, Dan Zhao, Mick Yang, Isadora De Andrade, Xiaojun Jia, Yiming Li, Samuel Bauer, Heather McIntyre, Adam Gleave, Edward Yee, Kellin Pelrine

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究推出AI安全防护最低标准V1.0,测试Claude Fable5等四款模型的越狱鲁棒性,发现模型间防御能力差异大,部分模型未出现通用越狱,可通过现有技术缩小防御差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28609 2026-08-07 cs.AI cs.CL cs.CV 版本更新 62%

OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models

OSReward:为跨平台计算机使用奖励模型建立标准化评估

Qiushi Sun, Kanzhi Cheng, Yian Wang, Bowen Yang, Hang Yan, Liheng Chen, Fangzhi Xu, Zichen Ding, Nuo Chen, Jialin Cao, Xingdong Gong, Zehao Li, Kaiming Jin, Xinfeng Yuan, Zhoumianze Liu, Jingyang Gong, Zhangyue Yin, Jiahui Gao, Zhiyong Wu, Tianbao Xie, Jianbing Zhang, Ben Kao, Lingpeng Kong

机构 * The University of Hong Kong(香港大学) Nanjing University(南京大学) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Fudan University(复旦大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究推出OSReward基准评估VLM评判者的可靠性,构建OS-Shepherd开源奖励模型缩小成本差距,为规模化可靠CUA奖励设计提供参考

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06361 2026-08-07 cs.AI 新提交 57%

The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping

低频陷阱:视频语言模型在简单事件记录上的失败

Sarvesh Baskar, Zikui Cai, Shayan Shabihi, Anirudh Satheesh, Muhammad R. Islam, Udari Madhushani Sehwag, Tom Goldstein, Furong Huang

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 该研究提出基于轨迹的参数化分析方法,发现视频语言模型Gemini 3.6 Flash在高数量、高频率事件计数上表现极差,额外帧和提示策略难以解决问题,推动视频评估转向时间推理故障诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06041 2026-08-07 cs.SE cs.CL 新提交 57%

LangChoiceBench: Measuring and Explaining Programming-Language Choice in LLMs

LangChoiceBench:测量与解释大语言模型中的编程语言选择

Lukas Twist, Twm Stone, Helen Yannakoudakis, Jie M. Zhang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究推出LangChoiceBench基准,评估25种LLMs的代码语言选择,发现其普遍过度选择Python、一致性低,小开放模型偏好更强,还揭示了模型的虚假证据等失败模式。

Comments 19 pages, 9 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06022 2026-08-07 cs.CL q-bio.GN 新提交 57%

EpiBench: Can LLMs Understand Epitopes for Antibody Drug Discovery?

EpiBench:大型语言模型能否为抗体药物发现表位?

Zirui Wang, Jiaqi Wang, Qinghan Wang, Yuzhi Xu, Gang Du, Tingjun Hou, Odin Zhang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出用于评估大型语言模型表位推理能力的基准EpiBench,发现现有通用LLMs在抗体药物发现相关表位推理上仍存局限,为改进序列感知型生物医学LLMs提供了测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05893 2026-08-07 cs.AI 新提交 57%

ECG-LENS: Lead-Aware Clinical Context Enriched ECG Report Generation and Evaluation

ECG-LENS:导联感知且融入临床上下文的心电图报告生成与评估

Akanta Das, Tasinul Islam Ahon, Ahmed Mahir Sultan Rumi, Md Mahbubur Rahman, Tausif Amim Shadly, Tanzima Hashem

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出ECG-LENS框架,结合多导联信号建模等技术实现心电图报告生成,还提出F1-ECGBERT指标评估报告,实验显示其在PTB-XL和MIMIC-IV-ECG上性能优于现有最优方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05817 2026-08-07 cs.CL 新提交 57%

M$^3$R-Bench: A Unified Benchmark for Evidence-Grounded Multimodal Metaphor Understanding

M$^3$R-Bench:一个用于基于证据的多模态隐喻理解的统一基准

Hong Jiang, Junnan Zhu, Jingwang Huang, Xiao Sun, Yuming Yang, Jiang Zhong, Ruirui Chen, Jingman Shi, Hao Wu, Nayu Liu, Xinyi Jiang, Kaiwen Wei

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出多模态隐喻理解基准M$^3$R-Bench,针对现有模型的跨模态证据-映射不匹配问题,构建M$^3$R-Reasoner方法,在多指标上超越GPT-5.5等现有模型。

Comments 6 figures and 5 tables. Hong Jiang, Junnan Zhu, and Jingwang Huang contributed equally. Jiang Zhong and Kaiwen Wei are corresponding authors. Code and data are available at https://github.com/hongshi4/M3R-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05560 2026-08-07 cs.CV cs.CL 新提交 57%

From Sports to Safety: Benchmarking Proactive Risk Inference in MLLMs

从运动到安全:多模态大语言模型(MLLM)主动风险推理基准测试

Jiawei Qiu, Yichen Xu, Jianzhe Ma, Mingyang Yu, Wenbin Zhu, Yang Han, Pinzheng Lv, Wenxuan Wang

机构 * School of Information, Renmin University of China(中国人民大学信息学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 该研究构建了运动主动风险推理基准SPRINT,评估发现当前MLLM危险感知率高但原因识别率低,仅具备表层主动安全能力,缺乏稳定的基于原因的早期预警。

Comments Preprints

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05210 2026-08-07 cs.CV cs.AI cs.CR 新提交 57%

Innocent Panels, Hateful Stories: Evaluating and Detecting Hateful Intent in Multi-Turn Visual Story Generation

无辜的面板,仇恨的故事:评估与检测多轮视觉故事生成中的仇恨意图

Ye Leng, Junjie Chu, Yiting Qu, Mingjie Li, Yun Shen, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA亥姆霍兹信息安全中心) Hewlett Packard Enterprise(惠普企业)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究针对多轮视觉故事生成的组级仇恨意图问题,构建了专用评估数据集,发现现有审核系统存在漏检,提出互补防御方法,强调安全需适配视觉叙事的发展。

Comments 16 pages, 5 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01347 2026-08-07 cs.CL 版本更新 57%

Same Task, Different Work: Prompt-Induced Waste in Coding Agents

提示词诱导的大推理模型浪费:一项预注册的双框架编码智能体基准测试

Sarel Weinberger, Amir Hozez

机构 * PointFive

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 该研究通过预注册基准测试发现,提示词措辞和智能体框架会大幅影响大推理编码智能体的成本,部分提示指令可成倍增加推理成本却不提升任务成功率,框架选择的成本差异更显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01263 2026-08-07 cs.LG 版本更新 57%

Distill What the Student Can See: Fisher-Projected On-Policy Distillation for Vision-Language Models

提炼学生可见内容:面向视觉语言模型的Fisher投影在线策略蒸馏

Leyan Xue, Feng Xiong, Mingjun Ma, Changqing Zhang

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 针对视觉语言模型在线策略蒸馏中教师修正与学生能力不匹配的问题,提出FP-OPD方法,在8B到2B的蒸馏中使7个多模态基准平均得分分别提升2.77和1.60个点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27594 2026-08-07 cs.LG 版本更新 57%

Compliance2LoRA: Personalizable On-Demand Safety Alignment on Arbitrary Policy Subsets via Hypernetwork-Generated LoRA Adapters

Compliance2LoRA:通过超网络生成的LoRA适配器对任意策略子集进行按需安全对齐

Pankayaraj Pathmanathan, Furong Huang

机构 * University of Maryland College Park(马里兰大学帕克分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 Compliance2LoRA是一种自适应超网络框架,可通过生成LoRA适配器,在单个大型推理模型上实现对任意安全策略子集的按需对齐,且不牺牲任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06420 2026-08-07 cs.CV cs.AI 交叉投稿 57%

HoloCount: A Holistic Visual Counting Benchmark for MLLMs

HoloCount:用于多模态大语言模型的整体视觉计数基准

Jinhong Deng, Limeng Qiao, Guanglu Wan

机构 * Meituan(美团)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究针对多模态大语言模型定量精度瓶颈及现有计数基准局限,引入HoloCount基准,从语义、分析计数和鲁棒性测试三方面评估模型,经对20多个模型详尽评估,揭示其性能差距,为多模态系统发展提供路线图。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21800 2026-08-07 cs.AI 版本更新 57%

BioAgent Bench: An AI Agent Evaluation Suite for Bioinformatics

BioAgent Bench: 一个用于生物信息学的AI代理评估套件

Dionizije Fa, Marko Culjak, Bruno Pandza, Mateo Cupic

机构 * Entropic

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出BioAgent Bench,用于评估AI代理在常见生物信息学任务中的性能和鲁棒性。通过定制端到端任务和压力测试,发现前沿代理可完成多步骤流程,但鲁棒性测试揭示了在受控扰动下的失败模式,表明高阶流程构建不保证可靠步骤推理。

Comments ICML 2026 camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15604 2026-08-07 cs.CL 版本更新 57%

Text Generation: A Systematic Literature Review of Tasks, Evaluation, and Challenges

文本生成:关于任务、评估与挑战的系统文献综述

Jonas Becker, Jan Philip Wahle, Bela Gipp, Terry Ruas

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 该系统综述梳理2017-2025年257篇论文,划分文本生成五大任务,评估三类方法,指出任务特有与共有的9项挑战,为NLP领域不同阶段研究者提供领域概览与研究方向参考。

Comments Published in the Journal of Artificial Intelligence Research (JAIR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06126 2026-08-07 cs.CV 新提交 50%

Patient Pose Assessment Using a CT-Based Framework for Synthetic Data Generation

基于CT合成数据生成框架的患者姿态评估

Manuel Laufer, Dominik Mairhöfer, Malte Sieren, Hauke Gerdes, Fabio Leal dos Reis, Arpad Bischof, Thomas Käster, Erhardt Barth, Jörg Barkhausen, Thomas Martinetz

机构 * Institute for Neuro- and Bioinformatics, University of Lübeck(吕贝克大学神经与生物信息学研究所) University Medical Center Schleswig-Holstein(石勒苏益格-荷尔斯泰因大学医学中心) IMAGE Information Systems Europe GmbH(IMAGE信息系统欧洲有限公司) Pattern Recognition Company GmbH(模式识别有限公司)

专题命中 推理评测 :planning(abstract)

AI总结 该研究提出基于CT的合成数据生成框架,用于解决放射图像患者姿态评估中真实训练数据获取难的问题,经3077对踝关节图像预训练后,真实踝关节姿态评估性能提升最多11个百分点。

Comments Accepted for publication at the Journal of Machine Learning for Biomedical Imaging (MELBA) https://melba-journal.org/2026:027

Journal ref Machine.Learning.for.Biomedical.Imaging. 2026 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05699 2026-08-07 cs.CV 新提交 50%

TAU-Bench: From Anomaly Instance Tracking to Fine-Grained Video Anomaly Understanding

TAU-Bench:从异常实例跟踪到细粒度视频异常理解

Kepeng Yang, Dongxuan Liu, Rongxin Gao, Zixin Su, Rui Wu, Shuzhao Xie, Chenxin Li, Panwang Pan, Yuzhi Huang, Yue Huang, Jingyan Jiang

专题命中 推理评测 :reasoning(abstract)

AI总结 该研究引入TAU-Bench这一以跟踪为核心的基准,用于联合评估异常实例跟踪与细粒度视频异常理解,发现现有视觉-语言模型存在语义推理与视觉接地的差距,为构建更可靠的视频异常理解系统提供了关键评估方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06200 2026-08-07 physics.ed-ph 新提交 50%

Using LLMs to Detect Growth in Computational Thinking in Introductory Physics

使用大型语言模型(LLMs)检测入门物理课程中计算思维的发展

Sean Savage, Anand Shanker, Grace Michlitsch, N. Sanjay Rebello

专题命中 推理评测 :reasoning(abstract)

AI总结 本研究探究用LLMs分析学生计算物理问题书面解释,发现其可复刻人工评估结果并规模化检测计算思维发展趋势,为大招生规模物理课程的CT评估提供可行方法。

Comments 1 figure, 2 tables. Submitted to Physics Education Research Conference (PERC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09772 2026-08-07 cs.CV 版本更新 50%

SemDINO: Foundation Prior-Guided Cross-Temporal Semantic Alignment Network for Remote Sensing Change Detection

SemDINO: 一种基于DINOv3的跨时间语义对齐变化检测网络

Xinyu Tong, Meihua Zhou, Jinxiao Sun, Zaiyan Zhang, Hongruixuan Chen, Lei Wang

机构 * Xinjiang Institute of Ecology and Geography, Chinese Academy of Sciences(中国科学院新疆生态与地理研究所) University of Chinese Academy of Sciences(中国科学院大学) School of Computer Science, Xiangtan University(湘潭大学计算机科学学院) College of Information and Communication Engineering, Harbin Engineering University(哈尔滨工程大学信息与通信工程学院)

专题命中 推理评测 :reasoning(abstract)

AI总结 提出SemDINO网络,通过双分支编码器、多尺度时序交互、语义净化与变化增强模块,解决语义变化检测中跨时间对齐不足、多尺度表示弱及伪变化鲁棒性差的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04824 2026-08-07 cs.CV 50%

SOVABench: A Vehicle Surveillance Action Retrieval Benchmark for Multimodal Large Language Models

SOVABench:多模态大语言模型的车辆监控动作检索基准

Oriol Rabasseda, Zenjie Li, Kamal Nasrollahi, Sergio Escalera

机构 * Milestone Systems A/S(Milestone Systems公司) Universitat de Barcelona(巴塞罗那大学) Computer Vision Center(计算机视觉中心) Aalborg Universitet(奥胡斯大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 SOVABench为多模态大语言模型提供车辆监控动作检索基准,通过定义两种评估协议评估跨动作区分和时间方向理解,展示了模型在复杂监控任务中的性能。

Comments This work has been accepted at Real World Surveillance: Applications and Challenges, 6th (in WACV Workshops)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13621 2026-08-07 cs.CV 版本更新 50%

Visual Intention Grounding for Egocentric Assistants

面向第一人称视角助手的视觉意图定位

Pengzhan Sun, Junbin Xiao, Tze Ho Elden Tse, Yicong Li, Arjun Akula, Angela Yao

机构 * National University of Singapore(新加坡国立大学) Google DeepMind(谷歌DeepMind)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出首个第一人称视觉意图定位数据集EgoIntention,及推理至定位(RoG)指令微调方法,解决多模态模型在第一人称视角下的意图定位问题,实现了统一的视觉定位能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 11 篇

2608.05738 2026-08-07 cs.RO 新提交 86%

In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use

上下文视觉-语言-动作模型:通过上下文后训练与智能体工具使用为视觉-语言-动作模型赋予语言能力

Jiarui Yang, Wen Huang, Jiale Zhang, Maowei Hu, Hang Guo

专题命中 其他推理 :CoT(summary_cn,abstract);reasoning(abstract);chain-of-thought(abstract)

AI总结 该研究针对现有VLA模型用CoT会降低控制性能的问题,提出通过上下文后训练和智能体工具使用赋予VLA语言能力的方法,在多模拟和真实机器人任务上实现SOTA性能与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05583 2026-08-07 cs.CY cs.AI cs.LG 新提交 81%

The Judgment-Consequence Gap: LLM Moral Reasoning in Healthcare Decisions

判断-结果差距:医疗决策中的大语言模型道德推理

Hadi Hosseini, Samarth Khanna, Leona Pierce

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究发现LLMs在医疗决策中存在判断-结果差距,即虽认同患者对危害健康行为负有责任,但拒绝将该判断用于稀缺医疗资源分配,且随推理能力提升会放大与人类的道德分歧。

Comments Accepted at AIES 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03057 2026-08-07 stat.ML cs.AI cs.LG math.ST stat.TH 版本更新 81%

A note on conditional PAC-efficient reasoning in large language model routing

关于大语言模型中条件PAC有效推理不可能性的注记

Hao Zeng, Bingyi Jing

机构 * Department of Statistics and Data Science(统计与数据科学系)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究证明了在无分布设定下,大语言模型无法实现条件PAC有效推理,指出任何满足此条件的算法必须依赖专家模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05369 2026-08-07 cs.RO cs.CV 新提交 80%

World-to-Wrist: Task-Conditioned Future Wrist Modeling for Fine-Grained Robot Manipulation

世界到手腕:面向精细机器人操作的任务条件未来手腕建模

Yuhao Pan, Haosong Peng, Zhengshen Zhang, Zhengyang Yan, Yalun Dai, Fushuo Huo, Chujie Wang, Tianyu Qi, Xiucheng Wang, Nan Cheng, Wenchao Xu

机构 * The Hong Kong University of Science and Technology(香港科技大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Wuhan University(武汉大学) Sun Yat-sen University(中山大学) Xidian University(西安电子科技大学) Southeast University(东南大学)

专题命中 其他推理 :CoT(summary_cn,abstract)

AI总结 本研究提出W2-VLA模型,通过任务条件未来手腕建模结合W2-CoT辅助监督,在LIBERO等数据集及真实任务中提升了机器人精细接触敏感操作能力,动作生成速率超80Hz。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05521 2026-08-07 cs.SE 新提交 78%

Reasoning from Traces: Divergence-Guided Agentic Repair of WebAssembly Discrepancies

从痕迹中推理:分歧引导的智能体修复WebAssembly差异

Liyan Huang, Kaicheng Wang, Weihang Wang

专题命中 其他推理 :reasoning(title,abstract)

AI总结 本文提出WasmMend系统,通过差分痕迹分析定位Wasm与原生执行的分歧函数,引导LLM智能体生成补丁,在真实C/C++项目上修复率达70.0%,优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03573 2026-08-07 cs.CL cs.LG 版本更新 62%

SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs

SFT冲突,RL共存:大语言模型多任务学习的理论与实证分析

Kejian Zhu, Zhuoran Jin, Shangqing Tu, Hongbang Yuan, Yushi Bai, Kang Liu, Juanzi Li, Jun Zhao

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对大语言模型多任务学习,通过理论与实证分析揭示SFT存在任务冲突而RL可稳定共存的机制,进而提出Parallel-RL范式以解耦多任务训练,提升效率与灵活性。

Comments Code: https://github.com/GaryStack/Parallel-RL

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02691 2026-08-07 cs.LG cs.AI 版本更新 62%

Output-Aware Rotation for INT2 KV-Cache Quantization

面向INT2 KV缓存量化的输出感知旋转

Vincent-Daniel Yun, Woosang Lim, Minsoo Cheong, Sunwoo Lee, Murali Annavaram, Sai Praneeth Karimireddy, Sungjoo Yoo

机构 * University of Southern California(南加州大学) Seoul National University(首尔大学) Inha University(仁荷大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对长上下文大模型KV缓存的INT2量化瓶颈,提出OptR输出感知旋转方法,通过分解误差、学习正交修正等,提升QuaRot等性能并增强长上下文检索能力,且开销可忽略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05418 2026-08-07 cs.AI 新提交 57%

Negotiating Risk Boundaries in AI for Policing Through Mixed-Stakeholder Deliberation

通过混合利益相关者协商确定警务AI的风险边界

Mackenzie Jorgensen, Jo Reilly, Alex Sutherland, Miri Zilka

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究通过包含社区代表、警察和学者的混合利益相关者协商研讨会,评估13个警务AI用例的种族偏见风险,发现多数参与者支持AI采用,仅拒绝3个用例,强调种族公平可优化AI风险-收益分析。

Comments Accepted to AIES 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10921 2026-08-07 cs.CL 版本更新 57%

Trace Only What You Need: Structure-Aware On-Demand Hypergraph Memory for Long-Document Question Answering

仅追踪所需:面向长文档问答的结构感知按需超图记忆

Xiangjun Zai, Xingyu Tan, Chen Chen, Xiaoyang Wang, Wenjie Zhang

机构 * University of New South Wales(新南威尔士大学) CSIRO(澳大利亚联邦科学与工业研究组织) University of Wollongong(伍伦贡大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 提出DocTrace,一种多智能体RAG框架,通过查询触发的知识组织、文档结构感知和经验引导推理,解决长文档问答中知识组织成本高、结构利用不足和推理经验无法复用的问题,在三个数据集上取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏