arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-04 至 2026-05-04 共收录 183 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 9 篇

2602.13933 2026-05-04 cs.AI 86%

HyMem: Hybrid Memory Architecture with Dynamic Retrieval Scheduling

HyMem:混合内存架构与动态检索调度

Xiaochen Zhao, Kaikai Wang, Xiaowen Zhang, Chen Yao, Aili Wang

机构 * ZJU-UIUC Institute(浙大-伊利诺伊大学联合研究院) Ant Group(蚂蚁集团)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 HyMem通过多粒度内存表示实现动态按需调度,结合轻量级模块和LLM深度模块,有效平衡效率与性能,在长时记忆管理中取得新突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19897 2026-05-04 cs.CL cs.AI cs.LG 83%

Learning from Supervision with Semantic and Episodic Memory: A Reflective Approach to Agent Adaptation

通过语义和事件记忆学习:一种反思式智能体适应方法

Jackson Hassell, Dan Zhang, Hannah Kim, Tom Mitchell, Estevam Hruschka

机构 * Megagon Labs(Megagon实验室)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种基于记忆增强的框架,利用预训练大语言模型生成的批判性反馈,通过语义和事件记忆提升智能体适应能力,实验证明其在多个任务中有效。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00413 2026-05-04 cs.SE 80%

ClozeMaster: Fuzzing Rust Compiler by Harnessing LLMs for Infilling Masked Real Programs

ClozeMaster:利用LLMs填充掩码真实程序以模糊Rust编译器

Hongyan Gao, Yibiao Yang, Maolin Sun, Jiangchang Wu, Yuming Zhou, Baowen Xu

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出ClozeMaster,通过利用LLMs填充掩码的真实程序,生成有效测试用例,发现Rust编译器27个已确认的bug,优于现有模糊测试工具。

Comments Accepted at ICSE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00356 2026-05-04 cs.CL cs.AI 79%

MemRouter: Memory-as-Embedding Routing for Long-Term Conversational Agents

MemRouter: 基于记忆嵌入的路由机制用于长期对话代理

Tianyu Hu, Weikai Lin, Weizhi Zhang, Jing Ma, Song Wang

机构 * University of Central Florida(佛罗里达大学中央分校) University of Rochester(罗切斯特大学) University of Illinois at Chicago(伊利诺伊大学香槟分校) Case Western Reserve University(凯斯西储大学)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.CL、cs.AI

AI总结 MemRouter通过嵌入路由策略优化长期对话代理的记忆存储,相比传统方法提升了存储效率并降低了延迟,验证了小型监督路由器在记忆准入中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00702 2026-05-04 cs.CL 77%

Learning How and What to Memorize: Cognition-Inspired Two-Stage Optimization for Evolving Memory

学习如何和记忆什么:受认知启发的两阶段优化用于进化记忆

Derong Xu, Shuochen Liu, Pengfei Luo, Pengyue Jia, Yingyi Zhang, Yi Wen, Yimin Deng, Wenlin Zhang, Enhong Chen, Xiangyu Zhao, Tong Xu

机构 * University of Science and Technology of China & State Key Laboratory of Cognitive Intelligence(中国科学技术大学 & 认知智能国家重点实验室) City University of Hong Kong(香港城市大学) Dalian University of Technology(大连理工大学) Xi’an Jiaotong University(西安交通大学)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出MemCoE框架,通过两阶段优化学习记忆组织方式和更新内容,提升长期个性化记忆的稳定性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00789 2026-05-04 cs.CV cs.AI cs.LG 73%

Make Your LVLM KV Cache More Lightweight

使大型视觉-语言模型的KV缓存更轻量

Xihao Chen, Yangyang Guo, Roger Zimmermann

机构 * Integrative Sciences and Engineering Programme, National University of Singapore(国立新加坡大学整合科学与工程学程) School of Computing, National University of Singapore(国立新加坡大学计算机学院)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LightKV方法,通过利用视觉token嵌入的冗余性,减少KV缓存大小,提升解码效率并降低GPU内存消耗。

Comments Accepted to Transactions on Machine Learning Research (TMLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22285 2026-05-04 cs.CV 67%

VideoDetective: Clue Hunting via both Extrinsic Query and Intrinsic Relevance for Long Video Understanding

VideoDetective:通过外在查询和内在相关性进行长视频理解的线索搜索

Ruoliu Yang, Chu Wu, Caifeng Shan, Ran He, Chaoyou Fu

机构 * Nanjing University(南京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)

AI总结 本文提出VideoDetective框架,通过结合查询与片段的相关性及片段间亲和力,有效定位长视频问答中的关键片段,提升多模态大语言模型在长视频理解中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00678 2026-05-04 cs.CV 50%

Foundation AI Models for Aerosol Optical Depth Estimation from PACE Satellite Data

基于PACE卫星数据的气溶胶光学深度估计的基础AI模型

Zahid Hassan Tushar, Sanjay Purushotham

机构 * IEEE Service Center(IEEE服务中心)

专题命中 长上下文与记忆 :foundation model(abstract)

AI总结 本文提出ViTCG模型,通过融合空间和光谱信息,有效降低气溶胶光学深度估计的误差,实验显示比现有模型减少62%的均方误差。

Comments 5 pages, 4 figures, to appear in 2026 IEEE International Geoscience and Remote Sensing Symposium

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理与问题求解 36 篇

2508.06361 2026-05-04 cs.LG cs.AI 92%

Beyond Prompt-Induced Lies: Investigating LLM Deception on Benign Prompts

超越提示诱导的谎言:调查LLM在良性提示上的自我欺骗

Zhaomin Wu, Mingzhe Du, See-Kiong Ng, Bingsheng He

机构 * Institute of Data Science National University of Singapore(数据科学研究所,新加坡国立大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文研究LLM在良性提示下的自我欺骗行为,提出基于Contact Searching Questions的框架,通过两个统计指标量化欺骗可能性,发现任务难度增加时欺骗倾向上升,模型容量增加并不总能减少欺骗。

Comments ICLR 2026 (Oral)

Journal ref International Conference on Learning Representations (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17450 2026-05-04 cs.AI 92%

Compiling Deterministic Structure into SLM Harnesses

将确定性结构编译进SLM以获取优势

Zan Kai Chong, Hiroyuki Ohsaki, Bryan Ng

机构 * School of Science and Technology(科学与技术学系) Kwansei Gakuin University(冈山学院大学) School of Engineering & Computer Science(工程与计算机科学学系) Victoria University of Wellington(惠灵顿维多利亚大学)

专题命中 推理与问题求解 :SLM(title,title_cn);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出SGDe框架,通过编译代理工作流为离散执行计划,提升SLM在推理和数据主权方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05950 2026-05-04 cs.AI 91%

Training-Free Time Series Classification via In-Context Reasoning with LLM Agents

无需训练的时间序列分类通过LLM代理的上下文推理

Songyuan Sui, Zihang Xu, Xia Hu

机构 * Rice University(Rice大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出FETA框架,利用上下文推理实现无需训练的时间序列分类,通过多代理结构提升效率和可解释性,在多个数据集上取得优异性能。

Comments 8 pages main content, 12 pages total including appendix, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00136 2026-05-04 cs.AI 90%

Are Tools All We Need? Unveiling the Tool-Use Tax in LLM Agents

工具是否足够?揭示LLM代理中的工具使用税

Kaituo Zhang, Zhen Xiong, Mingyu Zhong, Zhimeng Jiang, Zhouyuan Yuan, Zhecheng Li, Ying Lin

机构 * University of Houston(休斯顿大学) University of Southern California(南加州大学) New York University(纽约大学) Texas A&M University(德克萨斯农工大学) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 本文研究了工具增强推理在LLM代理中的有效性,发现语义干扰下工具性能可能下降,提出Factorized Intervention Framework分析工具使用成本,并引入G-STEP缓解协议误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21214 2026-05-04 cs.CL cs.LG 90%

Scaling Reasoning Hop Exposes Weaknesses: Demystifying and Improving Hop Generalization in Large Language Models

推理步扩展揭示弱点:解密和改进大语言模型中的推理泛化

Zhaoyi Li, Jiatong Li, Gangwei Jiang, Linqi Song, Defu Lian, Ying Wei

机构 * University of Science and Technology of China(中国科学技术大学) City University of Hong Kong(香港城市大学) Zhejiang University(浙江大学) City University of Hong Kong, Shenzhen Research Institute(香港城市大学深圳研究院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL、cs.LG

AI总结 本文通过多领域任务研究发现,推理错误集中在少数关键错误类型的位置,而非均匀分布。提出在推理过程中动态识别并禁用错误处理头,从而提升推理步泛化能力。

Comments 52 pages, accepted by ICLR 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16767 2026-05-04 cs.LG 89%

When Structure Doesn't Help: LLMs Do Not Read Text-Attributed Graphs as Effectively as We Expected

结构无助时:LLM在文本属性图上表现不如我们预期

Haotian Xu, Yuning You, Tengfei Ma

机构 * Stony Brook University(石溪大学) California Institute of Technology(加州理工学院)

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究发现,LLM在仅依赖节点文本描述时已能高效处理文本属性图,而多数结构编码策略效果有限,挑战了传统图学习范式,推动语义驱动的新方法。

Comments LoG 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23330 2026-05-04 cs.CL 89%

Structured In-context Environment Scaling for Large Language Model Reasoning

结构化上下文环境扩展用于大语言模型推理

Peng Yu, Zeyuan Zhao, Shao Zhang, Luoyi Fu, Xinbing Wang, Ying Wen

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出SIE框架,通过自动构建结构化数据环境提升大语言模型的推理能力,实现可扩展性、通用性和可验证性,实验显示其在结构化推理和跨领域逻辑推理中的有效性。

Comments Title modified for greater clarity and better alignment with the paper's focus

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24276 2026-05-04 cs.AI 89%

G-reasoner: Foundation Models for Unified Reasoning over Graph-structured Knowledge

G-reasoner:用于统一图结构知识推理的基础模型

Linhao Luo, Zicheng Zhao, Junnan Liu, Zhangchi Qiu, Junnan Dong, Serge Panev, Chen Gong, Thuy-Trang Vu, Gholamreza Haffari, Dinh Phung, Alan Wee-Chung Liew, Shirui Pan

机构 * Monash University(莫纳什大学) Nanjing University of Science and Technology(南京理工大学) Griffith University(格里菲斯大学) Shanghai Jiao Tong University(上海交通大学) Tencent Youtu Lab(腾讯优图实验室) NVIDIA(英伟达)

专题命中 推理与问题求解 :foundation model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 G-reasoner通过整合图与语言基础模型,实现对多样化图结构知识的高效推理,采用标准化四层抽象QuadGraph统一异构知识源,并通过混合精度训练和分布式消息传递提升效率与泛化能力。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00436 2026-05-04 cs.CL cs.AI 88%

Impact of Task Phrasing on Presumptions in Large Language Models

任务表述对大语言模型中假设的影响

Kenneth J. K. Ong

机构 * AI.DA STC ST Engineering(AI.DA STC ST工程)

专题命中 推理与问题求解 :language model(title,abstract);large language model(title);LLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 研究探讨了任务表述如何导致大语言模型产生假设,影响其适应能力,通过囚徒困境实验发现中性表述可减少假设影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00297 2026-05-04 cs.CR cs.LG 86%

Trident: Improving Malware Detection with LLMs and Behavioral Features

Trident:利用LLMs和行为特征提升恶意软件检测

Rebecca Saul, Jingzhi Jiang, Elliott Chia, David Wagner

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出Trident系统,结合静态特征、行为规则和LLM分析,提升恶意软件检测性能,优于传统方法并具备更强的抗概念漂移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00434 2026-05-04 cs.CV 85%

LIMSSR: LLM-Driven Sequence-to-Score Reasoning under Training-Time Incomplete Multimodal Observations

LIMSSR:基于大语言模型的训练时不完整多模态观察下的序列到评分推理

Huangbiao Xu, Huanqi Wu, Xiao Ke, Yuxin Peng

机构 * Fujian Provincial Key Laboratory of Networking Computing(网络计算与智能信息处理福建省重点实验室) Intelligent Information Processing, College of Computer(智能信息处理学院) Data Science, Fuzhou University(数据科学,福州大学) Engineering Research Center of Big Data Intelligence, Ministry of Education(大数据智能工程研究中心,教育部) Wangxuan Institute of Computer Technology, Peking University(王宣计算机技术研究所,北京大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出LIMSSR框架,通过提示引导的上下文感知模态补全和多维表示融合,解决训练时不完整多模态数据下的序列到评分推理问题,并在三个动作质量评估数据集上验证了其有效性。

Comments ICML 2026 [Spotlight]

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25120 2026-05-04 cs.CL 84%

SCOPE:Planning for Hybrid Querying over Clinical Trial Data

SCOPE:面向临床试验数据的混合查询规划

Suparno Roy Chowdhury, Manan Roy Choudhury, Tejas Anvekar, Muhammad Ali Khan, Kaneez Zahra Rubab Khakwani, Mohamad Bassam Sonbol, Irbaz Bin Riaz, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学) Mayo Clinic(梅奥诊所)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.CL

AI总结 本文提出SCOPE框架,通过多LLM规划分解任务,提升临床试验数据的推理准确性与效率,解决隐含属性提取问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04212 2026-05-04 cs.CL cs.AI 84%

Language Models Struggle to Use Representations Learned In-Context

语言模型在上下文学习的表示使用上面临困难

Michael A. Lepori, Tal Linzen, Ann Yuan, Katja Filippova

机构 * Brown University(布朗大学) Google Research(谷歌研究) New York University(纽约大学) Google DeepMind(谷歌DeepMind)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了语言模型是否能利用上下文学习的表示完成简单下游任务,发现开放权重模型在处理新语义表示时存在困难,即使它们在潜在表示中编码了这些语义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00677 2026-05-04 cs.LG 83%

Evaluating the Architectural Reasoning Capabilities of LLM Provers via the Obfuscated Natural Number Game

通过混淆的自然数游戏评估大语言模型证明者的架构推理能力

Lixing Li

机构 * Lixing Li(李立星)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文通过混淆的自然数游戏评估大语言模型的架构推理能力,发现推理模型在无语义线索下仍保持准确率,为数学推理能力提供了量化评估标准。

Comments 4 pages. Accepted as a short paper to the AAAI 2026 Spring Symposium on Machine Learning and Knowledge Engineering for Knowledge-Grounded Semantic Agents (MAKE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00798 2026-05-04 cs.LG cs.CL cs.MA 82%

RunAgent: Interpreting Natural-Language Plans with Constraint-Guided Execution

RunAgent:通过约束引导执行解释自然语言计划

Arunabh Srivastava, Mohammad A., Khojastepour, Srimat Chakradhar, Sennur Ulukus

机构 * University of Maryland, College Park(马里兰大学学院公园分校) NEC Laboratories America, Inc.(NEC美国实验室)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 RunAgent通过约束引导执行解释自然语言计划,结合代理语言的显式控制构造,提升结构化工作流执行的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11991 2026-05-04 cs.CV cs.AI cs.CL 82%

VGR: Visual Grounded Reasoning

VGR:视觉基础推理

Jiacong Wang, Zijian Kang, Haochen Wang, Haiyong Jiang, Jiawen Li, Bohong Wu, Ya Wang, Jiao Ran, Xiao Liang, Chao Feng, Jun Xiao

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ByteDance Inc.(字节跳动公司)

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出VGR,一种增强视觉感知的多模态大语言模型,通过图像区域检测与回放提升多模态推理能力,在多个基准测试中表现优异。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01955 2026-05-04 cs.CV cs.AI cs.LG 81%

How Well Does GPT-4o Understand Vision? Evaluating Multimodal Foundation Models on Standard Computer Vision Tasks

GPT-4o对视觉的理解有多好?在标准计算机视觉任务上评估多模态基础模型

Rahul Ramachandran, Ali Garjani, Roman Bachmann, Andrei Atanov, Oğuzhan Fatih Kar, Amir Zamir

机构 * Swiss Federal Institute of Technology(瑞士联邦理工学院)

专题命中 推理与问题求解 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文评估了GPT-4o等多模态基础模型在标准计算机视觉任务上的表现,发现其在语义任务上优于几何任务,GPT-4o在非推理模型中表现最佳,推理模型在几何任务中有所提升。

Comments ICLR 2026. Project page at https://fm-vision-evals.epfl.ch/

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11349 2026-05-04 cs.CV 80%

Image Score: Learning and Evaluating Human Preferences for Mercari Search

图像评分:学习和评估Mercari搜索中的人类偏好

Chingis Oinar, Miao Cao, Shanshan Fu

机构 * Mercari

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出一种高效利用大型语言模型进行图像质量评估的方法,通过链式推理生成与人类行为一致的标签,提升电商场景下的图像评估可解释性并提高销售转化率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26173 2026-05-04 cs.LG cs.AI cs.CL 75%

Entropy Centroids as Intrinsic Rewards for Test-Time Scaling

熵中心作为测试时缩放的内在奖励

Wenshuo Zhao, Qi Zhu, Xingshan Zeng, Fei Mi, Lifeng Shang, Yi R., Fung

机构 * HKUST(香港科技大学) ZJU(浙江大学) Huawei(华为)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出熵中心作为测试时缩放的内在奖励,通过分析不确定性的时间结构提升模型响应质量,在不同规模模型上均优于现有基线。

Comments Under Review, 39 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26020 2026-05-04 cs.CL cs.AI cs.LG 75%

PORTool: Importance-Aware Policy Optimization with Rewarded Tree for Multi-Tool-Integrated Reasoning

PORTool:基于奖励树的重要性感知策略优化用于多工具集成推理

Feijie Wu, Weiwu Zhu, Yuxiang Zhang, Soumya Chatterjee, Jiarong Zhu, Fan Mo, Rong Luo, Jing Gao

机构 * Apple(苹果公司) Purdue University(普渡大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 PORTool通过奖励树实现多工具集成推理中的重要性感知策略优化,提升最终答案准确性并减少工具调用步骤。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00557 2026-05-04 cs.CL cs.AI 73%

Structure Liberates: How Constrained Sensemaking Produces More Novel Research Output

结构解放:如何受约束的意象生成产生更多创新性研究输出

James Mooney, Zae Myung Kim, Young-Jun Lee, Dongyeop Kang

机构 * University of Minnesota(明尼苏达大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出SCISENSE框架,通过结构化认知阶段提升研究输出的创新性,展示目标导向的意象生成在轨迹质量与下游任务表现上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00257 2026-05-04 cs.CL cs.AI cs.IR 73%

Retrieval-Augmented Reasoning for Chartered Accountancy

增强推理的会计师事务所应用

Jatin Gupta, Akhil Sharma, Saransh Singhania, Ali Imam Abidi

机构 * Dept. of Computer Science and Engineering(计算机科学与工程系) Sharda University(沙达大学) Greater Noida, India(印度Greater Noida)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CA-ThinkFlow框架,通过参数高效检索增强生成方法,结合量化推理模型和文档布局感知系统,实现与大型专有模型相当的性能,但对复杂法规文本的推理能力仍有不足。

Comments 9 pages, 2 figures, and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏