arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-31 至 2026-07-31 共收录 349 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 40 篇

2607.27798 2026-07-31 cs.AI 新提交 57%

MemeBench: What LVLMs Miss When Interpreting Culture-Dependent Memes

MemeBench:大型视觉语言模型在解读依赖文化的梗图时所缺失的内容

Weihang Wang, Kainan Tu, Jielei Zhang, Run Yang, Boheng Sheng, Yuchen He, Yu Xie, Pengyu Chen, Peiyi Li, Huyang Sun, Longwen Gao, Zhouhui Lian

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 研究针对LVLMs解读文化类梗图的知识缺口问题,推出诊断基准MemeBench及实体引导检索基线KAR,验证了检索手段可提升梗图解读的VIKR成功率。

Comments 17 pages, 5 figures, and 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20891 2026-07-31 cs.AI 版本更新 57%

Is Deep Research Reliable? Misleading Knowledge Induces False Conclusions

深度研究可靠吗?误导性知识会导致错误结论

Pengyu Zhu, Lijun Li, Longju Yang, Sen Su, Jing Shao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Chongqing University of Posts and Telecommunications(重庆邮电大学)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 研究深度研究代理在开放信息环境中的可靠性,引入MisKnow-Agent框架生成误导性实例,通过实验发现其易因误导知识得出错误结论,验证与实际证据使用脱节,评估防御措施效果,强调需提升模型和框架层面的证据验证及纠正能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16745 2026-07-31 cs.AI cs.MA 版本更新 57%

RELIC: Revealed Principles for Learning Interpretable Composable Skills in Multi-Agent Planning

RELIC:多智能体规划中学习可解释可组合技能的揭示原则

Nguyen Viet Tuan Kiet, Bui Dinh Pham, Duong Quoc Chinh, Dao Van Tung, Tran Cong Dao, Huynh Thi Thanh Binh

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 针对多智能体规划中隐私受限合作难题,提出RELIC框架,通过揭示原则学习可解释可组合技能,各智能体私用大语言模型引导搜索优化技能,协调器依团队性能评估更新,实现跨智能体转移,引入隐私保护技能学习新范式。

Comments v1 accepted at LM4Plan Workshop @ ICML 2026; v2 is the full paper version; Kiet, Pham, and Chinh contributed equally in v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27823 2026-07-31 cs.CV 新提交 50%

Hallucinations Leave a Grounding Signature:Verifier-Guided Decoding for Selective Object Correction

幻觉留下 grounding 特征:用于选择性对象修正的验证器引导解码

Lei Yang, Xinze Liu, Dayan Wu, Ding Wang, Hengjie Zhu, Zihao Zhang, Tianzhu Hu, Hanqi Wu, Peng Fu, Zheng Lin

专题命中 推理与问题求解 :language model(abstract)

AI总结 该研究针对大型视觉语言模型的对象幻觉问题,提出基于内在 grounding 特征(IGS)的验证器引导解码(VGD)框架,在保留视觉理解和对象覆盖率的同时,实现了最先进的对象幻觉缓解效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27564 2026-07-31 cs.CV 新提交 50%

Inference-Time Agentic Decision Rules Beat Longer Evolving Search for Multi-Image Medical Reasoning

推理时代理决策规则在多图像医学推理任务中优于更长的进化搜索

Site Li, Jianyi Hao, Xiaofeng Liu

机构 * Yale University(耶鲁大学)

专题命中 推理与问题求解 :language agent(abstract)

AI总结 本研究对比5种推理时代理策略,发现多图像医学推理中,顺序投票决策规则比扩展进化搜索预算的影响更大,其最终测试准确率显著优于基线及复杂变体。

Comments Presented at the CVPR 2026 Workshop on Multi-Modal Reasoning for Agentic Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 81 篇

2607.27674 2026-07-31 cs.SE 新提交 94%

Can Large Language Models Resolve Real Java Merge Conflicts? An Evaluation with a Calibrated LLM-as-Judge

大语言模型能否解决真实的Java合并冲突?一项使用校准后的LLM作为评判者的评估

Bowen Shen

专题命中 评测与基准 :LLM(title,title_cn);large language model(title,abstract);language model(title,abstract)

AI总结 该研究针对真实Java合并冲突,构建仅用推理信号的LLM求解器,经校准的LLM评判者评估发现,其解决冲突的覆盖和匹配开发者方案的表现优于传统工具AutoMerge,但结构正确性仍需确定性检查保障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28282 2026-07-31 cs.CL cs.LG 新提交 92%

(Towards) Scalable Reliable Automated Evaluation with Large Language Models

面向可扩展的可靠自动化评估:基于大语言模型

Bertil Braun, Martin Forell

机构 * KIT(卡尔斯鲁厄理工学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本研究提出一种基于多LLM两两比较与Elo评分的自动化评估框架,可近似专家评估,减少人工干预,实现对LLM输出的高效可靠评估。

Comments 17 pages. Published in the Proceedings of the Fourth Workshop on Generation, Evaluation and Metrics (GEM2) at ACL 2025

Journal ref Proceedings of the Fourth Workshop on Generation, Evaluation and Metrics (GEM2), pages 320-336, Association for Computational Linguistics, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04510 2026-07-31 cs.CE 版本更新 91%

OSCAgent: Accelerating the Discovery of Organic Solar Cells with LLM Agents

OSCAgent:利用LLM代理加速有机太阳能电池的发现

Zhaolin Hu, Zhiliang Wu, Kun Li, Hehe Fan, Yi Yang

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 OSCAgent通过多代理框架整合检索增强设计、分子生成和系统评估,提升有机太阳能电池材料发现效率,实现预测性能超越传统和LLM基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27654 2026-07-31 cs.CL cs.AI 新提交 91%

From Single- to Cross-Document: Benchmarking Multi-Granularity Event Analysis of Large Language Models

从单文档到跨文档:大语言模型多粒度事件分析的基准测试

Tao Wen, Shuai Shao, Pei Ke, Xu Han, Jie Zou, Guannan Li, Tao Tian, Jinjie Qiu, Lan Wang, Ke Qin

机构 * University of Electronic Science and Technology of China(电子科技大学) Tsinghua University(清华大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文推出MiGUE-Bench基准及MiGUE-Pipeline框架,通过四项核心任务评估LLMs多粒度事件分析能力,明确其能力边界与缺陷,为该领域改进提供方向。

Comments 9 pages. Published in the Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR 2026)

Journal ref Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR '26), pp. 3464-3472, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19786 2026-07-31 cs.CL 版本更新 90%

HumorRank: A Tournament-Based Leaderboard for Evaluating Humor Generation in Large Language Models

HumorRank: 基于锦标赛的大语言模型幽默生成评估排行榜

Edward Ajayi, Prasenjit Mitra

机构 * Carnegie Mellon University Africa(卡内基梅隆大学非洲分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出HumorRank,一种基于锦标赛的框架,通过理论指导的成对偏好判断对文本幽默生成进行排名,并利用Bradley-Terry估计生成全局排行榜。

Comments Leaderboard: https://humorrank-leaderboard.pages.dev/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27231 2026-07-31 cs.AI cs.LG 新提交 90%

KernelGenBench: A Multi-Source and Multi-Chip Benchmark for LLM-based Kernel Generation

KernelGenBench:面向基于大语言模型的内核生成的多源多芯片基准测试

Peiyu Zang, Jian Tao, Jialing Zhang, Yichen Yuan, Wentao Zhang, Guang Liu, Yonghua Lin

机构 * Beijing Normal University(北京师范大学) Beijing Jiaotong University(北京交通大学) Institute of Automation, CAS(中国科学院自动化研究所) Peking University(北京大学) BAAI(北京智源人工智能研究院)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出KernelGenBench基准,评估LLM与智能体生成的Triton内核,发现智能体方法优于纯LLM采样,cuBLAS算子最具挑战,跨平台性能退化严重,自主生成成本远高于简单采样。

Comments 10 pages, 4 figures. Code and data are publicly available at https://github.com/flagos-ai/KernelGenBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28006 2026-07-31 cs.AI 新提交 90%

MMLDSum-LLM: Multimodal Long-Document Summarization with Visual-Alignment and Keyword-Aware

MMLDSum-LLM:结合视觉对齐与关键词感知的多模态长文档摘要方法

Xianpeng Zhang, Jiahua Yang, Dongyu Chen, Lei zhang, Jian Ma, Xu guohuan, Haonan Lu, Tianhuang Su, Chuangchuang Wang, Kai Tang

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 针对多模态长文档摘要的关键信息遗漏与跨模态幻觉问题,提出结合视觉对齐与关键词感知的两阶段训练框架MMLDSum-LLM,在自研基准MMLDSum-Bench上验证了其性能优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17219 2026-07-31 cs.CL cs.AI quant-ph stat.ME 版本更新 90%

Auditing Question-Order Effects in Large Language Models with the QQ Equality: Mechanism Characterization and a Saturation Caveat

用QQ等式审计大语言模型中的问题顺序效应:机制表征与饱和警告

Pilsung Kang

机构 * Dankook University(韩国檀国大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型中问题顺序效应,将QQ等式发展为审计标准,理论上表征满足该等式的机制类别,方法上开发审计管道,实验发现强制二元下一个token对数概率不适用于分布级QQ审计,建议进行饱和诊断。

Comments v2: major revision. Five restructured findings separating order sensitivity, QQ imbalance, and residual contextuality; two-layer discriminant table; pipeline figure and per-item joint table; envelope pooling and certified Gamma bounds specified; retrospective batch-1 G3 re-validation (all verdicts preserved). No new pilot measurements

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11270 2026-07-31 cs.SE 版本更新 89%

Evaluating LLM Agents on Automated Software Analysis Tasks

评估LLM代理在自动化软件分析任务中的性能

Islem Bouzenia, Cristian Cadar, Michael Pradel

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本文通过AnalysisBench评估四种LLM架构在自动化软件分析任务中的表现,发现AnalysisAgent在手动验证的成功率高达94%,而现有代理存在阶段混用、错误定位差等问题,且整程序分析和符号执行是最具挑战性的任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28137 2026-07-31 cs.CY cs.AI 新提交 89%

Asymmetric Communication: Large Language Models and Language Games

非对称通信:大语言模型与语言游戏

Enzo Fenoglio

专题命中 评测与基准 :language model(title,abstract);large language model(title);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文通过提出非对称通信框架,纠正了AI讨论对大语言模型的错误属性投射,将相关现象重新归类为接收方一侧的现象,为AI治理提供了启示,明确对齐是制度约束工程,责任归人类机构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03328 2026-07-31 cs.LG cs.AI 版本更新 89%

Averaged Evaluation Masks Capability Trade-Offs: Multi-Source Calibration for High-Sparsity LLM Pruning

校准数据在能力维度上的权衡:为什么多源混合对高稀疏LLM剪枝至关重要

Hu Xu, Zhaolong Xing, Congcong Liu, Jiaxing Wang, Zhida Jiang, Junshi Huang, Zhen Chen, Jianfeng Xu

机构 * Shanghai Jiao Tong University(上海交通大学) JD.com(京东公司)

专题命中 评测与基准 :LLM(title,title_cn);pretraining(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 通过分解后剪枝能力维度并分析15个校准源,发现校准困惑度与通用能力保留正相关但与数学和代码能力保留负相关,提出多源混合校准方法IGSP以平衡各维度性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28307 2026-07-31 cs.SE cs.AI 新提交 89%

From Textual Requirements to Microservice Architectures - A Comprehensive Evaluation of LLM-Based Design Synthesis

从文本需求到微服务架构 —— 基于大语言模型的设计合成综合评估

Danyllo Albuquerque, José Renan, Guillermo Rodríguez, Guillermo Rodríguez, Emanuel Dantas, Ademar França, Mirko Perkusich, Kyller Gorgônio, Angelo Perkusich

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究探讨OpenAI o3能否仅从文本需求生成微服务架构,经实验发现少样本提示下其服务识别与通信恢复的一致性优于零样本,为需求驱动的架构合成提供了潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06458 2026-07-31 cs.CL cs.AI cs.LG 版本更新 88%

LLM Self-Correction with DeCRIM: Decompose, Critique, and Refine for Enhanced Following of Instructions with Multiple Constraints

基于DeCRIM的大语言模型自校正:分解、批判与优化,提升多约束指令遵循能力

Thomas Palmeira Ferraz, Kartik Mehta, Yu-Hsiang Lin, Haw-Shiuan Chang, Shereen Oraby, Sijia Liu, Vivek Subramanian, Tagyoung Chung, Mohit Bansal, Nanyun Peng

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 针对LLM处理多约束指令的不足,研究推出RealInstruct基准,提出DeCRIM自校正流程,可提升开源模型性能,结合强反馈时其表现能超越GPT-4。

Comments EMNLP 2024, see https://aclanthology.org/2024.findings-emnlp.458/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28318 2026-07-31 cs.AI 新提交 88%

PathView-Bench: Can Multimodal Large Language Models Achieve Fine-grained Multiscale Understanding of Pathology Images?

PathView-Bench:多模态大语言模型能否实现病理图像的细粒度多尺度理解?

Zongyi Chen, Yu Liang, Jie Lin, Liansheng Wang

机构 * National Institute for Data Science in Health and Medicine, Xiamen University(厦门大学健康与医学数据科学国家研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 研究针对现有病理多模态基准的不足,推出PathVU基准,评估发现主流MLLMs在多尺度病理图像细粒度视觉任务上存在显著局限,为相关模型的开发评估提供了可复现基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28086 2026-07-31 cs.AI 新提交 88%

Distilling Answer Set Programming Theories from Large Language Models

从大型语言模型中提炼答案集编程理论

Nelson Higuera Ruiz, Markus Hofmarcher, Claudiu Leoveanu-Condrei

机构 * ExtensityAI

专题命中 评测与基准 :large language model(title);language model(title);LLM(summary_cn);分类 cs.AI

AI总结 该研究针对从头编写ASP理论困难的问题,采用神经符号方法测试9种模型从LLM提炼ASP理论的能力,在VQA基准上验证了前沿模型的性能,并发布了相关资源。

Comments Accepted at NeSy 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27595 2026-07-31 cs.CL cs.AI cs.DL 新提交 87%

Beyond Similarity: Grounded Agentic Extraction and Expert-Adjudicated Evaluation of Intertextuality in Classical Chinese Histories

超越相似性:中国古典史书互文性的智能体式提取与专家裁决评估

Zhaoji Wang, Wanyu Si, Jun Wang

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究将细粒度互文性提取设为LLM智能体任务,构建专家裁决的古典史书互文基准,验证12种LLM性能,扩展至二十四史揭示引文的总体稳定与个案漂移规律并发布相关资源。

Comments 9 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27942 2026-07-31 cs.MA 新提交 87%

Scaling LLM-Driven Multi-Agent Systems: Design Principles and Architectural Scalability Analysis

扩展大语言模型驱动的多智能体系统:设计原则与架构可扩展性分析

Linus Sander, Fengjunjie Pan, Vahid Zolfaghari, Andre Schamschurko, Nenad Petrovic, Alois Knoll

专题命中 评测与基准 :LLM(title,summary_cn)

AI总结 该研究提炼出可扩展多智能体系统的四项设计原则,构建参考架构并在基准任务上评估,发现LLM超能力阈值时扩展可提升准确率但成本近似线性增长,性能在中等复杂度达峰,一致性是核心挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27294 2026-07-31 cs.SE 新提交 87%

AgentS4D: Benchmarking Runtime Risks across the Execution Lifecycle of LLM-Based Workspace Agents

AgentS4D:基于大语言模型的工作空间智能体执行生命周期内运行时风险基准

Jiajun Zhou, Zhaoxuan Ke, Jihang Ye, Xuanze Chen, Shanqing Yu, Qi Xuan

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究推出AgentS4D基准,评估20种智能体配置在328个风险案例中的表现,发现任务完成不代表安全,需跨风险条件完整评估智能体配置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27267 2026-07-31 cs.CR cs.AI 新提交 86%

FAVA: Formal Authorization for Verified Agents with Evidence-Backed Permission Graphs

FAVA:基于证据支持的权限图的经验证智能体的形式化授权

Yifan Zhang, Xinkui Zhao, Sai Liu, Hengxuan Lou, Guanjie Cheng, Chang Liu

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 FAVA是一种用于智能体执行的带权限授权框架,通过LLM引导的权限IR、证据支持的权限图和SMT授权器保障安全,在多场景评估中达90.5%决策合规率,可拦截动态违规迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26172 2026-07-31 cs.HC cs.AI cs.SI 版本更新 86%

Linking Heterogeneous Data with Coordinated Agent Flows for Social Media Analysis

通过协调智能体流关联异构数据以开展社交媒体分析

Shifu Chen, Dazhen Deng, Zhihong Xu, Sijia Xu, Linyu Qin, Tai-Quan Peng, Yingcai Wu

机构 * Zhejiang University(浙江大学) Department of Communication, Michigan State University(密歇根州立大学通讯系)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出LLM智能体系统SIA,通过协调智能体流关联社交媒体异构多模态数据,采用阶段同步策略挖掘洞见,经评估可发现多样有意义的洞见,为社交媒体分析提供新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27421 2026-07-31 cs.CL cs.AI cs.LG 新提交 85%

Selecting Open-Weight Language Models for Zero-Shot Intent Classification: A Systematic Evaluation of 41 Models

选择用于零样本意图分类的开放权重语言模型:41种模型的系统评估

Parishruthi Ganesh, Gerry Dozier, Cheryl Seals

专题命中 评测与基准 :language model(title,abstract);instruction tuning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究通过系统评估41种开放权重语言模型,为意图分类场景下选择符合计算、延迟等约束的模型提供了实用指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28094 2026-07-31 cs.AI 新提交 84%

An Instrument to Evaluate Governance Proposals: AI Policy Analysis at Scale

一种用于评估治理提案的工具:规模化AI政策分析

Paulo Carvao, Claudio Mayrink Verdun, Isabel Adler, Jeffrey Zhou

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种AI政策分析框架,结合专家见解与计算分析,以领域校准模型为基准评估商业LLM,助力用户评估AI治理提案的属性一致性,支持政策制定等人员应对复杂环境。

Comments 48 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00215 2026-07-31 cs.SE 版本更新 83%

DocPrism: Multi-lingual Detection of Incorrectness Inconsistencies between Code and Documentation

DocPrism:代码与文档间错误不一致性的多语言检测

Xiaomeng Xu, Zahin Wahab, Reid Holmes, Caroline Lemieux

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出轻量级多语言代码-文档不一致性检测工具DocPrism,通过LCEF方法降低标记率、提升F1分数,在多语言真实场景中表现优于现有技术。

Comments 22 pages. To appear in Proceedings of the ACM on Software Engineering, Volume 3, ISSTA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26993 2026-07-31 cs.LG 版本更新 83%

Foundation Models for Face Presentation Attack Detection: A Unified Linear-Probing Benchmark

用于人脸呈现攻击检测的基础模型:统一的线性探测基准

Peter Lorenz, Anjith George, Sébastien Marcel

机构 * Idiap Research Institute(Idiap研究所) University of Lausanne (UNIL)(洛桑大学)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 本研究在MCIO基准上评估24种冻结基础模型编码器的线性探测性能,发现其仅通过线性分类器可实现强劲的数据集内PAD性能,但跨数据集迁移能力有限,需明确适配以解决域偏移问题。

Comments accepted at IJCB 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25199 2026-07-31 q-fin.CP cs.AI 版本更新 83%

RIDGE: An Autonomous Framework for Validation and Method Discovery in LLM-Generated Option Pricing

RIDGE:一个用于验证和发现大语言模型生成的期权定价方法的自主框架

Liexin Cheng, Xue Cheng, Shuaiqiang Liu, Cornelis W. Oosterlee

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对大语言模型生成的期权定价实现,介绍自主验证框架RIDGE,通过多种测试和检查优化定价实现与验证方法,应用于五个随机波动率模型,消除缺陷并带来新定价方法。

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏