arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-07 至 2026-04-07 共收录 396 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 83 篇

2604.04791 2026-04-07 cs.CL 77%

How Far Are We? Systematic Evaluation of LLMs vs. Human Experts in Mathematical Contest in Modeling

我们离目标还有多远?对LLMs与人类专家在数学建模竞赛中的系统评估

Yuhang Liu, Heyan Huang, Yizhe Yang, Hongyan Zhao, Zhizhuo Zeng, Yang Gao

机构 * Beijing Institute of Technology(北京理工大学) Southeast Academy of Information Technology(东南信息技术研究院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文系统评估了LLMs与人类专家在数学建模竞赛中的能力差异,揭示了当前先进LLMs在执行阶段存在显著缺陷,需超越模型扩展的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04060 2026-04-07 cs.CR cs.AI 77%

CoopGuard: Stateful Cooperative Agents Safeguarding LLMs Against Evolving Multi-Round Attacks

CoopGuard:基于协作代理的有状态多轮防御框架用于抵御LLM的演变攻击

Siyuan Li, Zehao Liu, Xi Lin, Qinghua Mao, Yuliang Chen, Haoyu Li, Jun Wu, Jianhua Li, Xiu Su

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) Department of Computer Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校计算机科学系) Big Data Institute, Central South University(中南大学大数据研究院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出CoopGuard,通过协作代理维护和更新内部防御状态,有效应对多轮演变攻击。实验显示其在攻击成功率、欺骗率和攻击效率上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04036 2026-04-07 cs.IR cs.CL 77%

MisEdu-RAG: A Misconception-Aware Dual-Hypergraph RAG for Novice Math Teachers

MisEdu-RAG:一种面向初学者数学教师的误解意识双超图RAG

Zhihan Guo, Rundong Xue, Yuting Lu, Jionghao Lin

机构 * The University of Hong Kong(香港大学) Xi'an Jiaotong University(西安交通大学) Carnegie Mellon University(卡内基梅隆大学) Monash University(莫纳什大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对初学者数学教师难以诊断和纠正学生错误的问题,提出基于双超图的RAG框架,通过组织教学知识和学生错误案例,提升响应质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03695 2026-04-07 cs.CL 77%

POEMetric: The Last Stanza of Humanity

POEMetric:人类的最后一段

Bingru Li, Han Wang, Hazel Wilkinson

机构 * University of Birmingham(伯明翰大学) University of Trento(特伦托大学) Institute of Data and AI (IDAI)(数据与人工智能研究所)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出POEMetric框架,评估诗歌生成能力,通过人类和LLM的对比发现,尽管顶级模型在形式准确性和主题匹配上表现优异,但整体诗歌质量仍逊于人类诗人。

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26567 2026-04-07 cs.SE cs.AI 77%

Beyond Code Snippets: Benchmarking LLMs on Repository-Level Question Answering

超越代码片段:在仓库层面评估大语言模型的问答任务

Yoseph Berhanu Alebachew, Hunter Leary, Swanand Vaishampayan, Chris Brown

机构 * Department of Computer Science, Virginia Tech(弗吉尼亚理工大学计算机科学系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出StackRepoQA数据集,用于评估大语言模型在多项目仓库层面的问答能力,通过对比不同配置下的性能,揭示了模型在处理仓库级程序理解时的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04812 2026-04-07 cs.SE 75%

SysTradeBench: An Iterative Build-Test-Patch Benchmark for Strategy-to-Code Trading Systems with Drift-Aware Diagnostics

SysTradeBench: 一种用于策略到代码交易系统的迭代构建-测试-修补基准,具有漂移意识的诊断

Yuchen Cao, Hanlin Zhang, Jacky Wai Keung, Yang Chen, Linqi Song

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 SysTradeBench通过迭代构建、测试和修补流程评估LLM生成的交易系统,结合漂移意识诊断,验证策略到代码的准确性、风险控制、可靠性及鲁棒性,评估17个模型12个策略,发现LLM迭代补充而非替代人类治理。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04580 2026-04-07 cs.SE 75%

Beyond Fixed Tests: Repository-Level Issue Resolution as Coevolution of Code and Behavioral Constraints

超越固定测试:仓库级问题解决作为代码和行为约束的共进化

Kefan Li, Yuan Yuan, Mengfei Wang, Shihao Zheng, Wei Wang, Ping Yang, Mu Li, Weifeng Lv

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出Agent-CoEvo框架,通过共进化代码与行为约束提升修复效果,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03667 2026-04-07 cs.CV 75%

Leveraging Gaze and Set-of-Mark in VLLMs for Human-Object Interaction Anticipation from Egocentric Videos

利用目光和标记集在VLLMs中进行人-物体交互预测从第一人称视频

Daniele Materia, Francesco Ragusa, Giovanni Maria Farinella

机构 * Next Vision s.r.l. -- Spinoff of the University of Catania(Next Vision s.r.l. -- 卡塔尼亚大学衍生公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出利用VLLMs中的目光和标记集来预测人-物体交互,通过改进视觉定位能力和用户意图理解,结合逆指数采样策略,实验表明方法在HD-EPIC数据集上优于现有方法。

Comments Accepted to International Conference on Pattern Recognition (ICPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03610 2026-04-07 cs.SE 75%

DebugHarness: Emulating Human Dynamic Debugging for Autonomous Program Repair

DebugHarness: 模拟人类动态调试以实现自主程序修复

Maolin Sun, Yibiao Yang, Xuanlin Liu, Yuming Zhou, Baowen Xu

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 DebugHarness通过模拟人类动态调试过程,利用LLM实现复杂漏洞的自动修复,其动态调试方法在SEC-bench数据集上实现了90%的修复率,比现有方法提升30%以上。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17087 2026-04-07 cs.CL cs.AI cs.CY cs.DB cs.LG 75%

Informatics for Food Processing

食品加工的信息化

Gordana Ispirova, Michael Sebek, Giulia Menichetti

机构 * Channing Division of Network Medicine, Department of Medicine, Brigham and Women’s Hospital, Harvard Medical School(哈佛医学院布里格姆妇女医院医学系钱宁网络医学部) Network Science Institute and Department of Physics, Northeastern University(东北大学网络科学研究所与物理系) Harvard Data Science Initiative, Harvard University(哈佛大学哈佛数据科学计划)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨了食品加工的演变、分类及健康影响,提出利用机器学习和数据科学改进食品信息化,通过FoodProX模型和BERT等模型实现食品分类与评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04354 2026-04-07 cs.HC cs.CL cs.CY 70%

Talk2AI: A Longitudinal Dataset of Human--AI Persuasive Conversations

Talk2AI: 人类与AI说服对话的纵向数据集

Alexis Carrillo, Enrique Taietta, Ali Aghazadeh Ardebili, Giuseppe Alessandro Veltri, Massimo Stella

机构 * University of Trento(特伦托大学) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 Talk2AI数据集通过3080次对话研究说服、观点变化和人机交互,包含30800个对话轮次及丰富的上下文数据。

Comments 17 pages, 2 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04274 2026-04-07 cs.AI cs.CE stat.AP 70%

InferenceEvolve: Towards Automated Causal Effect Estimators through Self-Evolving AI

InferenceEvolve:通过自演化AI实现自动因果效应估计器

Can Wang, Hongyu Zhao, Yiqun Chen

机构 * Johns Hopkins Bloomberg School of Public Health(约翰霍普金斯大学彭博公共卫生学院) Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出InferenceEvolve框架,利用大语言模型发现并迭代优化因果方法,在多个基准测试中优于现有方法,展示了语言模型引导的进化在因果推断中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06668 2026-04-07 cs.IR cs.LG 70%

Contradictions in Context: Challenges for Retrieval-Augmented Generation in Healthcare

上下文中的矛盾:医疗领域检索增强生成的挑战

Saeedeh Javadi, Sara Mirabi, Manan Gangar, Bahadorreza Ofoghi

机构 * Deakin University(迪肯大学) RMIT University(皇家墨尔本理工大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文研究了在医疗领域使用检索增强生成方法时,源文档中过时或矛盾信息对模型性能的影响,提出了一个基准数据集并分析了不同LLM的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03660 2026-04-07 cs.AI 70%

TableVision: A Large-Scale Benchmark for Spatially Grounded Reasoning over Complex Hierarchical Tables

TableVision:一种大规模基准,用于复杂分层表格上的空间感知推理

Xiaoyu Chen, Lu Dai, Hanqing Wang, Zhuoyu Li, Wenbin Dai, Yanzong Zheng, Zhenggang Xia, Junyong Lin, Hui Xiong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出TableVision基准,通过量化分析发现复杂表格推理中的感知瓶颈,引入轨迹感知的分层任务分类,结合确定性接地流程生成6799条高保真推理轨迹,提升多模态大语言模型的空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03632 2026-04-07 cs.SE cs.AI 70%

Persistent Cross-Attempt State Optimization for Repository-Level Code Generation

持久的跨尝试状态优化用于仓库级代码生成

Ruwei Pan, Jiangshuai Wang, Qisheng Zhang, Yueheng Zhu, Linhao Wu, Zixiong Yang, Yakun Zhang, Lu Zhang, Hongyu Zhang

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出LiveCoder框架,通过跨尝试知识优化提升仓库级代码生成效率,通过保留任务特定状态提升生成效果,实验表明在RAL-Bench上功能得分提升22.94个百分点,仓库复用率提升至81.58%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03622 2026-04-07 cs.SE cs.AI 70%

Toward Executable Repository-Level Code Generation via Environment Alignment

面向环境对齐的仓库级代码生成

Ruwei Pan, Junlei Shen, Linhao Wu, Yueheng Zhu, Zixiong Yang, Yakun Zhang, Lu Zhang, Hongyu Zhang

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出EnvGraph框架,通过环境对齐问题解决仓库级代码生成中的可执行性挑战,实验显示其在功能正确性和非功能质量上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10882 2026-04-07 cs.CL 70%

Computational emotion analysis with multimodal LLMs: Current evidence on an emerging methodological opportunity

基于多模态大语言模型的计算情感分析:当前对新兴方法论机会的证据

Hauke Licht

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文评估了多模态大语言模型在政治视频情感分析中的表现,发现实验室条件下的模型表现接近人类水平,但在真实场景中存在显著性能差距及性别偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25224 2026-04-07 cs.CL 70%

ProMediate: A Socio-cognitive framework for evaluating proactive agents in multi-party negotiation

ProMediate:多方谈判中评估主动代理的社认知框架

Ziyi Liu, Bahar Sarrafzadeh, Pei Zhou, Longqi Yang, Jieyu Zhao, Ashish Sharma

机构 * University of Southern California(南加州大学) Microsoft Corporation(微软公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出ProMediate框架,用于评估多方谈判中主动代理的社认知能力,通过模拟测试平台和新指标衡量共识变化、干预延迟等,结果显示社会智能代理在复杂谈判中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23883 2026-04-07 cs.AI 70%

Agentic AI Security: Threats, Defenses, Evaluation, and Open Challenges

代理AI安全:威胁、防御、评估与开放挑战

Anshuman Chhabra, Shrestha Datta, Shahriar Kabir Nahin, Prasant Mohapatra

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨代理AI系统的安全威胁与防御策略,分析其在自动化中的独特风险,并提出安全设计的开放挑战。

Comments Published in IEEE Access. DOI: https://doi.org/10.1109/access.2026.3675554

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04658 2026-04-07 cs.CV 67%

Synthesis4AD: Synthetic Anomalies are All You Need for 3D Anomaly Detection

Synthesis4AD:合成异常就是3D异常检测所需

Yihan Sun, Yuqi Cheng, Junjie Zu, Yuxiang Tan, Guoyang Xie, Yucheng Wang, Yunkang Cao, Weiming Shen

机构 * National Center of Technology Innovation for Intelligent Design and Numerical Control, Huazhong University of Science and Technology(华中科技大学国家智能设计与数控技术创新中心) School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院) Department of Intelligent Manufacturing, Contemporary Amperex Technology Ltd.(宁德时代新能源科技股份有限公司智能制造部) Institute for Infocomm Research, A*STAR(新加坡科技研究局资讯通信研究院) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出Synthesis4AD方法,通过大规模高保真合成异常数据提升3D异常检测性能,利用3D-DefectStudio平台生成精确点云异常掩码,并结合多模态大语言模型实现知识驱动的数据生成,实验表明在多个数据集上达到领先水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04419 2026-04-07 cs.CV 67%

BoxComm: Benchmarking Category-Aware Commentary Generation and Narration Rhythm in Boxing

BoxComm:基于 boxing 的类别感知评论生成与叙述节奏基准测试

Kaiwen Wang, Kaili Zheng, Rongrong Deng, Yiming Shi, Chenyi Guo, Ji Wu

机构 * Tsinghua University(清华大学) Beijing Sport University(北京体育大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出 BoxComm 数据集,包含 445 场世界拳击锦标赛视频及 52000 多条专业评论,通过分类注解和两项新评估方法,解决拳击评论生成中的节奏与类别准确性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23047 2026-04-07 cs.SE 67%

CL4SE: Benchmarking Context Learning on Software Engineering

CL4SE:软件工程中基于上下文学习的基准测试

Haichuan Hu, Quanjun Zhang, Ye Shang, Guoqing Xie, Chunrong Fang, Zhenyu Chen, Liang Xiao

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出CL4SE基准测试,系统分类四种软件工程特定上下文类型,通过高质量数据集和五种主流LLM评估,展示上下文学习在代码生成、审查等任务中的性能提升。

Comments 34 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28532 2026-04-07 cs.LG cs.AI stat.AP 62%

Detecting low left ventricular ejection fraction from ECG using an interpretable and scalable predictor-driven framework

通过可解释且可扩展的预测驱动框架从ECG检测低左心室射血分数

Ya Zhou, Tianxiang Hao, Ziyi Cai, Haojie Zhu, Kejun He, Jia Liu, Xiaohan Fan, Jing Yuan

机构 * Fuwai Hospital, Chinese Academy of Medical Sciences and Peking Union Medical College(中国医学科学院阜外医院、北京协和医学院) The Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Institute of Statistics and Big Data, Renmin University of China(中国人民大学统计与大数据研究院) National Center for Cardiovascular Diseases(国家心血管病中心) Function Test Center, Fuwai Hospital(阜外医院功能检测中心)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ECGPD-LEF框架,结合基础模型诊断概率与可解释模型,有效检测ECG中的低左心室射血分数,优于现有方法,且具备高可解释性。

Comments This version includes minor typographical corrections. The results and conclusions remain unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21169 2026-04-07 cs.MM cs.AI cs.CL cs.CV 62%

Document Parsing Unveiled: Techniques, Challenges, and Prospects for Structured Information Extraction

文档解析揭示:结构信息提取的技术、挑战与前景

Qintong Zhang, Bin Wang, Victor Shea-Jay Huang, Junyuan Zhang, Zhengren Wang, Hao Liang, Conghui He, Wentao Zhang

机构 * Peking University(北京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Beihang University(北京航空航天大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了文档解析研究,系统分类了现有方法,探讨了布局分析、多类型内容识别及VLM驱动的解析模型发展,总结了评估指标与挑战,提出了更准确可扩展的文档智能系统方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04847 2026-04-07 eess.AS cs.CL 57%

Full-Duplex-Bench-v3: Benchmarking Tool Use for Full-Duplex Voice Agents Under Real-World Disfluency

全双工基准v3:在现实世界不流畅条件下评估全双工语音代理的基准工具

Guan-Ting Lin, Chen Chen, Zhehuai Chen, Hung-yi Lee

机构 * National Taiwan University(国立台湾大学) NVIDIA(英伟达)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 本文提出全双工基准v3,用于评估在自然语音条件下和多步骤工具使用中语言模型的性能。通过六个模型配置评估准确性、延迟和轮流交流维度,发现GPT-Realtime在Pass@1和打断避免方面表现最佳,而Gemini Live 3.1具有最短延迟但轮流率最低。

Comments Work in progress. Demo at https://daniellin94144.github.io/FDB-v3-demo

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04670 2026-04-07 eess.IV cs.AI cs.CY eess.SP 57%

An AI Teaching Assistant for Motion Picture Engineering

为电影工程专业设计的AI助教

Deirdre O'Regan, Anil C. Kokaram

机构 * Trinity College Dublin(都柏林圣三一大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本文介绍基于RAG技术的AI助教在电影工程硕士课程中的应用,通过实验证明其在教学环境中的有效性,并展示学生反馈和评估结果。

Comments Accepted for publication in IEEE Signal Processing Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04426 2026-04-07 cs.AI 57%

ShieldNet: Network-Level Guardrails against Emerging Supply-Chain Injections in Agentic Systems

ShieldNet: 针对代理系统中新兴供应链注入的网络级防护

Zhuowen Yuan, Zhaorun Chen, Zhen Xiang, Nathaniel D. Bastian, Seyyed Hadi Hashemi, Chaowei Xiao, Wenbo Guo, Bo Li

机构 * UIUC(伊利诺伊大学厄巴纳-香槟分校) University of Chicago(芝加哥大学) University of Georgia(佐治亚大学) United States Military Academy(美国军事学院) eBay Johns Hopkins University(约翰霍普金斯大学) UCSB(加州大学圣塔芭芭拉分校) Virtue AI

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本文提出ShieldNet,通过观察真实网络交互检测供应链注入,优于现有工具,检测性能达0.995 F-1,误报率低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04347 2026-04-07 cs.AI 57%

RoboPhD: Evolving Diverse Complex Agents Under Tight Evaluation Budgets

RoboPhD:在有限评估预算下演化多样化复杂智能体

Andrew Borthwick, Stephen Ash, Anthony Galczak

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本文通过对比三种优化方法,在四个基准测试中展示了RoboPhD在演化多样化复杂智能体方面的优越性,特别是在抽象推理、云调度、SQL生成和金融问答任务中表现突出。

Comments 20 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04258 2026-04-07 cs.AI cs.HC 57%

Context Engineering: A Practitioner Methodology for Structured Human-AI Collaboration

上下文工程:一种结构化的人机协作实践方法论

Elias Calboreanu

专题命中 评测与基准 :prompting(abstract);分类 cs.AI

AI总结 本文提出上下文工程方法,通过结构化方式构建、声明和排序AI提示的完整信息负载,提升输出质量。实验显示,结构化上下文可减少迭代次数并提高首次通过率。

Comments 39 pages, 6 figures, 10 tables, 47 references. Submitted to Springer Nature journal. Open-access extraction datasets and methodology artifacts available

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04220 2026-04-07 cs.AI 57%

TimeSeek: Temporal Reliability of Agentic Forecasters

TimeSeek:代理预测者的时序可靠性

Hamza Mostafa, Om Shastri, Dennis Lee

机构 * Automorphic Labs(Automorphic实验室)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 TimeSeek研究代理LLM预测者在预测市场生命周期中的可靠性变化,评估10种前沿模型在150个Kalshi二元市场中的表现,发现早期和高不确定性市场表现最佳,但接近解决和强共识市场时表现下降,网页搜索提升BSS但部分情况下降低,简单两模型组合能减少误差但未超越市场整体。

Comments Workshop paper. 11 pages including references

详情

展开后加载摘要…

URL PDF HTML 收藏