arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-14 至 2026-07-14 共收录 482 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 116 篇

2601.06401 2026-07-14 cs.AI cs.CL 版本更新 79%

BizFinBench.v2: Towards Reliable LLMs in Finance via Real-User Data and Offline/Online Bilingual Evaluation

BizFinBench.v2:通过真实用户数据和离线/在线双语评估实现金融领域可靠的大语言模型

Xin Guo, Rongjunchen Zhang, Guilong Lu, Xuntao Guo, Shuai Jia, Zhi Yang, Liwen Zhang

机构 * HiThink Research(HiThink研究机构) Shanghai University of Finance and Economics(上海财经大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对大语言模型在金融应用中实际效果与报告性能差距大的问题,构建BizFinBench.v2基准,涵盖中美股票市场真实用户数据及多个任务,通过实验评估模型,揭示现有模型局限,为金融领域大语言模型部署提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01436 2026-07-14 cs.CL cs.AI 79%

Towards Safer Chatbots: Automated Policy Compliance Evaluation of Custom GPTs

迈向更安全的聊天机器人:自动生成策略合规性评估的定制GPTs

David Rodriguez, William Seymour, Jose M. Del Alamo, Jose Such

机构 * Information Processing and Telecommunications Center Universidad Politécnica de Madrid ETSI Telecomunicación(信息处理与电信中心西班牙马德里理工大学电信工程学院) King’s College London(伦敦国王学院) INGENIO (CSIC-Universitat Politècnica de València)(INGENIO(西班牙国家研究委员会-瓦伦西亚理工大学))

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种自动化方法,用于评估定制GPTs是否符合其市场使用政策,通过黑盒交互结合大规模发现、红队提示和LLM作为法官,揭示了当前审核机制的不足及行为合规性评估的可行性。

Journal ref Array, Volume 30, July 2026, Article 100834

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11451 2026-07-14 cs.HC 新提交 78%

ManiScope: LLM-Assisted Visual Analytics of Cryptocurrency Manipulation Risk

ManiScope:基于大语言模型的加密货币操纵风险可视化分析

Xiaolin Wen, Feng Liang, Yuanye Ma, Qishuang Fu, Zhengyu Sun, Feng Zhu, Can Liu, Yong Wang

专题命中 评测与基准 :LLM(title,abstract)

AI总结 针对加密货币市场操纵风险评估问题,提出ManiScope系统,利用大语言模型辅助可视化分析,提供多方面协同视图及人机协作框架,经案例和用户研究验证,该系统能有效评估风险、减少人工并围绕假设组织发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09919 2026-07-14 cs.HC 新提交 78%

When LLM Tutoring Responses Work: Evidence from Student Programming Conversations

当大语言模型辅导回复起作用时:来自学生编程对话的证据

Mohammad Fahim Abrar, Shayla Sharmin, Roghayeh Leila Barmaki

专题命中 评测与基准 :LLM(title,abstract)

AI总结 研究学生在编程教育中使用大语言模型辅导时,哪种回复助于高效学习。通过分析StudyChat数据集,用大语言模型辅助标注并经人工验证,发现回复风格与延续情况相关,支持情境感知的人工智能辅导回复评估和设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11437 2026-07-14 cs.CL 新提交 77%

Relational Positioning as a Measurable Risk Object: History-Carried Lock-in and Self-Confabulation in Multi-Turn Human-AI Dialogue

作为可测量风险对象的关系定位:多轮人机对话中的历史锁定和自我虚构

Jihong Chen

机构 * Beijing Etown Academy(北京亦庄实验中学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究多轮人机对话中大语言模型的关系定位,定义并验证关系定位度量D1,刻画其立场,揭示历史携带锁定和自我虚构两种关系失败模式,通过控制门控和标尺证实,为相关研究提供新认知。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11042 2026-07-14 cs.SE cs.AI 新提交 77%

BackendForge: Benchmarking Agentic End-to-End Code Generation with Backend Services

BackendForge:使用后端服务对智能端到端代码生成进行基准测试

Yuzhe Guo, Mengzhou Wu, Yuan Cao, Jialei Wei, Dezhi Ran, Wei Yang, Tao Xie

机构 * Key Lab of HCST (PKU), MOE(北京大学计算机科学与技术国家重点实验室;软件学院,北京大学) SCS, Peking University(北京通明湖信息技术应用创新中心) Beijing Tongming Lake Information Technology Application Innovation Center (TLAIC)(复旦大学高级计算系统研究所) Fudan University Institute of Systems for Advanced Computing(上海开放计算系统研究所) Shanghai Institute of Systems for Open Computing

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究智能端到端代码生成评估问题,引入BackendForge基准,给定规范和契约让大语言模型生成容器化服务,用测试和代码代理共同进化测试预言机和参考服务,发现当前大语言模型虽能实现部分API行为,但生成完整后端服务仍有困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11026 2026-07-14 cs.CL 新提交 77%

Dimensionality in Satisfaction Ratings

满意度评级中的维度

Andrew Hong, Jason Potteiger

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究用大语言模型注释消费品公司对话文本,分解客户服务满意度为多轴,验证注释与客户自评的关系,发现轴间相关性及共线性,指出分解价值在于归因和覆盖,能识别对话数据中细微的客户体验驱动因素。

Comments 25 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10768 2026-07-14 cs.AI 新提交 77%

Opti-Agent-Bench: Benchmarking End-to-End Optimization R&D Agents on Real-World Business Problems

Opti-Agent-Bench:在实际业务问题上对端到端优化研发智能体进行基准测试

Yongchang Fu, Xinjie Huang, Chengjun Dai, Chengzhe Feng, Junshao Zhang, Hong Zhu

机构 * Ding Talk, Alibaba Group(钉钉,阿里巴巴集团) Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大语言模型解决优化问题的现有不足,引入Opti-Agent-Bench基准测试,通过业务语义真实性、模块化评估、ORAC双层有效性框架,在多工业规模任务中揭示当前模型关键失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10647 2026-07-14 cs.CL 新提交 77%

Knowledge Distillation for Automated AI Tutor Evaluation

用于自动评估人工智能导师的知识蒸馏

Tahmid Al Hannan, Diego Garcia, Alex Njoroge, Suha Al Juboori, Tarek Sakakini

机构 * Folsom Lake College(福尔松湖学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 大语言模型融入教育但缺乏教学质量评估方法,研究引入FATE模型评估人工智能导师,利用前沿大语言模型的知识蒸馏生成额外监督提升评估性能,通过基准测试证明了FATE作为自动评估器的效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23750 2026-07-14 cs.CL 版本更新 77%

IslamicMMLU: A Benchmark for Evaluating LLMs on Islamic Knowledge

伊斯兰MMLU:评估大语言模型在伊斯兰知识上的基准

Ali Abdelaal, Mohammed Nader Al Haffar, Mahmoud Fawzi, Walid Magdy

机构 * The University of Edinburgh(爱丁堡大学)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 伊斯兰MMLU基准通过10,013道题评估大语言模型在伊斯兰知识上的表现,涵盖《古兰经》、圣训和教法三个领域,测试模型在不同方面的能力,初步评估26个模型,准确率差异显著。

Comments Leaderboard link: https://huggingface.co/spaces/islamicmmlu/leaderboard

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02905 2026-07-14 cs.AI 版本更新 77%

FIRE-Bench: Evaluating AI Agents on the Rediscovery of Scientific Insights

FIRE-Bench:评估人工智能代理在科学见解重新发现方面的表现

Zhen Wang, Fan Bai, Zhongyan Luo, Jinyan Su, Kaiser Sun, Xinle Yu, Jieyuan Liu, Kun Zhou, Claire Cardie, Mark Dredze, Zhiting Hu, Eric P. Xing

机构 * Johns Hopkins University(约翰霍普金斯大学) Cornell University(康奈尔大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究旨在评估大语言模型驱动的人工智能代理在科学见解重新发现上的能力。核心方法是引入FIRE-Bench基准,让代理基于高层次研究问题进行全周期探索。主要贡献是为衡量代理驱动的科学发现进展提供了严格诊断框架,揭示当前代理系统在全周期科研上的挑战。

Comments 34 pages, 3 figures, 16 tables; ICML 2026 Camera-ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11354 2026-07-14 cs.IR 新提交 75%

User Preference Induction with LLMs for Offline Top-N Recommendation Evaluation

基于大语言模型的用户偏好归纳用于离线 Top-N 推荐评估

David Otero, Javier Parapar

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究针对离线 Top-N 推荐评估依赖不完整相关性信息的问题,提出基于大语言模型的框架,通过归纳用户偏好及判断候选项目相关性来扩展判断,提升评估稳健性并减轻流行度敏感失真。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10738 2026-07-14 cs.LG cs.AI cs.CL 新提交 75%

To Answer or to Abstain: Mitigating Search-Agent Hallucinations via Abstention-Aware Reinforcement Learning

回答还是弃权:通过弃权感知强化学习减轻搜索代理幻觉

Fengji Zhang, Tianyu Fan, Yuxiang Zheng, Xinyao Niu, Chengen Huang, Jacky Keung, Bei Chen

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对大语言模型训练范式易加剧搜索代理幻觉的问题,提出弃权感知强化学习(AWA-RL),利用模型能力动态塑造弃权奖励,并引入RA-F1指标,实验表明该方法有效提升了搜索代理的性能和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11873 2026-07-14 cs.CL cs.LG 新提交 73%

A Durability and Cross-Language Transfer Benchmark for a Validated Teaching-Feedback Classification Protocol

用于经过验证的教学反馈分类协议的耐久性和跨语言转移基准

Esteban U. Vega Barajas

机构 * Universidad de Guadalajara(瓜达拉哈拉大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究教学反馈分类协议的复用性问题,通过在原始西班牙数据上跨三代表示方法重新运行,并转移到英语,发现该协议具有耐久性,模型选择是部署决策而非方法特性。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11493 2026-07-14 cs.LG cs.AI math.CT 新提交 73%

Agentic Skill Optimization over Lie Algebroids

李代数胚上的智能体技能优化

Sridhar Mahadevan

机构 * Adobe Research(Adobe研究院) University of Massachusetts, Amherst(马萨诸塞大学阿默斯特分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究智能体技能优化问题,提出LASKO框架,将技能建模为李代数胚截面,利用李括号筛选测试替代昂贵验证,在自然语言任务因果提取中实现近15倍加速,提升技能优化速度。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07175 2026-07-14 cs.CL cs.LG 73%

Quantifying Data Contamination in Psychometric Evaluations of LLMs

对LLM心理测评中数据污染程度的量化

Jongwook Han, Woojung Song, Jonggeun Lee, Yohan Jo

机构 * Graduate School of Data Science, Seoul National University(数据科学研究生院,首尔国立大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种量化LLM心理测评中数据污染的框架,发现主流心理量表清单存在显著污染问题。

Comments EACL 2026 Findings

Journal ref Findings of the Association for Computational Linguistics: EACL 2026, pages 6070-6088, Rabat, Morocco. Association for Computational Linguistics, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18908 2026-07-14 cs.CL cs.AI 版本更新 73%

Improving Topic Modeling of Social Media Short Texts with Rephrasing: A Case Study of COVID-19 Related Tweets

通过改写改进社交媒体短文本的主题建模:以新冠疫情相关推文为例

Wangjiaxuan Xin, Shuhua Yin, Shi Chen, Yaorong Ge

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对社交媒体短文本主题建模难题,开发TM-Rephrase框架,利用大语言模型改写推文。通过新冠疫情推文数据集,研究两种改写策略对多种建模方法的影响,结果显示该框架提升了主题建模性能,减少冗余,为公共卫生等领域社交媒体分析提供了新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11849 2026-07-14 cs.CL 新提交 70%

AdvancedMathBench: A Benchmark Suite for Advanced Mathematical Proof Generation and Verification

高级数学基准测试:用于高级数学证明生成与验证的基准测试套件

Lingkai Kong, Zijian Wu, Yuzhe Gu, Haiteng Zhao, Wenyong Huang, Shuang Sun, Zhicheng Xiong, Xiaotian Zhang, Shuya Zhao, Yan Wang, Disheng Xu, Wenwei Zhang, Kai Chen

机构 * Shanghai AI Laboratory(上海人工智能实验室) MMLab, The Chinese University of Hong Kong(香港中文大学多媒体实验室) Shanghai Jiao Tong University(上海交通大学) Great Bay University(大湾区大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 介绍用于评估高级数学推理能力的AdvancedMathBench基准测试套件,含ProverBench证明生成基准及自动验证管道,还有VerifierBench。实验显示前沿模型在证明生成与验证上表现不佳,该套件对模型提升高级数学证明能力有挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11503 2026-07-14 cs.CL 新提交 70%

GEIS: A Generation-Evaluation-Improvement Loop of Agent Skills for Long-Form Article Generation

GEIS:用于长篇文章生成的智能体技能生成-评估-改进循环

Jiale Zhang, Juntao Hu, Zhijian Ou

机构 * Speech Processing and Machine Intelligence (SPMI) Lab, Tsinghua University, China(清华大学语音处理与机器智能实验室) TasiTech Co., Ltd., China(泰赛科技有限公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对长篇文章生成难题,提出GEIS循环,通过在Tasi Harness中实现文章写作、证据图像收集等技能,经核心写作、成对评估及改进技能,在20个主题实验中提升了PDF质量得分,证明可将其转变为可改进循环。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11151 2026-07-14 cs.CR cs.AI 新提交 70%

AMT-X: Phase-Structured Multi-Turn Red-Teaming with Checklist-Gated Evaluation

AMT-X:基于清单门控评估的阶段结构化多轮红队测试

Yi Ting Shen, Kentaroh Toyoda, Alex Leung

机构 * Vulcan Research, AIFT(Vulcan研究,AIFT)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大语言模型安全评估问题,提出AMT-X框架,将攻击设为多阶段状态机,用多角色评审团取代单评判评分,在六个前沿受害者模型和七个审核子类别测试中,不同门控下攻击成功率有显著差异,揭示了部分与完全可操作危害的差距。

Comments A reference implementation is available at https://github.com/VulcanLab/amt-x

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11141 2026-07-14 cs.AI 新提交 70%

NextFund: A Unified Performance Tracking Platform for Agentic Portfolio Management

NextFund:用于智能投资组合管理的统一绩效跟踪平台

Changlun Li, Peixian Ma, Qiqi Duan, Zhenyu Lin, Peineng Wu

机构 * Paradoox AI Research(帕拉多克斯人工智能研究)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究基于大语言模型智能体参与投资组合管理的评估问题,提出NextFund平台,通过时间一致的市场准入等实现智能体行为可观察,能跨市场比较模型等,在多地股票上展示其可实现更公平基准测试和可行诊断的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11127 2026-07-14 cs.CL cs.CY 新提交 70%

Do LLMs Fabricate Legal Citations? A Bilingual Benchmark on Saudi Data Protection Law and the GDPR

大语言模型会编造法律引用吗?关于沙特数据保护法和通用数据保护条例的双语基准测试

Noura Suliman Alrajeh

机构 * IT Department, King Abdulaziz University, Jeddah, Saudi Arabia(国王阿卜杜勒阿齐兹大学信息科技系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究大语言模型对法律引用的编造情况,通过120个双语问题的基准测试评估三个模型,发现对GDPR和沙特PDPL存在管辖权差距,编造与法律管辖权有关,模型置信度无法保障,提出用逐字验证保障合规筛选。

Comments 5 pages, 3 tables. Benchmark data and model outputs to be released. Also archived at Zenodo: 10.5281/zenodo.21320218

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10617 2026-07-14 cs.LG 新提交 70%

modelDNA: Calibrated Lineage Verification and Merge Decomposition from Sampled Weight Fingerprints

modelDNA:从采样权重指纹进行校准谱系验证和合并分解

Muhammad Awais Bin Adil, Saad Aamir

专题命中 评测与基准 :language model(abstract);foundation model(abstract);分类 cs.LG

AI总结 研究开放权重语言模型谱系验证问题,提出modelDNA工具,通过HTTP读取指纹识别模型,与参考数据库比较并返回判定类别,实现高AUROC和零误报,还能进行合并分解,恢复混合权重,公开相关数据可离线重现。

Comments Code: https://github.com/AwaisAdilKhokhar/modelDNA . Data: https://huggingface.co/datasets/AwaisAdilKhokhar/modeldna-atlas . Live scanner: https://huggingface.co/spaces/AwaisAdilKhokhar/modelDNA . DOI: 10.5281/zenodo.21305586

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10123 2026-07-14 cs.SE cs.AI 新提交 70%

A Large-Scale Dataset of MCP Implementations on GitHub

GitHub 上 MCP 实现的大规模数据集

Benny Toeppe, Amine Barrak, Emna Ksontini

机构 * Oakland University(奥克兰大学) University of North Carolina Wilmington(北卡罗来纳州温斯洛普大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对模型上下文协议(MCP)在开源开发中的应用情况,通过混合管道从 GitHub 收集并验证相关数据,构建了大规模数据集,分析得出 Python 和 TypeScript 主导 MCP 开发且混合架构最常见,为 MCP 生态系统研究建立基准并支持相关未来研究。

Journal ref Proceedings of MSR '26: 23rd International Conference on Mining Software Repositories, April 13-14, 2026, Rio de Janeiro, Brazil. ACM, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10113 2026-07-14 cs.AI 新提交 70%

Dynamic Agent Skills: A Lifecycle Survey and Taxonomy of Evolving Skill Libraries

动态智能体技能:不断演进的技能库的生命周期调查与分类法

Yubo Li

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大型语言模型智能体中技能库随时间的变化,通过分类法、生命周期架构和技能记录模式等工具组织文献,合成证据分级模式,指出相关问题并提出报告标准及开放问题。

Comments Accepted by TMLR (2026.07), OpenReview Link: https://openreview.net/forum?id=cjU3YbcRr8

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09804 2026-07-14 cs.CR cs.AI 新提交 70%

Trivial Prompt Reframing Bypasses Safety Guardrails in Googleś MedGemma-4B

简单提示重构绕过谷歌MedGemma-4B中的安全护栏

Avi-ad Avraam Buskila

机构 * Department of Information Science and Applied Artificial Intelligence, Bar-Ilan University, Ramat Gan, Israel(信息科学与应用人工智能系,巴伊兰大学,拉马特甘,以色列)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.AI

AI总结 研究谷歌MedGemma-4B在安全护栏方面的问题,构建全因子基准测试,通过多种攻击方式和法官编码量化其表现,发现重新解释请求的框架能提高攻击成功率,且稳健性受主题主导,呼吁为开放医学模型加强部署时护栏。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09789 2026-07-14 cs.AI cond-mat.mtrl-sci 新提交 70%

PHITSBench: an execution-scored benchmark for AI-assisted PHITS radiation-transport input generation using natural language

PHITSBench:用于使用自然语言生成人工智能辅助的PHITS辐射传输输入的执行评分基准

Xianglin Ji, Svetlana V. Boriskina

机构 * MIT(麻省理工学院)

专题命中 评测与基准 :foundation model(abstract);prompting(abstract);分类 cs.AI

AI总结 介绍用于PHITS辐射传输输入生成的PHITSBench基准,涵盖三类任务。评估五种基于GPT - 5.4的配置,无特定知识时模型在编辑和修复任务表现好,Reproduce任务差。知识目录和智能体执行可提升成功率,结果显示建模进展依赖多方面因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24074 2026-07-14 cs.CL 70%

How Sensitive Are Safety Benchmarks to Judge Configuration Choices?

安全基准对裁判配置选择的敏感性如何?

Xinran Zhang

机构 * University of California, Berkeley, Berkeley CA 94720, USA(加州大学伯克利分校)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 研究通过实验展示裁判提示语对安全基准评估结果的显著影响,揭示裁判配置对测量变异的决定性作用。

Comments Accepted by the 22nd International Conference on Intelligent Computing (ICIC 2026). Final version to appear in Springer CCIS

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22823 2026-07-14 cs.CV cs.AI 版本更新 70%

PivotMerge: Bridging Heterogeneous Multimodal Pre-training via Post-Alignment Model Merging

PivotMerge: 通过后对齐模型融合弥合异构多模态预训练

Zibo Shao, Baochen Xiong, Xiaoshan Yang, Yaguang Song, Qimeng Zhang, Haifeng Chen, Changsheng Xu

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,中国科学院自动化研究所) Pengcheng Laboratory(鹏城实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Data Science and Artificial Intelligence Research Institute, China United Network Communications Group Co., Ltd.(中国联合网络通信集团有限公司数据科学与人工智能研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出PivotMerge框架,通过后对齐模型融合技术,解决多模态预训练中跨模态对齐能力整合问题,提升模型统一语义空间的构建效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18576 2026-07-14 cs.AI 版本更新 70%

Agentic Forecasting using Sequential Bayesian Updating of Linguistic Beliefs

基于序列贝叶斯更新的语义信念的代理预测

Kevin Murphy

机构 * Department of Computer Science(计算机科学系) University of British Columbia(不列颠哥伦比亚大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 BLF系统通过语义信念状态、层级多试聚合和层级校准方法,在预测基准上超越了现有方法,同时具备低泄露率的回测框架。

Comments v4 adds 2 new appendices: app J evaluates a "generative" Bayesian alternative to BLF (which does worse than the "discriminative" approached used by BLF), and app K sketches how to do value of information computation to decide when to stop searching (although this idea has not been tried). v4 also adds a few more recent references

Journal ref v3 was published in ICML AI Forecasting workshop 2026 (https://forecasting-workshop.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏