From Accuracy to Auditability: A Survey of Determinism in Financial AI Systems
从准确性到可审计性:金融AI系统中的确定性综述
专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG
AI总结 本文从系统视角综述了金融AI中表格模型、图网络和基于LLM的智能体工作流三种模态的不可重现性问题,通过实验量化了确定性指标并提出了分层评估框架。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
从准确性到可审计性:金融AI系统中的确定性综述
专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG
AI总结 本文从系统视角综述了金融AI中表格模型、图网络和基于LLM的智能体工作流三种模态的不可重现性问题,通过实验量化了确定性指标并提出了分层评估框架。
超越回忆:行为规范作为AI个性化的解释层
专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI
AI总结 提出行为规范作为解释层,通过压缩用户数据为解释性模式,显著提升AI代理对用户意图的表示准确性,减少模型规避,并在解释型问题上优于原始语料和商业记忆系统。
Comments 142 pages, 4 figures. Code, data, judge prompts, and reproduction instructions: this http URL (http://github.com/agulaya24/beyond-recall) 8/19 Replacement: Pages updated to 142 from 134. Added Table of Contents. Updated table/graph formatting. Updated Section 8: Data, Code, and Reproducibility to include updated links, corrected author names
合规性、能力与冲突:基于系统消息的多模态大语言模型基准测试
机构 * NAVER Cloud(NAVER云) ; KAIST AI(韩国科学技术院人工智能)
专题命中 评测与基准 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.CL
AI总结 该研究构建基准VSysBench测试多模态大语言模型在系统消息下的合规性,发现施加系统消息会降低任务准确率,开放权重模型易受用户冲突影响,视觉约束最难。
Self-Harness:自我改进的操控框架
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL
AI总结 提出Self-Harness范式,让LLM智能体通过弱点挖掘、框架提议和验证迭代改进自身操控框架,在Terminal-Bench-2.0上使三种模型的通过率分别提升21.4%、14.3%和14.2%。
Comments this https URL (https://github.com/qzzqzzb/Self-Harness)
超越计数:病理学基础模型的分布稳健性余量
机构 * Radboud University Medical Center(拉德堡德大学医学中心)
专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI
AI总结 研究病理学基础模型受非生物学变异影响的问题,提出交叉混杂稳健性余量(CRoMa),通过直接比较距离评估模型稳健性,将其重塑为队列范围的余量分布,为模型选择和稳健性评估提供原则基础。
Comments Preprint
用于快速射电暴检测的通用视觉语言模型:针对专用探测器的零样本基准测试
机构 * Universidade Federal de Campina Grande(坎皮纳格兰德联邦大学) ; Instituto de Formação de Educadores, Universidade Federal do Cariri(卡里里联邦大学教育工作者培训学院)
专题命中 评测与基准 :language model(title,abstract);分类 cs.LG
AI总结 研究通用视觉语言模型在零样本下检测快速射电暴,从模拟动态频谱中抽取样本作基准,比较其与专用探测器,发现Gemma 4 2B准确率与SwinYNet相近,在结构化RFI上误报率低,重写提示可用于三类分类,准确率较高。
Comments 31 pages, 7 figures. Section added with analysis for real data. New figures and tables added. Other minor changes
HiFi-KPI:用于从财报中提取层次化KPI的数据集
机构 * Department of Computer Science, Aalborg University(奥尔堡大学计算机科学系) ; ALIPES ApS(ALIPES公司) ; University of Copenhagen(哥本哈根大学) ; Pioneer Centre for AI(先锋人工智能中心)
专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 针对财报中关键绩效指标(KPI)跨公司可迁移性差的问题,提出包含165万段落和19.8万层次化标签的HiFi-KPI数据集,并评估分类、提取和结构化提取三个任务。
Comments Camera-ready. Accepted at LREC 2026 (main conference)
BreakGuard:基于大语言模型生成的测试检测依赖项破坏性变更
专题命中 评测与基准 :LLM(title,abstract)
AI总结 BreakGuard是一种基于大语言模型生成测试的方法,可静态提取客户端焦点方法生成测试,在89个真实破坏性变更上检测到30.3%的变更,对崩溃型破坏性变更检测可靠性更高。
ROBOSHACKLES: 面向具身基础模型中人体伤害预防的安全数据集
机构 * Institute of Al for Industries, Chinese Academy of Sciences(工业人工智能研究所,中国科学院) ; University of Science and Technology of China(中国科学技术大学)
专题命中 评测与基准 :foundation model(title,abstract)
AI总结 为解决机器人伤害人类数据难以安全收集的问题,提出基于真实观测的安全数据构建流水线,生成包含1万条视频的ROBOSHACKLES数据集,涵盖直接和间接伤害类别,评估发现现有模型在安全关键场景下100%产生不安全动作。
Hear2Act:对韵律应何时改变助手行为的基准测试
机构 * Amazon(亚马逊公司) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University College London(伦敦大学学院)
专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.CL
AI总结 该研究推出 Hear2Act 基准,评估发现词汇证据不足时韵律对助手决策很重要,具备音频能力的 LLM 能从语音恢复信息但需显式中间表示才能可靠转化为行动。
AI智能体为何违反规则?框架、情境与社会信号如何影响合规性
专题命中 评测与基准 :language model(abstract);post-training(abstract);分类 cs.CL、cs.AI
AI总结 该研究运用法律与经济学的合规理论,发现安全微调AI模型大体合规,任务优化与智能体模型会在低惩罚等条件下违规,且引入经济激励等会导致大规模合规失败,指出模型选择与合规性评估需改进。
Comments Published at 2026 AAAI/ACM Conference on AI, Ethics, and Society and 2026 COLM Workshop on Agent Behavior
系统评估TabPFN-TS在区域供热网络零样本概率热负荷预测中的应用
机构 * RWTH Aachen University(亚琛工业大学) ; Process Systems Engineering(过程系统工程) ; Chair of Energy Efficient Buildings Indoor Climate(节能建筑室内气候主席席位)
专题命中 评测与基准 :foundation model(abstract);pretraining(abstract);分类 cs.LG
AI总结 本研究系统评估TabPFN-TS用于区域供热网络零样本概率热负荷预测,确定了最优配置,其性能接近Chronos-2且校准更好,相关发现推动了多分辨率残差校正预测器的开发。
Comments 33 pages, 10 figures; supplementary information included
MaliciousSkillBench:用于恶意智能体技能检测的综合基准
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 本文提出MaliciousSkillBench这一综合基准,整合多源恶意技能数据构建含9740个技能的数据集,评估三类检测器后发现现有方法不足,需更广泛跨源覆盖及联合评估攻击检测与良性误报的方案。
Comments Project page: this https URL (https://protectskills.github.io/MaliciousSkillBench/)
基于多尺度对比学习量化事件对时间序列的影响
机构 * Rutgers University(罗格斯大学) ; NEC Laboratories America(美国NEC实验室)
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.LG
AI总结 本文提出多分辨率框架EventTime,结合多维度信息与动态对比目标,在自主构建的SECURE数据集上,实现了对网络安全事件后短期金融异常损失的更精准估计。
Holtercare-Bench:用于评估长期动态心电图分析的多模态基准
机构 * Zhejiang University(浙江大学) ; Beijing Institute of Technology(北京理工大学) ; University of Electronic Science and Technology of China(电子科技大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG
GreekBarRetrieval:希腊成文法检索基准
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL
AI总结 本研究推出希腊成文法检索基准GreekBarRetrieval,通过实验发现基于大型语言模型的查询重表述可提升BM25检索效果,使其在多项指标上优于其他检索方法。
Comments Submitted to NLLP workshop 2026
ATBench:一个多样且现实的代理轨迹基准,用于安全评估与诊断
机构 * Shanghai AI Lab(上海人工智能实验室) ; Fudan University(复旦大学) ; Shanghai Jiao Tong University(上海交通大学) ; Tsinghua University(清华大学) ; KAUST(卡塔尔人工智能科学中心) ; East China Normal University(华东师范大学)
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 ATBench通过多样化的轨迹和现实场景评估代理安全,包含1000条轨迹,挑战性强,支持跨基准比较和长周期故障诊断。
评估上下文协议(ECP):一种用于AI智能体评估的便携式契约
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 针对当前AI智能体评估范式的局限性,提出厂商中立的ECP协议,实现跨框架的统一评估,已开发适配主流智能体框架的开源参考实现,相关验证为未来工作。
Comments 14 pages, 4 tables, 4 figures, Code available at this https URL (https://github.com/evaluation-context-protocol)
自进化编码智能体
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 本综述系统梳理自进化编码智能体领域,明确其与传统智能体的区别,提出分类法,分析该领域的挑战,为设计更优智能系统奠定基础。
评估人工智能模型自动实施语音网络钓鱼攻击的能力
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 研究评估美国成年人对人工智能驱动语音网络钓鱼攻击的易感性,通过大规模调查实验和定性访谈,让参与者接触多种语音模型及人类基线生成的诈骗场景,发现高合规率,分析得出人工智能驱动的vishing在经济上可行,其风险在于自动化经济性,引发相关政策担忧。
Comments Updated to the published version. Published in Expert Systems with Applications, Volume 332, Part D
Zoom-IQA:基于可靠区域感知推理的图像质量评估
机构 * S-Lab, Nanyang Technological University, Singapore(S实验室,南洋理工大学,新加坡) ; SenseTime Research(商汤科技研究院)
专题命中 评测与基准 :language model(abstract);SFT(abstract)
AI总结 研究图像质量评估问题,提出基于视觉语言模型的Zoom-IQA,通过两阶段训练管道,包括监督微调与强化学习,有效减轻标注偏差,提升了模型在鲁棒性、可解释性和泛化性方面的表现,在下游任务中也展现出有效性。
Comments ECCV 2026, Project Page: this https URL (https://ethanliang99.github.io/ZOOMIQA-Projectpage)
过于自信难安全:面向可靠日志异常检测的模型校准
机构 * Beijing Jiaotong University(北京交通大学) ; University of Florida(佛罗里达大学)
专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG
AI总结 针对基于语言模型的日志异常检测器置信度校准差的问题,提出轻量级事后校准框架LoRD,经实验验证其可提升置信度可靠性并减少过度自信异常相关错误且不牺牲检测性能。
Comments Accepted at the 2026 IEEE International Conference on Data Mining (ICDM 2026)
FinVerse:金融时间序列基准
专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG
AI总结 本研究推出金融时间序列预测基准FinVerse,其针对43个公开时间序列基础模型的分析显示,通用预测标准下的优异表现未必对应实用金融预测,凸显了领域感知基准的必要性。
Comments 24 pages
表征涌现的自举理论:解释不充分性作为表征学习与世界模型的驱动力
机构 * Laboratory of Bioengineering and Nanosciences (LBN), University of Montpellier(生物工程与纳米科学实验室(LBN),蒙彼利埃大学) ; EuroMov Digital Health in Motion, University of Montpellier, IMT Mines Alès(EuroMov数字健康运动,蒙彼利埃大学,IMT矿山阿尔勒) ; Certified Sophrologist, Sensorimotor Practice, Montpellier, France(认证Sophrologist,运动觉实践,蒙彼利埃,法国) ; Emeritus Professor, University of Montpellier(荣誉教授,蒙彼利埃大学)
专题命中 评测与基准 :foundation model(abstract);分类 cs.LG
AI总结 提出表征涌现自举理论(TBER),将解释不充分性视为新表征涌现的积极信号,通过五阶段递归过程驱动表征创新,应用于表征学习、世界模型和科学发现。
Comments Version 4. Major theoretical revision introducing the distinction between manifestations of explanatory insufficiency and resolution regimes (local-corrective, representationally resolutive, and structurally recurrent), together with regime-sensitive diagnosis and closure assessment. Formal mathematical boundary cases have been clarified. 28 references, no figures or tables
将BrowseComp-Plus映射到ClimbMix:构建更符合智能体搜索需求的真实语料库
专题命中 评测与基准 :language model(abstract)
AI总结 该研究将BrowseComp-Plus的查询映射到NVIDIA的ClimbMix语料库,构建了与基准无关的映射流水线,生成57个有效查询,使智能体搜索难度向检索环节转移,发布了相关资源。
BeyondMasks:评估视频对象移除中的因果与物理一致性
机构 * Bilkent University(毕尔肯大学) ; Koç University(科克大学) ; Hacettepe University(哈杰泰佩大学) ; KUIS AI Center(KUIS人工智能中心)
专题命中 评测与基准 :language model(abstract)
AI总结 该研究推出BeyondMasks基准及CORE评估协议,针对现有视频对象移除评估仅关注局部掩码保真度的问题,填补了视觉合理性与因果正确性的差距。
Comments ECCV 2026 Project Page: this https URL (https://yigitekin.github.io/BeyondMasks/)
CAViAR:用于真实场景细粒度事故推理的因果视频数据集
机构 * NEC Laboratories, America(美国NEC实验室)
专题命中 评测与基准 :language model(abstract)
AI总结 该研究推出人工标注的真实事故视频基准CAViAR,测试发现现有VLMs存在感知-推理差距,无法可靠将驾驶场景主体行为映射到责任类别。
Comments Accepted to ECCV 2026 Workshop DriveX
跨巡天十年:行动号召
专题命中 评测与基准 :foundation model(abstract)
AI总结 本文呼吁构建跨巡天科学基础设施,围绕四大支柱推进,以实现三个旗舰巡天项目联合数据的科学价值,需多方协作且当下是行动的关键时机。
Comments 23 pages, 1 figure. Community perspective on cross-survey science infrastructure
OVIP-SG:用于小型细粒度物体映射与检索的开放词汇实例保留场景图
专题命中 评测与基准 :language model(abstract)
AI总结 本文提出OVIP-SG框架,通过VLM等技术实现小型细粒度物体的实例保留映射与语言引导检索,在Replica数据集上的多项指标优于现有方法,且经实际机器人实验验证有效。
Comments 15 pages, 6 figures, including appendix
PosterText:面向电商海报的统一视觉文本生成与编辑
专题命中 评测与基准 :pretraining(abstract)
AI总结 本文提出PosterText框架,将文本块作为原子单元实现电商海报的统一生成与编辑,构建了带块级标注的数据集与评估基准,经实验验证其性能优于现有相关方法。