arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2707 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2707 篇

2607.13968 2026-07-16 q-fin.GN 新提交 78%

Measuring Sentiment News with Transformer-Based Language Models

用基于Transformer的语言模型衡量新闻情绪

Maria Saveria Mavillonio, Stefano Borgioli, Caterina Giannetti, Chiara Ongari, Giampiero M. Gallo

专题命中 评测与基准 :language model(title,abstract)

AI总结 研究财经新闻情绪衡量,提出用基于Transformer语言模型构建指数框架,经实验将其结果与基准指标对比,并通过人类标注验证,发现该模型能产生更贴近人类评估的情绪指标,与人类判断一致性更强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14026 2026-07-16 cs.CE 新提交 78%

From Forecasts to Auditable Reports: Evidence Contracts for LLM-Assisted Housing-Guarantee Risk Monitoring

从预测到可审计报告:大语言模型辅助住房担保风险监测的证据契约

Hyeongcheol Kim, Yoontae Hwang

专题命中 评测与基准 :LLM(title,abstract)

AI总结 研究将住房担保风险预测转化为可审计报告的挑战,提出证据约束报告流程,利用韩国租房押金数据,结合预测模型与结构化证据、验证及分析师监督,提升高风险检测能力,经评估报告支持实际决策,证明该方法可靠。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11451 2026-07-14 cs.HC 新提交 78%

ManiScope: LLM-Assisted Visual Analytics of Cryptocurrency Manipulation Risk

ManiScope:基于大语言模型的加密货币操纵风险可视化分析

Xiaolin Wen, Feng Liang, Yuanye Ma, Qishuang Fu, Zhengyu Sun, Feng Zhu, Can Liu, Yong Wang

专题命中 评测与基准 :LLM(title,abstract)

AI总结 针对加密货币市场操纵风险评估问题,提出ManiScope系统,利用大语言模型辅助可视化分析,提供多方面协同视图及人机协作框架,经案例和用户研究验证,该系统能有效评估风险、减少人工并围绕假设组织发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09919 2026-07-14 cs.HC 新提交 78%

When LLM Tutoring Responses Work: Evidence from Student Programming Conversations

当大语言模型辅导回复起作用时:来自学生编程对话的证据

Mohammad Fahim Abrar, Shayla Sharmin, Roghayeh Leila Barmaki

专题命中 评测与基准 :LLM(title,abstract)

AI总结 研究学生在编程教育中使用大语言模型辅导时,哪种回复助于高效学习。通过分析StudyChat数据集,用大语言模型辅助标注并经人工验证,发现回复风格与延续情况相关,支持情境感知的人工智能辅导回复评估和设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09016 2026-07-13 cs.CR cs.SE 新提交 78%

SLBench: Evaluating How LLM Agents Follow Logical Relations in Skills

SLBench:评估大语言模型智能体在技能中遵循逻辑关系的情况

Xuan Chen, Chengpeng Wang, Lu Yan, Xiangyu Zhang

专题命中 评测与基准 :LLM(title,abstract)

AI总结 研究评估大语言模型智能体遵循逻辑关系情况,引入SkillLogic框架,构建SLBench基准,扫描超500个公共技能,评估发现不安全率高,人工审核分析失败原因,还表明SLGuard可减少违规,确立遵循逻辑关系是技能引导智能体的可靠性挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08952 2026-07-13 cs.HC 新提交 78%

Micro-level AI Feedback Features and Student Responses in Consecutive LLM Tutoring Interactions

连续大语言模型辅导交互中的微观层面人工智能反馈特征与学生反应

Shayla Sharmin, Mohammad Fahim Abrar, Roghayeh Leila Barmaki

专题命中 评测与基准 :LLM(title,abstract)

AI总结 研究自然辅导场景下连续用户与AI交互中反馈特征与学生反应的关系,聚焦具体阐述、情感语言和回复长度三个微观特征,通过数据分析发现具体阐述有助于学生理解,凸显跨交互检查反馈的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06000 2026-07-08 cs.CR 新提交 78%

Context-to-Execution Integrity for LLM Agents

语言模型代理的上下文到执行完整性

Igor Santos-Grueiro

专题命中 评测与基准 :LLM(title,abstract)

AI总结 研究语言模型代理执行中的上下文到执行完整性问题,提出CXI系统,通过策略标记、类型化释放等机制保障安全执行,经多方面评估,在AgentDojo和代码代理基准测试等中取得良好效果,确保权限绑定才允许执行。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05291 2026-07-07 q-fin.ST econ.EM 新提交 78%

Forecasting Realized Volatility with Time Series Foundation Models: A Comparison with Econometric Benchmarks

使用时间序列基础模型预测已实现波动率:与计量经济学基准的比较

Alessio Brini

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 研究预训练时间序列基础模型能否改进已实现波动率预测的计量经济学基准。通过对多种模型在多资产多预测期测试比较,发现基础模型优势集中于少数资产,简单平均模型表现良好,选对模型架构更重要。

Comments 5 figures, 41 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05264 2026-07-07 cs.CV 新提交 78%

SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments

SteelBench:真实工业环境下的视觉语言模型评估基准

Suryanarayana Reddy Yarrabothula, Manisha Chawla, Kunal Sinha, Gagan Raj Gupta, Sashank Lekkala, Ashirvadhan Dosapati, Saikamal Nannuri, Katragadda Ajay RamaSwamy Chowdary Gowtham

机构 * Indian Institute of Technology Bhilai(印度理工学院比莱分校) Steel Authority of India Limited(印度钢铁管理局有限公司) VIT Vellore(维洛尔理工学院)

专题命中 评测与基准 :language model(title,abstract)

AI总结 针对现有基准无法适配真实工业监控场景的问题,构建含1345条标注片段的SteelBench基准,评估视觉语言模型的工业活动识别、安全规则推理等能力,发现现有模型性能远低于人类水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05197 2026-07-07 cs.SE 新提交 78%

Is Three the Magic Number? An Empirical Evaluation of LLM-Based Repair Loops

三是神奇数字吗?基于大语言模型的修复循环的实证评估

Tobias Kiecker, Eik Reichmann, Hosung Kang, Gabin An, Lars Grunske

专题命中 评测与基准 :LLM(title,abstract)

AI总结 研究基于大语言模型的修复循环迭代限制,通过多个软件工程任务观察到收益递减模式,前几次迭代收获大,后续贡献小,还发现修复行为受工作流编排和反馈设计影响更大。

Comments 4 Pages (+1 for references), NIER Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02857 2026-07-07 cs.CR cs.SE 新提交 78%

MOSAIC: Knowledge-Guided CLI Command Composition Attack in LLM Coding Agents

MOSAIC:大语言模型编码代理中知识引导的命令行命令组合攻击

Jiangrong Wu, Huaijin Wang, Yihao Zhang, Yuhong Nan, Shuai Wang

专题命中 评测与基准 :LLM(title,abstract)

AI总结 研究大语言模型编码代理中CLI命令组合风险,提出知识引导框架MOSAIC,从漏洞等提取命令状态行为总结成攻击路径,实例化开发者工作流程,通过多实验得高攻击成功率。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02853 2026-07-07 cs.CV cs.SE 新提交 78%

Prior Bias in Vision Language Models on UML Diagram Interpretation

视觉语言模型在UML图解释中的先验偏差

Zaiyu Cheng, Khai-Nguyen Nguyen, Antonio Mastropaolo

机构 * Dept. of Computer Science(计算机科学系) William & Mary, USA(威廉玛丽学院)

专题命中 评测与基准 :language model(title,abstract)

AI总结 研究视觉语言模型在UML图解释时是依据先验知识还是真正理解图表。通过引入对比基准测试,评估多个模型,发现反转关系箭头会降低开源模型关系方向准确率,不同模型表现有差异,揭示先验驱动的理解故障。

Comments 16 pages, 14 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02605 2026-07-07 cs.SE 新提交 78%

A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges

大语言模型驱动的渗透测试综述:分类法、共同演化及开放挑战

Zheyuan He, Jiaxun Dong, Zihao Li, Ting Chen, Gelei Deng, Feng Luo, Jinkun Ji, Yuanlong Cao, Xiapu Luo

专题命中 评测与基准 :LLM(title,abstract)

AI总结 通过系统分析2023至2026年间81篇论文,梳理大语言模型驱动的渗透测试文献分类,追溯架构四阶段演化,指出关键发现,识别出评估可靠性等三个开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02604 2026-07-07 cs.CV cs.RO 新提交 78%

DynaWM: A Base-VLA-Guided World Foundation Model for Moving-Object Manipulation

DynaWM:用于移动物体操纵的基于基础VLA的世界基础模型

Chongkei Chang, Zhidong Deng

机构 * Department of Computer Science and Technology, THUAI, Tsinghua University, Beijing 100084, China(计算机科学与技术系,THUAI,清华大学,北京100084,中国)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 针对移动物体操纵挑战,提出DynaWM模型,用多种编码器提取特征,联合条件流匹配DiT生成动作轨迹,构建数据集评估,相比其他模型有性能提升,消融实验验证各部分作用。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25312 2026-07-07 cs.CV 新提交 78%

LEVIRDet: A Million-Scale 159-Category Dataset and Foundation Model for Universal Remote Sensing Object Detection

LEVIRDet: 用于通用遥感目标检测的百万级159类数据集与基础模型

Qinzhe Yang, Dongyu Wang, Haohan Niu, Jia Xu, Zhenwei Shi, Zhengxia Zou

机构 * Shen Yuan Honors College, Beihang University(北京航空航天大学沈元荣誉学院) State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室) Qian Xuesen Laboratory of Space Technology, China Academy of Space Technology(中国空间技术研究院钱学森空间技术实验室)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 提出包含159类、256万边界框的遥感目标检测数据集LEVIRDet-159,并设计尺度层次感知检测基础模型LEVIRDetNet,在9个外部基准上无需微调即达到SOTA,平均mAP提升5.02。

Comments 18 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01753 2026-07-03 cs.CV q-bio.QM 新提交 78%

The Turning Point of 3D Plant Phenotyping: 3D Foundation Models Enable Minute-to-Second Cross-Crop Reconstruction and Beyond

3D植物表型分析的转折点:3D基础模型实现分钟到秒级的跨作物重建及更多

Hanyue Jia, Wei Zhou, Wenbo Zhou, Yanan Li, Hao Lu, Tingting Wu

机构 * Northwest A&F University(西北农林科技大学) Huazhong University of Science and Technology(华中科技大学) Wuhan Institute of Technology(武汉工程大学)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 提出基于3D基础模型的跨作物表型分析框架,用前馈几何恢复替代COLMAP,结合3D高斯泼溅实现少视图重建,将重建时间从6.52分钟降至1.58秒,保持高质量与高精度。

Comments 39 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01442 2026-07-03 cs.CR cs.CV 新提交 78%

From Forgeries to Foundation Models: A Systematic Survey of Identity Document Attack and Detection

从伪造到基础模型:身份证件攻击与检测的系统性综述

Gourab Das, Pavan Kumar C, Raghavendra Ramachandra

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文系统综述了身份证件伪造攻击(物理呈现、数字注入、生成式合成)及检测方法,揭示了基准与现实间的差距,并发现最强模型在零样本场景下APCER超25%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23172 2026-07-03 eess.IV 新提交 78%

A Benchmark of (MRI-) Foundation Models to Predict IDH Mutational Status in Glioma

(MRI)基础模型预测胶质瘤IDH突变状态的基准测试

Nathan Hollet, Elise Robinson, Efthymios Georgiou, Ekin Ermis, Uri Nahum, Sarah Brüningk

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本研究比较了四种图像基础模型和基于影像组学的基线方法在预测胶质瘤IDH突变状态上的性能,发现影像组学基础模型TabPFN表现最佳,而图像基础模型在跨队列迁移中性能下降,但BiomedCLIP在外部队列中AUROC最高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00745 2026-07-02 cs.CV 新提交 78%

Foundation Model-driven Key Anatomy Frame Selection for Blind-sweep Ultrasound Fetal Birth Weight Estimation

基于基础模型的关键解剖帧选择用于盲扫超声胎儿出生体重估计

Le Ou, Xiliang Zhu, Huanwen Liang, Wenxiong Pan, Yuhao Huang, Yuxiang Deng, Xuan Sheng, Hong Yin, Juhua Xiao, Xin Zhou, Dong Ni

机构 * Medical Ultrasound Image Computing (MUSIC) Lab, Shenzhen University(深圳大学医学超声图像计算实验室) School of Biomedical Engineering, Shenzhen University(深圳大学生物医学工程学院) School of Biomedical Engineering and Informatics, Nanjing Medical University(南京医科大学生物医学工程与信息学院) Centre for Artificial Intelligence and Robotics, Hong Kong Institute of Science & Innovation, Chinese Academy of Sciences(中国科学院香港创新研究院人工智能与机器人中心) Shandong Provincial Maternal and Child Health Care Hospital Affiliated to Qingdao University(青岛大学附属山东省妇幼保健院) Jiangxi Maternal and Child Health Hospital(江西省妇幼保健院) School of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 提出一种基于基础模型的关键解剖帧选择框架,从盲扫超声视频中估计胎儿出生体重,无需操作员依赖,在839例患者数据上达到MAE 161.3g。

Comments Accepted by MICCAI 2026. 10 pages, 2 figures. Code: https://github.com/ouleoule/BlindSweep-EBW

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18610 2026-06-29 cs.RO cs.CV 新提交 78%

SC3-Eval: Evaluating Robot Foundation Models via Self-Consistent Video Generation

SC3-Eval: 通过自洽视频生成评估机器人基础模型

Wei-Cheng Tseng, Gashon Hussein, Yuzhu Dong, Allen Z. Ren, Lucy X. Shi, XuDong Wang, Sergey Levine, Zhaoshuo Li, Jinwei Gu, Florian Shkurti, Ming-Yu Liu, Quan Vuong

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) NVIDIA(英伟达) Physical Intelligence Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校) Allen Institute for AI(艾伦人工智能研究所)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 提出SC3-Eval方法,利用前向-反向动力学一致性、跨视角一致性和测试时一致性,将预训练视频基础模型转化为准确的策略评估器,在7个真实世界策略上达到0.929的皮尔逊相关系数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25056 2026-06-25 cs.RO 新提交 78%

BFMTrack: Latent Sequence Optimization for Physics-Based Motion Tracking with Behavioral Foundation Models

BFMTrack: 基于行为基础模型的物理运动跟踪的潜在序列优化

Thomas Rupf, Agon Serifi, David Müller, Sammy Christen, Ruben Grandia, Espen Knoop, Moritz Bächer

机构 * Disney Research(迪士尼研究院)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 提出潜在序列优化方法,结合仿真展开和策略梯度更新,优化潜在序列以实现精确运动跟踪,无需奖励工程,并在密集跟踪、稀疏关键帧和真实人形机器人上验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25610 2026-06-25 astro-ph.IM astro-ph.GA 新提交 78%

The Galaxy's Guide to the Tokenizer: A Benchmark for Scientific Foundation Models

银河系分词器指南:科学基础模型的基准测试

Sogol Sanjaripour, Michael J. Smith, Manuel Pérez-Carrasco, Juan Rafael Martínez-Galarza, Bahram Mobasher, Gabriela Canalizo

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本研究在统一transformer框架下比较四种分词策略对天文图像重建和物理属性预测的影响,发现重建与表征质量解耦,无单一方法全面最优。

Comments Accepted as a spotlight talk at the Conference on Physics and AI (PAI) 2026, Stanford University

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22597 2026-06-24 cs.CV 新提交 78%

MapReason-OSM: Can Vision-Language Models Make Graph-Verifiable Mobility Decisions from Street Maps ?

MapReason-OSM:视觉语言模型能否从街道地图中做出可图验证的移动决策?

Srinivas Venkatanarayanan, Clement Pakkam Isaac

机构 * NVIDIA(英伟达) University of Central Florida(中佛罗里达大学) University of South Florida(南佛罗里达大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 提出MapReason-OSM基准,通过自渲染OpenStreetMap面板和隐藏街道图,评估VLM在路由、设施定位等任务中做出可图验证的移动决策的能力,发现模型在图形成本推理和跨缩放一致性上表现不佳。

Comments 9 pages, 7 figures. Submitted to ACM SIGSPATIAL 2026 (Industrial Track). Code and data: https://github.com/Vi-Sri/mapreason-osm

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23139 2026-06-23 eess.AS 新提交 78%

Audio Editing in the Era of Foundation Models: A Survey

基础模型时代的音频编辑:综述

Changhao Pan, Yifei Fan, Fan Zhuo, Yifu Chen, Wenxiang Guo, Yu Zhang, Ruiqi Li, Zhiyuan Zhu, Rui Yang, Shengpeng Ji, Chenyuhao Wen, Jiayang Xu, Ke Lei, Xiaoda Yang, Jingyu Lu, Zhou Zhao

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文综述了基础模型时代音频编辑的研究进展,提出了统一的任务分类法,总结了基于训练和免训练的编辑范式,并讨论了数据集、评估协议等资源及未来方向。

Comments 23 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21861 2026-06-23 cs.CV 新提交 78%

Zero-Shot Vision-Language Models for Classroom Engagement Recognition: A Benchmark Study of Prompt Sensitivity and Cross-Dataset Generalization

零样本视觉语言模型用于课堂投入度识别:提示敏感性与跨数据集泛化的基准研究

Aman Goyal, Kshama Nitin Shah, Kemmannu Vineet Venkatesh Rao

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校) Magna International(麦格纳国际)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本研究系统评估五种视觉语言模型在零样本条件下识别课堂投入度的表现,发现三个主要失败模式:个体学生识别近乎随机、类别崩溃和极端提示敏感性,但场景级分类效果较好。

Comments 11 pages, 6 figures, including supplementary material. Presented as a non-archival paper at the CV4Edu Workshop, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21787 2026-06-23 cs.SE 新提交 78%

Towards Imputation of Pre-Trained Language Model Metadata using Semantic Fingerprinting

基于语义指纹的预训练语言模型元数据插补方法

Adekunle Ajibode, Oussama Ben Sghaier, Keheliya Gallaba, Bram Adams, Ahmed E. Hassan

专题命中 评测与基准 :language model(title,abstract)

AI总结 提出语义指纹(SemFin)方法,利用Hugging Face配置文件和仓库标签自动插补缺失的PTLM元数据并重建模型谱系,在317,133个模型上相比基线提升预测准确率最高31.4%,并成功处理16.6%的孤立模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19062 2026-06-18 cs.CV 新提交 78%

DREAM: Extending Vision-Language Models with Dual-Objective Encoding for Cross-Modal Retrieval

DREAM: 通过双目标编码扩展视觉-语言模型用于跨模态检索

Kaleem Ullah, Altaf Hussain, Muhammad Munsif, Sung Wook Baik

机构 * Sejong University(世宗大学) Korea Advanced Institute of Science and Technology(韩国科学技术院) Ulsan National Institute of Science and Technology(乌山国立科学研究院)

专题命中 评测与基准 :language model(title,abstract)

AI总结 提出DREAM模型,通过双路径表示增强与对齐,结合层级视觉编码器和混合语言建模,在视频检索任务中实现新SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19053 2026-06-18 cs.CV 新提交 78%

Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: From Evaluation to Diagnosis

大规模视觉-语言模型在细粒度图像任务上的基准测试:从评估到诊断

Hong-Tao Yu, Chen-Wei Xie, Yuxin Peng, Serge Belongie, Xiu-Shen Wei

机构 * School of Computer Science and Engineering, Southeast University, China(东南大学计算机科学与工程学院,中国) Alibaba Group(阿里巴巴集团) School of Computer Science and Engineering, School of Intelligence Science and Engineering, and Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications, Southeast University, China(东南大学计算机科学与工程学院、智能科学与工程学院以及新一代人工智能技术及其交叉应用关键实验室,中国) Wangxuan Institute of Computer Technology, National Key Laboratory for Multimedia Information Processing, Peking University, China(北京大学王轩计算机技术研究所、多媒体信息处理国家重点实验室,中国) University of Copenhagen, Denmark(丹麦哥本哈根大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 提出FG-BMK基准,含101万问题和28万图像,通过人机双范式评估LVLM的细粒度语义识别与视觉判别能力,诊断失败原因,发现视觉表示、语义对齐等瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18632 2026-06-18 cs.RO 新提交 78%

ROBOSHACKLES: A Safety Dataset for Human-Injury Prevention in Embodied Foundation Models

ROBOSHACKLES: 面向具身基础模型中人体伤害预防的安全数据集

Zhuowen Yin, Chongyang Liu, Wenzhang Yang, Renjue Li, Yinxing Xue

机构 * Institute of Al for Industries, Chinese Academy of Sciences(工业人工智能研究所,中国科学院) University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 为解决机器人伤害人类数据难以安全收集的问题,提出基于真实观测的安全数据构建流水线,生成包含1万条视频的ROBOSHACKLES数据集,涵盖直接和间接伤害类别,评估发现现有模型在安全关键场景下100%产生不安全动作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17423 2026-06-17 q-fin.CP stat.ML 新提交 78%

Martingale Doppelgänger-Eval: An Identification Framework for Auditing Candlestick Understanding in Vision-Language Models

鞅双生评估:审计视觉语言模型对K线图理解的识别框架

Ziyao Wang

专题命中 评测与基准 :language model(title,abstract)

AI总结 提出Martingale Doppelgänger-Eval基准,通过受控实验识别VLM是否基于K线证据而非趋势外推进行判断,发现模型忽略或反向利用K线语义。

详情

展开后加载摘要…

URL PDF HTML 收藏