arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2780 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2780 篇

2607.01420 2026-07-09 cs.CL cs.AI cs.CV 新提交 62%

MultAttnAttrib: Training-Free Multimodal Attribution in Long Document Question Answering

MultAttnAttrib:长文档问答中的无训练多模态归因

Dang Quang Thien Tran, Quang V. Dang, Vinamra Tyagi, Sai Soorya Rao Veeravalli, Trang Nguyen, Ryan A. Rossi, Franck Dernoncourt, Nedim Lipka, Koustava Goswami, Samyadeep Basu

专题命中 评测与基准 :prompting(abstract);分类 cs.CL、cs.AI

AI总结 提出无训练归因方法MultAttnAttrib,利用模型预填充、选定注意力头和校准阈值定位证据,并构建多模态归因基准MultAttrEval,实验表明其优于多种方法,匹配GPT 5.4且延迟降低至1/7。

Comments 25 pages (8 main, 17 references + appendix), 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04690 2026-07-07 cs.CL cs.LG 新提交 62%

PAST-TIDE: Prototype-Anchored Statement Tuning with Topic-Invariant Normalization for Stance Detection

PAST-TIDE:用于立场检测的基于主题不变归一化的原型锚定语句微调

Md. Shakhoyat Rahman Shujon, MD Jahid Hasan Jim, Md. Milon Islam, Md Rezwanul Haque, Fakhri Karray

机构 * Department of Computer Science and Engineering, Khulna University of Engineering & Technology(库尔纳工程技术大学计算机科学与工程系) Department of Electrical and Computer Engineering, University of Waterloo(滑铁卢大学电气与计算机工程系) Department of Machine Learning, Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学机器学习系)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 PAST-TIDE是用于立场检测的系统,通过语句微调,将立场重新定义为完形填空式掩码语言建模,并用原型对比学习及主题条件层归一化补充,在低资源设置中表现有竞争力。

Comments Published in The Fifteenth Language Resources and Evaluation Conference (LREC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04542 2026-07-07 cs.LG cs.AI cs.SE 新提交 62%

Auto: The AGI Compiler

自动:通用人工智能编译器

Jaber Jaber, Osama Jaber

机构 * RightNow AI(即时人工智能)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 研究提出通用人工智能编译器Auto,通过记录智能体行为,提取确定性部分转化为程序或专家,生成带保障的认知二进制文件。在基准测试中表现良好,还量化了失败模式,强调校准和参考保真度对正确性的决定作用。

Comments 10 pages, 4 figures, 3 tables, 1 algorithm. Code: https://github.com/RightNow-AI/auto

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04319 2026-07-07 cs.CL cs.LG 新提交 62%

Legible-by-Construction: Attention and End-to-End Transformers

通过构造实现可读:注意力机制与端到端变换器

Mark Oskin

机构 * Professor School of Computer Science and Engineering University of Washington(计算机科学与工程教授 美国华盛顿大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 研究将变换器前馈层可读化的思想应用于注意力机制,提出最小化机制及布尔变体,通过选择性压力使值通道成为可读探测器,在多注意力设计中提升了可读性,还训练了端到端可读语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04281 2026-07-07 cs.CL cs.AI 新提交 62%

Risk-Constrained Freshness-Aware Semantic Caching for Open-Web Retrieval-Augmented LLMs

面向开放网络检索增强语言模型的风险约束新鲜度感知语义缓存

Muhammad Mansoor, Tahir Ahmad, Yeo-Chan Yoon

机构 * Jeju National University(济州国立大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究针对开放网络证据时变新鲜度,提出三层语义缓存FreshCache,将缓存重用视为风险约束时间推理问题,给出评估方法并引入基准测试,实验表明其在节省搜索API及降低陈旧错误率方面效果良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03991 2026-07-07 cs.LG cs.CL 新提交 62%

Knowing When to Stop: Predicting Execution-Consistency Convergence in Text-to-SQL

知道何时停止:预测文本到SQL执行一致性收敛

Yaron Anavi, Mor Aisenberg, Nadav Nesher, Elena Khabibullina, Isabella Cattinelli

机构 * GIGASPACES

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.LG

AI总结 研究预测文本到SQL结果执行一致性收敛的停止时机,训练轻量级1-D模型观察一致性轨迹来决定是否继续运行,在多数据集上验证方法能自适应停止点,还展示了训练增强及噪声注入下的效果。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03386 2026-07-07 cs.AI cs.LG 新提交 62%

When Aggregate Alignment Misleads: Auditing Policy Repair Without Per-State Expert Actions

当聚合对齐产生误导时:无需逐状态专家操作的审核策略修复

Peiying Zhu, Sidi Chang

机构 * Blossom AI(绽放人工智能公司) Blossom AI Labs(绽放人工智能实验室)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 研究在酒店定价模拟器中,智能策略编辑器仅接收区域级诊断反馈时的策略修复问题,用多重启大语言模型编辑器进行修复,其不仅提升收益还减小情节构成距离,结果表明应按诊断反馈是否成可靠闭环结果评估策略修复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02975 2026-07-07 cs.AI cs.CL 新提交 62%

Evaluating Generative Agents with Actions Grounded in Socially Distributed Task Environments using Incognita

使用Incognita评估基于社会分布式任务环境中行动的生成智能体

Dan C. Hsu, Luke Lu

机构 * RedMind Research(RedMind研究)

专题命中 评测与基准 :language agent(abstract);分类 cs.CL、cs.AI

AI总结 研究结合现有基准和社会模拟环境要求的评估设置,定义社会分布式任务环境,介绍Incognita框架,以之评估三个生成智能体模型,发现其在奖励和行为上有进展但可靠性仍低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02932 2026-07-07 cs.CR cs.AI cs.HC cs.LG 新提交 62%

PromptPET: Privacy-Utility Optimized Prompt Obfuscation

PromptPET:隐私-效用优化的提示混淆

Ke Yang, Olivia Figueira, Umar Iqbal, Athina Markopoulou

机构 * University of California, Irvine(加州大学 Irvine 分校) Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 旨在通过用户端机制保护用户隐私,该机制转换用户提示中的敏感信息,在保护隐私和保留效用间权衡。考虑评估比较四种混淆动作,提出基于大语言模型的PROMPTPET,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02718 2026-07-07 cs.CV cs.AI cs.LG 新提交 62%

Diagnosing Aerial-View Object Detectors with Foundational Image Generative Models

用基础图像生成模型诊断鸟瞰目标检测器

Stanislav Panev, Minhyek Jeon, Vaishnavi Khindkar, Ahish Deshpande, Celso M de Melo, Shuowen Hu, Shayok Chakraborty, Fernando De la Torre

机构 * Carnegie Mellon University(卡内基梅隆大学) DEVCOM Army Research Laboratory(陆军研究实验室(DEVCOM)) Florida State University(佛罗里达州立大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 研究用文本引导生成、属性控制编辑和自动属性验证构建可控合成测试平台,对预训练检测器进行细粒度评估,以预测实际性能差距并指导高效数据收集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03193 2026-07-07 quant-ph cs.AI cs.LG 新提交 62%

Self-Specializing Vision-Language Transmon Chip Calibration in a Physics-Grounded Environment

在物理基础环境中自专业化的视觉语言跨导芯片校准

Animesh Tripathy, Aswanth Krishnan

机构 * QpiAI India Pvt. Ltd(QpiAI印度私人有限公司)

专题命中 评测与基准 :language agent(abstract);分类 cs.AI、cs.LG

AI总结 研究视觉语言智能体能否在无权重更新下校准超导跨导芯片。通过设计物理模拟环境、视觉语言智能体及无梯度在线自适应方法,在预算压力下提升芯片保真度,诊断硬件故障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16494 2026-07-07 cs.CL cs.AI cs.CV 新提交 62%

Lost at the End: Primacy Bias in Multimodal Retrieval-Augmented Question Answering

迷失在末尾:多模态检索增强问答中的首因偏差

Jieyuan Liu, Jianyang Gu, Shijie Chen, Jefferson Chen, Zhen Wang

机构 * University of California, San Diego(加州大学圣地亚哥分校) The Ohio State University(俄亥俄州立大学)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 研究多模态知识型视觉问答中检索上下文的位置依赖,发现不同于纯文本的U形效应,出现首因偏差(开头优于末尾),并通过消融实验定位原因为指令调优阅读器的提示槽0。

Comments 15 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02469 2026-07-03 cs.SE cs.AI cs.CL 新提交 62%

TestEvo-Bench: An Executable and Live Benchmark for Test and Code Co-Evolution

TestEvo-Bench:一个可执行且动态的测试与代码协同演化基准

Jiale Amber Wang, Kaiyuan Wang, Pengyu Nie

专题命中 评测与基准 :foundation model(abstract);分类 cs.CL、cs.AI

AI总结 提出TestEvo-Bench基准,包含测试生成和更新两类任务,基于真实提交历史并支持执行指标,评估自动化代理在代码变更后同步调整测试的能力。

Comments TestEvo-Bench leaderboard and data explorer are hosted at https://www.testevo-bench.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01973 2026-07-03 cs.CV cs.AI cs.LG 新提交 62%

Assessing VLM Reliability for Medical Image Quality Evaluation Under Corruption and Bias

评估视觉语言模型在图像退化与偏差下进行医学图像质量评估的可靠性

Sofiane Ouaari, Kevin Vorwalder, Nico Pfeifer

机构 * University of Tuebingen(图宾根大学) Institute for Bioinformatics and Medical Informatics (IBMI), University of Tuebingen(图宾根大学生物信息学与医学信息学研究所)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 研究视觉语言模型在医学图像质量评估中,面对图像退化(如像素化)和文本属性偏差时的可靠性,发现像素化显著降低性能,而文本属性(如机构声望)引入偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01709 2026-07-03 cs.AI cs.LG 新提交 62%

COMFYCLAW: Self-Evolving Skill Harnesses for Image Generation Workflows

COMFYCLAW:面向图像生成工作流的自进化技能工具包

Zongxia Li, Dawei Liu, Fuxiao Liu, Yuhang Zhou, Xiyang Wu, Jingxi Chen, Jing Xie, Xiaomin Wu, Lichao Sun

机构 * University of Maryland(马里兰大学) University of Pennsylvania(宾夕法尼亚大学) Nvidia(英伟达) Lehigh University(里海大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出COMFYCLAW框架,通过类型化图编辑、区域级VLM验证器和渐进式技能库进化,提升ComfyUI工作流构建的代理可靠性和性能,在多个基准上取得最佳平均评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00325 2026-07-02 cs.LG cs.CL 新提交 62%

Watermarking for Proprietary Dataset Protection

专有数据集保护的水印技术

John Kirchenbauer, Brian R. Bartoldson, Bhavya Kailkhura, Tom Goldstein

机构 * University of Maryland(马里兰大学) Lawrence Livermore National Labs(劳伦斯利弗莫尔国家实验室)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 针对生成模型训练数据成员推断难题,提出基于水印的数据集推断方法,在子集暴露充分时达到与传统损失法相当的检测性能。

Comments 8 pages and 6 figures in the main body; presented at the ICML 2026 Workshop on Trustworthy AI for Good

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32002 2026-07-01 cs.AI cs.LG 新提交 62%

Self-Study Reconsidered: The Hidden Fragility of Learning from Self-Generated QA

自我学习再思考:从自生成问答中学习的隐藏脆弱性

Ekaterina Alimaskina, Denis Shveykin, Gleb Molodtsov, Igor Shalygin, Alexey Kadeishvili, Aleksandr Beznosikov

机构 * BRAIn Lab(BRAIn实验室) Yandex Research(Yandex研究院)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文揭示语言模型从自生成问答对学习中存在的脆弱性:生成阶段会偏向选择显著内容并服从文本中的指令式段落,导致覆盖不均和注入偏差。通过固定目标问题和过滤指令式跨度可显著降低偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31179 2026-07-01 cs.AI cs.CL cs.CV 新提交 62%

HealthAgentBench: A Unified Benchmark Suite of Realistic Agentic Healthcare Environments for Challenging Frontier AI Agents

HealthAgentBench:面向挑战性前沿AI代理的统一真实医疗环境基准套件

Qianchu Liu, Sheng Zhang, Guanghui Qin, Jeya Maria Jose Valanarasu, Maximilian Rokuss, Mingyu Lu, Timothy Ossowski, Juan Manuel Zambrano Chaves, Cliff Wong, Peniel Argaw, Yashna Hasija, Mu Wei, Wen-wai Yim, Qin Liu, Zilin Jing, Jason Entenmann, Naoto Usuyama, Tristan Naumann, Hoifung Poon

机构 * Microsoft(微软)

专题命中 评测与基准 :prompting(abstract);分类 cs.CL、cs.AI

AI总结 提出包含54个医疗任务的基准套件HealthAgentBench,评估AI代理在真实临床工作流中的端到端多步推理能力,最强代理Codex GPT-5.5仅达42%成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30702 2026-07-01 cs.LG cs.AI stat.ML 新提交 62%

Accelerometry-Derived Digital Biomarkers for Cardiometabolic Risk: A Population-Representative Tabular Benchmark with Uncertainty Quantification

基于加速度计的心血管代谢风险数字生物标志物:一个具有不确定性量化的群体代表性表格基准

Federico Felizzi

机构 * SIIAM, Rome, Italy(意大利罗马SIIAM)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 基于NHANES 2003-2006数据构建加速度计心血管代谢基准,评估三种表格学习方法预测HbA1c、甘油三酯和CRP的性能,并应用分裂共形预测进行不确定性量化与公平性分析。

Comments Accepted at the SD4H Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23375 2026-07-01 cs.CL cs.AI 新提交 62%

Measuring & Mitigating Over-Alignment for LLMs in Multilingual Criminal Law Courts

测量与缓解多语言刑事法庭中大语言模型的过度对齐

Arthur Wuhrmann, Gaetan Stein, Daniel Brunner, Andrei Kucharavy

机构 * Swiss Federal Supreme Court(瑞士联邦最高法院) HES-SO Valais-Wallis(HES-SO瓦莱州-瓦利斯高等专业学院)

专题命中 评测与基准 :prompting(abstract);分类 cs.CL、cs.AI

AI总结 针对刑事法律场景中大语言模型因安全护栏导致拒绝响应(过度对齐)的问题,提出TF-RefusalBench基准,并评估提示工程与拒绝方向消融(abliteration)等缓解方法。

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27539 2026-06-29 cs.SI cs.AI cs.LG 新提交 62%

Benchmarking Multi-Modal Graph-based Social Media Popularity Prediction

基于多模态图的社交媒体流行度预测基准测试

Utkarsh Sahu, Zhisheng Qi, Li Zhu, Yizhao Yang, Jun Li, Ryan Rossi, Yu Wang

机构 * University of Oregon(俄勒冈大学) University of Georgia(佐治亚大学) Adobe Research(Adobe研究)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 提出统一的多模态图基准MMG-Pop和模型MMG-PopNet,联合建模文本、视觉、时间与社交交互信号,在Bluesky和Reddit数据集上验证了跨平台泛化与多模态贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16682 2026-06-29 cs.LG cs.CL 新提交 62%

Multimodal Evaluator Preference Collapse: Cross-Modal Coupling in Self-Evolving Agents

多模态评估者偏好坍缩:自进化智能体中的跨模态传染

Zewen Liu

机构 * Qilu Institute of Technology, School of Software Engineering(齐鲁理工学院软件工程学院)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 研究多模态自评估中偏好坍缩的加剧现象,发现跨模态传染导致策略选择扭曲,并引入传染矩阵量化风险。

Comments 17 pages, 0 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11585 2026-06-29 cs.LG cs.CL nlin.AO 新提交 62%

Kuramoto Attention: Synchronizing Self-Attention on the Torus

Kuramoto注意力:在环面上同步自注意力

Joshua Nunley

机构 * Department of Informatics, Luddy School of Informatics, Computing, and Engineering, Cognitive Science Program, Indiana University Bloomington(印第安纳大学伯明顿分校信息学系,卢迪信息学、计算与工程学院,认知科学项目)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 提出Kuramoto注意力层,将隐藏坐标视为角度,通过门控余弦相似度和环形均值更新实现自注意力,等价于Kuramoto耦合项,在字符级语言建模中达到与强基线相近的性能。

Comments 15 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25990 2026-06-25 cs.CL cs.AI cs.SD 新提交 62%

SpeechEQ: Benchmarking Emotional Intelligence Quotient in Socially Aware Voice Conversational Models

SpeechEQ: 社交感知语音对话模型的情商基准测试

Liang-Yuan Wu, Zih-Ching Chen, Tongshuang Wu, Chao-Han Huck Yang, Hua Shen

机构 * New York University(纽约大学) NVIDIA(英伟达) Carnegie Mellon University(卡内基梅隆大学) NYU Shanghai(上海纽约大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 提出SpeechEQ框架,基于EQ-i 2.0理论构建2265个对话数据集,通过口语情商(SEQ)评分评估语音语言模型在主动多轮对话中的副语言社交线索推理能力,揭示端到端模型存在模态捷径、安全陷阱和上下文遗忘等瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21843 2026-06-23 cs.AI cs.CL 新提交 62%

Measuring What Persists: Conditioning Mechanisms and a Geometric Framework for AI Agent Identity

测量持续存在的内容:AI智能体身份的调节机制与几何框架

Andrew Tanner

机构 * Anisotrope AI

专题命中 评测与基准 :post-training(abstract);分类 cs.CL、cs.AI

AI总结 提出基于√JSD度量空间和丰富范畴理论中幅度同调的几何框架,用于测量AI智能体身份结构,发现双机制调节结构:身份真空簇和安全盆地簇,并通过等边探针基线验证身份规范创造可测量的行为丰富性。

Comments 29 pages, 6 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20676 2026-06-23 cs.CV cs.AI cs.CL 新提交 62%

Jury Duty: Calibration and Orientation Failures in MLLM-as-a-Judge Under Cultural Ambiguity

陪审团职责:文化模糊性下MLLM作为评判者的校准与定向失败

Daniel Lee, Harsh Sharma, Eunkyu Park, Pranav Narayanan Venkit, Jeonghwan Kim, Kah Mun Chia, Andreas Vlachos, Shafiq Joty

机构 * Salesforce AI Research(Salesforce AI 研究院) University of Cambridge(剑桥大学) University of Colorado Boulder(科罗拉多大学博尔德分校) Carnegie Mellon University(卡内基梅隆大学) UIUC(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :prompting(abstract);分类 cs.CL、cs.AI

AI总结 针对MLLM作为评判者在跨文化场景中的偏差问题,提出VOIR DIRE基准,通过分析校准失败(压缩尺度)和定向失败(默认一种文化规范),揭示模型偏向于更宽容的文化解读。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08810 2026-06-17 cs.CL cs.LG 新提交 62%

Continuous Language Diffusion as a Decoder-Interface Problem

连续语言扩散作为解码器-接口问题

Zhicheng Du, Lan Ma

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院, 清华大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 研究连续扩散语言模型如何从高斯噪声生成流畅文本,提出解码器-盆地机制,并设计诊断协议揭示标量指标隐藏的失败,通过接口相图解释令牌恢复行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17006 2026-06-16 cs.SD cs.AI cs.LG cs.MM eess.AS 新提交 62%

TuneJury: An Open Metric for Improving Music Generation Preference Alignment

TuneJury: 一种改进音乐生成偏好对齐的开放指标

Yonghyun Kim, Junwon Lee, Haiwen Xia, Yinghao Ma, Junghyun Koo, Koichi Saito, Yuki Mitsufuji, Chris Donahue

机构 * Carnegie Mellon University(卡内基梅隆大学) Sony AI(索尼AI) Georgia Tech(佐治亚理工学院) KAIST(韩国科学技术院) Peking University(北京大学) QMUL(伦敦玛丽女王大学)

专题命中 评测与基准 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 提出TuneJury,一个开放、实例级别的成对奖励模型,用于文本到音乐生成,通过预测偏好分数支持数据筛选、后处理校准,并在推理、优化和训练中提升对齐效果。

Comments 32 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14604 2026-06-15 cs.LG cs.AI 新提交 62%

A Comparative Study of Deep Learning Architectures for Multi-Horizon Behavioural Forecasting for Mobile Health

移动健康多时间范围行为预测的深度学习架构比较研究

Pavlos Nicolaou, Kleanthis Malialis, Artemis Kontou, Panayiotis Kolios

机构 * KIOS Research and Innovation Center of Excellence, University of Cyprus(塞浦路斯大学KIOS研究与创新卓越中心) Department of Electrical and Computer Engineering, University of Cyprus(塞浦路斯大学电气与计算机工程系)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本研究在三个公开数据集上系统比较了六种深度学习架构、两种零样本基础模型和统计基线在1-8天时间范围内的行为预测性能,发现PatchTST表现最佳,基础模型TimesFM在低数据场景下可与训练模型匹敌,且参与者级微调可将RMSE降低16-60%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13870 2026-06-15 cs.CV cs.AI cs.LG 新提交 62%

Mirage Probes: How Vision Models Fake Visual Understanding

幻象探针:视觉模型如何伪造视觉理解

Daniel Ben-Levi, Judah Goldfeder, Weiliang Zhao, Raz Lapid, Amit LeVi, Allen G. Roush, Ravid Shwartz-Ziv, Hod Lipson

机构 * Columbia University(哥伦比亚大学) Intuit Technion(以色列理工学院) Thoughtworks New York University(纽约大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出幻象探针框架,通过对比探针揭示视觉语言模型在无图像时也能回答问题的两种幻象行为:文本偏见和虚假图像,并证明后者需要表征级干预。

详情

展开后加载摘要…

URL PDF HTML 收藏