arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2780 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2780 篇

2608.17883 2026-08-19 cs.CV 新提交 50%

Improving Complex Moiré Removal with Generative Supervision

利用生成式监督改进复杂莫尔条纹去除

Xinyang Gu, Zhilu Zhang, Honglei Xu, Yanting Mei, Yukang Ding, Wangmeng Zuo

专题命中 评测与基准 :foundation model(abstract)

AI总结 本研究针对现有数据集难以覆盖真实场景复杂莫尔条纹的问题,提出生成式监督数据引擎,构建WildMoiré数据集,在多模型上验证其可提升复杂莫尔条纹去除性能。

Comments 14 pages, 5 figures. Project page: https://xinygu-pavo.github.io/WildMoire/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17502 2026-08-19 cs.SI cs.CY 新提交 50%

The Brazilian Vaccination Debate on YouTube: Topics, Perspectives, and Engagement Dynamics

YouTube上的巴西疫苗接种辩论:主题、观点与参与动态

Matheus S. Azevedo, Geovana S. de Oliveira, Andrea Failla, Alexandre M. de Sousa, Fabricio Murai, Ana Paula C. da Silva, Carlos H. G. Ferreira

专题命中 评测与基准 :language model(abstract)

AI总结 本研究以127万条巴西YouTube评论为数据集,整合多维度计算分析,揭示了巴西疫苗接种辩论的主题分布、动态变化及观众对创作者框架的重构机制。

Comments Accepted at ASONAM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17165 2026-08-19 cs.CV eess.IV 新提交 50%

Rapid Debris-Volume Estimation from Post-Hurricane Aerial Imagery

飓风后航拍图像的快速 debris 体积估算

Kooshan Amini, Jamie Ellen Padgett, Guha Balakrishnan

机构 * Rice University(莱斯大学) Ken Kennedy Institute(肯·肯尼迪研究所)

专题命中 评测与基准 :foundation model(abstract)

AI总结 该研究提出 DebrisHeightNet 网络,利用飓风后单次航拍 RGB 图像,结合 CW-LMF 等技术实现残骸体积快速估算,精度优于传统参数化方法,部署便捷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16843 2026-08-18 cs.RO 新提交 50%

Security of Foundation-Model-Powered Embodied Agents: Attack Surfaces, Attacks, Defenses, and Evaluation

基于基础模型的具身智能体的安全性:攻击面、攻击、防御与评估

Jiawei Liu, Jiacheng Guo, Tian Zhang, Yiwei Xu, Juan Wang, Jinlin Fan, Bowen Xiao

机构 * Wuhan University(武汉大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 该研究以信任边界为核心,针对基于基础模型的具身智能体安全,划分了五个层级与十二个攻击面,分析了58种攻击、61种防御的现状,指出部分领域研究不足并提出开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16789 2026-08-18 cs.CY 新提交 50%

"This Is So Claude!" Towards a Theory of the Recognition of AI Character Without Reidentification

这真像Claude!:走向无需重识别的AI特征识别理论

Michele Loi

专题命中 评测与基准 :language model(abstract)

AI总结 该研究区分AI身份研究的三类路径,提出Claude式分级判断的溯因推理,指出AI可识别特征的连续性对陪伴的重要性,不解决数值同一性问题。

Comments 13 pages. Submitted to Philosophical Studies

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15336 2026-08-18 cs.CV 新提交 50%

SAGE-OR: Semi-supervised Adaptive Scene Graph Generation for Operating Rooms

SAGE-OR:面向手术室的半监督自适应场景图生成

Brandon Leblanc, Charalambos Poullis

机构 * Concordia University(康考迪亚大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 SAGE-OR是面向手术室的半监督自适应场景图生成框架,采用解耦范式,轻量高效,在4D-OR基准上F1达76%,经无监督手部增强后达86%,可低成本适配新手术场景。

Comments Accepted at BMVC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14721 2026-08-18 cs.CV 新提交 50%

AeroGround: A Comprehensive Benchmark for Aerial-Ground Collaborative Reasoning

AeroGround:用于空-地协同推理的综合基准

Shenghong Yi, Lin Zhang, Muzian Li, Jiakang Yuan, Haoyu Zhang, Peng Ye, Jiayuan Fan, Huafeng Qin, Tao Chen

机构 * Shanghai Innovation Institute(上海创新研究院) College of Future Information Technology, Fudan University(复旦大学未来信息技术学院) College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) Chongqing Technology and Business University(重庆工商大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出AeroGround基准,针对现有VLMs在空-地协同场景推理能力的研究空白,构建含29000组多模态观测与2250个问答实例的数据集,实验发现模型与人类表现差距显著,为相关系统开发提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13766 2026-08-17 cs.CV 新提交 50%

ChartProbe: A Diagnostic Study on Visual Reasoning through Perception, Grounding, and Simple Reasoning

ChartProbe:通过感知、定位与简单推理开展视觉推理的诊断研究

Mahsa Khoshnoodi, Sarah Adel Bargal

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出诊断框架ChartProbe,发现视觉-语言模型可通过单独监督感知、定位等简单技能,在无需复杂推理数据的情况下提升复杂图表推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12649 2026-08-14 cs.CY 新提交 50%

Proactive Computing

主动式计算

Joonhee Lee

专题命中 评测与基准 :foundation model(abstract)

AI总结 本综述定义主动式计算范式,区分其与相关计算类型,梳理技术使能因素与挑战,指出关键研究挑战为确定系统代表用户行动的时机、方式与可行性。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12532 2026-08-14 cs.MM cs.CV cs.IR 新提交 50%

MASCOT: Model-Aware Submodular Coverage for Composite-Attribute Text-to-Image Retrieval

MASCOT:面向复合属性文本到图像检索的模型感知子模覆盖

Aaryan Sharma, Vishak Prasad C, Virendra Singh, Ganesh Ramakrishnan

专题命中 评测与基准 :language model(abstract)

AI总结 针对现有流形重排序方法在复合属性文本到图像检索的多样性降低任务中早期排名召回率大幅下降的问题,提出MASCOT方法,在PixelProse数据集复合约束任务中表现优于MS-DPP,尤其在排名1后召回率上优势显著。

Comments 21 pages, 4 figures. Accepted at ACM Multimedia 2026 (MM '26), Rio de Janeiro, Brazil. Extended version with full appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11592 2026-08-13 cs.RO 新提交 50%

Video2Track: From Real-World Interaction Videos to Steerable Adversarial Closed-Track Testing for Automated Driving Systems

Video2Track:从真实世界交互视频到自动驾驶系统的可操控对抗性封闭赛道测试

Mengjie Tian, Xinrui Zhang, Tianyu Li, Peizhi Zhang, Guirong Zhou, Haojie Feng, Junpeng Huang, Qixiang Zhang, Lu Xiong

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出Video2Track框架,通过两个耦合模块将真实驾驶视频交互场景转化为可操控对抗性封闭赛道测试,可复现实景交互场景并生成可控变体,为ADS验证提供可扩展方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11425 2026-08-13 cs.CV 新提交 50%

VLMs Win a Systematic Evaluation of Underwater Image Reconstruction

视觉语言模型(VLMs)在水下图像重建的系统评估中胜出

Sara Aghajanzadeh, Yingxue Wang, Ieva Bagdonaviciute, David Forsyth

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出水下图像重建的系统评估流程,评估发现未经过明确物理模型训练的视觉语言模型(VLMs)显著优于基于物理的模型,真实场景图像结果验证了该评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10858 2026-08-12 cs.DL cs.CY cs.HC 新提交 50%

Auditable AI-Assisted Research Writing: An Engineering Discipline with Pre-Registered Process Observation

可审计的AI辅助研究写作:一种带有预注册过程观测的工程学科

Yang Zhou, Chengqun Yu

专题命中 评测与基准 :language model(abstract)

AI总结 针对AI辅助研究写作缺乏可追溯责任历史的问题,该研究提出一套预注册过程观测的可审计性工程规范,通过git密封、红线门等技术实现审计,经实验验证其停止规则可有效终止不合规工作,相关工具包可供第三方复现指标。

Comments 25 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10662 2026-08-12 cs.MA 新提交 50%

Reifying Research Logic: AI-Assisted Workflow Construction and Incremental Refinement for Quantitative Syntax

具象化研究逻辑:面向定量句法的AI辅助工作流构建与增量优化

He Wang, Jingbo Chen, Yuqiao Lai, Nan Yang, Hanwen Zhang, Wei Yuan

专题命中 评测与基准 :language model(abstract)

AI总结 针对定量句法研究的步骤逻辑隐藏问题,提出QLWF可视化工作流平台,可通过AI辅助将自然语言描述转为可执行工作流,在基准测试中表现优异并发布相关可复用资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10426 2026-08-12 cs.CV 新提交 50%

GeoSeg-OV: Bridging Geospatial Gaps with Structural Guidance for Open-Vocabulary Remote Sensing Segmentation

GeoSeg-OV:利用结构引导弥合地理空间差距的开放词汇遥感分割方法

Ruizhong Liu, Tingzhang Luo, Zaiyan Zhang, Jundong Chen, Hongruixuan Chen, Shaoguang Huang, Hongyan Zhang

机构 * School of Computer Science, China University of Geosciences(中国地质大学计算机学院) Systems Hub, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)系统中心) Department of Computer Science, City University of Hong Kong(香港城市大学计算机系) School of Geodesy and Geomatics, Wuhan University(武汉大学测绘学院) Data Science and AI Innovation Research Promotion Center, Shiga University(滋贺大学数据科学与人工智能创新研究促进中心)

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文提出GeoSeg-OV,通过解耦辅助VFM特征与视觉-文本匹配,将其用作结构引导,结合SGA与CAD模块,在HRLC基准上优于当前最优方法,且具备跨域零样本泛化能力。

Comments Code and benchmark: https://github.com/zzaiyan/GeoSeg-OV

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09497 2026-08-11 cs.CV 新提交 50%

SwissCrop25: A National Multi-Year Benchmark for Operational Crop Mapping

SwissCrop25:用于业务化作物制图的国家级多年基准数据集

Thomas Lauber, Mehmet Ozgur Turkoglu, Sélène Ledain, Helge Aasen

机构 * Agroscope(阿格罗斯普(瑞士农业研究机构))

专题命中 评测与基准 :foundation model(abstract)

AI总结 本研究推出覆盖2019-2025年7个生长季的国家级作物制图基准SwissCrop25,通过留一法年份交叉验证协议测试三类模型,发现领域特定模型表现更优,TSViT整体性能最佳,还揭示了年际分布偏移及季内模型性能权衡等关键结论。

Comments Accepted at the ECCV 2026 Workshop TerraBytes II. To appear in the workshop proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08476 2026-08-11 cs.CV 新提交 50%

RayLift: Lifting Complementary Ray-Wise Evidence with 3D Geometry Priors for Semantic Scene Completion

RayLift:利用3D几何先验提升互补射线级证据以实现语义场景补全

Meng Wang, Hongxia Yu, Wenzhe He, Xingdong Song, Huilong Pi, Jiapeng Zhang, Ruihui Li

专题命中 评测与基准 :foundation model(abstract)

AI总结 针对现有语义场景补全方法的深度误差传播问题,提出RayLift框架,通过互补上下文编码器、深度射线证据提升模块和语义感知体素集成器,在两个基准数据集上实现优于现有方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08315 2026-08-11 cs.CV cs.MM 新提交 50%

Your VLM Already Knows When: Training-Free Temporal Grounding by Asking Yes or No

你的视觉语言模型(VLM)已经知道时间:通过提问“是/否”实现无需训练的时间定位

Ji Huang, Barry Devereux, Hui Wang

专题命中 评测与基准 :LLM(abstract_cn)

AI总结 针对VLM时间定位任务的自信错误问题,提出无需训练的FV-Action方法,通过从粗到细的二元问题扫描替代时间戳回归,在多个基准数据集上大幅提升了时间定位性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08273 2026-08-11 cs.RO cs.CV 新提交 50%

Action- and Language-Conditioned Video Assessment for Embodied Control

面向具身控制的动作与语言条件视频评估

Hwanhee Kim, Jaehyun Jang, Seungmin Cha, Hyeonseo Yun, Donghoon Lee, Chang D. Yoo

专题命中 评测与基准 :language model(abstract)

AI总结 该研究提出ALVA轨迹评估器,结合视觉观测、动作序列与语言指令评估具身控制任务,在模拟3D家庭环境中误报率低,作为反馈机制可提升闭环策略优化效果。

Comments 21 pages, 7 figures, Published in Sensors

Journal ref Sensors 26(16), 5046 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07941 2026-08-11 cs.CV 新提交 50%

LAD-COD: Language-Aligned Dense Perception for Camouflaged Object Detection

LAD-COD:面向伪装目标检测的语言对齐密集感知

Shangye Song, Tianzhi Zhu, Syed Ariff Syed Hesham, Xin He, Yun Liu

专题命中 评测与基准 :prompting(abstract)

AI总结 本研究针对伪装目标检测中密集视觉特征缺乏语言指导的问题,提出LAD-COD框架,通过语言对齐双视觉融合实现语义与分层视觉特征的对齐,在三个数据集的12组对比中取得最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07141 2026-08-10 cs.CV 新提交 50%

Human-AI Perceptual Alignment by Playing Hues and Cues

通过玩Hues and Cues游戏实现人类与AI的感知对齐

Nuria Alabau-Bosque, Jorge Vila-Tomás, Paula Daudén-Oliver, Pablo Hernández-Cámara, Valero Laparra, Jesús Malo

机构 * Universitat de València(瓦伦西亚大学) Image Processing Lab(图像处理实验室)

专题命中 评测与基准 :language model(abstract)

AI总结 本研究提出基于Hues and Cues游戏的评估框架,对比162个CVLMs与人类的颜色感知对齐,发现其在抽象领域偏离人类基线,筛选的预训练数据集可缓解错位。

Comments 19 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07117 2026-08-10 cs.CV 新提交 50%

Beyond Fluency: A Clinical Benchmark and Anomaly-Enhanced Baseline for Spine MRI Report Generation

超越流畅性:脊柱MRI报告生成的临床基准与异常增强基线

Bruno Palau, Franziska Vogt, Daria Laslo, Haobo Li, Ender Konukoglu, Maria Monzon, Catherine R. Jutzeler

机构 * ETH Zurich(苏黎世联邦理工学院) Swiss Institute of Bioinformatics (SIB)(瑞士生物信息学研究所)

专题命中 评测与基准 :language model(abstract)

AI总结 该研究针对放射学报告的耗时与阅片差异问题,构建腰椎MRI的VLM临床基准,提出半监督U-Net++生成异常热图增强VLM的框架,提升诊断可靠性与可解释性。

Comments Maria Monzon and Catherine R. Jutzeler contributed equally as shared last authors. Accepted at the CV4Clinic Workshop, CVPR 2026

Journal ref Proc. IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 6759-6770

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07062 2026-08-10 cs.CV 新提交 50%

Explanation Stability of Test-Time Adaptation in Computational Pathology: A Large-Scale Benchmark

计算病理学中测试时自适应的解释稳定性:大规模基准测试

R. G. Bahumanya, Harshith V. M., Shreyank N. Gowda, Anala M. R

机构 * R.V. College of Engineering(R.V.工程学院) University of Nottingham(诺丁汉大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 该研究构建了计算病理学TTA的大规模基准,发现不同TTA方法对模型解释的影响差异显著,解释稳定性与自适应质量弱相关,强调了解释稳定性是TTA的重要可靠性维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06972 2026-08-10 cs.CV 新提交 50%

Generative Embedding Benchmark: How Much Information Survives in a Dense Embedding?

生成式嵌入基准:密集嵌入中保留了多少信息?

Yun Li, Biao Yang, Peixi Wu, Yunhao Zhou, Mingzhou Jiang, Wei Yuan, Fan Yang, Wenwu Ou

专题命中 评测与基准 :foundation model(abstract)

AI总结 该研究提出Generative Embedding Benchmark(GEB),通过仅用嵌入和问题文本的解码器评估7种嵌入模型,发现生成式读出能揭示可分性评估未捕捉的信息瓶颈,视觉语言模型嵌入表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06886 2026-08-10 cs.CV 新提交 50%

HazeSpikeMamba: Coupling Spiking-Inspired and State-Space Features for Self-Supervised Real-World Dehazing

HazeSpikeMamba:结合类脉冲与状态空间特征的自监督真实图像去雾框架

Haoran Liu, Huibin Li, Mingzhe Liu, Peng Li, Guibin Zan

专题命中 评测与基准 :prompting(abstract)

AI总结 本研究提出HazeSpikeMamba框架,结合类脉冲局部路径与注意力状态空间全局路径,采用转导式域适配,在多个真实去雾数据集上取得最优的BRISQUE与NIMA指标

Comments 21 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05699 2026-08-07 cs.CV 新提交 50%

TAU-Bench: From Anomaly Instance Tracking to Fine-Grained Video Anomaly Understanding

TAU-Bench:从异常实例跟踪到细粒度视频异常理解

Kepeng Yang, Dongxuan Liu, Rongxin Gao, Zixin Su, Rui Wu, Shuzhao Xie, Chenxin Li, Panwang Pan, Yuzhi Huang, Yue Huang, Jingyan Jiang

专题命中 评测与基准 :language model(abstract)

AI总结 该研究引入TAU-Bench这一以跟踪为核心的基准,用于联合评估异常实例跟踪与细粒度视频异常理解,发现现有视觉-语言模型存在语义推理与视觉接地的差距,为构建更可靠的视频异常理解系统提供了关键评估方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05539 2026-08-07 cs.CV 新提交 50%

OmniMech: All-in-one Multimodal Mechanical Benchmark for 3D Reconstruction

OmniMech:面向3D重建的全合一多模态机械基准

Taiting Lu, Runze Liu, Ziwei Dong, Sisong Bei, Jingying Zeng, Mingjia Wang, Zhenghao Li, Kaiyuan Lin, Yi-Shan Wu, Yangshoudu Zheng, Hongxing Pan, Kai Zhang, Guoliang Shi, Ling Ma, Yifan Yang, Jiaying Lu, Qi He, Sung-Liang Chen, Yi-Chao Chen, Yincheng Jin, Mahanth Gowda

专题命中 评测与基准 :language model(abstract)

AI总结 研究人员提出OmniMech——首个百万级多模态机械基准,针对工业制造数据的可执行CAD生成任务,含四类任务,实验发现现有模型在相关任务中存在不足,将发布资源支持后续研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05049 2026-08-06 cs.CV 新提交 50%

OmniEdit-Bench: A Comprehensive Benchmark for Instruction-based Video Editing

OmniEdit-Bench:基于指令的视频编辑综合基准

Chenxuan Miao, Yutong Feng, Yi Lu, Yunfeng Yan, Donglian Qi, Shiwei Zhang, Yu Liu, Xi Chen, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学) Peking University(北京大学)

专题命中 评测与基准 :language model(abstract)

AI总结 针对现有基于指令的视频编辑基准的任务覆盖有限、指标不足的问题,OmniEdit-Bench将编辑任务分解为多维度并提出含惩罚机制的评估框架,实验显示当前IVE模型仍待提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04995 2026-08-06 cs.CV 新提交 50%

Promptable Animal Pose Tracking Across Species

可跨物种提示式动物姿态跟踪

Le Li, Daniela Ivanova, Nicolas Pugeault

专题命中 评测与基准 :foundation model(abstract)

AI总结 针对动物姿态跟踪的跨物种泛化与精度问题,提出有监督、无监督两种基于视觉基础模型的方法,在APTv2和TigDog数据集上实现了精度与泛化性的平衡,为动物保护应用提供实用方案。

Comments Accepted for presentation at the ECCV 2026 Workshop on CV4Ecology

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03474 2026-08-05 cs.CV 新提交 50%

MT-Web2Code: Benchmarking Coding Agents on Multi-Turn Regional Reconstruction and Localized Modification

MT-Web2Code:面向多轮区域重构与局部修改的编码智能体基准测试

Qiming Li, Shujie Hu, Haohan Liu, Xiaocheng Feng, Songxiang Liu, Guanglu Wan

专题命中 评测与基准 :language model(abstract)

AI总结 MT-Web2Code是首个面向多轮区域重构与局部修改的多模态编码基准,实验发现现有编码智能体存在多轮错误滚雪球等问题,其评估指标或助力相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏