arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-01 至 2026-07-01 共收录 348 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 79 篇

2508.08237 2026-07-01 cs.MM cs.AI cs.CV cs.SD eess.AS 版本更新 79%

VGGSounder: Audio-Visual Evaluations for Foundation Models

VGGSounder:基础模型的音视频评估

Daniil Zverev, Thaddäus Wiedemer, Ameya Prabhu, Matthias Bethge, Wieland Brendel, A. Sophia Koepke

机构 * Technical University of Munich, MCML(慕尼黑技术大学,MCML) University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心) MPI for Intelligent Systems, ELLIS Institute(智能系统Max Planck研究所,ELLIS研究所)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 针对VGGSound数据集在音视频基础模型评估中的标签不完整、类别重叠和模态错位等问题,提出重新标注的多标签测试集VGGSounder,并引入模态混淆指标分析模型性能退化。

Comments Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32004 2026-07-01 cs.AI cs.LG cs.LO cs.SC 新提交 79%

PolicyGuard: From Organizational Policies to Neuro-SymbolicCompliance Review Engines

PolicyGuard: 从组织策略到神经符号合规审查引擎

Sameer Malik, Ayush Singh, Amar Prakash Azad

机构 * Fujitsu Research India Private Limited, Bengaluru, India(富士通研究印度私人有限公司,印度班加罗尔)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 提出PolicyGuard框架,将组织策略转化为可执行的神经符号审查引擎,通过分离策略形式化、局部文档解释和符号合规评估,实现显式、可维护且可系统测试的文档合规审查。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31464 2026-07-01 cs.CL cs.AI 新提交 79%

Team MKC at CLPsych 2026: Capturing and Characterizing Mental Health Changes through Social Media Timeline Dynamics

Team MKC 在 CLPsych 2026:通过社交媒体时间线动态捕捉和表征心理健康变化

Kyomin Hwang, Hyeonjin Kim, Hyunho Lee, Nojun Kwak

机构 * Seoul National University(首尔大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于大语言模型的流水线,通过分析用户按时间排序的帖子,实现帖子级评估和用户级时间建模,以支持心理健康的早期检测和持续监测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31435 2026-07-01 cs.AI cs.CL 新提交 79%

CDR-Bench: Evaluating Faithful Execution of Compositional, Order-Sensitive Data Refinement Recipes

CDR-Bench:评估组合式、顺序敏感数据精炼配方的忠实执行

Yuchen Huang, Xiang Li, Zhenqing Ling, Sijia Li, Qianli Shen, Daoyuan Chen, Yi R. Fung, Yaliang Li

机构 * HKUST(香港科技大学) NUS(新加坡国立大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出CDR-Bench基准,包含3462个高质量任务,评估LLM在组合式和顺序敏感设置下直接执行数据精炼配方的能力,发现当前LLM缺乏程序忠实性。

Comments 29 pages, 20 figures. Corresponding authors: Daoyuan Chen and Yi R. Fung

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11094 2026-07-01 cs.CL cs.AI cs.CR 79%

The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs

正义的尺度:关于大语言模型安全评估的全面调查

Songyang Liu, Chaozhuo Li, Jiameng Qiu, Xi Zhang, Feiran Huang, Litian Zhang, Yiming Hei, Philip S. Yu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Jinan University(暨南大学) Beihang University(北京航空航天大学) China Academy of Information and Communications Technology(中国信息通信研究院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文系统调研了大语言模型的安全评估现状,提出四维分类框架,分析评估原因、内容、场景及方法,指出当前挑战并提出研究方向,强调安全评估对可靠部署的重要性。

Comments 20 pages, preprint

Journal ref Information Fusion 136 (2026) 104579

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31273 2026-07-01 cs.LG 新提交 77%

The Calibration Turn in AI-Assisted Research: A Conceptual and Methodological Framework for Evidence-Licensed Claims

AI辅助研究中的校准转向:证据许可主张的概念与方法论框架

Hongmin Li

机构 * School of Life Science and Technology, Institute of Science Tokyo(东京科学大学生命科学与技术学院) Department of Computational Biology and Medical Sciences, Graduate School of Frontier Sciences, The University of Tokyo(东京大学前沿科学研究生院计算生物学与医学科学系)

专题命中 评测与基准 :LLM(abstract,abstract_cn);foundation model(abstract);分类 cs.LG

AI总结 提出AI辅助研究中证据许可主张的概念与方法论框架,通过五个算子描述研究过程,强调校准作为管理科学断言权的机制,并区分不同语义类型。

Comments 42 pages, 4 figures. Companion code and synthetic simulation artifacts: https://github.com/Li-Hongmin/calibration-turn-ai-assisted-research

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31209 2026-07-01 cs.AI cs.RO 新提交 77%

Long-term Traffic Simulation via Structured Autoregressive Modeling

基于结构化自回归建模的长期交通仿真

Lingyu Xiao, Zexin Feng, Xintao Yan

机构 * The University of Hong Kong(香港大学)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出RosettaSim框架,利用大规模序列模型的归纳偏置和统计先验,通过结构化自回归流建模场景拓扑、智能体状态和生成意图,实现短期准确与长期稳定仿真;并引入基于检索的交通评估(RTE)解决长期评估难题。

Comments ECCV 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31966 2026-07-01 cs.MA cs.AI cs.CL cs.CV 新提交 73%

MECoBench: A Systematic Study of Multimodal Agent Collaboration in Embodied Environments

MECoBench:具身环境中多模态智能体协作的系统研究

Qingyun Liu, Jiwen Zhang, Jingyi Hu, Siyuan Wang, Zhongyu Wei

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) The Chinese University of Hong Kong(香港中文大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出MECoBench基准,通过多任务、多结构、多模式的实验,系统研究多模态大模型在具身环境中的协作机制,发现协作能提升任务完成度但需平衡收益与复杂度,通信是关键,且协作增强鲁棒性。

Comments Project website: https://q-i-n-g.github.io/MECoBench-Website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31518 2026-07-01 cs.AI 新提交 70%

Design and Implementation of Agentic Orchestrations and Orchestration of Agents

代理编排与代理编排的设计与实现

Stefanie Rinderle-Ma, Juergen Mangler, Johannes Loebbecke, Dominik Voigt, Nataliia Klievtsova, Matthias Ehrendorfer

机构 * Technical University of Munich(慕尼黑工业大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出代理业务流程管理的分类框架,包括任务特异性、可追溯性、自主性等属性,并给出定性决策标准和定量评估指标,通过预测光感场景实例验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30755 2026-07-01 cs.CR cs.AI 新提交 70%

Understanding and Evaluating Claw-like Agent Security Through a Computer-Systems Lens

通过计算机系统视角理解与评估爪类智能体安全性

Peizhi Niu, Wenjie Qu, Shangding Gu, Tianneng Shi, Yuankai Li, Ahmad Tawaha, Hend Alzahrani, Vincent Siu, Boyi Li, Chenguang Wang, Jiaheng Zhang, Basel Alomair, Ming Jin, Muhao Chen, Chi Wang, Costas Spanos, Dawn Song

机构 * UIUC(伊利诺伊大学厄巴纳-香槟分校) NUS(新加坡国立大学) UC Berkeley(加州大学伯克利分校) UC Davis(加州大学戴维斯分校) Virginia Tech(弗吉尼亚理工大学) KACST(阿卜杜勒阿齐兹国王科技城) UC Santa Cruz(加州大学圣克鲁兹分校) NVIDIA(英伟达) Google DeepMind(谷歌DeepMind) UW Seattle(华盛顿大学西雅图分校) HUMAIN(胡迈因研究所)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对爪类AI智能体安全漏洞,提出计算机系统类比,构建SafeClawArena基准测试,评估406个对抗任务,发现最高攻击成功率70%,恶意插件100%成功。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16783 2026-07-01 cs.CL 70%

SubData: Bridging Heterogeneous Datasets to Enable Theory-Driven Evaluation of Political and Demographic Perspectives in LLMs

SubData:连接异构数据集以实现对LLM政治和人口视角的理论驱动评估

Pietro Bernardelle, Leon Fröhling, Stefano Civelli, Gianluca Demartini

机构 * The University of Queensland(昆士兰大学) GESIS - Leibniz Institute for the Social Sciences(GESIS - 莱布尼茨社会科学研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出SubData框架,通过标准化异构数据集评估LLM视角对齐,并展示如何利用该工具测试不同对齐LLM对特定人口群体内容的分类差异。

Comments 14 pages, 2 figures, 3 tables

Journal ref Proceedings of the 5th Workshop on Perspectivist Approaches to NLP (NLPerspectives) at the 15th Language Resources and Evaluation Conference (LREC), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31706 2026-07-01 cs.SE 新提交 67%

AdaTrans: Automated C to Rust Transformation via Error-Adaptive Repair

AdaTrans: 通过错误自适应修复实现C到Rust的自动转换

Xiaofan Liu, Zecan Li, Zhuang Zhao, Ziqi Shuai, Yanming Yang, Qi Xin, Jifeng Xuan

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出AdaTrans框架,通过策略驱动检索增强生成、错误分层转换策略和多阶段验证流水线,解决C到Rust自动转换中所有权和借用语义违反问题,在104个算法问题上实现95.51%编译通过率和81.09%解决率,不安全文件率仅1.19%。

Comments 37 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31665 2026-07-01 cs.MA 新提交 67%

ForecastAgentSearch: Towards a Multi-Expert Agent Search System for Geopolitical Event Forecasting

ForecastAgentSearch:面向地缘政治事件预测的多专家智能体搜索系统

Miaomiao Cai, He Chang, Yunshan Ma, See-kiong Ng

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出ForecastAgentSearch框架,将地缘政治事件预测建模为多专家智能体搜索问题,通过检索、排序和协调专业智能体生成预测,并讨论关键设计挑战与评估方案。

Journal ref SIGIR 2026 AgentSearch Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31169 2026-07-01 cs.CV 新提交 67%

Beyond Single Character: Evaluating MLLMs for Sentence-Level Oracle Bone Inscription Understanding

超越单字符:评估多模态大语言模型在句子级甲骨文理解中的表现

Ziqi Li, Zijian Chen, Tingzhu Chen, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Nanjing University of Science and Technology(南京理工大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出S-OBI基准,通过字形替换与组合合成清晰标准的句子级甲骨文实例,设计语义匹配、语义槽提取和上下文推理任务,评估多模态大语言模型在句子级甲骨文理解中的表现,发现当前模型仍依赖字符级识别。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31424 2026-07-01 hep-th 新提交 67%

Critical Lin-Lunin-Maldacena geometries

临界Lin-Lunin-Maldacena几何

Prokopii Anempodistov, Vladimir Kazakov, Lev Senchukov

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 研究Lin-Lunin-Maldacena几何中液滴形成尖点时的临界行为,发现超引力对偶具有ISO(1,3)×SO(5)对称形式并出现裸奇点,粒子被奇点线捕获,轨迹在仿射时间内到达但观测时间发散。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08758 2026-07-01 eess.IV cs.CV 版本更新 67%

M3CoTBench: Benchmark Chain-of-Thought of MLLMs in Medical Image Understanding

M3CoTBench:医学图像理解中多模态大语言模型的思维链基准测试

Juntao Jiang, Jiangning Zhang, Yali Bi, Jinsheng Bai, Weixuan Liu, Weiwei Jin, Zhucun Xue, Yong Liu, Xiaobin Hu, Shuicheng Yan

机构 * Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学) East China Normal University(华东师范大学) Zhejiang Provincial People’s Hospital(浙江省人民医院) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出M3CoTBench基准,通过多层级难度数据集和专用评估指标,系统评测多模态大语言模型在医学图像理解中的思维链推理正确性、效率、影响和一致性。

Comments 39 pages, 8 figures; accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32002 2026-07-01 cs.AI cs.LG 新提交 62%

Self-Study Reconsidered: The Hidden Fragility of Learning from Self-Generated QA

自我学习再思考:从自生成问答中学习的隐藏脆弱性

Ekaterina Alimaskina, Denis Shveykin, Gleb Molodtsov, Igor Shalygin, Alexey Kadeishvili, Aleksandr Beznosikov

机构 * BRAIn Lab(BRAIn实验室) Yandex Research(Yandex研究院)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文揭示语言模型从自生成问答对学习中存在的脆弱性:生成阶段会偏向选择显著内容并服从文本中的指令式段落,导致覆盖不均和注入偏差。通过固定目标问题和过滤指令式跨度可显著降低偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31179 2026-07-01 cs.AI cs.CL cs.CV 新提交 62%

HealthAgentBench: A Unified Benchmark Suite of Realistic Agentic Healthcare Environments for Challenging Frontier AI Agents

HealthAgentBench:面向挑战性前沿AI代理的统一真实医疗环境基准套件

Qianchu Liu, Sheng Zhang, Guanghui Qin, Jeya Maria Jose Valanarasu, Maximilian Rokuss, Mingyu Lu, Timothy Ossowski, Juan Manuel Zambrano Chaves, Cliff Wong, Peniel Argaw, Yashna Hasija, Mu Wei, Wen-wai Yim, Qin Liu, Zilin Jing, Jason Entenmann, Naoto Usuyama, Tristan Naumann, Hoifung Poon

机构 * Microsoft(微软)

专题命中 评测与基准 :prompting(abstract);分类 cs.CL、cs.AI

AI总结 提出包含54个医疗任务的基准套件HealthAgentBench,评估AI代理在真实临床工作流中的端到端多步推理能力,最强代理Codex GPT-5.5仅达42%成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30702 2026-07-01 cs.LG cs.AI stat.ML 新提交 62%

Accelerometry-Derived Digital Biomarkers for Cardiometabolic Risk: A Population-Representative Tabular Benchmark with Uncertainty Quantification

基于加速度计的心血管代谢风险数字生物标志物:一个具有不确定性量化的群体代表性表格基准

Federico Felizzi

机构 * SIIAM, Rome, Italy(意大利罗马SIIAM)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 基于NHANES 2003-2006数据构建加速度计心血管代谢基准,评估三种表格学习方法预测HbA1c、甘油三酯和CRP的性能,并应用分裂共形预测进行不确定性量化与公平性分析。

Comments Accepted at the SD4H Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23375 2026-07-01 cs.CL cs.AI 新提交 62%

Measuring & Mitigating Over-Alignment for LLMs in Multilingual Criminal Law Courts

测量与缓解多语言刑事法庭中大语言模型的过度对齐

Arthur Wuhrmann, Gaetan Stein, Daniel Brunner, Andrei Kucharavy

机构 * Swiss Federal Supreme Court(瑞士联邦最高法院) HES-SO Valais-Wallis(HES-SO瓦莱州-瓦利斯高等专业学院)

专题命中 评测与基准 :prompting(abstract);分类 cs.CL、cs.AI

AI总结 针对刑事法律场景中大语言模型因安全护栏导致拒绝响应(过度对齐)的问题,提出TF-RefusalBench基准,并评估提示工程与拒绝方向消融(abliteration)等缓解方法。

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30902 2026-07-01 q-bio.BM cs.CE cs.LG 新提交 57%

Structure-Regularized Interpretable TCR-Epitope Prediction

结构正则化的可解释TCR-表位预测

Jiarui Li, Zixiang Yin, Yunbei Zhang, Janet Wang, Samuel J. Landry, Zhengming Ding, Ramgopal R. Mettu

机构 * Department of Computer Science, Tulane University(杜兰大学计算机科学系) Department of Biochemistry and Molecular Biology, Tulane University School of Medicine(杜兰大学医学院生物化学与分子生物学系)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 提出TCR-SRIM模型,结合蛋白质语言模型嵌入与可解释接触原型,在TCR-XAI基准上实现最优预测性能和解释质量,并揭示生成结构对模型学习的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30686 2026-07-01 cs.RO cs.AI 新提交 57%

Position: Vision-Language-Action Models Cannot Be Verified to Perform Physical Reasoning

立场:视觉-语言-动作模型无法被验证执行物理推理

Taozhao Chen, Ian Manchester, Huaming Chen

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本文指出基于预训练视觉-语言模型的VLA系统在机器人操作基准上的性能提升无法区分语义匹配与物理泛化,现有评估指标不能验证物理推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27876 2026-07-01 cs.CV cs.AI 新提交 57%

SpatialUAV: Benchmarking Spatial Intelligence for Low-Altitude UAV Perception, Collaboration, and Motion

SpatialUAV:低空无人机感知、协作与运动的空间智能基准

Haoyu Zhang, Meng Liu, Qianlong Xiang, Kun Wang, Yaowei Wang, Liqiang Nie

机构 * IEEE

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出SpatialUAV基准,包含4331个实例和14种任务类型,评估低空无人机在语义判别、空间关系、多视角协作及运动理解等方面的空间智能,发现现有模型在跨视角关联、结构化定位、几何推理和时间理解上远逊于人类。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22678 2026-07-01 cs.SE cs.AI 新提交 57%

RigorBench: Benchmarking Engineering Process Discipline in Autonomous AI Coding Agents

RigorBench: 自主AI编码代理中工程过程纪律的基准测试

Meher Bhaskar Madiraju, Meher Sai Preetam Madiraju

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.AI

AI总结 提出RigorBench基准,通过五个维度评估AI编码代理的过程纪律,实验表明结构化过程纪律使过程质量提升41%,结果正确性提升17%。

Comments 9 pages, 7 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02863 2026-07-01 cs.AI 版本更新 57%

Don't Gamble, GAMBLe: An Analytical Framework for AI-Driven Research Systems

不要赌博,GAMBLe:AI驱动研究系统的分析框架

Marquita Ellis, Paul Castro

机构 * IBM Research(IBM研究院)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.AI

AI总结 提出GAMBLe框架,通过四个参数(生成器G、评估器A、发现机制M、预算B)和一个有效景观L_eff = A ∘ G分解AI驱动研究系统行为,实验表明组件选择可显著提升性能和搜索效率。

Comments Preprint. 23 pages (10 main, 13 appendix). 6 figures (2 in main, 4 in appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31785 2026-07-01 cs.CV 新提交 50%

Self-Supervised Temporal Regularization for Landmark-Based Cardiac Segmentation with Automatic AHA Regional Mapping

基于地标的心脏分割的自监督时间正则化与自动AHA区域映射

David Montalvo-García, Nicolás Gaggion, María J. Ledesma-Carbayo, Enzo Ferrante

机构 * Biomedical Image Technologies, ETSI Telecomunicación, Universidad Politécnica de Madrid, Madrid, Spain(生物医学图像技术,电信工程学院,马德里理工大学,马德里,西班牙) Centro de Investigación Biomédica en Red de Bioingeniería, Biomateriales y Nanomedicina (CIBER-BBN), Instituto de Salud Carlos III, Madrid, Spain(生物工程、生物材料和纳米医学网络生物医学研究中心(CIBER-BBN),卡洛斯三世健康研究所,马德里,西班牙) APOLO Biotech, Ciudad Autónoma de Buenos Aires, Argentina(APOLO Biotech,布宜诺斯艾利斯自治市,阿根廷) Departamento de Computación, Universidad de Buenos Aires, Ciudad Autónoma de Buenos Aires, Argentina(计算系,布宜诺斯艾利斯大学,布宜诺斯艾利斯自治市,阿根廷) Instituto de Ciencias de la Computación (ICC), CONICET-Universidad de Buenos Aires, Ciudad Autónoma de Buenos Aires, Argentina(计算机科学研究所(ICC),CONICET-布宜诺斯艾利斯大学,布宜诺斯艾利斯自治市,阿根廷)

专题命中 评测与基准 :post-training(abstract)

AI总结 提出自监督时间正则化方法,利用图像序列的时间一致性增强心脏分割和运动估计的连续性,并自动映射到AHA 17节段标准,在CAMUS数据集上验证了临床实用性。

Comments Accepted at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31488 2026-07-01 cs.CV 新提交 50%

DrivingDepth: Sparse-Prompted Pixel-wise Scale Correction for Driving Depth Estimation

DrivingDepth: 稀疏提示的像素级尺度校正用于驾驶深度估计

Chi Huang, Wenhao Zhang, Hang Yin, YuAn Wang, Hao Li, Bosheng Wang, Xun Sun, Liang Wang

机构 * Baidu Inc.(百度公司)

专题命中 评测与基准 :foundation model(abstract)

AI总结 针对自动驾驶深度估计中几何与尺度的冲突,提出DrivingDepth方法,利用稀疏LiDAR作为几何提示,通过残差像素级尺度校正校准冻结的深度基础模型,在保持密集视觉几何的同时实现度量精度与几何一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31388 2026-07-01 cs.CV 新提交 50%

One Video, One World: Turning Monocular Video into Physical 4D Scenes

一视频一世界:将单目视频转化为物理4D场景

Junhao Chen, Boran Zhang, Mingjin Chen, Henghaofan Zhang, Saining Zhang, Congcong Zhu, Hao Zhao, Ruqi Huang, Zhihao Li, Yufei Wang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) SparcAI Inc(SparcAI公司) University of Science and Technology of China(中国科学技术大学) The Hong Kong Polytechnic University(香港理工大学) University of Electronic Science and Technology of China(电子科技大学) Nanyang Technological University(南洋理工大学) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)

专题命中 评测与基准 :language model(abstract)

AI总结 提出OVOW,首个无需训练的系统,从单目视频重建实例级、可仿真的4D网格场景,通过视觉语言模型发现实例、类别感知重建、迭代优化恢复尺度与位姿、物理装配确保接触支撑,并建立结构化视频到4D评估基准。

Comments Accepted by ECCV 2026. Project Page: https://OneVideoOneWorld.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31382 2026-07-01 cs.RO 新提交 50%

Revisiting Parameter Redundancy in Vision-Language-Action Models: Insights from VLM-to-VLA Adaptation

重新审视视觉-语言-动作模型中的参数冗余:从VLM到VLA适配的见解

Fengnian Zhang, Tao Huang, Siyu Xu, Zhong Jin, Chang Xu

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) University of Chinese Academy of Sciences(中国科学院大学) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) School of Computer Science, The University of Sydney(悉尼大学计算机科学学院)

专题命中 评测与基准 :language model(abstract)

AI总结 通过分析VLM到VLA适配中参数差异的空间分布,设计多模块联合剪枝方案,在无需微调恢复的情况下减少12%-30%参数并保持约90%性能。

Comments 22 pages, 3 figures, ECCV 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31249 2026-07-01 cs.CV 新提交 50%

Rethinking the Role of Feature Engineering and Learning Strategies in Few-Shot Hidden Emotion Recognition

重新思考特征工程与学习策略在少样本隐藏情感识别中的作用

Xiaochuan Guo, Jihao Gu, Haixu Liu, Yuxin Liu, Qi Wang, Yufei Wang, Fei Wang, Kun Li, Dan Guo

机构 * Hefei University of Technology(合肥工业大学) University College London(伦敦大学学院) The University of Sydney(悉尼大学) Beijing QBoson Quantum Technology Co., Ltd.(北京量子芯光科技有限公司) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) Beihang University(北京航空航天大学) The University of New South Wales(新南威尔士大学) United Arab Emirates University(阿拉伯联合酋长国大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出跨注意力机制与多实例学习框架,利用多源特征(2D/3D骨架、面部Blendshapes、DINOv2/v3、X-CLIP、Gemini)解决长视频中弱稀疏隐式情感识别,在IJCAI挑战赛Track 3中获第一名。

详情

展开后加载摘要…

URL PDF HTML 收藏