arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1997 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 1997 篇

2605.05501 2026-05-08 cs.CR 50%

SOCpilot: Verifying Policy Compliance for LLM-Assisted Incident Response

SOCpilot: 验证LLM辅助事件响应中的政策合规性

Sidnei Barbieri, Leonardo Vaz de Meneses, Ágney Lopes Roth Ferraz, Lourenço Alves Pereira Júnior

专题命中 测试时计算 :verifier(abstract)

AI总结 SOCpilot通过固定事件包、行动目录、政策规则和验证器,验证LLM辅助事件响应计划的合规性,评估两个LLM提供商在金融行业案例中的表现,去除非合规动作并提供零成本准备检查。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01662 2026-05-05 cs.CV 50%

Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models

视频主动感知:基于视觉-语言模型的高效推理时长视频理解

Martin Q. Ma, Willis Guo, Aditya Agrawal, Ankit Gupta, Paul Pu Liang, Ruslan Salakhutdinov, Louis-Philippe Morency

机构 * Carnegie Mellon University(卡内基梅隆大学) MIT(麻省理工学院)

专题命中 测试时计算 :reasoning(abstract)

AI总结 本文提出视频主动感知方法,通过主动感知理论提升长视频问答性能,实现帧效率提升5.6倍,优于现有模型。

Comments ICCV 2025 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26974 2026-05-01 cs.CR cs.ET 50%

C8s: A Confidential Kubernetes Architecture

C8s:一种保密的Kubernetes架构

Amean Asad, Patrick McClurg, João Andrade

专题命中 测试时计算 :verifier(abstract)

AI总结 C8s为Kubernetes提供加密保密性,完整性和可验证性保障,利用硬件可信执行环境实现可信边界,使数据所有者、计算提供者和终端用户获得传统部署无法实现的保障。

Comments 47 pages, 21 figures. Whitepaper from Confidential.ai

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17187 2026-04-21 cs.SE 50%

React-ing to Grace Hopper 200: Five Open-Weights Coding Models, One React Native App, One GH200, One Weekend

回应格蕾丝·霍普200周年:五个开源权重编码模型,一个React Native应用,一个GH200,一个周末

Alex Potanin

专题命中 测试时计算 :reasoning(abstract)

AI总结 评估五个最先进的开源权重编码语言模型在生成React Native应用任务中的表现,发现Kimi-K2.5在3位量化下表现最佳,揭示了部署中的新发现及硬件层级结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14820 2026-04-17 cs.SE 50%

SWE-TRACE: Optimizing Long-Horizon SWE Agents Through Rubric Process Reward Models and Heuristic Test-Time Scaling

SWE-TRACE:通过规则过程奖励模型和启发式测试时间缩放优化长 horizon SWE代理

Hao Han, Jin Xie, Xuehao Ma, Weiquan Zhu, Ziyao Zhang, ZhiLiang Long, Hongkai Chen, Qingwen Ye

专题命中 测试时计算 :reasoning(abstract)

AI总结 本文提出SWE-TRACE框架,通过优化数据收集、强化学习和测试时间推理,提升SWE代理的长horizon推理能力,减少token消耗和推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15602 2026-04-17 cs.CV 50%

TennisTV: Do Multimodal Large Language Models Understand Tennis Rallies?

TennisTV: 多模态大语言模型能否理解网球发球?

Zhongyuan Bao, Lejun Zhang

机构 * New York University(纽约大学) Tandon School of Engineering(坦顿工程学院) Shanghai, China(上海,中国) New York, USA(纽约,美国)

专题命中 测试时计算 :reasoning(abstract)

AI总结 TennisTV是首个全面评估网球视频理解的基准,通过模拟发球过程中的连续击球事件,评估17种大语言模型在网球视频理解中的表现,发现帧采样密度需平衡且需提升时间定位能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13403 2026-04-16 cs.CV 50%

Why Multimodal In-Context Learning Lags Behind? Unveiling the Inner Mechanisms and Bottlenecks

为何多模态上下文学习滞后?揭示内部机制和瓶颈

Yu Wang, Sharon Li

机构 * Department of Computer Sciences, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机科学系)

专题命中 测试时计算 :reasoning(abstract)

AI总结 本文分析了多模态上下文学习在零样本设置中表现与少样本演示下退化的原因,揭示了模型在视觉与文本表示对齐和任务映射转移方面的不足,并提出改进方法。

Comments ACL Main 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07251 2026-04-14 cs.HC 50%

MeepleLM: A Virtual Playtester Simulating Diverse Subjective Experiences

MeepleLM:一种模拟多样化主观体验的虚拟玩家测试者

Zizhen Li, Chuanhao Li, Yibin Wang, Yukang Feng, Jianwen Sun, Jiaxin Ai, Fanrui Zhang, Mingzhu Sun, Yifei Huang, Kaipeng Zhang

专题命中 测试时计算 :reasoning(abstract)

AI总结 本文提出MeepleLM,通过整合规则书和玩家反馈数据,模拟多样化玩家体验,提升棋盘游戏设计的协作效率与批判性。

Comments ACL 2026 MainConference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06849 2026-04-09 cs.CV 50%

Vision-Language Model-Guided Deep Unrolling Enables Personalized, Fast MRI

基于视觉-语言模型的深度展开实现个性化快速MRI

Fangmao Ju, Yuzhu He, Zhiwen Xue, Chunfeng Lian, Jianhua Ma

专题命中 测试时计算 :reasoning(abstract)

AI总结 本文提出PASS框架,利用视觉-语言模型指导深度展开网络,实现任务导向的快速成像,通过动态个性化成像流程提升MRI图像质量及诊断性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19433 2026-04-09 cs.CV 50%

dMLLM-TTS: Self-Verified and Efficient Test-Time Scaling for Diffusion Multi-Modal Large Language Models

dMLLM-TTS:用于扩散多模态大语言模型的自验证和高效测试时间扩展

Yi Xin, Siqi Luo, Tianxiang Xu, Qi Qin, Haoxing Chen, Kaiwen Zhu, Zhiwei Zhang, Yangfan He, Rongchao Zhang, Jinbin Bai, Shuo Cao, Bin Fu, Junjun He, Yihao Liu, Yuewen Cao, Xiaohong Liu

机构 * Nanjing University(南京大学) Shanghai Innovation Institute(上海创新研究院) Shanghai AI Lab(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) National University of Singapore(新加坡国立大学)

专题命中 测试时计算 :verifier(abstract)

AI总结 本文提出dMLLM-TTS框架,通过轨迹探索扩展和迭代细化扩展两个互补的扩展轴,提升生成多样性和稳定性,同时通过自验证机制提高效率,实验表明在GenEval基准上生成质量显著提升且效率提高6倍。

Comments Project page: https://github.com/Alpha-VLLM/Lumina-DiMOO

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18740 2026-04-08 cs.IR 50%

Multimodal Large Language Models with Adaptive Preference Optimization for Sequential Recommendation

具有自适应偏好优化的多模态大语言模型用于序列推荐

Yu Wang, Yonghui Yang, Le Wu, Yi Zhang, Fei Liu, Richang Hong

专题命中 测试时计算 :reasoning(abstract)

AI总结 本文提出HaNoRec框架,通过自适应偏好优化解决多模态序列推荐中的样本不平衡和跨模态语义偏差问题,提升推荐性能。

Comments Accepted by SIGIR 2026 (Full Paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02761 2026-04-06 cs.SE 50%

Sustainability Analysis of Prompt Strategies for SLM-based Automated Test Generation

基于SLM的自动化测试生成提示策略可持续性分析

Pragati Kumari, Novarun Deb

专题命中 测试时计算 :reasoning(abstract)

AI总结 本文研究了基于小语言模型的自动化测试生成中提示策略对计算和环境可持续性的影响,通过实验评估七种策略,发现策略选择对可持续性指标有显著影响,简单策略更环保。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29301 2026-04-01 cs.CV 50%

Self-Consistency for LLM-Based Motion Trajectory Generation and Verification

基于大语言模型的运动轨迹生成与验证的自一致性

Jiaju Ma, R. Kenny Jones, Jiajun Wu, Maneesh Agrawala

机构 * Stanford University(斯坦福大学)

专题命中 测试时计算 :reasoning(abstract)

AI总结 本文提出利用自一致性技术提升大语言模型生成运动轨迹的准确性,通过聚类和几何变换实现轨迹的一致性验证,提升生成精度4-6%并验证精度11%。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19610 2026-03-24 cs.CV 50%

ParallelVLM: Lossless Video-LLM Acceleration with Visual Alignment Aware Parallel Speculative Decoding

ParallelVLM: 无损视频-大语言模型加速与视觉对齐感知并行推测解码

Quan Kong, Yuhao Shen, Yicheng Ji, Huan Li, Cong Wang

机构 * Zhejiang University(浙江大学)

专题命中 测试时计算 :verifier(abstract)

AI总结 ParallelVLM通过并行化阶段和无偏验证器引导剪枝策略,有效提升视频理解任务的解码效率,实现3.36倍的加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19863 2026-03-23 cs.CV 50%

MedQ-Engine: A Closed-Loop Data Engine for Evolving MLLMs in Medical Image Quality Assessment

MedQ-Engine:一种用于医疗图像质量评估中进化多模态大语言模型的闭环数据引擎

Jiyao Liu, Junzhi Ning, Wanying Qu, Lihao Liu, Chenglong Ma, Junjun He, Ningsheng Xu

机构 * Fudan University, Shanghai, China(复旦大学,上海,中国) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国)

专题命中 测试时计算 :reasoning(abstract)

AI总结 本文提出MedQ-Engine,通过闭环数据引擎迭代评估模型,发现失败原型,利用人类在循环注释提升模型性能,使8B参数模型在医疗图像质量评估中超越GPT-4o 13%并接近人类专家水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19364 2026-03-23 cs.CV 50%

AURORA: Adaptive Unified Representation for Robust Ultrasound Analysis

AURORA:适应性统一表示用于鲁棒超声分析

Ufaq Khan, L. D. M. S. Sai Teja, Ayuba Shakiru, Mai A. Shaaban, Yutong Xie, Muhammad Bilal, Muhammad Haris Khan

机构 * MBZUAI NIT Silchar(Silchar国立理工学院) Birmingham City University(伯明翰城市大学)

专题命中 测试时计算 :reasoning(abstract)

AI总结 本文提出基于Transformer视觉编码器的统一多任务框架,解决超声图像在不同设备、操作者和解剖目标下的泛化问题,通过轻量级多尺度特征金字塔实现像素级预测与全局推理,提升多任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18850 2026-03-20 cs.CV 50%

HORNet: Task-Guided Frame Selection for Video Question Answering with Vision-Language Models

HORNet:基于任务引导的帧选择用于视觉语言模型的视频问答

Xiangyu Bai, Bishoy Galoaa, Sarah Ostadabbas

机构 * Northeastern University(东北大学)

专题命中 测试时计算 :reasoning(abstract)

AI总结 HORNet通过轻量级策略优化,显著减少视频输入帧数和VLM处理时间,同时提升问答质量与时间推理任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16600 2026-03-19 cs.CV 50%

Rationale Matters: Learning Transferable Rubrics via Proxy-Guided Critique for VLM Reward Models

原因至关重要:通过代理引导的批评学习可转移的评分标准用于视觉语言模型奖励模型

Weijie Qiu, Dai Guan, Junxin Wang, Zhihang Li, Yongbo Gai, Mengyu Zhou, Erchao Zhao, Xiaoxi Jiang, Guanjun Jiang

机构 * Qwen Large Model Application Team, Alibaba(阿里云大模型应用团队) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 测试时计算 :verifier(abstract)

AI总结 本文提出Proxy-GRM,通过代理引导的评分标准验证提升视觉语言模型奖励模型的评分质量,利用轻量级代理代理进行评分标准验证,实现评分标准的可转移性和一致性,实验表明其在多个基准测试中表现优异。

Comments 25 pages, 10 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14633 2026-03-17 cs.CR cs.PF 50%

When Scanners Lie: Evaluator Instability in LLM Red-Teaming

当扫描器撒谎:在LLM红队测试中的评估者不稳定性

Lidor Erez, Omer Hofman, Tamir Nizri, Roman Vainshtein

专题命中 测试时计算 :verifier(abstract)

AI总结 本文研究了LLM安全评估中评估者不稳定性问题,提出了一种可靠性意识的评估框架,通过量化评估者分歧和验证方法提升评估准确性,发现22个攻击类别存在评估不稳定现象,使评估准确率从72%提升至89%。

Comments Submitted to the EvalEval Workshop at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11423 2026-03-13 cs.CV 50%

Beyond Single-Sample: Reliable Multi-Sample Distillation for Video Understanding

超越单样本:面向视频理解的可靠多样本蒸馏

Songlin Li, Xin Zhu, Zechao Guan, Peipeng Chen, Jian Yao

机构 * University of Electronic Science and Technology of China & Robotics Center(电子科技大学 & 机器人中心)

专题命中 测试时计算 :reasoning(abstract)

AI总结 本文提出R-MSD方法,通过任务自适应教师池和对抗蒸馏目标提升视频理解任务的蒸馏稳定性,实验显示在多个基准上优于单样本蒸馏方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11397 2026-03-13 cs.SD 50%

Edge-Cloud Collaborative Speech Emotion Captioning via Token-Level Speculative Decoding in Audio-Language Models

边缘-云协同语音情绪描述 via 令牌级推测解码在音频-语言模型中

Xiangyuan Xue, Jiajun Lu, Yan Gao, Gongping Huang, Ting Dang, Hong Jia

专题命中 测试时计算 :verifier(abstract)

AI总结 本文提出基于不确定性引导推测解码的边缘-云协同框架,通过轻量级边缘模型和云验证器的协同,提升语音情绪描述的准确率和效率,同时降低延迟和隐私风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03400 2026-03-13 cs.RO 50%

GUIDES: Guidance Using Instructor-Distilled Embeddings for Pre-trained Robot Policy Enhancement

GUIDES: 利用教师蒸馏嵌入进行预训练机器人策略增强

Minquan Gao, Xinyi Li, Qing Yan, Xiaojian Sun, Xiaopan Zhang, Chien-Ming Huang, Jiachen Li

机构 * University of California, Riverside(加州大学河滨分校) Johns Hopkins University(约翰霍普金斯大学)

专题命中 测试时计算 :reasoning(abstract)

AI总结 GUIDES通过教师蒸馏嵌入提升预训练机器人策略,实现语义增强与高效升级

Comments IEEE International Conference on Robotics and Automation (ICRA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02754 2026-03-04 cs.CV 50%

Seeing Clearly without Training: Mitigating Hallucinations in Multimodal LLMs for Remote Sensing

无需训练即可清晰感知:减轻多模态大语言模型在遥感中的幻觉

Yi Liu, Jing Zhang, Di Wang, Xiaoyu Tian, Haonan Guo, Bo Du

机构 * School of Computer Science, Wuhan University, China(武汉大学计算机学院) Zhongguancun Academy, China(中关村学院) School of Computer Science, Chongqing University, China(重庆大学计算机学院)

专题命中 测试时计算 :reasoning(abstract)

AI总结 RADAR通过利用多模态大语言模型的内在注意力,无需训练即可减少遥感视觉问答中的事实性和逻辑性幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14948 2026-03-04 cs.SE 50%

Learning to Solve and Verify: A Self-Play Framework for Code and Test Generation

学习解决与验证:一种用于代码和测试生成的自博弈框架

Zi Lin, Sheng Shen, Ilia Kulikov, Jingbo Shang, Jason Weston, Yixin Nie

专题命中 测试时计算 :verifier(abstract)

AI总结 本研究提出Sol-Ver框架,通过自博弈方式提升代码和测试生成能力,无需人工标注或大模型,实现代码生成和测试生成的性能提升。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22932 2026-02-27 cs.CV 50%

MSJoE: Jointly Evolving MLLM and Sampler for Efficient Long-Form Video Understanding

MSJoE:联合进化多模态大语言模型与采样器以实现高效的长视频理解

Wenhui Tan, Xiaoyi Yu, Jiaze Li, Yijing Chen, Jianzhong Ju, Zhenbo Luo, Ruihua Song, Jian Luan

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) Tongji University(同济大学) MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus)

专题命中 测试时计算 :reasoning(abstract)

AI总结 MSJoE通过联合进化多模态大语言模型与轻量级采样器,提升长视频理解效率,实验表明其在多个基准测试中表现优异。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13667 2026-02-26 cs.RO 50%

Adaptive Diffusion Constrained Sampling for Bimanual Robot Manipulation

自适应扩散约束采样用于双臂机器人操作

Haolei Tong, Yuezhe Zhang, Sophie Lueth, Georgia Chalvatzaki

机构 * TU Darmstadt(图宾根大学) Robotics Institute Germany(德国机器人研究所)

专题命中 测试时计算 :planning(abstract)

AI总结 本文提出自适应扩散约束采样方法,通过整合等式和不等式约束,提升双臂机器人操作的样本多样性和泛化能力。

Comments Accepted by IEEE International Conference on Robotics and Automation 2026(ICRA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20799 2026-02-25 cs.SE 50%

Unseen-Codebases-Domain Data Synthesis and Training Based on Code Graphs

基于代码图的未见代码库数据合成与训练

Guangsheng Ou, Qiming Zhang, Sirong Chen, Anji Li, Dong Xu, Tiancheng Luo, Dekun Dai, Cuiyun Gao, Long Wang, Jun Zhou, Mingwei Liu, Zibin Zheng

专题命中 测试时计算 :reasoning(abstract)

AI总结 提出UCD-Training框架,通过代码图构建和两阶段训练,提升模型对未见代码库的推理能力和数据合成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10522 2026-02-12 cs.SE 50%

Consistency Meets Verification: Enhancing Test Generation Quality in Large Language Models Without Ground-Truth Solutions

一致性与验证:在没有真实解决方案的情况下提升大型语言模型的测试生成质量

Hamed Taherkhani, Alireza DaghighFarsoodeh, Mohammad Chowdhury, Hung Viet Pham, Hadi Hemmati

专题命中 测试时计算 :reasoning(abstract)

AI总结 ConVerTest通过自我一致性、验证链和双执行协议,在无需真实解决方案的情况下提升大型语言模型的测试生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03589 2026-02-04 cs.CV 50%

SlowFocus: Enhancing Fine-grained Temporal Understanding in Video LLM

SlowFocus: 提升视频大语言模型中的细粒度时间理解

Ming Nie, Dan Ding, Chunwei Wang, Yuanfan Guo, Jianhua Han, Hang Xu, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Noah’s Ark Lab, Huawei(华为诺亚实验室) Yinwang Intelligent Technology Co., Ltd.(亿万象智能科技有限公司)

专题命中 测试时计算 :reasoning(abstract)

AI总结 SlowFocus通过提升等效采样频率和引入多频率混合注意力模块,提升视频大语言模型对细粒度时间理解的能力。

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02767 2026-02-02 cs.CV 50%

Dynamic Reflections: Probing Video Representations with Text Alignment

动态反射:通过文本对齐探测视频表示

Tyler Zhu, Tengda Han, Leonidas Guibas, Viorica Pătrăucean, Maks Ovsjanikov

机构 * Princeton University(普林斯顿大学) Google DeepMind(谷歌DeepMind)

专题命中 测试时计算 :reasoning(abstract)

AI总结 本研究通过视频-文本表示对齐探索现代视频和语言编码器的能力,揭示了跨模态对齐与数据丰富性、语义对齐与性能相关性以及时间推理与对齐的关系。

Comments To appear at ICLR 2026. 27 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏