arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1997 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 1997 篇

2601.13015 2026-01-21 cs.SE 50%

MeltRTL: Multi-Expert LLMs with Inference-time Intervention for RTL Code Generation

MeltRTL: 多专家LLMs结合推理时干预用于RTL代码生成

Nowfel Mashnoor, Mohammad Akyash, Hadi Kamali, Kimia Azar

专题命中 测试时计算 :reasoning(abstract)

AI总结 MeltRTL通过多专家注意力和推理时干预提升LLM生成RTL代码的准确性和效率,实现96%的可综合性和60%的功能正确性,无需微调模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04726 2026-01-21 cs.IR 50%

Hard Negative Sampling via Large Language Models for Recommendation

通过大型语言模型进行推荐系统中的困难负样本采样

Chu Zhao, Enneng Yang, Yuting Liu, Jianzhe Zhao, Guibing Guo

专题命中 测试时计算 :reasoning(abstract)

AI总结 本文提出HNLMRec,利用大型语言模型生成语义相关的困难负样本,以提升推荐系统的性能和泛化能力。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09350 2026-01-15 cs.CV 50%

See More, Store Less: Memory-Efficient Resolution for Video Moment Retrieval

看清更多,存储更少:视频时刻检索的内存高效解决方案

Mingyu Jeon, Sungjin Han, Jinkwon Hwang, Minchol Kwon, Jonghee Kim, Junyeong Kim

机构 * Department of Artificial Intelligence, Chung-Ang University(人工智能系, Chung-Ang 大学) Electronics and Telecommunications Research Institute (ETRI)(电子与电信研究院)

专题命中 测试时计算 :reasoning(abstract)

AI总结 SMORE通过查询引导的描述和自适应压缩技术,在视频时刻检索中实现高信息分辨率与内存效率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08408 2026-01-14 cs.CV cs.RO 50%

Edge-Optimized Multimodal Learning for UAV Video Understanding via BLIP-2

边缘优化的多模态学习用于无人机视频理解 via BLIP-2

Yizhan Feng, Hichem Snoussi, Jing Teng, Jian Liu, Yuyang Wang, Abel Cherouat, Tian Wang

专题命中 测试时计算 :reasoning(abstract)

AI总结 本文提出基于BLIP-2的轻量级多模态学习平台,通过集成YOLO模型实现无人机视频理解的高效处理与多任务适应。

Comments The Tenth International Conference on Data Mining and Big Data (DMBD'2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04674 2026-01-09 cs.IR 50%

PROMISE: Process Reward Models Unlock Test-Time Scaling Laws in Generative Recommendations

PROMISE: 过程奖励模型解锁生成推荐的测试时扩展定律

Chengcheng Guo, Kuo Cai, Yu Zhou, Qiang Luo, Ruiming Tang, Han Li, Kun Gai, Guorui Zhou

专题命中 测试时计算 :reasoning(abstract)

AI总结 PROMISE通过整合密集逐步验证和PRM引导的束搜索策略,解决生成推荐中的语义漂移问题,提升推荐准确性并实现高效部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22693 2026-01-01 cs.CV 50%

VADTree: Explainable Training-Free Video Anomaly Detection via Hierarchical Granularity-Aware Tree

VADTree: 通过分层粒度感知树实现可解释的无训练视频异常检测

Wenlong Li, Yifei Xu, Yuan Rao, Zhenhua Wang, Shuiguang Deng

机构 * School of Software, Xi’an Jiaotong University(西安交通大学软件学院) China Railway Xi’an Group(中国铁路西安集团) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 测试时计算 :reasoning(abstract)

AI总结 VADTree通过分层粒度感知树结构实现无训练视频异常检测,利用预训练模型知识和多维先验提升异常感知与推理能力。

Comments NeurIPS 2025 poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02262 2025-12-19 cs.CV 50%

From Frames to Clips: Training-free Adaptive Key Clip Selection for Long-Form Video Understanding

从帧到片段:训练免费的自适应关键片段选择用于长形式视频理解

Guangyu Sun, Archit Singhal, Burak Uzkent, Mubarak Shah, Chen Chen, Garin Kessler

机构 * Amazon(亚马逊公司) University of Central Florida(中央佛罗里达大学)

专题命中 测试时计算 :reasoning(abstract)

AI总结 F2C通过自适应关键片段选择提升长视频理解,比均匀采样在多个基准上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15512 2025-12-18 cs.CV cs.MM 50%

VAAS: Vision-Attention Anomaly Scoring for Image Manipulation Detection in Digital Forensics

VAAS:面向数字取证中图像篡改检测的视觉-注意力异常评分

Opeyemi Bamigbade, Mark Scanlon, John Sheppard

机构 * Forensics and Security Research Group, South East Technological University(法医与安全研究组,南东技术大学) Security Research Group, School of Computer Science, University College Dublin(安全研究组,计算机科学学院,都柏林大学学院)

专题命中 测试时计算 :reasoning(abstract)

AI总结 VAAS通过整合视觉注意力和片段一致性评分,提出一种双模块框架用于图像篡改检测,提升检测精度和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13276 2025-12-16 cs.CV 50%

CogniEdit: Dense Gradient Flow Optimization for Fine-Grained Image Editing

CogniEdit: 密集梯度流优化用于细粒度图像编辑

Yan Li, Lin Liu, Xiaopeng Zhang, Wei Xue, Wenhan Luo, Yike Guo, Qi Tian

机构 * Hongkong University of Science and Technology(香港科学与技术大学) Huawei Company(华为公司)

专题命中 测试时计算 :reasoning(abstract)

AI总结 CogniEdit通过密集梯度流优化实现细粒度图像编辑,结合多模态推理与动态令牌焦点重新定位,提升指令遵循与视觉质量的平衡

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12196 2025-12-16 cs.MM cs.CV cs.SD eess.AS 50%

AutoMV: An Automatic Multi-Agent System for Music Video Generation

AutoMV: 一种自动多智能体系统用于音乐视频生成

Xiaoxuan Tang, Xinping Lei, Chaoran Zhu, Shiyun Chen, Ruibin Yuan, Yizhi Li, Changjae Oh, Ge Zhang, Wenhao Huang, Emmanouil Benetos, Yang Liu, Jiaheng Liu, Yinghao Ma

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanjing University(南京大学) Queen Mary University of London(伦敦大学女王学院) Hong Kong University of Science and Technology(香港科技大学) University of Manchester(曼彻斯特大学)

专题命中 测试时计算 :verifier(abstract)

AI总结 AutoMV通过多智能体协作生成完整音乐视频,优于现有方法并接近专业水准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07299 2025-12-15 cs.CV 50%

VADER: Towards Causal Video Anomaly Understanding with Relation-Aware Large Language Models

VADER:基于关系感知大型语言模型的因果视频异常理解

Ying Cheng, Yu-Ho Lin, Min-Hung Chen, Fu-En Yang, Shang-Hong Lai

机构 * National Tsing Hua University(清华大学) NVIDIA

专题命中 测试时计算 :reasoning(abstract)

AI总结 VADER通过整合关系感知的大型语言模型与视频关键帧特征,提升视频异常的因果理解与解释能力。

Comments Accepted to WACV 2026. Project page available at: https://vader-vau.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08079 2025-12-10 cs.IR 50%

Leveraging Machine Learning and Large Language Models for Automated Image Clustering and Description in Legal Discovery

利用机器学习和大语言模型实现法律发现中的自动化图像聚类与描述

Qiang Mao, Fusheng Wei, Robert Neary, Charles Wang, Han Qin, Jianping Zhang, Nathaniel Huber-Fliflet

专题命中 测试时计算 :chain-of-thought(abstract)

AI总结 本文提出利用机器学习和大语言模型实现法律发现中自动化图像聚类与描述,通过比较不同采样策略、提示技术和生成方法,提升大规模图像数据处理的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06017 2025-12-09 cs.RO eess.IV 50%

Training-Free Robot Pose Estimation using Off-the-Shelf Foundational Models

无需训练的机器人姿态估计使用现成的基础模型

Laurence Liang

机构 * McGill University(麦吉尔大学)

专题命中 测试时计算 :verifier(abstract)

AI总结 本文提出利用现成的基础模型无需训练即可估计机器人关节角度,通过实验验证了模型性能基准及测试扩展对预测效果的影响。

Comments Accepted at CVIS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20390 2025-11-26 cs.CV 50%

FREE: Uncertainty-Aware Autoregression for Parallel Diffusion Transformers

FREE: 用于并行扩散变换器的不确定性感知自回归

Xinwan Wen, Bowen Li, Jiajun Luo, Ye Li, Zhi Wang

机构 * Tsinghua University(清华大学)

专题命中 测试时计算 :verifier(abstract)

AI总结 FREE通过引入不确定性感知的自回归方法,在并行扩散变换器中实现高效的无损加速,提升去噪效率的同时保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16951 2025-11-24 cs.CV 50%

FingerCap: Fine-grained Finger-level Hand Motion Captioning

FingerCap:细粒度指尖级手部动作描述

Xin Shen, Rui Zhu, Lei Shen, Xinyu Wang, Kaihao Zhang, Tianqing Zhu, Shuchen Wu, Chenxi Miao, Weikang Li, Yang Li, Deguo Xia, Jizhou Huang, Xin Yu

机构 * Baidu Inc.(百度公司) The University of Queensland(昆士兰大学) Nanjing University(南京大学) Institute of Computing Technology, CAS(中国科学院计算技术研究所) Peking University(北京大学) Australian National University(澳大利亚国立大学) City University of Macau(澳门城市大学)

专题命中 测试时计算 :reasoning(abstract)

AI总结 FingerCap通过FiGOP技术提升细粒度手部动作描述的准确性,解决视频大语言模型在指尖运动识别中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10648 2025-11-14 cs.CV 50%

Enhancing the Outcome Reward-based RL Training of MLLMs with Self-Consistency Sampling

Jiahao Wang, Weiye Xu, Aijun Yang, Wengang Zhou, Lewei Lu, Houqiang Li, Xiaohua Wang, Jinguo Zhu

机构 * Xi’an Jiaotong University(西安交通大学) University of Science and Technology of China(中国科学技术大学) SenseTime Research(商汤科技研究院)

专题命中 测试时计算 :reasoning(abstract)

Comments Accepted to NeurIPS 2025 (The Thirty-Ninth Annual Conference on Neural Information Processing Systems)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17714 2025-11-11 cs.CV 50%

F2RVLM: Boosting Fine-grained Fragment Retrieval for Multi-Modal Long-form Dialogue with Vision Language Model

Hanbo Bi, Zhiqiang Yuan, Zexi Jia, Jiapei Zhang, Chongyang Li, Peixiang Luo, Ying Deng, Xiaoyue Duan, Jinchao Zhang

专题命中 测试时计算 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01423 2025-11-04 cs.SE 50%

LLM-Assisted Tool for Joint Generation of Formulas and Functions in Rule-Based Verification of Map Transformations

Ruidi He, Yu Zhang, Meng Zhang, Andreas Rausch

专题命中 测试时计算 :verifier(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01208 2025-11-04 cs.IR 50%

Contextual Relevance and Adaptive Sampling for LLM-Based Document Reranking

Jerry Huang, Siddarth Madala, Cheng Niu, Julia Hockenmaier, Tong Zhang

专题命中 测试时计算 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14624 2025-10-17 cs.CV 50%

Efficient Video Sampling: Pruning Temporally Redundant Tokens for Faster VLM Inference

Natan Bagrov, Eugene Khvedchenia, Borys Tymchenko, Shay Aharon, Lior Kadoch, Tomer Keren, Ofri Masad, Yonatan Geifman, Ran Zilberstein, Tuomas Rintamaki, Matthieu Le, Andrew Tao

机构 * NVIDIA

专题命中 测试时计算 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11070 2025-10-17 cs.CV 50%

Falcon: A Remote Sensing Vision-Language Foundation Model (Technical Report)

Kelu Yao, Nuo Xu, Rong Yang, Yingying Xu, Zhuoyan Gao, Titinunt Kitrungrotsakul, Yi Ren, Pu Zhang, Jin Wang, Ning Wei, Chao Li

机构 * Research Center for Space Computing System, ZhejiangLab, Hangzhou, China(空间计算系统研究中心,浙江实验室,杭州,中国)

专题命中 测试时计算 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09274 2025-10-13 cs.CV 50%

MomentSeg: Moment-Centric Sampling for Enhanced Video Pixel Understanding

Ming Dai, Sen Yang, Boqiang Duan, Wankou Yang, Jingdong Wang

机构 * Southeast University(东南大学) Baidu VIS(百度视觉)

专题命中 测试时计算 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04041 2025-10-07 cs.RO 50%

SITCOM: Scaling Inference-Time COMpute for VLAs

Ayudh Saxena, Harsh Shah, Sandeep Routray, Rishi Rajesh Shah, Esha Pahwa

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 测试时计算 :planning(abstract)

Comments Accepted at the NeurIPS 2025 Workshop on Space in Vision, Language, and Embodied AI (SpaVLE). *Equal contribution

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04130 2025-09-24 cs.CV 50%

STORM: Token-Efficient Long Video Understanding for Multimodal LLMs

Jindong Jiang, Xiuyu Li, Zhijian Liu, Muyang Li, Guo Chen, Zhiqi Li, De-An Huang, Guilin Liu, Zhiding Yu, Kurt Keutzer, Sungjin Ahn, Jan Kautz, Hongxu Yin, Yao Lu, Song Han, Wonmin Byeon

机构 * NVIDIA(英伟达) Rutgers University(罗格斯大学) UC Berkeley(加州大学伯克利分校) MIT(麻省理工学院) Nanjing University(南京大学) KAIST(韩国科学技术院)

专题命中 测试时计算 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17522 2025-09-23 cs.CV 50%

Chat-CBM: Towards Interactive Concept Bottleneck Models with Frozen Large Language Models

Hangzhou He, Lei Zhu, Kaiwen Li, Xinliang Zhang, Jiakui Hu, Ourui Fu, Zhengjian Yao, Yanye Lu

机构 * Department of Biomedical Engineering, College of Future Technology, Peking University(生物医学工程系,未来技术学院,北京大学) Institute of Medical Technology, Peking University Health Science Center, Peking University(医学技术研究所,北京大学医学部,北京大学) National Biomedical Imaging Center, College of Future Technology, Peking University(国家生物医学成像中心,未来技术学院,北京大学)

专题命中 测试时计算 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11238 2025-09-16 cs.SE 50%

UserTrace: User-Level Requirements Generation and Traceability Recovery from Software Project Repositories

Dongming Jin, Zhi Jin, Yiran Zhang, Zheng Fang, Linyu Li, Yuanpeng He, Xiaohong Chen, Weisong Sun

专题命中 测试时计算 :verifier(abstract)

Comments 21page, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09263 2025-09-12 cs.CV 50%

DATE: Dynamic Absolute Time Enhancement for Long Video Understanding

Chao Yuan, Yang Yang, Yehui Yang, Zach Cheng

机构 * Beihang University(北京航空航天大学) Dcar, ByteDance(字节跳动Dcar部门) Qfin Holdings,Inc(Qfin控股公司) MAIS, Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院)

专题命中 测试时计算 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19903 2025-08-05 cs.CV 50%

Scaling Vision Pre-Training to 4K Resolution

Baifeng Shi, Boyi Li, Han Cai, Yao Lu, Sifei Liu, Marco Pavone, Jan Kautz, Song Han, Trevor Darrell, Pavlo Molchanov, Hongxu Yin

机构 * UC Berkeley(加州大学伯克利分校) NVIDIA(英伟达)

专题命中 测试时计算 :test-time compute(abstract)

Comments CVPR 2025. Project Page: https://nvlabs.github.io/PS3

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14641 2025-07-28 cs.SE cs.SY eess.SY 50%

HLSTester: Efficient Testing of Behavioral Discrepancies with LLMs for High-Level Synthesis

Kangwei Xu, Bing Li, Grace Li Zhang, Ulf Schlichtmann

专题命中 测试时计算 :reasoning(abstract)

Comments arXiv admin note: text overlap with arXiv:2407.03889

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04501 2025-06-06 cs.CV 50%

AuthGuard: Generalizable Deepfake Detection via Language Guidance

Guangyu Shen, Zhihua Li, Xiang Xu, Tianchen Zhao, Zheng Zhang, Dongsheng An, Zhuowen Tu, Yifan Xing, Qin Zhang

机构 * Purdue University(普渡大学) AWS AI Labs(AWS人工智能实验室)

专题命中 测试时计算 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏