SOCpilot: Verifying Policy Compliance for LLM-Assisted Incident Response
SOCpilot: 验证LLM辅助事件响应中的政策合规性
专题命中 测试时计算 :verifier(abstract)
AI总结 SOCpilot通过固定事件包、行动目录、政策规则和验证器,验证LLM辅助事件响应计划的合规性,评估两个LLM提供商在金融行业案例中的表现,去除非合规动作并提供零成本准备检查。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
SOCpilot: 验证LLM辅助事件响应中的政策合规性
专题命中 测试时计算 :verifier(abstract)
AI总结 SOCpilot通过固定事件包、行动目录、政策规则和验证器,验证LLM辅助事件响应计划的合规性,评估两个LLM提供商在金融行业案例中的表现,去除非合规动作并提供零成本准备检查。
视频主动感知:基于视觉-语言模型的高效推理时长视频理解
机构 * Carnegie Mellon University(卡内基梅隆大学) ; MIT(麻省理工学院)
专题命中 测试时计算 :reasoning(abstract)
AI总结 本文提出视频主动感知方法,通过主动感知理论提升长视频问答性能,实现帧效率提升5.6倍,优于现有模型。
Comments ICCV 2025 workshop
C8s:一种保密的Kubernetes架构
专题命中 测试时计算 :verifier(abstract)
AI总结 C8s为Kubernetes提供加密保密性,完整性和可验证性保障,利用硬件可信执行环境实现可信边界,使数据所有者、计算提供者和终端用户获得传统部署无法实现的保障。
Comments 47 pages, 21 figures. Whitepaper from Confidential.ai
回应格蕾丝·霍普200周年:五个开源权重编码模型,一个React Native应用,一个GH200,一个周末
专题命中 测试时计算 :reasoning(abstract)
AI总结 评估五个最先进的开源权重编码语言模型在生成React Native应用任务中的表现,发现Kimi-K2.5在3位量化下表现最佳,揭示了部署中的新发现及硬件层级结构。
SWE-TRACE:通过规则过程奖励模型和启发式测试时间缩放优化长 horizon SWE代理
专题命中 测试时计算 :reasoning(abstract)
AI总结 本文提出SWE-TRACE框架,通过优化数据收集、强化学习和测试时间推理,提升SWE代理的长horizon推理能力,减少token消耗和推理延迟。
TennisTV: 多模态大语言模型能否理解网球发球?
机构 * New York University(纽约大学) ; Tandon School of Engineering(坦顿工程学院) ; Shanghai, China(上海,中国) ; New York, USA(纽约,美国)
专题命中 测试时计算 :reasoning(abstract)
AI总结 TennisTV是首个全面评估网球视频理解的基准,通过模拟发球过程中的连续击球事件,评估17种大语言模型在网球视频理解中的表现,发现帧采样密度需平衡且需提升时间定位能力。
为何多模态上下文学习滞后?揭示内部机制和瓶颈
机构 * Department of Computer Sciences, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机科学系)
专题命中 测试时计算 :reasoning(abstract)
AI总结 本文分析了多模态上下文学习在零样本设置中表现与少样本演示下退化的原因,揭示了模型在视觉与文本表示对齐和任务映射转移方面的不足,并提出改进方法。
Comments ACL Main 2026
MeepleLM:一种模拟多样化主观体验的虚拟玩家测试者
专题命中 测试时计算 :reasoning(abstract)
AI总结 本文提出MeepleLM,通过整合规则书和玩家反馈数据,模拟多样化玩家体验,提升棋盘游戏设计的协作效率与批判性。
Comments ACL 2026 MainConference
基于视觉-语言模型的深度展开实现个性化快速MRI
专题命中 测试时计算 :reasoning(abstract)
AI总结 本文提出PASS框架,利用视觉-语言模型指导深度展开网络,实现任务导向的快速成像,通过动态个性化成像流程提升MRI图像质量及诊断性能。
dMLLM-TTS:用于扩散多模态大语言模型的自验证和高效测试时间扩展
机构 * Nanjing University(南京大学) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai AI Lab(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学) ; Peking University(北京大学) ; National University of Singapore(新加坡国立大学)
专题命中 测试时计算 :verifier(abstract)
AI总结 本文提出dMLLM-TTS框架,通过轨迹探索扩展和迭代细化扩展两个互补的扩展轴,提升生成多样性和稳定性,同时通过自验证机制提高效率,实验表明在GenEval基准上生成质量显著提升且效率提高6倍。
Comments Project page: https://github.com/Alpha-VLLM/Lumina-DiMOO
具有自适应偏好优化的多模态大语言模型用于序列推荐
专题命中 测试时计算 :reasoning(abstract)
AI总结 本文提出HaNoRec框架,通过自适应偏好优化解决多模态序列推荐中的样本不平衡和跨模态语义偏差问题,提升推荐性能。
Comments Accepted by SIGIR 2026 (Full Paper)
基于SLM的自动化测试生成提示策略可持续性分析
专题命中 测试时计算 :reasoning(abstract)
AI总结 本文研究了基于小语言模型的自动化测试生成中提示策略对计算和环境可持续性的影响,通过实验评估七种策略,发现策略选择对可持续性指标有显著影响,简单策略更环保。
Comments 11 pages
基于大语言模型的运动轨迹生成与验证的自一致性
机构 * Stanford University(斯坦福大学)
专题命中 测试时计算 :reasoning(abstract)
AI总结 本文提出利用自一致性技术提升大语言模型生成运动轨迹的准确性,通过聚类和几何变换实现轨迹的一致性验证,提升生成精度4-6%并验证精度11%。
Comments Accepted to CVPR 2026
ParallelVLM: 无损视频-大语言模型加速与视觉对齐感知并行推测解码
机构 * Zhejiang University(浙江大学)
专题命中 测试时计算 :verifier(abstract)
AI总结 ParallelVLM通过并行化阶段和无偏验证器引导剪枝策略,有效提升视频理解任务的解码效率,实现3.36倍的加速效果。
MedQ-Engine:一种用于医疗图像质量评估中进化多模态大语言模型的闭环数据引擎
机构 * Fudan University, Shanghai, China(复旦大学,上海,中国) ; Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国)
专题命中 测试时计算 :reasoning(abstract)
AI总结 本文提出MedQ-Engine,通过闭环数据引擎迭代评估模型,发现失败原型,利用人类在循环注释提升模型性能,使8B参数模型在医疗图像质量评估中超越GPT-4o 13%并接近人类专家水平。
AURORA:适应性统一表示用于鲁棒超声分析
机构 * MBZUAI ; NIT Silchar(Silchar国立理工学院) ; Birmingham City University(伯明翰城市大学)
专题命中 测试时计算 :reasoning(abstract)
AI总结 本文提出基于Transformer视觉编码器的统一多任务框架,解决超声图像在不同设备、操作者和解剖目标下的泛化问题,通过轻量级多尺度特征金字塔实现像素级预测与全局推理,提升多任务性能。
HORNet:基于任务引导的帧选择用于视觉语言模型的视频问答
机构 * Northeastern University(东北大学)
专题命中 测试时计算 :reasoning(abstract)
AI总结 HORNet通过轻量级策略优化,显著减少视频输入帧数和VLM处理时间,同时提升问答质量与时间推理任务表现。
原因至关重要:通过代理引导的批评学习可转移的评分标准用于视觉语言模型奖励模型
机构 * Qwen Large Model Application Team, Alibaba(阿里云大模型应用团队) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 测试时计算 :verifier(abstract)
AI总结 本文提出Proxy-GRM,通过代理引导的评分标准验证提升视觉语言模型奖励模型的评分质量,利用轻量级代理代理进行评分标准验证,实现评分标准的可转移性和一致性,实验表明其在多个基准测试中表现优异。
Comments 25 pages, 10 figures,
当扫描器撒谎:在LLM红队测试中的评估者不稳定性
专题命中 测试时计算 :verifier(abstract)
AI总结 本文研究了LLM安全评估中评估者不稳定性问题,提出了一种可靠性意识的评估框架,通过量化评估者分歧和验证方法提升评估准确性,发现22个攻击类别存在评估不稳定现象,使评估准确率从72%提升至89%。
Comments Submitted to the EvalEval Workshop at ACL 2026
超越单样本:面向视频理解的可靠多样本蒸馏
机构 * University of Electronic Science and Technology of China & Robotics Center(电子科技大学 & 机器人中心)
专题命中 测试时计算 :reasoning(abstract)
AI总结 本文提出R-MSD方法,通过任务自适应教师池和对抗蒸馏目标提升视频理解任务的蒸馏稳定性,实验显示在多个基准上优于单样本蒸馏方法。
边缘-云协同语音情绪描述 via 令牌级推测解码在音频-语言模型中
专题命中 测试时计算 :verifier(abstract)
AI总结 本文提出基于不确定性引导推测解码的边缘-云协同框架,通过轻量级边缘模型和云验证器的协同,提升语音情绪描述的准确率和效率,同时降低延迟和隐私风险。
GUIDES: 利用教师蒸馏嵌入进行预训练机器人策略增强
机构 * University of California, Riverside(加州大学河滨分校) ; Johns Hopkins University(约翰霍普金斯大学)
专题命中 测试时计算 :reasoning(abstract)
AI总结 GUIDES通过教师蒸馏嵌入提升预训练机器人策略,实现语义增强与高效升级
Comments IEEE International Conference on Robotics and Automation (ICRA 2026)
无需训练即可清晰感知:减轻多模态大语言模型在遥感中的幻觉
机构 * School of Computer Science, Wuhan University, China(武汉大学计算机学院) ; Zhongguancun Academy, China(中关村学院) ; School of Computer Science, Chongqing University, China(重庆大学计算机学院)
专题命中 测试时计算 :reasoning(abstract)
AI总结 RADAR通过利用多模态大语言模型的内在注意力,无需训练即可减少遥感视觉问答中的事实性和逻辑性幻觉。
学习解决与验证:一种用于代码和测试生成的自博弈框架
专题命中 测试时计算 :verifier(abstract)
AI总结 本研究提出Sol-Ver框架,通过自博弈方式提升代码和测试生成能力,无需人工标注或大模型,实现代码生成和测试生成的性能提升。
Comments 14 pages, 5 figures
MSJoE:联合进化多模态大语言模型与采样器以实现高效的长视频理解
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) ; Tongji University(同济大学) ; MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus)
专题命中 测试时计算 :reasoning(abstract)
AI总结 MSJoE通过联合进化多模态大语言模型与轻量级采样器,提升长视频理解效率,实验表明其在多个基准测试中表现优异。
Comments Accepted by CVPR2026
自适应扩散约束采样用于双臂机器人操作
机构 * TU Darmstadt(图宾根大学) ; Robotics Institute Germany(德国机器人研究所)
专题命中 测试时计算 :planning(abstract)
AI总结 本文提出自适应扩散约束采样方法,通过整合等式和不等式约束,提升双臂机器人操作的样本多样性和泛化能力。
Comments Accepted by IEEE International Conference on Robotics and Automation 2026(ICRA 2026)
基于代码图的未见代码库数据合成与训练
专题命中 测试时计算 :reasoning(abstract)
AI总结 提出UCD-Training框架,通过代码图构建和两阶段训练,提升模型对未见代码库的推理能力和数据合成效果。
一致性与验证:在没有真实解决方案的情况下提升大型语言模型的测试生成质量
专题命中 测试时计算 :reasoning(abstract)
AI总结 ConVerTest通过自我一致性、验证链和双执行协议,在无需真实解决方案的情况下提升大型语言模型的测试生成质量。
SlowFocus: 提升视频大语言模型中的细粒度时间理解
机构 * School of Data Science, Fudan University(复旦大学数据科学学院) ; Noah’s Ark Lab, Huawei(华为诺亚实验室) ; Yinwang Intelligent Technology Co., Ltd.(亿万象智能科技有限公司)
专题命中 测试时计算 :reasoning(abstract)
AI总结 SlowFocus通过提升等效采样频率和引入多频率混合注意力模块,提升视频大语言模型对细粒度时间理解的能力。
Comments NeurIPS 2024
动态反射:通过文本对齐探测视频表示
机构 * Princeton University(普林斯顿大学) ; Google DeepMind(谷歌DeepMind)
专题命中 测试时计算 :reasoning(abstract)
AI总结 本研究通过视频-文本表示对齐探索现代视频和语言编码器的能力,揭示了跨模态对齐与数据丰富性、语义对齐与性能相关性以及时间推理与对齐的关系。
Comments To appear at ICLR 2026. 27 pages, 12 figures