An Anthropic Argument against the Future Existence of Superintelligent Artificial Intelligence
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
Comments 11 pages
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
Comments 11 pages
专题命中 测试时计算 :planning(abstract);分类 cs.AI
Comments To appear at AAMAS 2013
专题命中 测试时计算 :planning(abstract);分类 cs.AI
Comments Appears in Proceedings of the Twenty-Sixth Conference on Uncertainty in Artificial Intelligence (UAI2010)
面向视觉-语言-动作驾驶模型的推理时注意力引导
机构 * FAU Erlangen-Nürnberg(埃尔朗根-纽伦堡大学)
专题命中 测试时计算 :reasoning(abstract)
AI总结 该研究针对VLA驾驶模型无法在推理时重定向注意力的问题,在Qwen3-VL主干上添加预softmax注意力偏差,实验验证了其对轨迹的引导效果及层相关特性。
Comments Attention Steering, Vision-Language-Action, AutonomousDriving, Inference-Time Intervention
Journal ref European Conference on Computer Vision 2026
智能体调控蒸馏:自主多智能体系统中的推理时调控提取与利用
专题命中 测试时计算 :reasoning(abstract)
AI总结 本文提出AHD框架,将AMAS推理时调控提取形式化为新安全问题,实验证实其可提取调控致IP泄露,还提出对应欺骗防御,揭示AMAS新安全威胁。
基于基础模型的高效数据采样(FEEDS):用于泛癌、多示踪剂PET/CT数据集的标签高效训练策略
机构 * Geisel School of Medicine at Dartmouth(达特茅斯盖泽尔医学院) ; Dartmouth Hitchcock Medical Center(达特茅斯-希区柯克医疗中心) ; Yale University(耶鲁大学)
专题命中 测试时计算 :planning(abstract)
AI总结 该研究提出FEEDS策略,利用视觉基础模型嵌入选择信息性和多样性未标注病例,在减少70%标注负担时达到全标注训练性能,解决了PET/CT病灶分割的标签稀缺问题。
Comments Code is publicly available on https://github.com/Image-and-Multimodal-Data-Analytics/FEEDS
超越全局编辑:用于LVLMs无训练幻觉缓解的实例级解耦子空间
机构 * Macquarie University(麦考瑞大学) ; York University(约克大学) ; Northern Illinois University(北伊利诺伊大学) ; University of Technology Sydney(悉尼科技大学) ; North South University(北南大学) ; Lancaster University(兰卡斯特大学) ; Australian National University(澳大利亚国立大学)
专题命中 测试时计算 :reasoning(abstract)
AI总结 针对LVLMs现有模型编辑技术采用单一全局子空间无法适配多样幻觉模式的问题,提出无训练的实例级解耦子空间框架,经多基准实验验证其鲁棒性、通用性与效率。
Comments BMVC 2026
你无需停留在循环中:用于机器人策略改进的智能体机器人循环
专题命中 测试时计算 :verifier(abstract)
AI总结 该研究将编码智能体的软件循环架构迁移至机器人策略改进领域,提出AgenticRobotics控制平面,解决机器人工具易失效问题,实现错误提升控制等性能提升。
Comments Agentic Robotics Preview Version
下一张截图知晓:面向移动GUI智能体的门控事后蒸馏(Gated Hindsight Distillation)
专题命中 测试时计算 :reasoning(abstract)
AI总结 本文针对移动GUI智能体训练中丢失动作依据的问题,提出门控事后蒸馏方法,利用下一张截图作为特权信息,在AndroidWorld等基准上相比GRPO提升了任务成功率。
超越帧选择:用多模态大语言模型重新思考长视频理解
机构 * National Institute of Informatics(信息学研究所)
专题命中 测试时计算 :reasoning(abstract)
AI总结 针对 MLLMs 长视频理解的帧选择策略难以兼顾全局与局部信息的问题,提出 VideoRouter 模型,通过时间层次结构和验证引导路由器协调全局与局部推理,在 VideoMME 数据集上实现性能提升。
用于提升AI生成新闻摘要事实可靠性的跨平台认知验证
专题命中 测试时计算 :verifier(abstract)
AI总结 本研究提出多源证据共识验证(MECV)框架,通过多异构来源证据聚合与多LLM陪审团机制修正AI生成新闻摘要的幻觉,在SummEdits基准上提升了事实一致性,为可信AI与自动化新闻研究提供了新方法。
CARE:用于执行 shell 的语言模型代理的执行前命令验证
专题命中 测试时计算 :verifier(abstract)
AI总结 研究 LLM 代理执行 shell 命令时的调度风险,提出 CARE 验证器,通过规范化命令、推导证据并结合 LLM 判断,实现命令级调解,降低调度边界风险,平衡良性恢复、误报负担、延迟和危害降低之间的关系。
Comments Accepted by ISSRE 2026
潜在去噪提升大多模态模型的视觉对齐
机构 * University of Southern California(南加州大学) ; DEVCOM ARL Army Research Office(DEVCOM ARL陆军研究办公室)
专题命中 测试时计算 :reasoning(abstract)
AI总结 本文提出通过潜在去噪框架改进大多模态模型的内部视觉特征对齐和多模态理解,采用掩码和高斯噪声混合腐蚀视觉token,并利用解码器恢复教师特征,提升模型在分布偏移下的鲁棒性。
Comments ACM MM 2026
通过端到端评估应用层行动证据发现Project Veraison的TPM参考方案中存在的挑战随机数新鲜度缺口
专题命中 测试时计算 :verifier(abstract)
AI总结 本文发现Project Veraison的TPM参考方案存在挑战随机数新鲜度缺口,通过端到端测试验证修复方案,使重放Quote的评估结果变为否定,提升了RATS架构的安全性。
Comments 18 pages, 3 figures. Responsible disclosure: veraison/services#427, fixed in PR #432. Artifact and data: doi:10.5281/zenodo.20998730
AI智能体证据的硬件根证明:将IETF RATS与行动证据包组合
专题命中 测试时计算 :verifier(abstract)
AI总结 本研究提出将IETF RATS架构与行动证据包组合,实现AI智能体的硬件根证明,通过仿真TPM实验验证了该方案的可行性。
Comments 9 pages, 1 figure, 1 table. Technical note. Also deposited at Zenodo: doi:10.5281/zenodo.20818671
证据见证组合:针对闭集多模态答案的单预填充风险检测
专题命中 测试时计算 :verifier(abstract)
AI总结 该研究提出WEP方法,利用MLLM的白盒预填充路径,无需额外操作即可检测闭集视觉答案的推理风险,在3个MLLM和4个基准上提升了平均错误AP。
Comments 22 pages, 6 figures; includes supplementary material. Code: https://github.com/SouthWinter/WEP
Fabric 是集群驱动:面向 GPU-CXL Fabric 的跨层 eBPF 策略
专题命中 测试时计算 :verifier(abstract)
AI总结 该研究提出 fabric_ext 中间件编译器与运行时,通过语义移动图实现跨 GPU-CXL Fabric 多层的 eBPF 策略,以处理 LLM 预填充等场景下的跨岛数据流需求。
STORM:从单张图像进行片段、跟踪和目标重定位
机构 * Department of Computer Science, Technical University of Darmstadt, Darmstadt, Hesse, Germany(德累斯顿技术大学计算机科学系) ; Hessian Center for Artificial Intelligence (hessian.AI), Darmstadt, Hesse, Germany(黑森人工智能中心(hessian.AI)) ; German Research Center for Artificial Intelligence (DFKI), Darmstadt, Hesse, Germany(德国人工智能研究中心(DFKI)) ; Centre for Cognitive Science, Technical University of Darmstadt, Darmstadt, Hesse, Germany(德累斯顿技术大学认知科学中心) ; Google Intrinsic AI Research, Germany. † Work done while at the AIML research lab, now working at Intrinsic, Google.(谷歌Intrinsic AI研究)
专题命中 测试时计算 :verifier(abstract)
AI总结 STORM提出一种统一框架,通过单张参考图像实现6D跟踪,减少人工干预并提升鲁棒性,实验显示其在无标注姿态跟踪和严重遮挡场景中表现优异。
Comments 21 pages. Accepted at the 43rd International Conference on Machine Learning (ICML 2026); camera-ready version
Journal ref Proceedings of the 43rd International Conference on Machine Learning (ICML 2026), PMLR, 2026
代理奖励建模:通过在线主动交互验证GUI代理
机构 * MAIS, Institute of Automation, Chinese Academy of Sciences ; School of Artificial Intelligence, University of Chinese Academy of Sciences ; School of Computer Science \& Technology, Beijing Jiaotong University
专题命中 测试时计算 :verifier(abstract)
AI总结 VAGEN通过引入代理交互验证范式,解决GUI代理评估中的视觉限制问题,提升评估准确性与性能。
Comments 25 pages, 12 figures
大规模捕捉内心体验:与一种具有里程碑意义的现象学方法的创始人共同开发的人工智能访谈者
专题命中 测试时计算 :reasoning(abstract)
AI总结 研究聚焦于主观体验研究中深度与规模的权衡问题,核心方法是将描述性经验抽样法转化为人工智能访谈者的推理架构,主要贡献是开发出首个基于既定方法研究内心体验的人工智能访谈者及相关平台。
PhysClaw-0:一种通过语言修正实现机器人自主的共生智能体系统
机构 * GigaAI(字节跳动人工智能实验室) ; University of Chinese Academy of Sciences(中国科学院大学) ; Hong Kong University of Science and Technology(香港科技大学) ; University of Leeds(利兹大学) ; Cornell University(康奈尔大学) ; Tsinghua University(清华大学) ; Nanjing University of Science and Technology(南京理工大学) ; The Chinese University of Hong Kong(香港中文大学) ; FAWTD(一汽技术开发部)
专题命中 测试时计算 :verifier(abstract)
AI总结 研究针对自主数据收集问题,提出PhysClaw-0共生智能体系统,通过跨轮保留和重用修正、自主收集验证等方式,在真实机器人测试中减少人力时间,提高成功率,并提升验证者与人类一致性。
Comments WebPage: https://open-gigaai.github.io/Zero2Skill
Kubernetes推理服务中的冷启动模型交付:基于OCI的分发及其完整性的实证研究
专题命中 测试时计算 :verifier(abstract)
AI总结 研究Kubernetes推理服务中模型冷启动交付问题,通过在KServe平台实现oci+native://和oci+fetch://两条新交付路径进行分析,对比不同交付路径在不同模型大小下的表现,提出服务时完整性设计并验证其对交付时间的影响。
Comments 8 pages, 2 figures, 3 tables. Submitted to IEEE Access. Benchmark harness and data: https://github.com/kliukovkin/oci-model-delivery-bench
ProfMalPlus:通过静态-动态分析协同实现代理协调检测恶意NPM包
专题命中 测试时计算 :reasoning(abstract)
AI总结 研究针对NPM包恶意代码检测问题,提出ProfMalPlus,结合对象敏感行为图与大语言模型推理,经多步骤提取安全切片并评估,对不确定情况增强证据后再评估,最终定位恶意代码,F1分数高且发现多个未知恶意包,性能优于现有检测器。
超越随机采样:用于半监督医学图像分割的分布感知对齐
机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) ; Department of Ultrasound, Xinhua Hospital Affiliated to Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属新华医院超声科)
专题命中 测试时计算 :planning(abstract)
AI总结 研究针对半监督医学图像分割中随机采样策略在低数据量时表征偏差的问题,提出基于分布对齐的高效框架,用分布感知样本选择策略和记忆引导复制粘贴模块,提升分割性能。
Comments 19 pages, 5 figures, accepted by ECCV 2026
CogRad:一种用于放射学报告生成的受认知启发的多智能体框架
机构 * German Research Center for Artificial Intelligence(德国人工智能研究中心) ; Intelligentx GmbH(智能X有限公司) ; Department of Core Informatics, Graduate School of Informatics, Osaka Metropolitan University(大阪城市大学信息科学研究生院核心信息学系)
专题命中 测试时计算 :verifier(abstract)
AI总结 提出受认知启发的多智能体框架CogRad,围绕放射科医生阅读过程的四个阶段构建报告生成,通过多智能体协作提升报告质量,在多个数据集上取得最佳成绩。
用于智能应用的工作流感知服务层
专题命中 测试时计算 :verifier(abstract)
AI总结 研究智能AI应用工作流,其介于现有两层之间。提出Dyserve工作流感知服务层填补空白,通过整数线性规划在异构后端池编译节点模型和验证器选择,还可在不同压力水平预求解并动态调整。
理解代理硬件验证中推理时间标记分配与覆盖限制
专题命中 测试时计算 :reasoning(abstract)
AI总结 本文研究了代理硬件验证中推理时间标记分配与覆盖限制,通过两个层级的代理框架,分析覆盖孔径并改进效率,展示领域专业化如何提升覆盖效率。
DataEvolver: 面向文本丰富图像生成的自我进化多智能体数据构建
机构 * Central South University(中南大学) ; The Hong Kong University of Science and Technology(香港科技大学)
专题命中 测试时计算 :verifier(abstract)
AI总结 提出DataEvolver,一种自我进化的多智能体框架,通过反馈驱动策略迭代优化数据构建,显著提升文本丰富图像生成质量。
当潜在智能体说谎时:多智能体LLM协作中的KV缓存完整性
专题命中 测试时计算 :verifier(abstract)
AI总结 研究多智能体问答中KV缓存传递的安全问题,发现恶意智能体可通过篡改隐藏状态破坏协作,提出HMAC-SHA256清单保护传输完整性。
Comments 16 pages, 2 figures, 3 tables
远距离推测:边缘-云推测解码何时真正有效
专题命中 测试时计算 :verifier(abstract)
AI总结 本文通过闭式不等式分析分布式推测解码(DSD)在广域网边缘-云通信下的延迟收益,指出其仅在低RTT场景下优于共置SD,并发现多租户容量是DSD的主要优势。