Inductive Generalization for Robotic Manipulation
机器人操作的归纳泛化
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 评测与基准 :language model(abstract);分类 cs.LG
AI总结 提出归纳泛化概念,通过轴基评估测试策略在分布外任务变体上的泛化能力,发现现有范式(如VLA模型)失败,揭示了与数据规模正交的学习挑战。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
机器人操作的归纳泛化
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 评测与基准 :language model(abstract);分类 cs.LG
AI总结 提出归纳泛化概念,通过轴基评估测试策略在分布外任务变体上的泛化能力,发现现有范式(如VLA模型)失败,揭示了与数据规模正交的学习挑战。
面向面板数据的时间因果先验数据拟合网络及其学习到的可靠性信号
机构 * ProfitOps Inc.(ProfitOps公司)
专题命中 评测与基准 :foundation model(abstract);分类 cs.LG
AI总结 提出TCPFN,一种零样本时间因果发现基础模型,通过因果判断头联合预测多种因果属性,结合混合训练先验和离散令牌面板数据架构,实现工业规模推理,在多个基准上达到竞争性性能。
Comments 42 pages, 6 figures, 9 tables. Code and pretrained checkpoint to be released
逐步测量信息:超越情绪的AI评估
机构 * Department of Computer Science(计算机科学系)
专题命中 评测与基准 :prompting(abstract);分类 cs.LG
AI总结 本文提出基于AI的评估方法,通过战略游戏与信息损失的联系,分析对抗操纵下鲁棒的机制,证明总变差距离在对抗攻击下保持多项式保证,提升信息关系提示的鲁棒性。
Comments Accepted to TMLR (2026). Updated appendix to restore the proof of Theorem 3.3
基于流形学习的个性化和无标签心律失常检测
机构 * Department of Electrical and Computer Engineering, Princeton University, Princeton, 08544, New Jersey, USA(电气与计算机工程系,普林斯顿大学) ; Princeton Precision Health, Princeton University, Princeton, 08544, New Jersey, USA(普林斯顿精准健康,普林斯顿大学) ; Omenn-Darling Bioengineering Institute, Princeton University, 35 Ivy Lane, Princeton, 08540, New Jersey, USA(Omenn-Darling生物工程研究所,普林斯顿大学)
专题命中 评测与基准 :pretraining(abstract);分类 cs.LG
AI总结 本文提出利用非线性降维方法在无监督条件下检测心律失常,通过MIT-BIH数据库验证,NLDR能有效区分正常与异常心跳,实现高准确率分类。
Journal ref Informatics in Medicine Unlocked 64 (2026) 101770
ViMedCSS:越南语医学术语代码转换语音数据集与基准
机构 * College of Engineering and Computer Science(工程与计算机科学学院) ; Center for AI Research(人工智能研究中心) ; College of Health Sciences(健康科学学院) ; University of Technology Sydney(悉尼科技大学)
专题命中 评测与基准 :pretraining(abstract);分类 cs.CL
AI总结 针对越南语医学术语代码转换问题,构建了34小时语音数据集ViMedCSS,评估多种ASR模型并探索微调策略,发现越南语优化模型与多语言预训练结合效果最佳。
Comments Accepted at LREC 2026
HumaniBench: 一种以人为中心的大型多模态模型评估框架
机构 * Vector Institute for Artificial Intelligence(向量人工智能研究院) ; University of Central Florida(中央佛罗里达大学)
专题命中 评测与基准 :prompting(abstract);分类 cs.AI
AI总结 本文提出HumaniBench框架,通过32000个专家验证的图像-问题对评估大型多模态模型在公平性、伦理、包容性等人类中心原则上的对齐情况,揭示了不同模型在伦理、推理和共情方面的权衡。
MSU-Bench:面向对话多说话人场景中以说话人为中心的理解
专题命中 评测与基准 :language model(abstract)
AI总结 提出MSU-Bench基准,包含16个说话人中心任务和2300个问答实例,用于评估多说话人对话中的说话人定位与推理能力,揭示现有模型在复杂场景下的不足。
Comments 4 pages, accepted by interspeech 2026
调查10000种抗体的适应度景观
专题命中 评测与基准 :language model(abstract)
AI总结 本文提出无参数群体遗传框架,通过分析公共克隆型中趋同亲和成熟信号,识别超过10000种抗体的有益突变位点及其适应度效应,揭示突变流行度与适应度效应间的权衡,并用于基准测试抗体语言模型。
PHOEBI:用于相差显微镜细菌识别的开放世界基准
机构 * University of Central Florida(中佛罗里达大学)
专题命中 评测与基准 :pretraining(abstract)
AI总结 提出PHOEBI数据集(12万张相差显微镜图像,6种杆状菌的40种组合),通过留出组合评估协议模拟开放世界场景,发现聚合器存在系统性开放世界识别失败,并设计基于锚点的轻量化解码器在未见组合上表现更优。
READ:超越所见——基于强化学习的准确连贯音频描述生成
机构 * City University of Hong Kong(香港城市大学) ; Baidu Inc(百度公司) ; Tsinghua University(清华大学)
专题命中 评测与基准 :prompting(abstract)
AI总结 提出首个基于强化学习的音频描述生成框架READ,通过序列级优化和连贯性奖励,显著提升生成准确性与连贯性。
FetSelect: 面向自动化胎儿超声帧选择的任务特定架构与自监督学习
机构 * College of Science and Engineering, Hamad Bin Khalifa University(哈马德·本·哈利法大学科学与工程学院) ; LIST Laboratory Department of Electrical Systems Engineering, University of Boumerdes(布迈德斯大学电气系统工程系LIST实验室) ; Sidra Medicine(锡德拉医学)
专题命中 评测与基准 :pretraining(abstract)
AI总结 提出FetSelect框架,结合冻结视觉基础骨干与混合多头设计(任务门控分类头+检测派生质量头),通过BYOL自监督预训练,在四个胎儿测量目标上实现高AUROC与质量相关性。
Comments Accepted in 30th Conference on Medical Image Understanding and Analysis
CVSBench:跨视角空间推理与想象的全面基准
机构 * Faculty of Electronic and Information Engineering, Xi’an Jiaotong University(西安交通大学电子与信息工程学院) ; Ministry of Education Key Laboratory of Intelligent Networks and Network Security(教育部智能网络与网络安全重点实验室)
专题命中 评测与基准 :language model(abstract)
AI总结 提出CVSBench基准,通过卫星-街景对评估视觉语言模型的跨视角空间推理能力,发现模型在视角剧变下难以保持物体与布局一致性,引入3D场景想象管道可显著提升性能。
T-IMPACT:面向上下文图像-文本操纵的严重性感知基准
机构 * The University of Queensland(昆士兰大学)
专题命中 评测与基准 :language model(abstract)
AI总结 提出T-IMPACT基准,包含98,786个图像-文本对,涵盖原始、仅图像、仅文本和联合操纵,通过校准的连续严重性分数和粗粒度标签评估操纵对上下文理解的影响,实验表明现有模型在严重性预测上仍远弱于人类判断。
Comments 7 pages, 2 figures
野生的开放AI:r/LocalLLaMA社区中开放模型的采纳与适应
专题命中 评测与基准 :foundation model(abstract)
AI总结 通过对r/LocalLLaMA社区的实证研究,揭示用户对开放模型的实用主义理解,包括可靠性、本地控制、隐私和适应能力,并分析采纳动机与障碍,以及共享资源如何支撑开放AI生态。
Comments Accepted at FAccT'26
T-MOR:学习面向运动感知的骨架表示用于人体动作识别
机构 * Suzhou Institute for Advanced Research, University of Science and Technology of China(中国科学技术大学苏州高等研究院) ; Inria Center at Université Côte d'Azur(法国蔚蓝海岸大学Inria中心) ; Woven by Toyota ; Toyota Motor Europe(丰田汽车欧洲公司)
专题命中 评测与基准 :language model(abstract)
AI总结 提出T-MOR框架,通过多模态对比学习对齐骨架运动与视觉、文本表示,仅用轻量骨架输入实现高效动作识别,并在大规模数据集PoseCap-1M上预训练,在多个基准上取得一致提升。
SARIF: 用于鲁棒图像鉴别的 Segment Anything
机构 * Department of Electrical and Computer Engineering, Inha University(仁荷大学电气与计算机工程系)
专题命中 评测与基准 :prompting(abstract)
AI总结 提出SARIF框架,利用Segment Anything Model的提示架构和泛化能力,通过反馈引导掩码解码器和双编码器设计提取伪造痕迹,实现自动伪造定位,在跨数据集和图像退化下表现鲁棒。
Comments Accepted to ECCV 2026. Equal contribution: Dong-Hyun Moon and Ju-Hyeon Nam. Corresponding author: Sang-Chul Lee. Code: https://github.com/Inha-CVAI/SARIF_ECCV2026
REKEY: 基于元数据的视觉键再生方法用于抗污染的VQA评估
机构 * Zhejiang University(浙江大学) ; ETH Zürich(苏黎世联邦理工学院) ; Nanjing University of Science and Technology(南京理工大学) ; Nanjing University(南京大学) ; University of Waterloo(滑铁卢大学) ; Binjiang Institute of Zhejiang University(浙江大学滨江研究院)
专题命中 评测与基准 :language model(abstract)
AI总结 提出ReKey协议,通过随机再生图像中的视觉键来防止VQA基准测试泄露,实验显示原始项目得分比再生变体高9.5-18.8个百分点。
AEF-Econ:面向城市遥感的即插即用社会经济基础嵌入
机构 * State Key Laboratory of Information Engineering in Surveying, Mapping, and Remote Sensing(测绘遥感信息工程国家重点实验室)
专题命中 评测与基准 :pretraining(abstract)
AI总结 针对AlphaEarth基础模型在社会经济任务中即插即用受限的问题,提出容量自适应重构方法,通过多流解码器缓解高维流对低维流的抑制,在跨区域和跨层级评估中R²分别提升至0.848和0.693。
看到场景才重要:通过场景感知的长视频基准揭示视频理解模型中的遗忘现象
机构 * CUHK (SZ)(香港中文大学(深圳)) ; University of Cambridge(剑桥大学) ; UESTC(电子科技大学) ; CUHK(香港中文大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 评测与基准 :language model(abstract)
AI总结 本文提出SceneBench基准,揭示视频理解模型在长场景上下文中的遗忘问题,并提出Scene-RAG方法提升性能2.50%。
Comments Accepted to CVPR 2026 (Highlight)
Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026
DynProto: 动态原型进化用于分布外检测
机构 * Sun Yat-sen University(中山大学) ; Peng Cheng Laboratory(鹏城实验室) ; University of Nottingham Malaysia(诺丁汉马来西亚大学) ; Hong Kong University of Science and Technology(香港科学与技术大学) ; Key Laboratory of Machine Intelligence and Advanced Computing(智能与先进计算关键实验室)
专题命中 评测与基准 :language model(abstract)
AI总结 DynProto通过动态学习分布内信息生成原型,提升分布外检测性能,减少FPR95并提升AUROC。
Comments Under review
PICO:集体操作的性能洞察
专题命中 评测与基准 :LLM(abstract)
AI总结 PICO框架通过解耦实验设置与平台执行,提供跨MPI和NCCL的参数选择接口,记录系统配置以实现可重复比较,并通过诊断证据揭示拓扑敏感的算法选择,优化集体操作性能,减少训练时间达44%。
Journal ref ISC High Performance 2026 Research Paper Proceedings (41st International Conference)
ReconMIL: 协同潜在空间重建与双流Mamba的全切片图像分析
机构 * USTC(中国科学技术大学) ; NUDT(南京理工大学) ; SCNU(华南师范大学) ; NTU(南洋理工大学) ; Anhui Province Key Laboratory of Biomedical Imaging and Intelligent Processing(安徽省生物医学成像与智能处理重点实验室)
专题命中 评测与基准 :foundation model(abstract)
AI总结 提出ReconMIL框架,通过潜在空间重建模块适配任务特定特征,并设计双流架构(Mamba全局流+CNN局部流)平衡全局与局部特征,有效抑制背景噪声并定位细粒度诊断区域,在多个基准上超越现有方法。
Comments This paper has been withdrawn by the authors due to identified issues in the evaluation protocol in Section Exp. , which may affect the interpretation of the experimental results. The authors are preparing a substantially revised version addressing these issues
Real5-OmniDocBench:面向野外鲁棒文档解析的全尺度物理重建基准
机构 * PaddlePaddle Team, Baidu Inc.(百度公司PaddlePaddle团队) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 评测与基准 :language model(abstract)
AI总结 提出首个对OmniDocBench v1.5进行全尺度一对一物理重建的基准Real5-OmniDocBench,覆盖扫描、弯曲、屏幕摄影、光照和倾斜五种真实场景,通过完整真值映射实现性能退化的因子级归因,揭示文档解析中的“现实鸿沟”。
从同源蛋白家族中的稀缺功能标签到标签感知生成
专题命中 评测与基准 :language model(abstract)
AI总结 研究两阶段轻监督策略,比较不同序列表示在有限监督下预测功能标签,并利用推断标签训练标签感知RBM进行条件生成,揭示稀缺标签在准确传播下可支持标签感知设计。
Comments 13 pages, 4 figures + SI
LLM辅助的非几何网络图中的A*搜索
机构 * KU 6G Research Centre, Department of Computer Science, Khalifa University, Abu Dhabi, UAE(KU 6G研究中心,计算机科学系,哈利法大学,阿布扎赫德,阿联酋)
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 针对非几何网络图最短路径问题,提出LLM辅助A*算法,利用LLM生成中间路标点引导搜索,结合路标距离作为启发式,减少约50%扩展节点,路径成本略有增加。
VCT: 一种用于LLM对话的可验证转录系统
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 针对LLM对话非线性演化(如重提示、回复再生、会话删除等)导致传统日志无法保证完整性的问题,提出VCT系统,通过三层密码学数据结构(分支级哈希链、会话级Merkle树、账户级Merkle根)和带删除屏障的状态转换协议,实现账户级对话记录的完整性、一致性、可验证共享和不可否认性。
Comments 58 pages, 14 figures, 10 tables
你见过它们吗?通过审问大型语言模型进行实体级成员推断
机构 * Zhejiang University(浙江大学)
专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI总结 提出实体级成员推断任务,通过语义特征分析从LLM生成文本中判断实体信息是否用于训练,形式化约束并设计五种审问策略,在人物实体上AUC达0.97。
面向OpenSIL固件中大语言模型生成的单元测试的库感知双打与迭代修复
机构 * School of Software Design and Data Science(软件设计与数据科学学院) ; Seneca Polytechnic(森纳学院) ; Advanced Micro Devices Canada(加拿大先进微器件公司)
专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 针对OpenSIL固件单元测试因构建约束易失败的问题,提出LLM引导的多智能体自动化测试生成与迭代修复流程,在76个函数中73个生成可编译测试,行覆盖率达98.8%。
Comments 20 pages, 10 figures, 1 Table. This work has been submitted to the IEEE for possible publication
大型语言模型辅助的BSM模型构建框架
专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)
AI总结 提出bsm_agent框架,结合确定性物理后端与LLM聊天接口,通过自然语言指定新场量子数,自动构建可重整拉氏量、检查规范反常、导出对称性破缺条件与质量矩阵,确保结果可重复。
Comments 49 pages. Includes a Python package for BSM model building via LLM chat from user-specified particle quantum numbers. Code: https://github.com/saad-hep/bsm_agent
scLLM-DSC:基于LLM知识增强的跨模态深度结构聚类用于单细胞RNA测序
机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) ; University of Chinese Academy of Sciences(中国科学院大学) ; Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院) ; School of Computing and Information Technology, Great Bay University(大湾区大学计算机科学与技术学院) ; School of Engineering, Westlake University(西湖大学工学院)
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 提出scLLM-DSC框架,通过知识驱动语义视图与结构感知拓扑视图的跨模态对比对齐,利用LLM增强单细胞RNA测序数据的聚类性能,显著优于现有方法。