Chinese Grammatical Error Correction: A Survey
中文语法纠错:综述
机构 * KAIST(韩国科学技术院)
专题命中 评测与基准 :language model(abstract);分类 cs.CL
AI总结 本文综述中文语法纠错(CGEC)研究,涵盖数据集、标注方案、评估方法和系统进展,指出关键挑战并展望未来方向。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
中文语法纠错:综述
机构 * KAIST(韩国科学技术院)
专题命中 评测与基准 :language model(abstract);分类 cs.CL
AI总结 本文综述中文语法纠错(CGEC)研究,涵盖数据集、标注方案、评估方法和系统进展,指出关键挑战并展望未来方向。
后GCN十年回顾:曲率分层的关联学习评估
机构 * University of Electronic Science and Technology of China(电子科技大学) ; Tsinghua University(清华大学) ; Western University(西方大学) ; Zhejiang University(浙江大学)
专题命中 评测与基准 :foundation model(abstract);分类 cs.LG
AI总结 针对关联学习中统一基准掩盖几何依赖性性能的问题,提出曲率分层评估框架,通过将数据集按曲率正负零分区,揭示模型性能本质上是几何依赖的,并给出更可靠的评估协议。
Comments Comments: Suggestions and comments are welcomed
高斯RBF支持向量回归预测函数最小化的DCA收敛性分析评估
机构 * Nihon University(日本大学) ; Tokyo City University(东京城大学)
专题命中 评测与基准 :post-training(abstract);分类 cs.LG
AI总结 针对以训练好的高斯RBF核支持向量回归(RBF-SVR)预测函数为目标函数的非凸优化问题,利用RBF核的解析结构构造显式DC分解,推导出DC分量强凸参数下界μ和子问题梯度Lipschitz常数上界L的闭式表达式,并通过数值实验表明特征量Cαρ主导DCA的收敛性和初始点依赖性。
Comments 29 pages, 5 figures, 2 tables
MMArt:用于视觉艺术理解的多视角多模态数据集
机构 * University of Amsterdam(阿姆斯特丹大学) ; Amazon AGI(亚马逊AGI) ; College of Business and Economics, University of Johannesburg(约翰内斯堡大学经济与商学院)
专题命中 评测与基准 :language model(abstract)
AI总结 针对现有艺术数据集单视角局限,推出含74234幅WikiArt画作的多视角多模态数据集MMArt,通过分析各视角特性证实多视角设计的必要性,为视觉艺术理解提供支撑。
SQL-RewriteBench:用于语句级SQL重写的正确性门控全分母基准测试[实验、分析与基准测试]
专题命中 评测与基准 :LLM(abstract)
AI总结 研究语句级SQL重写,提出SQL-RewriteBench基准测试,应用正确性门控和全分母计算,其指标套件可区分多种指标,定义了SCS和CGOQ,提供多个可执行实例,通过测试发现现有方法存在问题,强调可部署SQL重写需多方面改进。
WiWorld-RealData:用于6G无线世界模型的真实世界多模态数据集
专题命中 评测与基准 :foundation model(abstract)
AI总结 提出WiWorld-RealData数据集,包含3.7 GHz和6.775 GHz的信道冲激响应、多视角图像、全景图像、LiDAR点云、毫米波雷达记录和GNSS轨迹,支持环境辅助的信道预测,路径损耗预测MAE为2.02 dB。
Comments 6 pages, 6 figures, 3 tables
SkillClone: 多模态克隆检测与克隆传播分析在智能体技能生态系统中
专题命中 评测与基准 :LLM(abstract)
AI总结 本文提出SkillClone,首个多模态智能体技能克隆检测方法,通过融合TF-IDF与通道分解实现高精度检测,揭示技能生态系统中大量克隆关系及传播问题。
Comments 13 pages, ASE 2026
使用CLIP进行合成图像检测:理解和评估预测线索
机构 * Institute for Data Science I4DS(数据科学研究所) ; University of Applied Sciences FHNW(应用科学大学) ; FHNW Brugg-Windisch AG(FHNW布吕克-温迪施公司)
专题命中 评测与基准 :language model(abstract)
AI总结 本文提出SynthCLIC数据集,通过分析CLIP-based检测器的学习机制,揭示其在合成图像检测中依赖于高级摄影属性而非生成器特定伪影,并强调了持续更新和广泛训练的重要性。
Comments 10 figures; 25 pages
增强检测器的SAMURAI用于长时间无人机跟踪
机构 * Institute for the Protection of Terrestrial Infrastructures, German Aerospace Center (DLR)(地面基础设施保护研究所,德国航空航天中心(DLR)) ; ACIDA Lab, Technical University of Applied Sciences Würzburg-Schweinfurt(应用技术大学施魏尔堡-施维恩富特学院ACIDA实验室) ; Data Science Institute, European University of Technology(欧洲技术大学数据科学研究所) ; LIST3N, Université de Technologie de Troyes(图卢兹理工大学LIST3N)
专题命中 评测与基准 :foundation model(abstract)
AI总结 本文提出增强检测器的SAMURAI模型,用于提升无人机在复杂城市环境中的长时间跟踪鲁棒性,显著提高了成功率并降低了误检率。
Journal ref 2026 IEEE/CVF Winter Conference on Applications of Computer Vision Workshops (WACVW)
世界中的世界:闭环世界中的世界模型
机构 * JHU(约翰·霍普金斯大学) ; PKU(北京大学) ; Princeton(普林斯顿大学) ; MIT(麻省理工学院) ; Harvard(哈佛大学)
专题命中 评测与基准 :post-training(abstract)
AI总结 研究人员推出首个具身场景闭环世界模型基准平台World-in-World,发现视觉质量不保障任务成功,后训练缩放比升级预训练视频生成器更有效,增加推理计算可提升闭环性能。
Comments ICLR 2026 Oral. Add acknowledgement in arxiv v2. Code is at https://github.com/World-In-World/world-in-world
基于深度学习的核糖核酸-蛋白质相互作用预测:一项综合综述
专题命中 评测与基准 :language model(abstract)
AI总结 该综述分析2014-2023年179项研究,考察AI在基于深度学习的RPI预测中的应用,总结技术演进、最优模型、挑战及未来方向,填补相关文献空白。
Comments Accepted for publication in Applied Soft Computing. DOI: 10.1016/j.asoc.2025.113795
ChatGPT: 何时在理解和修改陌生代码时是朋友还是敌人
专题命中 评测与基准 :LLM(abstract)
AI总结 研究探讨了AI对开发者在编程任务中问题解决过程的影响,发现AI在某些情况下帮助解决问题,而在其他情况下阻碍了突破困境。
Comments 12 pages, 2 figures, 5 tables. To appear in the 30th International Conference on Evaluation and Assessment in Software Engineering (EASE 2026), Glasgow, Scotland, UK, 9-12 June 2026; corrected and expanded bibliography entries
面向公平的语音技术:语音AI中的偏差与公平性综合综述
专题命中 评测与基准 :language model(abstract)
AI总结 本综述整合400余项相关研究,构建统一框架,针对语音模态提出7种公平定义,梳理偏差来源并系统化缓解策略,为语音AI的公平性研究提供了全面指引。
Comments 73 pages, work in progress
OccAnyScene:面向统一的室内-室外三维占用预测
机构 * SuSTech(南方科技大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; HITSZ(哈尔滨工业大学深圳校区) ; Pengcheng Laboratory(鹏城实验室)
专题命中 评测与基准 :foundation model(abstract)
AI总结 该研究提出跨场景三维语义占用预测新任务,构建OccAnyScene框架实现室内外场景统一三维占用预测,在Occ-ScanNet和SurroundOcc-nuScenes数据集上取得最优mIoU结果。
Comments Corrected a typo in the title; manuscript unchanged
MuSS:一个多镜头数据集和电影叙事基准用于多镜头主体到视频生成
机构 * South China University of Technology(华南理工大学) ; Fudan University(复旦大学) ; Yunnan Normal University(云南师范大学)
专题命中 评测与基准 :foundation model(abstract)
AI总结 本文提出MuSS数据集和电影叙事基准,解决多镜头视频生成中的叙事逻辑、时空对齐和复制粘贴问题,通过改进的标注流程和反复制粘贴指标提升生成质量。
Comments 17 pages, 9 figues
默认以视觉为中心:解决面向盲人和低视力(BLV)用户的实时视觉语言模型(VLM)辅助中的隐含视觉假设问题
专题命中 评测与基准 :language model(abstract)
AI总结 针对现有面向BLV用户的实时VLM辅助工具存在的以视觉为中心的默认偏见问题,提出VIA-Agent模型,其在保持与Doubao相当成功率的同时,缩短了任务时间并减少了对话轮次,提升了用户信任度。
Comments Accepted to UIST 2026
从神经意图到加密授权:管理智能代理工作流程
专题命中 评测与基准 :LLM(abstract)
AI总结 研究人工智能驱动的智能代理工作流程中的安全问题,提出神经加密服务(NCS),通过神经符号设计,在大语言模型代理和特权工具间构建安全治理平面,经实验评估,能大幅降低攻击成功率,转变代理安全验证方式。
良性代码中的残余风险分析:我们距离目标有多远?一种多模型语义和结构相似性方法
专题命中 评测与基准 :language model(abstract)
AI总结 本文通过多模型语义和结构相似性分析,探讨了修复后的代码中残余风险的评估问题,提出Residual Risk Scoring框架,发现良性函数与脆弱函数在语义和结构上高度相似,存在潜在残余风险。
Comments 20 pages, 7 figures. Accepted for presentation at the SecAssure 2026 Track @ 31st ESORICS 2026
用于模型数据集的基准框架
专题命中 评测与基准 :LLM(abstract)
AI总结 本文提出了一种用于模型数据集的基准框架,旨在系统评估和比较软件模型数据集的质量、代表性和适用性。
描述到评分:一种用于图像复杂度评估的文本引导框架
机构 * Xi’an University of Architecture and Technology(西安建筑科技大学)
专题命中 评测与基准 :language model(abstract)
AI总结 该研究针对现有图像复杂度评估方法无法捕捉高级语义的问题,提出文本引导框架D2S,仅训练阶段引入描述语义正则化,在IC9600基准达SOTA,跨任务也具竞争力。
Comments Accepted by Pattern Recognition
基于特权传感器引导对比学习的点目标导航鲁棒场景迁移
机构 * University of Padua(帕多瓦大学) ; ETH Zurich(苏黎世联邦理工学院)
专题命中 评测与基准 :pretraining(abstract)
AI总结 提出一种传感器引导的自适应对比学习框架,利用特权LiDAR传感器在训练时引导视觉编码器学习导航相关结构,并通过解耦表征学习与策略优化以及跨阶段域不匹配来提升策略级场景迁移能力。
Comments 8 pages, Accepted to IEEE Robotics and Automation Letters (RA-L)
一致性检验的协和宇宙学
专题命中 评测与基准 :prompting(abstract)
AI总结 本文提出一种模型无关的框架,通过角直径距离和径向膨胀率的导数检验大尺度几何结构,提供对标准宇宙学的严格诊断。
Comments 5 pages, 1 captioned figure. v2: 6 pages, text slightly elaborated and figures updated. No changes to results. Matches version accepted for publication in PRL. Joint submission with arXiv:2604.05822
多重独立多项式的下界及其推广
专题命中 评测与基准 :language model(abstract)
AI总结 本文研究了多重独立多项式的下界及其推广,提出并证明了关于图的独立集的不等式,并推测该结果可推广至其他反铁磁模型。
Comments 17 pages. Clarify Section 3 and add a Lean formalisation of Theorem 1.4. See https://github.com/thegreatseo/multivar-indep-formalize for the GitHub repo
MI-CXR:多区间胸部X光片纵向推理基准
机构 * AIDAS Laboratory(AIDAS实验室) ; Seoul National University(首尔国立大学)
专题命中 评测与基准 :language model(abstract)
AI总结 MI-CXR基准旨在评估多visit胸部X光片的纵向推理能力,通过五选一问题和三个互补任务家族,揭示现有视觉语言模型在时间维度上的局限性。
Comments 33 pages
LiveXiv —— 基于 arXiv 论文内容的多模态实时基准测试集
机构 * Faculty of Engineering Tel-Aviv University(特拉维夫大学工程学院) ; IBM Research(IBM研究院) ; Department of Statistics, University of Michigan(密歇根大学统计学系) ; JKU Linz, Austria(林茨大学,奥地利) ; MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) ; MIT-IBM(麻省理工学院-IBM)
专题命中 评测与基准 :foundation model(abstract)
AI总结 针对多模态模型训练中测试数据污染问题,提出基于 arXiv 论文的 LiveXiv 实时基准,自动生成 VQA 对,用部分模型评估降低成本,验证了其性能差异极小,数据集已在 HuggingFace 公开。
基于特征相似度的量子生成建模电路设计
专题命中 评测与基准 :pretraining(abstract)
AI总结 本研究针对量子生成模型的可训练性问题,提出基于度量的电路扩展启发式方法,在bars and stripes数据集及金融数据上验证其能引入归纳偏置,为问题导向的电路设计提供实验基础。
StereoVGGT: 一种无需训练的视觉几何变换器用于立体视觉
专题命中 评测与基准 :foundation model(abstract)
AI总结 本文提出StereoVGGT,一种专为立体视觉设计的特征骨干网络,通过冻结VGGT并引入无训练特征调整流程,缓解几何退化,提升立体匹配性能,在KITTI基准中取得第一。
无监督学术合作推荐的评估与可解释性
专题命中 评测与基准 :language model(abstract)
AI总结 研究无监督、基于内容的学术合作推荐,比较TF-IDF基线、主题模型和基于嵌入的检索等方法,引入受限设置评估模型,还从两视角考察可解释性,展现不同方法差异及权衡。
Comments 6 pages, 2 figures, Submitted to ICMLA 2026
3D场景自适应轨迹可控的人体图像动画与相机运动
机构 * Engineering Research Center of Autonomous Unmanned System Technology(自主无人系统工程研究中心) ; Ministry of Education(教育部) ; Anhui Provincial Key Laboratory of Security Artificial Intelligence(安徽省安全人工智能重点实验室) ; School of Artificial Intelligence, Anhui University(安徽大学人工智能学院) ; University of Warwick(沃林格大学) ; Zhejiang Yuexiu University(浙江越秀大学) ; University of Surrey(萨里大学)
专题命中 评测与基准 :foundation model(abstract)
AI总结 提出场景自适应人体动画框架,通过地面自适应3D运动重定向和视角自适应潜在融合机制,实现自然场景中人体运动与相机轨迹的可控视频生成。
Comments Accepted to the 19th European Conference on Computer Vision (ECCV 2026)
聚焦女性安全分析:多模态数据集能否增强VAD模型?
机构 * Indian Institute of Technology Bhubaneswar(印度理工学院巴特那分校) ; Artificial Intelligence and Robotics Institute, Korea Institute of Science and Technology(人工智能与机器人研究所,韩国科学技术院) ; Yonsei-KIST Convergence Research Institute, Yonsei University(延世大学KIST融合研究中心)
专题命中 评测与基准 :LLM(abstract)
AI总结 针对现有视频异常检测数据集缺乏女性中心异常样本的问题,提出包含1001个视频及文本描述的多模态基准ExtrAnom,覆盖5种犯罪类型,并验证了多模态方法在检测女性中心异常上的有效性。
Comments 15 pages, 8 figures, 6 tables