arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1309 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 1309 篇

2510.03880 2026-08-14 cs.CV 版本更新 75%

Exploring Instruction Data Quality for Explainable Image Quality Assessment

探索可解释图像质量评估的指令数据质量

Yunhao Li, Sijing Wu, Jun Jia, Kang Fu, Qi Jia, Yucheng Zhu, Wei Sun, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 该研究针对可解释图像质量评估任务,提出Q-Selector数据选择框架,仅用10%训练数据就达到全数据微调的102.1%和103.7%性能,证明指令数据存在冗余。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04923 2026-08-13 cs.LG cs.AI cs.CL 版本更新 75%

Reproducing, Analyzing, and Detecting Reward Hacking in Rubric-Based Reinforcement Learning

基于评分标准的强化学习中的奖励黑客行为的复现、分析与检测

Xuekang Wang, Zhuoyuan Hao, Shuo Hou, Hao Peng, Juanzi Li, Xiaozhi Wang

机构 * Tsinghua University(清华大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Xi’an Jiaotong University(西安交通大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出可控黑客环境CHERRL,通过注入已知偏见复现奖励黑客行为,分析其可发现性与可利用性,并探索基于智能体的自动检测方法。

Comments 23 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12226 2026-08-12 cs.IR 版本更新 75%

Crowd-OM: Crowdsourcing for Ontology Matching Validation

解锁众包用于本体匹配验证

Zhangcheng Qiang, Weiqing Wang, Kerry Taylor

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对本体匹配验证依赖领域专家的问题,提出一种结合差分可信度、一致性预填充和时变意见的众包系统,实现人机协同验证。

Comments 6 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14657 2026-08-04 cs.CL cs.AI cs.LG 版本更新 75%

OpenDebateEvidence: A Massive-Scale Argument Mining and Summarization Dataset

OpenDebateEvidence:一个大规模论证挖掘与摘要数据集

Allen Roush, Yusuf Shabazz, Arvind Balaji, Peter Zhang, Stefano Mezza, Markus Zhang, Sanjay Basu, Sriram Vishwanath, Mehdi Fatemi, Ravid Shwartz-Ziv

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究推出源自美国竞技辩论界的大规模OpenDebateEvidence数据集,经实验验证微调大语言模型可实现论证性抽象摘要,旨在推进计算论证并公开数据集供研究使用。

Comments Published to the 38th Conference on Neural Information Processing Systems (NeurIPS 2024) Track on Datasets and Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11518 2026-07-31 cs.IR 版本更新 75%

KuaiSearch: An E-Commerce Search Dataset with Authentic Queries and Product Texts for Recall, Ranking, and Relevance

KuaiSearch: 一个大规模电商平台搜索数据集用于召回、排序和相关性

Yupeng Li, Ben Chen, Mingyue Cheng, Zhiding Liu, Xuxin Zhang, Chenyi Lei

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出KuaiSearch,首个涵盖召回、排序和相关性评估的大型电商平台搜索数据集,通过真实用户交互数据提升电商搜索研究的准确性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25635 2026-07-30 cs.SE 版本更新 75%

An Empirical Study of Model Context Protocol Applications

模型上下文协议应用的实证研究

Muhammad Hamza Arshad Majeed, May Mahmoud, Sarah Nadi

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究对1723个GitHub上的MCP应用展开大规模研究,先从样本得出分类,再用大语言模型辅助流程刻画服务器集成。结果表明该生态系统部分实践趋同,如多数用文件配置服务器、用官方SDK通信,但配置文件命名无约定,人工监督差异大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17492 2026-07-28 cs.AI cs.CL cs.LG 版本更新 75%

PD$^3$: A Project Duplication Detection Framework via Adapted Multi-Agent Debate

PD$^3$:一种通过适应性多智能体辩论的项目重复检测框架

Dezheng Bao, Yueci Yang, Chutian Yu, Xin Chen, Zeguo Fei, Xiang Yuan, Lijun Zhang, Jiangqian Huang, Zhengxuan Jiang, Daoze Zhang, Junru Chen, Yang Yang

机构 * Zhejiang University(浙江大学) State Grid Power Supply Co. Ltd.(国网电力供应有限公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究项目重复检测问题,提出PD$^3$框架,通过适应性多智能体辩论,结合局部多智能体辩论与全局循环调度检索项目集,能保证公平比较并产生相关分数和反馈,在真实项目上优于基线,还部署平台节省资金。

Comments 17 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02001 2026-07-24 cs.DB 版本更新 75%

Bespoke OLAP: Synthesizing Workload-Specific One-size-fits-one Database Engines

定制OLAP:合成工作负载特定的定制数据库引擎

Johannes Wehrstein, Timo Eckmann, Matthias Jasny, Carsten Binnig

专题命中 评测与基准 :LLM(abstract,abstract_cn);prompting(abstract)

AI总结 Bespoke OLAP通过自动化合成流程,生成针对特定工作负载的高性能数据库引擎,实现比通用系统高多个数量级的性能提升。

Comments Accepted to VLDB'26 (Boston)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13144 2026-07-22 cs.SE 版本更新 75%

A Grey Literature Review of AI-Native Applications

人工智能原生应用的灰色文献综述

Lingli Cao, Shanshan Li, Ying Fan, Danyang Li, Chenxing Zhong

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 该研究通过灰色文献综述,整合多方见解,识别出人工智能原生应用的定义特征、关键质量属性与典型技术栈等,揭示其核心支柱,为全面理解该应用提供了系统认识,还首次提出双层工程蓝图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22683 2026-07-21 cs.SE 版本更新 75%

Identifying Quality Indicators in Student Self-Reflections in Software Engineering

软件工程学生自我反思中的质量指标识别

Matthew Minish, Matthias Galster, Fabian Gilson

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究基于反思写作框架,提出八指标评估方案,并验证了基于RoBERTa的自动分类器在软件工程学生反思评估中的有效性,实现快速结构化反馈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29573 2026-07-20 cs.CV 版本更新 75%

Reliability-Prioritized Fine-Grained Generation in Multimodal Large

多模态大模型中可靠性优先的细粒度生成

Xiaomeng Fan, Wei Wu, Yuwei Wu, Zhi Gao, Shiyu Luo, Mingyang Gao, Haoyu Zhao, Zhenxin Diao, Yuxuan Ba, Lijia Feng, Yunde Jia, Mehrtash Harandi

机构 * Beijing Key Laboratory of Intelligent Information Technology, School of Computer Science & Technology, Beijing Institute of Technology(北京智能信息科技重点实验室,计算机科学与技术学院,北京理工大学) Guangdong Laboratory of Machine Perception and Intelligent Computing, Shenzhen MSU-BIT University(广东机器感知与智能计算实验室,深圳MSU-BIT大学) Department of Electrical and Computer System Engineering, Monash University(电子与计算机系统工程系,莫纳什大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 针对多模态大模型细粒度生成易出错的问题,提出GranFact基准和层次感知评估算法,并基于直接偏好优化提出可靠性优先的偏好优化方法,提升细粒度生成同时保持可靠性。

Comments Equal contribution: Xiaomeng Fan and Wu Wei. Corresponding authors: Zhi Gao and Yunde Jia

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24009 2026-07-20 cs.CR cs.AI cs.CL cs.LG 版本更新 75%

Jailbreak Foundry: From Papers to Runnable Attacks for Reproducible Benchmarking

Jailbreak Foundry: 从论文到可运行攻击的可重复基准测试

Zhicheng Fang, Jingjie Zheng, Chenxu Fu, Wei Xu

机构 * Shanghai Qi Zhi Institute(上海启智研究院) Tsinghua University(清华大学) University of Melbourne(墨尔本大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 JAILBREAK FOUNDRY通过多代理工作流将论文转换为可执行模块,实现可重复基准测试的标准化评估和自动化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12254 2026-07-17 cs.CV 版本更新 75%

Self-Aware Recursively Self-Improving Agents for Personal Singularity: A Goal-, Scope-, Tool-, and Benchmark-Driven Multi-Agent Architecture

如何实现递归式自我提升智能体与个人奇点:一种目标、范围、工具和基准驱动的多智能体架构

Chengshuai Yang

机构 * NextGen PlatformAI C Corp.(下一代平台人工智能C公司)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究大型语言模型智能体进步引发的问题,提出受治理多智能体架构实现递归式自我提升,以个人奇点为目标,详细介绍智能体各要素及架构组成,形式化多种机制并提供设计与路线图。

Comments 28 pages, 5 figures, 7 tables, and 5 algorithms. Position and systems-design paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20867 2026-07-15 cs.IR 版本更新 75%

E-GEO: A Testbed for Generative Engine Optimization in E-Commerce

E-GEO:电子商务中生成引擎优化的测试平台

Puneet S. Bagga, Vivek F. Farias, Tamar Korkotashvili, Tianyi Peng, Yuhang Wu

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究电子商务中生成引擎优化问题,引入E-GEO数据集,对多种生成引擎、重写器和启发式方法进行大规模实证研究,将GEO公式化并开发优化算法,通过攻击验证其有效性,揭示存在通用有效GEO策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13723 2026-07-10 cs.SE 版本更新 75%

Compiling Large Multi-Modal Requirement Documents into Runnable Software Systems: From an Agentic Test-Driven Perspective

ARC:将大型多模态需求文档编译为可运行软件系统

Weiyu Kong, Yun Lin, Xiwen Teoh, Duc-Minh Nguyen, Ruofei Ren, Jiaxin Chang, Haoxu Hu, Haoyu Chen

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 提出Agentic需求编译(ARC)技术,通过双向测试驱动智能体循环,将多模态DSL文档直接编译为可运行Web系统,在GUI测试通过率上平均提升50.6%。

Comments This work is accepted at issta'26 (SIGSOFT International Symposium on Software Testing and Analysis)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06683 2026-07-08 cs.SE 版本更新 75%

Benchmarking Requirement-to-Architecture Generation with Hybrid Evaluation

基于混合评估的软件需求到架构生成基准测试

Minxiao Li, Li Zhang, Shuying Yan, Fang Liu, Liehao Li, Yang Liu, Xiaoli Lian

专题命中 评测与基准 :LLM(summary_cn,abstract_cn)

AI总结 本文提出R2ABench基准,包含真实软件项目及PRD和PlantUML图,通过多维混合评估框架评估生成架构,发现LLM在关系推理上存在不足,代码专用模型和代理框架各有优劣。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16560 2026-07-08 cs.LG cs.AI cs.CL 版本更新 75%

Sparse but Wrong: Incorrect L0 Leads to Incorrect Features in Sparse Autoencoders

稀疏但错误:稀疏自编码器中不正确的L0导致特征错误

David Chanin, Adrià Garriga-Alonso

机构 * University College London(伦敦大学学院) MATS Research(MATS研究)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究稀疏自编码器中L0对特征提取的影响,指出L0设置不当会致SAE无法解开潜在特征,提出代理指标指导寻找正确L0,发现多数常用SAEs的L0过低,强调正确设置L0对训练具有单语义特征SAEs的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07591 2026-07-07 cs.LG cs.AI cs.CL 版本更新 75%

ResearchClawBench: A Benchmark for End-to-End Autonomous Scientific Research

ResearchClawBench: 端到端自主科学研究基准

Wanghan Xu, Shuo Li, Tianlin Ye, Qinglong Cao, Yixin Chen, Hengjian Gao, Yiheng Wang, Qi Li, Kun Li, Sheng Xu, Shengdu Chai, Fangchen Yu, Xiangyu Zhao, Zhangrui Zhao, Weijie Ma, Zijie Guo, Koutian Wu, Haoyu Zhou, Haoxiang Yin, Lixue Cheng, Chaofan Hu, Haoxuan Li, Lu Mi, Xuxuan Xie, Yifan Zhou, Ruizhe Chen, Zhiwang Zhou, Xingjian Guo, Yuhao Zhou, Xuming He, Shengyuan Xu, Xinyu Gu, Jiamin Wu, Mianxin Liu, Chunfeng Song, Fenghua Ling, Dongzhan Zhou, Shixiang Tang, Yuqiang Li, Mao Su, Peng Ye, Siqi Sun, Bin Wang, Xue Yang, Zhenfei Yin, Tianfan Fu, Guangtao Zhai, Wanli Ouyang, Bo Zhang, Lei Bai, Wenlong Zhang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出ResearchClawBench基准,包含10个领域40个任务,通过多模态评分标准评估自主科研能力,最强智能体仅得21.5分,揭示当前系统在实验协议、证据匹配和科学核心方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17418 2026-07-07 eess.SY cs.SY 版本更新 75%

PowerDAG: Supervisory Agentic AI System for Automating Distribution Grid Analysis

PowerDAG:用于自动化配电网络分析的可靠代理AI系统

Emmanuel O. Badmus, Amritanshu Pandey

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出PowerDAG,一种用于自动化复杂配电网络分析的代理AI系统,通过自适应检索和即时监督机制提升可靠性,实验显示其在未见查询上表现优异,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16584 2026-06-23 cs.CL cs.AI cs.LG 版本更新 75%

Measuring Intent Comprehension in LLMs

测量LLMs中的意图理解

Nadav Kunievsky, James A. Evans

机构 * Knowlesdge Lab, University of Chicago, Chicago, Illinois, USA(知识实验室,芝加哥大学,芝加哥,伊利诺伊州,美国) Knowledge Lab, Data Science Institute, Department of Sociology, University of Chicago, Chicago, Illinois, USA(知识实验室,数据科学学院,社会学系,芝加哥大学,芝加哥,伊利诺伊州,美国)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出一个形式化框架,通过方差分解评估LLMs对用户意图的理解能力,发现更大模型通常将更多输出方差归因于意图差异,表明意图理解更强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07226 2026-06-16 cs.LG cs.AI cs.CL 版本更新 75%

DEFINED: A Data-Efficient Computational Framework for Fine-Grained Creativity Assessment in Debate Scenarios

DEFINED: 辩论场景中细粒度创造力评估的数据高效计算框架

Tongzhou Yu, Mingjia Li, Hong Qian, Wenkai Wang, Zongbao Zhang, Yaoyu Jiang, Xiangfeng Wang, Aimin Zhou, Jiajun Guo

机构 * Nanjing University(南京大学) Shanghai Innovation Institute(上海创新研究院) East China Normal University(华东师范大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出DEFINED框架,通过层次化八维指标体系、预训练语言模型和混合粒度训练策略,在辩论场景中实现数据高效的细粒度创造力自动评估,优于现有方法。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04646 2026-06-15 cs.IR cs.AI cs.CL cs.LG 版本更新 75%

Succeeding at Scale: Enterprise Retrieval Benchmark Construction and Index-Preserving Query Adaptation for Multi-Tenant Search

规模化成功:面向多租户搜索的企业检索基准构建与索引保持查询适配

Prateek Jain, Shabari S Nair, Ritesh Goru, Prakhar Agarwal, Ajay Yadav, Yoga Sri Varshan Varadharajan, Constantine Caramanis

机构 * Prateek Jain Shabari S Nair Ritesh Goru Prakhar Agarwal Ajay Yadav Yoga Sri Varshan Varadharajan Constantine Caramanis

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 针对多租户检索系统中标注数据匮乏和模型更新成本高的问题,提出全自动构建基准DevRev-Search,并研究仅微调查询编码器而保持文档索引不变的索引保持查询适配策略,实现质量与效率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06142 2026-06-15 cs.PL cs.AI cs.CL cs.LG cs.PF 版本更新 75%

Protean Compiler: An Agile Framework to Drive Fine-grain Phase Ordering

Protean Compiler: 一种驱动细粒度阶段排序的敏捷框架

Amir H. Ashouri, Shayan Shirahmad Gale Bagi, Kavin Satheeskumar, Tejas Srikanth, Jonathan Zhao, Ibrahim Saidoun, Ziwen Wang, Bryan Chan, Tomasz S. Czajkowski

机构 * Huawei Technologies Canada(华为技术加拿大)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出Protean Compiler框架,在LLVM中内置细粒度阶段排序能力,通过140多种静态特征收集方法和机器学习优化,平均加速4.1%,最高15.7%。

Comments Version 3: Preprint version of the accepted work at ACM TACO 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13379 2026-06-12 cs.CR cs.AI cs.CL cs.LG cs.SE 版本更新 75%

Unsafer in Many Turns: Benchmarking and Defending Multi-Turn Safety Risks in Tool-Using Agents

多轮交互中的安全隐患:工具使用智能体的多轮安全风险基准与防御

Xu Li, Simon Yu, Minzhou Pan, Yiyou Sun, Bo Li, Dawn Song, Xue Lin, Weiyan Shi

机构 * Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出多轮工具使用安全基准MT-AgentRisk,发现多轮设置下攻击成功率平均增加16%,并设计无训练、与工具无关的自探索防御方法ToolShield,平均降低30%攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04464 2026-06-09 cs.CY econ.GN q-fin.EC 版本更新 75%

Bounded by Risk, Not Capability: Quantifying AI Occupational Substitution Rates via a Tech-Risk Dual-Factor Model

受风险限制而非能力:通过技术-风险双因素模型量化AI职业替代率

Shuyao Gao, Minghao Huang

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文通过技术-风险双因素模型量化AI职业替代率,揭示了职业替代并非瞬间发生,而是渐进过程,并指出算法概率无法涵盖专家受专业责任限制的'机构溢价'。

Comments 32 pages, 4 figures. v2: added link to the reproducibility repository (https://github.com/ShuyaoGao/bounded-risk-oai), updated author email, and updated several references

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06609 2026-08-11 cs.AI 版本更新 74%

Automated item evaluation: Predicting item acceptance and rejection using LLM-generated critiques

自动化项目评估:利用大语言模型生成的评语预测项目的接受与拒绝

Hotaka Maeda, Yikai Lu

机构 * Smarter Balanced, University of California-Santa Cruz(加州大学圣克鲁兹分校 Smarter Balanced) University of Minnesota-Twin Cities(明尼苏达大学双城分校)

专题命中 评测与基准 :LLM(title);分类 cs.AI

AI总结 本研究利用大规模标准化测试的项目数据,通过融合DeBERTa分类器与Qwen3生成的项目评语,构建AIE模型预测项目接受/拒绝,可减轻人工评审负担,但对公平性相关项目的识别仍需人工评审。

Comments 19 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10202 2026-08-11 cs.LG 版本更新 74%

When Counterbalancing Hides the Bias: Access-Conditioned Position Lock in Forced-Choice LLM Evaluation

跨模型价值比较中的两个混淆因素:响应确定性和访问约束

Hong-In Won, Jinseok Jang, Hyoseop Kim

机构 * KITECH(韩国产业技术评价院) National Research Council of Science and Technology (NST)(韩国国家科学技术研究院)

专题命中 评测与基准 :LLM(title);分类 cs.LG

AI总结 研究跨模型价值比较中的两个混淆因素,提出无规则价值困境等方法分离并校正响应确定性,还发现访问约束影响模型价值概况,贡献了确定性校正分解,识别出部署约束是独特价值混淆因素。

Comments 16 pages, 3 figures, 7 tables. Substantially revised: reframed around an identifiability result for the counterbalanced concentration index, with access configuration presented as one generator of the failure rather than a separate confound. Code and data are included as ancillary files

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03230 2026-07-17 cs.CL 版本更新 74%

PERL: Pinyin Enhanced Rephrasing Language Model for Chinese ASR N-best Error Correction

PERL:用于中文语音识别N-best纠错的拼音增强改写语言模型

Junhong Liang, Bojun Zhang

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 评测与基准 :language model(title);分类 cs.CL

AI总结 针对中文语音识别纠错难题,提出PERL受限改写管道,通过预测目标长度、掩码预算及融合语义与拼音表示来纠错,在Aishell-1和DoAD实验中持续降低字符错误率且保持低延迟,还分析了相关交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27232 2026-07-16 cs.CL 版本更新 74%

Targeted Linguistic Analysis of Sign Language Models with Minimal Translation Pairs

基于最小翻译对的手语语言模型目标语言分析

Serpil Karabüklü, Kanishka Misra, Shester Gueuwou, Diane Brentari, Greg Shakhnarovich, Karen Livescu

机构 * Toyota Technological Institute at Chicago(芝加哥丰田技术研究所) Linguistics Department, The University of Texas at Austin(德克萨斯大学奥斯汀分校语言学系) Linguistics Department, The University of Chicago(芝加哥大学语言学系)

专题命中 评测与基准 :language model(title);分类 cs.CL

AI总结 针对手语翻译模型,通过构建美国手语最小翻译对数据集(ASL-MTP)并消融输入线索,分析模型对不同手语现象(尤其是非手动线索)的捕捉能力。

Comments It is accepted to CVPR 2026 Workshop GenSign: Generative AI for Sign Language

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25937 2026-06-17 cs.RO cs.LG 版本更新 74%

Can Vision Foundation Models Navigate? Zero-Shot Real-World Evaluation and Lessons Learned

视觉基础模型能否导航?零样本真实世界评估与经验教训

Maeva Guerrier, Karthik Soma, Jana Pavlasek, Giovanni Beltrame

机构 * Polytechnique Montreal(蒙特利尔理工学院)

专题命中 评测与基准 :foundation model(title);分类 cs.LG

AI总结 本文对五种视觉导航模型在真实环境中进行零样本评估,发现其存在几何理解不足、感知混淆和分布漂移等系统性问题,并公开评估代码与数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏