arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Annual Meeting of the Association for Computational Linguistics · 会议 · Natural Language Processing

2026-06-12 至 2026-06-12 共收录 5
2606.13647 2026-06-12 cs.CL cs.AI cs.LG 新提交

SkMTEB: Slovak Massive Text Embedding Benchmark and Model Adaptation

SkMTEB:斯洛伐克大规模文本嵌入基准与模型适配

Marek Šuppa, Andrej Ridzik, Daniel Hládek, Natália Kňažeková, Viktória Ondrejová

机构 * Comenius University in Bratislava(布拉迪斯拉发夸美纽斯大学) Cisco Systems(思科系统) Technical University of Košice(科希策技术大学) Kempelen Institute of Intelligent Technologies(肯佩伦智能技术研究所)

AI总结 针对低资源西斯拉夫语斯洛伐克语,构建首个MTEB风格文本嵌入基准SkMTEB(含31个数据集、7类任务),并开发高效本地部署模型e5-sk-small/large,通过词汇裁剪与微调在参数减少62%下达到与商业API相当的竞争力。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13537 2026-06-12 cs.CL 新提交

When Does Mixing Help? Analyzing Query Embedding Interpolation in Multilingual Dense Retrieval

何时混合有帮助?分析多语言稠密检索中的查询嵌入插值

Tongyao Zhu, Chao-Ming Huang, Min-Yen Kan

机构 * National University of Singapore(新加坡国立大学)

AI总结 通过嵌入级插值构造混合查询,系统研究多语言稠密检索对混合语言查询的敏感性,发现最优混合比在多数情况下优于单语言查询,且英语主导性导致不对称性。

Comments ACL 2026 Main (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13288 2026-06-12 cs.CV cs.AI cs.CL 新提交

Cross-Modal Masked Compositional Concept Modeling for Enhancing Visio-Linguistic Compositionality

跨模态掩码组合概念建模以增强视觉-语言组合性

Wei Li, Zhen Huang, Xinmei Tian

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(中国科学技术大学,教育部脑启发智能感知与认知重点实验室) Independent Researcher(独立研究员)

AI总结 提出MACCO框架,通过掩码一个模态的组合概念并从另一模态完整上下文重建,增强视觉-语言模型的组合理解能力,在五个基准上显著提升。

Comments Accepted to ACL 2026 Main Conference, 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13051 2026-06-12 cs.AI 新提交

AAbAAC: An Annotated Corpus for Autoimmunity Information Extraction

AAbAAC:用于自身免疫信息抽取的标注语料库

Fabien Maury, Solène Grosdidier, Maud de Dieuleveult, Adrien Coulet

机构 * Inserm, Université Paris Cité, U1163 Institut Imagine(法国国家健康与医学研究院、巴黎西岱大学、U1163 想象研究所) Inria, Inserm, Université Paris Cité, U1346 HeKA(法国国家信息与自动化研究所、法国国家健康与医学研究院、巴黎西岱大学、U1346 HeKA) Freelance researcher(自由研究员)

AI总结 针对自身免疫领域信息抽取性能不足,构建了包含115篇PubMed摘要的AAbAAC语料库,手动标注实体和关系,通过微调NER模型验证了其有效性。

Journal ref BioNLP 2026 - 25th Workshop on Biomedical Natural Language Processing, ACL, Jul 2026, San Diego (CA), United States

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12854 2026-06-12 cs.CL q-bio.QM 新提交

Small LLMs for Biomedical Claim Verification: Cost-Effective Fine-Tuning, Structural Dataset Shortcuts, and Cross-Domain Generalization

小型LLM用于生物医学声明验证:成本效益微调、结构性数据集捷径与跨域泛化

Gaurav Kumar

机构 * Moveworks AI University of California San Diego(加州大学圣迭戈分校)

AI总结 通过QLoRA微调小型LLM(Phi-3-mini、Qwen2.5-3B、Mistral-7B),在生物医学声明验证中超越GPT-4o和GPT-5(F1提升12%),并发现SciFact数据集的结构性伪影,提出基于结构稳健数据的跨域迁移方法。

Comments 8 pages, 2 figures, 12 tables. To appear at BioNLP Workshop, ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏