arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-05 至 2026-05-05 共收录 190 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 24 篇

2602.05048 2026-05-05 cs.AI cs.HC 70%

MINT: Minimal Information Neuro-Symbolic Tree for Objective-Driven Knowledge-Gap Reasoning and Active Elicitation

MINT:最小信息神经符号树用于目标驱动的知识缺口推理和主动提取

Zeyu Fang, Mahdi Imani, Tian Lan

机构 * Department of Electrical and Computer Engineering, George Washington University(乔治华盛顿大学电气与计算机工程系) Department of Electrical and Computer Engineering, Northeastern University(东北大学电气与计算机工程系)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出MINT用于解决AI代理在目标驱动规划中主动提取人类输入的问题,通过神经符号树和自博弈优化策略,提升规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01566 2026-05-05 cs.AI 57%

Multi-Agent Reasoning Improves Compute Efficiency: Pareto-Optimal Test-Time Scaling

多智能体推理提升计算效率:帕累托最优测试时缩放

Florian Valentin Wunderlich, Lars Benedikt Kaesberg, Jan Philip Wahle, Terry Ruas, Bela Gipp

机构 * University of Göttingen(戈滕堡大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本文分析了多智能体推理策略的计算效率,通过实验确定在不同模型规模下,帕累托最优方法能以最低计算成本获得最高准确性,尤其在复杂任务中多智能体方法表现更优。

Comments Accepted at SRW at ACL 2026, long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01329 2026-05-05 cs.AI cs.CY 57%

Truth or Tribe: How In-group Favoritism Prioritize Facts in Persona Agents

真实还是部落:群体偏好如何优先事实于拟人代理

Shijun Lei, Hongyu Wang, Yunji Liang, Haowen Zheng, Bin Guo, Zhiwen Yu

机构 * Northwestern Polytechnical University(西北工业大学) Central University of Finance and Economics(中央财经大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 研究探讨了群体偏好在面对矛盾信息时对拟人代理的影响,提出Triadic交互框架和三种干预策略以缓解群体偏见。

Comments 21 pages. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00914 2026-05-05 cs.MA cs.AI 57%

The Cost of Consensus: Isolated Self-Correction Prevails Over Unguided Homogeneous Multi-Agent Debate

共识的成本:孤立自我修正胜过无指导的同质多智能体辩论

Blaž Bertalanič, Carolina Fortuna

机构 * Jo z ef Stefan Institute Ljubljana Slovenia Jo z ef Stefan Institute

专题命中 推理与问题求解 :LLM(abstract_cn);分类 cs.AI

AI总结 研究探讨了同质多智能体辩论中共识失败的机制,发现孤立自我修正在成本与准确性上优于无指导的同伴交流,尤其在参数规模7-8B时效果更佳。

Comments 19 pages, ACM Conference on AI and Agentic Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17815 2026-05-05 cs.HC cs.CL cs.CY 57%

Navigating the Conceptual Multiverse

在概念多元宇宙中导航

Andre Ye, Jenny Y. Huang, Alicia Guo, Rose Novick, Tamara Broderick, Mitchell L. Gordon

机构 * MIT EECS(麻省理工学院电子工程与计算机科学系) UW Allen School of CSE(华盛顿大学Allen学院计算机科学与工程系) UW Department of Philosophy(华盛顿大学哲学系)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 本文提出概念多元宇宙,通过交互系统让用户透明地检查和改变概念决策,提升问题理解。在三个领域中,该系统帮助参与者更清晰地把握问题,如哲学学生改写论文、对齐标注者深入分析用户意图、诗人发现创作模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27437 2026-05-05 cs.CV 50%

SpatialStack: Layered Geometry-Language Fusion for 3D VLM Spatial Reasoning

SpatialStack:用于3D VLM空间推理的分层几何-语言融合

Jian Zhang, Shijie Zhou, Bangya Liu, Achuta Kadambi, Zhiwen Fan

机构 * XMU(厦门大学) UCLA(美国大学) Google(谷歌) UW-Madison(威斯康星大学麦迪逊分校) TAMU(德克萨斯农工大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出SpatialStack框架,通过分层融合视觉、几何和语言表征,提升3D空间推理能力,实验表明其在多个基准上表现优异。

Comments CVPR 2026, Project Website: https://spatial-stack.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13209 2026-05-05 math.HO 50%

AI for Mathematics: Progress, Challenges, and Prospects

人工智能与数学:进展、挑战与前景

Haocheng Ju, Bin Dong

专题命中 推理与问题求解 :foundation model(abstract)

AI总结 本文综述了AI4Math领域,探讨其在数学研究中的应用及发展,强调数学作为严格推理的测试场,推动通用推理能力的进步。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 57 篇

2605.01461 2026-05-05 cs.RO cs.MA 95%

LLM-Foraging: Large Language Models for Decentralized Swarm Robot Foraging

LLM-Foraging:基于大规模语言模型的去中心化蚁群觅食

Peihan Li, Joanna Gutierrez, Fabian Hernandez, Qi Lu, Lifeng Zhou

机构 * Drexel University(德雷塞尔大学) The University of Texas Rio Grande Valley(德克萨斯大学里奥格兰德谷分校)

专题命中 评测与基准 :LLM(title,title_cn);large language model(title,abstract);language model(title,abstract)

AI总结 本文提出LLM-Foraging,通过在CPFA状态机中加入LLM战术决策器,使蚁群觅食控制器在无训练状态下适应不同配置,优于传统GA优化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01100 2026-05-05 cs.AI 92%

A Knowledge-Driven LLM-Based Decision-Support System for Explainable Defect Analysis and Mitigation Guidance in Laser Powder Bed Fusion

基于知识的LLM决策支持系统:用于激光粉末床融合的可解释缺陷分析与缓解指导

Basit Mahmud Shahriar, Md Habibor Rahman

机构 * Department of Mechanical Engineering, University of Massachusetts Dartmouth(达特茅斯大学机械工程系)

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 本文提出一种整合结构化缺陷知识与LLM推理的知识驱动决策支持系统,用于制造业中激光粉末床融合的可解释缺陷诊断与缓解指导。系统基于包含27种已知缺陷类型的知识库,支持模糊自然语言查询、文献支持的缺陷解释及基于编码工艺知识的缺陷原因和缓解策略指导。

Comments 28 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23452 2026-05-05 cs.CL cs.DL 91%

CiteAudit: You Cited It, But Did You Read It? A Benchmark for Verifying Scientific References in the LLM Era

CiteAudit:你引用了它,但你读过它吗?LLM时代验证科学参考的基准

Kaiwen Shi, Weixiang Sun, Zheyuan Zhang, Lichao Sun, Nitesh V. Chawla, Yanfang Ye

机构 * University of Notre Dame(诺丁汉大学) Lehigh University(莱恩大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出CiteAudit基准,用于验证LLM时代科学引用的真实性,通过多代理验证流程和大规模人工验证数据集,实现优于现有模型的引用验证性能。

Comments We have further refined the benchmark construction and reference verification pipeline to improve clarity and consistency. The revised version includes updated results and additional details to better align the evaluation with the intended setup. These changes provide a more precise presentation of the experimental findings, with conclusions and contributions remaining unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01451 2026-05-05 cs.CL 90%

Auditing demographic bias in AI-based emergency police dispatch: a cross-lingual evaluation of eleven large language models

对基于AI的紧急警务调度中的种族偏见进行审计:对十一种大型语言模型的跨语言评估

William Guey, Wei Zhang, Pierrick Bougault, Yi Wang, Bertan Ucar, Vitor D. de Moura, José O. Gomes

机构 * Department of Industrial Engineering, Tsinghua University(清华大学工业工程系) School of Social Sciences, Tsinghua University(清华大学社会科学部) Department of Industrial Engineering, Federal University of Rio de Janeiro(里约热内卢联邦大学工业工程系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文通过跨语言框架评估11种模型,在19800个输出中发现当事件严重性模糊时种族偏见系统性出现,但当操作优先级由通话内容确定时偏见消失。偏见程度因种族轴而异,宗教外观影响最大,性别次之,种族最小。语言间偏见转移不一致,性别偏见在中文中放大,种族偏见在英文中更明显。

Comments 26 pages, 7 figures. Submitted to Humanities and Social Sciences Communications (Nature) collection on Artificial Intelligence and Emerging Technologies in Public Safety. Code and data: https://github.com/williamguey/llmdispatchbias

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07885 2026-05-05 cs.CR cs.AI cs.SE 90%

False Friends in the Shell: Unveiling the Emoticon Semantic Confusion in Large Language Models

壳中的假朋友:揭示大型语言模型中的表情符号语义混淆

Weipeng Jiang, Xiaoyu Zhang, Juan Zhai, Shiqing Ma, Chao Shen, Yang Liu

机构 * Xi’an Jiaotong University(西安交通大学) Nanyang Technological University(南洋理工大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 研究揭示大型语言模型对表情符号的语义混淆问题,通过构建数据集发现平均混淆率超38%,且多数混淆响应导致安全风险,呼吁开发有效缓解方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19298 2026-05-05 cs.CL cs.AI cs.IR 90%

IndiaFinBench: An Evaluation Benchmark for Large Language Model Performance on Indian Financial Regulatory Text

IndiaFinBench:用于评估大语言模型在印度金融监管文本性能的评估基准

Rajveer Singh Pall

机构 * Gyan Ganga Institute of Technology and Sciences(加延加anga科技与科学学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出IndiaFinBench,首个公开的评估基准,用于评估大语言模型在印度金融监管文本上的性能,包含406个专家标注的问题-答案对,涵盖四个任务类型,评估十二个模型,发现数值推理任务表现最显著。

Comments 24 pages, 4 figures, 11 tables. Dataset and evaluation code at https://github.com/rajveerpall/IndiaFinBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01209 2026-05-05 cs.SE cs.FL 89%

ClarifySTL: An Interactive LLM Agent Framework for STL Transformation through Requirements Clarification

ClarifySTL: 一种通过需求澄清的交互式LLM代理框架用于STL转换

Yue Fang, Zhi Jin, Jie An, Hongshen Chen, Xiaohong Chen, Naijun Zhan

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出ClarifySTL框架,通过交互式澄清需求中的模糊和歧义信息,提升STL转换的准确性与效率,实验表明其在多个基准测试中表现优异。

Comments 32 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09723 2026-05-05 cs.CL cs.AI cs.LG stat.ME 89%

ALIGNS: Unlocking nomological networks in psychological measurement through a large language model

ALIGNS:通过大型语言模型解锁心理测量中的规范网络

Kai R. Larsen, Sen Yan, Roland M. Mueller, Lan Sang, Mikko Rönkkö, Ravi Starzl, Donald Edmondson

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ALIGNS利用大型语言模型构建包含55万+指标的规范网络,首次将大语言模型应用于测量验证基础问题,通过三个评估发现心理测量中的新维度和潜在问题。

Comments Error in algorithm explanation

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01292 2026-05-05 cs.CL 89%

Addressing Data Scarcity in Bangla Fake News Detection: An LLM-Based Dataset Augmentation Approach

缓解孟加拉语虚假新闻检测中的数据稀缺问题:一种基于大语言模型的数据集增强方法

Ahmed Alfey Sani, Kazi Akib Zaoad, Shefayat E Shams Adib, Md Abdul Muqtadir, Ajwad Abrar

机构 * Islamic University of Technology(伊斯兰科技大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出基于大语言模型的数据集增强框架,通过生成合成新闻文章提升孟加拉语虚假新闻分类性能,实验表明高增益率随机采样可将F1分数提升至0.88,同时公开发布4545个合成样本以支持低资源领域研究。

Comments Accepted in 15th ACM ICSCA, 2026 in Langkawi, Malaysia

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01394 2026-05-05 cs.SE cs.AI 88%

LiveFMBench: Unveiling the Power and Limits of Agentic Workflows in Specification Generation

LiveFMBench: 揭示代理工作流在规范生成中的力量与局限

Dong Xu, Jialun Cao, Guozhao Mo, Junjie Hu, Cheng Wen, Hongyu Lin, Xianpei Han, Shengchao Qin, Cong Tian, Shing-Chi Cheung, Le Sun, Yaojie Lu

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) The Hong Kong University of Science(香港科学与技术大学) Guangzhou Institute of Technology, Xidian University(西安电子科技大学广州研究所)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文通过LiveFMBench系统研究LLM和代理在C程序形式化规范生成中的能力与失败模式,发现直接提示和代理流程显著提升成功率,但需排除不忠实行为以准确评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01582 2026-05-05 cs.IR cs.AI 87%

KG-First, LLM-Fallback: A Hybrid Microservice for Grounded Skill Search and Explanation

基于知识图谱与大语言模型的混合微服务:面向 grounded skill search 和解释的 hybrid 方法

Ngoc Luyen Le, Marie-Hélène Abel, Bertrand Laforge

机构 * UTC(UTC大学) LPNHE(LPNHE研究所)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出 SkillGraph-Service 微服务,通过统一权威能力框架资源构建知识图谱,结合符号严谨与子符号灵活,实现教育者查询中的词汇不匹配处理,并利用大语言模型进行约束排序和受众感知解释,实验证明其在多语言数据集上具有高检索效果和低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01449 2026-05-05 cs.CR cs.AI 87%

VisInject: Disruption != Injection -- A Dual-Dimension Evaluation of Universal Adversarial Attacks on Vision-Language Models

VisInject:破坏≠注入——对视觉-语言模型中通用对抗攻击的双维度评估

Pang Liu, Yingjie Lao

机构 * Department of Electrical and Computer Engineering, Tufts University(Tufts大学电气与计算机工程系)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.AI

AI总结 本文通过双维度评估揭示视觉-语言模型中通用对抗攻击的脆弱性,发现攻击成功与精确注入存在显著差异,揭示了模型在微小扰动下的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01630 2026-05-05 cs.CL cs.AI 87%

Prosa: Rubric-Based Evaluation of LLMs on Real User Chats in Brazilian Portuguese

Prosa:基于评分标准的LLM在巴西葡萄牙语真实用户聊天中的评估

Roseval Malaquias Junior, Giovana Kerche Bonás, Thales Sales Almeida, Hugo Abonizio, Thiago Laitz, Ramon Pires, Marcos Piau, Celio Larcher, Rodrigo Nogueira

机构 * Maritaca AI Jusbrasil

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.CL、cs.AI

AI总结 本文提出Prosa基准,通过多判官过滤的二元评分标准减少LLM评分偏差,提升评估的判别能力,验证了评分标准的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27924 2026-05-05 cs.CL cs.AI 87%

Can AI Be a Good Peer Reviewer? A Survey of Peer Review Process, Evaluation, and the Future

人工智能能成为良好的同行评审者吗?同行评审流程、评估与未来的调查

Sihong Wu, Owen Jiang, Yilun Zhao, Tiansheng Hu, Yiling Ma, Kaiyan Zhang, Manasi Patwardhan, Arman Cohan

机构 * Yale University(耶鲁大学) New York University(纽约大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文调查了同行评审流程中的生成、 rebuttals 和 meta-review 等任务,以及评估方法,探讨了 LLM 在整个同行评审流程中的应用与未来方向。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15658 2026-05-05 cs.CL cs.AI cs.IR 87%

SurGE: A Benchmark and Evaluation Framework for Scientific Survey Generation

SurGE:科学调查生成的基准和评估框架

Weihang Su, Anzhe Xie, Qingyao Ai, Jianming Long, Xuanyi Chen, Jiaxin Mao, Ziyi Ye, Yiqun Liu

机构 * Tsinghua University(清华大学) Quan Cheng Laboratory(泉城实验室) Renmin University of China(中国人民大学) Fudan University(复旦大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 为科学调查生成任务设计了SurGE基准和评估框架,通过测试实例和学术文献库评估生成质量,揭示LLM在该任务上的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01368 2026-05-05 cs.RO 87%

Assistance Without Interruption: A Benchmark and LLM-based Framework for Non-Intrusive Human-Robot Assistance

无中断协助:一种非侵入式人机协助的基准和基于大语言模型的框架

Yuedi Zhang, Shuanghao Bai, Wanqi Zhou, Haoran Zhang, Qi Zhang, Zhirong Luan, Badong Chen

机构 * Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院) Xi’an Jiaotong University(西安交通大学) School of Electrical Engineering(电气工程学院)

专题命中 评测与基准 :LLM(title,summary_cn)

AI总结 本文提出非侵入式协助的基准和框架,通过模拟基准和新指标评估,结合LLM与评分模型实现主动非侵入式协助,减少人类努力并保持任务有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00877 2026-05-05 cs.MM cs.AI cs.CL cs.CV cs.LG 87%

OceanPile: A Large-Scale Multimodal Ocean Corpus for Foundation Models

OceanPile:一个大规模多模态海洋语料库用于基础模型

Yida Xue, Ningyu Zhang, Tingwei Wu, Zhe Ma, Daxiong Ji, Zhao Wang, Guozhou Zheng, Huajun Chen

机构 * College of Computer Science and Technology, Zhejiang University, Hangzhou 310027, China(浙江大学计算机科学与技术学院) ZJU-Hangzhou Global Scientific and Technological Innovation Center, Hangzhou 311200, China(浙江大学杭州全球科技创新中心) School of Software Technology, Zhejiang University, Ningbo 315048, China(浙江大学软件学院) Ocean College, Zhejiang University, Zhoushan 316021, China(浙江大学海洋学院) State Key Laboratory of Ocean Sensing, Hangzhou 311200, China(杭州海洋传感国家重点实验室) Ocean Research Center of Zhoushan, Zhejiang University, Zhoushan 316021, China(舟山海洋研究中心)

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出OceanPile,一个用于海洋基础模型的多模态语料库,整合了声呐数据、水下图像、海洋科学图像和科学文本,通过高质量指令数据集和评估基准提升海洋领域模型性能。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00829 2026-05-05 cs.CY 87%

LLM-based uncertainty assessment of social media situational signals for crisis reporting

基于大型语言模型的社会媒体情境信号不确定性评估用于危机报道

Timothy Douglas, Roben Delos Reyes, Asanobu Kitamoto

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出一种考虑社会媒体声明可信度的自动化情境感知报告框架,通过评估外部代理数据下的置信度生成危机报告,提升危机响应中的信息优先级处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01484 2026-05-05 cs.LG stat.ML 86%

Evaluating LLMs on Large-Scale Graph Property Estimation via Random Walks

通过随机游走评估大图属性估计中的LLM

Sunil Kumar Maurya, Xin Liu

机构 * University of Tokyo(东京大学) AIST(日本产业技术综合研究所)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出EstGraph基准数据集,设计四类任务估计大图属性,通过随机游走采样生成提示,评估LLM在大图场景下的推理能力。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01392 2026-05-05 cs.SE cs.AI 86%

Using LLMs in Software Design: An Empirical Study of GitHub and A Practitioner Survey

在软件设计中使用LLMs:GitHub和实践者调查的实证研究

Yifei Wang, Ruiyin Li, Peng Liang, Yangxiao Cai, Zengyang Li, Mojtaba Shahin, Arif Ali Khan, Qiong Feng

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) School of Computer Science, Central China Normal University(中央财经大学计算机学院) School of Computing Technologies, RMIT University(皇家墨尔本理工大学计算技术学院) M3S Research Unit, University of Oulu(奥卢大学M3S研究单位) School of Computer Science, Nanjing University of Science(南京理工大学计算机学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过实证研究和调查,探讨开发者如何利用LLM进行软件设计,发现LLM在架构设计、数据模型设计等方面的应用,揭示其优势与局限性。

Comments 29 pages, 8 images, 6 tables, Manuscript submitted to a Journal (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01372 2026-05-05 cs.CL 86%

Embedding-based In-Context Prompt Training for Enhancing LLMs as Text Encoders

基于嵌入的上下文提示训练:增强LLM作为文本编码器

Ailiang Lin, Zhuoyun Li, Keyu Mao, Kotaro Funakoshi, Manabu Okumura

机构 * Institute of Science Tokyo(东京科学研究院) Tencent(腾讯)

专题命中 评测与基准 :LLM(title_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出EPIC方法,通过上下文学习生成高质量嵌入,减少计算负担,实验表明在MTEB基准上取得新突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01417 2026-05-05 cs.CL cs.AI 86%

Medmarks: A Comprehensive Open-Source LLM Benchmark Suite for Medical Tasks

Medmarks:面向医疗任务的综合性开源大语言模型评估套件

Benjamin Warner, Ratna Sagari Grandhi, Max Kieffer, Aymane Ouraq, Saurav Panigrahi, Geetu Ambwani, Kunal Bagga, Nikhil Khandekar, Arya Hariharan, Nishant Mishra, Manish Ram, Shamus Sim Zi Yang, Ahmed Essouaied, Adepoju Jeremiah Moyondafoluwa, Robert Scholz, Bofeng Huang, Molly Beavers, Srishti Gureja, Anish Mahishi, Sameed Khan, Maxime Griot, Hunar Batra, Jean-Benoit Delbrouck, Siddhant Bharadwaj, Ronald Clark, Ashish Vashist, Anas Zafar, Leema Krishna Murali, Harsh Deshpande, Ameen Patel, William Brown, Johannes Hagemann, Connor Lane, Paul Steven Scotti, Tanishq Mathew Abraham

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Medmarks,一个包含30个医疗任务基准的开源评估套件,系统评估61个模型,揭示前沿模型在医疗推理中的优势及模型对答案顺序偏见的敏感性。

Comments website: https://medmarks.ai

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19227 2026-05-05 cs.CL cs.AI cs.HC 86%

Generative Interfaces for Language Models

生成式接口用于语言模型

Jiaqi Chen, Yanzhe Zhang, Yutong Zhang, Yijia Shao, Diyi Yang

机构 * Stanford University(斯坦福大学) Georgia Tech(佐治亚理工学院)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract_cn);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出生成式接口,通过主动生成用户界面提升多轮交互效率,实验表明其在人类偏好上提升达72%。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏