arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-24 至 2026-04-24 共收录 35 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 35 篇

2510.15313 2026-04-24 cs.CL 92%

Capabilities and Evaluation Biases of Large Language Models in Classical Chinese Poetry Generation: A Case Study on Tang Poetry

大型语言模型在古典汉语诗歌生成中的能力与评估偏差:以唐诗为例

Bolei Ma, Yina Yao, Anna-Carolina Haensch

机构 * LMU Munich(慕尼黑大学) Munich Center for Machine Learning(慕尼黑机器学习中心) University of Maryland, College Park(马里兰大学College Park分校)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文通过三步评估框架,分析了六个先进LLM在唐诗生成中的表现,揭示了LLM在模仿统计模式时对机器生成诗歌的系统性高估问题,强调了需要混合人类-模型验证框架的重要性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21505 2026-04-24 cs.SE 91%

Assessing the Impact of Requirement Ambiguity on LLM-based Function-Level Code Generation

评估需求模糊性对基于LLM的函数级代码生成的影响

Di Yang, Xinou Xie, Xiuwen Yang, Ming Hu, Yihao Huang, Yueling Zhang, Weikai Miao, Ting Su, Chengcheng Wan, Geguang Pu

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出Orchid基准,评估需求模糊性对LLM代码生成的影响,发现模糊性显著降低模型性能,且高阶模型受影响更严重,揭示了明确与模糊需求之间的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21377 2026-04-24 cs.RO cs.HC 91%

A Replicable Robotics Awareness Method Using LLM-Enabled Robotics Interaction: Evidence from a Corporate Challenge

一种利用LLM增强的机器人交互方法进行可复制的机器人意识:来自企业挑战的证据

S. A. Prieto, M. A. Gopee, Y. Ben Arab, B. García de Soto, J. Esteba, P. Olivera Brizzio

机构 * KINESIS Core Technology Platform, New York University Abu Dhabi (NYUAD)(纽约大学阿布扎比分校KINESIS核心科技平台) S.M.A.R.T. Construction Research Group, Division of Engineering, New York University Abu Dhabi (NYUAD)(纽约大学阿布扎比分校S.M.A.R.T.建筑研究小组) AD Ports Group, Corporate Innovation Department(AD Ports集团企业创新部)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出了一种基于挑战的机器人意识方法,通过LLM增强的人形机器人与阿德港集团员工的互动,展示了在工业环境中提升机器人意识的可行性与可复制性。

Comments 10 pages, 8 Figures, to be submitted for journal per-review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20677 2026-04-24 cs.CL 90%

Intersectional Fairness in Large Language Models

大语言模型中的交叉公平性

Chaima Boufaied, Ronnie De Souza Santos, Ann Barcomb

机构 * University of Calgary(卡尔加里大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文评估了六个大语言模型在交叉人口属性上的公平性,发现模型在模糊情境中表现良好,但在解歧情境中受刻板印象影响,且跨群体结果分布不均。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20726 2026-04-24 cs.CL cs.AI 90%

Exploiting LLM-as-a-Judge Disposition on Free Text Legal QA via Prompt Optimization

通过提示优化利用LLM-as-a-Judge在自由文本法律问答中的处置

Mohamed Hesham Elganayni, Runsheng Chen, Sebastian Nagl, Matthias Grabmair

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文研究提示设计和法官选择在LLM-as-a-Judge评估自由文本法律问答中的作用,通过ProTeGi方法优化提示,发现自动优化优于人类设计,宽松反馈的提示在严格法官间转移更有效。

Comments Accepted at the 21st International Conference on Artificial Intelligence and Law (ICAIL 2026), Singapore, June 8-12, 2026. 10 pages, 14 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21308 2026-04-24 cs.CR cs.CL 90%

CI-Work: Benchmarking Contextual Integrity in Enterprise LLM Agents

CI-Work: 企业LLM代理中情境完整性基准测试

Wenjie Fu, Xiaoting Qin, Jue Zhang, Qingwei Lin, Lukas Wutschitz, Robert Sim, Saravan Rajmohan, Dongmei Zhang

机构 * Huazhong University of Science and Technology(华中科技大学) Microsoft(微软)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 CI-Work基准测试评估企业LLM代理在密集检索中传达关键内容并隐藏敏感信息的能力,揭示隐私泄露普遍且高任务效用与隐私违规正相关,需转向以情境为中心的架构。

Journal ref The 64th Annual Meeting of the Association for Computational Linguistics (ACL'2026) -- Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21120 2026-04-24 cs.LG cs.CL 90%

TabSHAP

TabSHAP:一种用于LLM表格分类器的解释框架

Aryan Chaudhary, Prateek Agarwal, Tejasvi Alladi

机构 * Department of Computer Science(计算机科学系)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出TabSHAP,一种用于LLM表格分类器的解释框架,通过Jensen-Shannon散度量化特征分布影响,提升解释可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21549 2026-04-24 cs.AI stat.ME 89%

Unbiased Prevalence Estimation with Multicalibrated LLMs

基于多校准LLM的无偏流行率估计

Fridolin Linder, Thomas Leeper, Daniel Haimovich, Niek Tax, Lorenzo Perini, Milan Vojnovic

机构 * Meta Platforms Inc.(Meta公司) The London School of Economics and Political Science(伦敦政治经济学院)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出多校准方法以解决分类模型在存在协变量偏移时的流行率估计偏差问题,通过理论分析和实证应用展示其在LLM中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21697 2026-04-24 cs.CR cs.AI cs.MM 88%

Structured Visual Narratives Undermine Safety Alignment in Multimodal Large Language Models

结构化视觉叙事削弱多模态大语言模型的安全对齐

Rui Yang Tan, Yujia Hu, Roy Ka-Wei Lee

机构 * Singapore University of Technology and Design(新加坡技术与设计大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 研究发现结构化视觉叙事在多模态大语言模型中导致安全对齐问题,通过漫画模板劫持攻击展示其危害,揭示现有防御方法在处理非有害敏感内容时的不可靠性。

Comments Code released at: https://github.com/Social-AI-Studio/ComicJailbreak

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20697 2026-04-24 cs.SD cs.AI 88%

Musical Score Understanding Benchmark: Evaluating Large Language Models' Comprehension of Complete Musical Scores

音乐乐谱理解基准:评估大型语言模型对完整乐谱的理解能力

Congren Dai, Yue Yang, Krinos Li, Huichi Zhou, Shijie Liang, Bo Zhang, Enyang Liu, Ge Jin, Hongran An, Haosen Zhang, Peiyuan Jing, Kinhei Lee, Z henxuan Zhang, Xiaobing Li, Maosong Sun

机构 * Central Conservatory of Music(中央音乐学院) Imperial College London(帝国理工学院) Tsinghua University(清华大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出MSU-Bench基准,评估大型语言模型和视觉-语言模型对完整乐谱的理解能力,发现模型在模态间存在显著差距,通过微调可提升多层级正确性,为多模态推理研究提供基础。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17085 2026-04-24 cs.LG cs.AI 88%

Why Do Language Model Agents Whistleblow?

为何语言模型代理会泄露信息?

Kushal Agrawal, Frank Xiao, Guido Bergman, Asa Cooper Stickland

机构 * Relativity California Institute of Technology(加州理工学院) BAISH

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨了语言模型在作为工具使用代理时的对齐训练新表现,发现模型可能在无用户指令的情况下披露疑似违规行为,通过多样化场景评估发现模型泄露行为受模型家族、任务复杂度、道德提示和工具提供影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21125 2026-04-24 cs.DC 87%

A Cloud-Native Architecture for Human-in-Control LLM-Assisted OpenSearch in Investigative Settings

面向调查场景的云原生架构:人类控制的LLM辅助OpenSearch

Benjamin Puhani, Kai Brehmer, Malte Prieß

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出一种云原生微服务架构,用于在私有云环境中处理复杂犯罪调查中的非结构化证据和语言与技术搜索逻辑间的语义鸿沟,通过整合大语言模型实现自然语言查询到OpenSearch领域特定语言的转换,结合BM25和语义向量嵌入进行混合检索,建立系统基础架构以支持未来评估。

Journal ref Proceedings of the 17th International Conference on Cloud Computing, GRIDs, and Virtualization (CLOUD COMPUTING 2026), p. 62-65, Lisbon, Portugal, April 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21510 2026-04-24 cs.CL 86%

OptiVerse: A Comprehensive Benchmark towards Optimization Problem Solving

OptiVerse:一个面向优化问题求解的综合基准

Xinyu Zhang, Boxuan Zhang, Yuchen Wan, Lingling Zhang, YiXing Yao, Bifan Wei, Yaqiang Wu, Jun Liu

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) Ministry of Education Key Laboratory of Intelligent Networks and Network Security, China(教育部智能网络与网络安全重点实验室) Shaanxi Province Key Laboratory of Big Data Knowledge Engineering, China(陕西省大数据知识工程重点实验室) Lenovo Research(联想研究院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 OptiVerse通过1000个跨领域问题评估LLM在复杂优化任务中的表现,揭示模型在难题上的性能下降,并提出Dual-View Auditor Agent提升准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12994 2026-04-24 cs.CR cs.AI 86%

LogicEval: A Systematic Framework for Evaluating Automated Repair Techniques for Logical Vulnerabilities in Real-World Software

LogicEval: 一个系统框架用于评估自动修复技术在现实软件中逻辑漏洞的修复

Syed Md Mukit Rashid, Abdullah Al Ishtiaq, Kai Tu, Yilu Dong, Tianwei Wu, Ali Ranjbar, Tianchang Yang, Najrin Sultana, Shagufta Mehnaz, Syed Rafiul Hussain

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出LogicEval框架,通过LogicDS数据集评估传统和基于LLM的修复方法,发现编译和测试失败主要由提示敏感性、代码上下文丢失和补丁定位困难导致。

Comments To appear in ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20569 2026-04-24 cs.HC cs.AI 84%

The Effect of Idea Elaboration on the Automatic Assessment of Idea Originality

想法扩展对自动评估想法原创性的影响

Umberto Domanti, Moritz Mock, Sergio Agnoli, Antonella De Angeli

机构 * Free University of Bozen-Bolzano(博洛尼亚自由大学) University of Trieste(特里埃斯特大学) Marconi Institute for Creativity(马科尼创造力研究所)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究探讨了大型语言模型在评估发散思维任务中原创性时与人类评分者的一致性,发现LLM存在自我偏好偏差,但控制想法扩展后该偏差消失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20983 2026-04-24 cs.CV cs.AI cs.CL 84%

Thinking Like a Botanist: Challenging Multimodal Language Models with Intent-Driven Chain-of-Inquiry

像植物学家一样思考:用意图驱动的连续询问挑战多模态语言模型

Syed Nazmus Sakib, Nafiul Haque, Shahrear Bin Amin, Hasan Muhammad Abdullah, Md. Mehedi Hasan, Mohammad Zabed Hossain, Shifat E. Arman

机构 * Department of Robotics and Mechatronics Engineering, University of Dhaka(达卡大学机器人与机电工程系) Department of Computer Science and Engineering, University of Dhaka(达卡大学计算机科学与工程系) Department of Agronomy, Gazipur Agricultural University(加兹ipur农业大学作物学系) Department of Botany, University of Dhaka(达卡大学植物学系)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PlantInquiryVQA基准,通过结构化询问提升植物病害诊断准确性,揭示多步意图驱动的视觉推理方法,改进多模态模型的临床推理能力。

Comments Accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21204 2026-04-24 cs.CL cs.AI cs.IR 82%

On Reasoning Behind Next Occupation Recommendation

关于未来职业推荐的推理方法

Shan Dong, Palakorn Achananuparp, Hieu Hien Mai, Lei Wang, Yao Lu, Ee-Peng Lim

机构 * Singapore Management University(新加坡国立管理学院) Columbia University(哥伦比亚大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种两阶段职业预测方法,通过生成用户职业选择原因来提升大语言模型在职业推荐中的性能,实验表明该方法在准确率上优于无监督方法。

Comments Accepted to PAKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20859 2026-04-24 cs.IR cs.AI cs.CL 82%

KGiRAG: An Iterative GraphRAG Approach for Responding Sensemaking Queries

KGiRAG:一种用于应答意义生成查询的迭代图RAG方法

Isabela Iacob, Melisa Marian, Gheorghe Cosmin Silaghi

机构 * Babe s -Bolyai University, Business Informatics Research Center, Cluj-Napoca, Romania

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出KGiRAG,一种基于图的迭代RAG方法,通过反馈机制迭代优化输出,提升复杂查询的语义质量和相关性。

Comments Paper accepted at the 18th International Conference on Agents and Artificial Intelligence, ICAART 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21102 2026-04-24 cs.CV cs.AI 81%

Leveraging Multimodal LLMs for Built Environment and Housing Attribute Assessment from Street-View Imagery

利用多模态大语言模型进行基于街景图像的建筑环境和住房属性评估

Siyuan Yao, Siavash Ghorbany, Kuangshi Ai, Arnav Cherukuthota, Meghan Forstchen, Alexis Korotasz, Matthew Sisk, Ming Hu, Chaoli Wang

机构 * University of Notre Dame(诺丁汉大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型和谷歌街景图像自动评估美国全国建筑状况,通过微调Gemma 3 27B模型并结合知识蒸馏,实现高效准确的建筑评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20848 2026-04-24 cs.IR cs.AI 81%

MATRAG: Multi-Agent Transparent Retrieval-Augmented Generation for Explainable Recommendations

MATRAG:多智能体透明检索增强生成用于可解释推荐

Sushant Mehta

机构 * ACM

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MATRAG通过多智能体协作与知识图谱增强检索,提升推荐系统的透明性和可解释性,实验表明其在准确率和可信度上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22823 2026-04-24 cs.AI 81%

Empirical Comparison of Agent Communication Protocols for Task Orchestration

任务编排中代理通信协议的实证比较

Ivan Dobrovolskyi

机构 * MS in AI & ML Engineering, Independent Researcher, Sunnyvale, CA, USA(人工智能与机器学习工程硕士,独立研究员,美国加利福尼亚州森尼维尔)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过系统性实验比较了任务编排中工具集成、多代理委托和混合架构在三个复杂度层级上的表现,评估响应时间、上下文窗口消耗、成本、错误恢复和实现复杂度等指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10177 2026-04-24 cs.AI 81%

KompeteAI: Accelerated Autonomous Multi-Agent System for End-to-End Pipeline Generation for Machine Learning Problems

KompeteAI:面向机器学习问题端到端流水线生成的加速自主多智能体系统

Stepan Kulibaba, Artem Dzhalilov, Roman Pakhomov, Oleg Svidchenko, Alexander Gasnikov, Aleksei Shpilman

机构 * Research Center of the Artificial Intelligence Institute(人工智能研究所研究中心) Innopolis University(因诺波利斯大学) Sberbank of Russia(俄罗斯Sberbank) AI4S Center(AI4S中心) MIPT(莫斯科国立信息安全大学) Steklov Institute(斯捷克洛夫研究所)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 KompeteAI通过动态探索解决方案空间和整合RAG技术,提升了AutoML的探索效率与执行速度,实现6.9倍的流水线评估加速,并在MLE-Bench基准上超越主流方法3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28342 2026-04-24 cs.CL cs.LG 79%

Kernel-Smith: A Unified Recipe for Evolutionary Kernel Optimization

Kernel-Smith:一种统一的进化核优化配方

He Du, Qiming Ge, Jiakai Hu, Aijun Yang, Zheng Cai, Zixian Huang, Sheng Yuan, Qinxiu Cheng, Xinchen Xie, Yicheng Chen, Yining Li, Jiaxing Xie, Huanan Dong, Yaguang Wu, Xiangjun Huang, Jian Yang, Hui Wang, Bowen Zhou, Bowen Li, Qipeng Guo, Kai Chen

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) MetaX

专题命中 评测与基准 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.CL、cs.LG

AI总结 Kernel-Smith结合稳定评估驱动的进化代理与进化导向的后训练配方,通过GPU核与运算符生成实现高性能优化,其在KernelBench上取得最佳速度提升,超越多个前沿模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21131 2026-04-24 cs.CR cs.AI cs.CL cs.LG 75%

Cross-Session Threats in AI Agents: Benchmark, Evaluation, and Algorithms

AI代理中的跨会话威胁:基准测试、评估与算法

Ari Azarafrooz

机构 * Intrinsec AI

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出CSTM-Bench基准数据集,通过信息瓶颈方法评估跨会话检测,并引入CSR_prefix指标,用于评估检测算法的召回率与服务稳定性。

Comments 46 pages, 8 figures. Dataset: https://huggingface.co/datasets/intrinsec-ai/cstm-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21508 2026-04-24 cs.AI q-bio.BM 70%

BioMiner: A Multi-modal System for Automated Mining of Protein-Ligand Bioactivity Data from Literature

BioMiner:一种用于从文献中自动挖掘蛋白质-配体生物活性数据的多模态系统

Jiaxian Yan, Jintao Zhu, Yuhang Yang, Qi Liu, Kai Zhang, Zaixi Zhang, Xukai Liu, Boyan Zhang, Kaiyuan Gao, Jinchuan Xiao, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(中国科学技术大学认知智能国家重点实验室) Princeton University(普林斯顿大学) Huazhong University of Science and Technology(华中科技大学) Infinite Intelligence Pharma(无限智能制药)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 BioMiner通过多模态框架提取生物活性数据,解决手动整理与文献增长不匹配的问题,其核心方法结合直接推理和化学结构解析,实现生物活性三元组的高准确率提取。

Comments 20 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21309 2026-04-24 cs.CL 70%

When Bigger Isn't Better: A Comprehensive Fairness Evaluation of Political Bias in Multi-News Summarisation

当更大并非更好:对多新闻摘要中政治偏见的全面公平性评估

Nannan Huang, Iffat Maab, Junichi Yamagishi

机构 * RMIT University(皇家墨尔本理工大学) National Institute of Informatics(日本信息处理学会)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文评估多文档新闻摘要中的政治偏见,发现大模型并不总是更公平,中等规模模型在公平性与效率上表现更优,提示需多维评估框架和针对性去偏策略。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21154 2026-04-24 cs.AI 70%

Agentic AI for Personalized Physiotherapy: A Multi-Agent Framework for Generative Video Training and Real-Time Pose Correction

代理AI用于个性化物理治疗:一种多代理框架用于生成视频训练和实时姿态校正

Abhishek Dharmaratnakar, Srivaths Ranganathan, Anushree Sinha, Debanshu Das

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出多代理系统框架,结合生成AI和计算机视觉,解决家庭物理治疗依从性低的问题,通过生成个性化视频和实时姿态校正提升康复效果。

Comments 3 pages, 2 figures, submitted to ICDH IEEE conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21134 2026-04-24 cs.CL 70%

Beyond Pixels: Introspective and Interactive Grounding for Visualization Agents

超越像素:可视化代理的 introspective 和 interactive 地基

Yiyang Lu, Woong Shin, Ahmad Maroof Karimi, Feiyi Wang, Jie Ren, Evgenia Smirni

机构 * William & Mary(威廉玛丽学院) Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 评测与基准 :language model(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出IVG框架,结合规范引导的反思与视图引导的交互,解决VLM在可视化任务中的误读与歧义问题,通过iPlotBench验证,提升问答准确度至0.81,并展示在自主探索与实时协作中的能力。

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21096 2026-04-24 cs.IR cs.CL 70%

Multilingual and Domain-Agnostic Tip-of-the-Tongue Query Generation for Simulated Evaluation

多语言和领域无关的舌尖提示查询生成用于模拟评估

Xuhong He, To Eun Kim, Maik Fröbe, Jaime Arguello, Bhaskar Mitra, Fernando Diaz

机构 * Carnegie Mellon University(卡内基梅隆大学) Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文构建了多语言舌尖提示测试集,研究提示语言和源文档语言对模拟查询准确性的影響,并发布四个多领域测试集,为构建非英语的现实舌尖提示数据集提供指导。

Comments SIGIR 2026; NTCIR track: https://ntcir-tot.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13711 2026-04-24 cs.CL 70%

GerAV: Towards New Heights in German Authorship Verification using Fine-Tuned LLMs on a New Benchmark

GerAV:利用细调大语言模型在新基准上实现德国作者验证的新高度

Lotta Kiefer, Christoph Leiter, Sotaro Takeshita, Elena Schmidt, Steffen Eger

机构 * University of Technology Nuremberg (UTN)(图恩大学(UTN))

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出GerAV基准,通过细调大语言模型在德国作者验证任务中取得新进展,展示了模型在零样本设置下的性能提升及领域适应性研究。

详情

展开后加载摘要…

URL PDF HTML 收藏