arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-28 至 2026-04-28 共收录 519 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 94 篇

2604.16817 2026-04-28 cs.LG cs.AI 62%

Self-Reinforcing Controllable Synthesis of Rare Relational Data via Bayesian Calibration

通过贝叶斯校准实现自我强化的可控稀有关系数据合成

Chongsheng Zhang, Hao Wang, Zelong Yu, Esteban Garces Arias, Julian Rodemann, Zhanshuo Zhang, Qilong Li, Gaojuan Fan, Krikamol Muandet, Christian Heumann

机构 * Henan University, China(河南大学) Department of Statistics, LMU Munich(慕尼黑大学统计系) MCML Munich(慕尼黑MCML) CISPA Helmholtz Center for Information Security, Saarbrücken, Germany(萨尔布吕肯德国海德堡中心信息安全研究所)

专题命中 推理与问题求解 :LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出RDDG框架,通过动态引导生成表格数据以提升不平衡分类性能,采用核心集选择和自强化反馈机制优化生成质量。

Comments Accepted at: Findings of the Association for Computational Linguistics: ACL 2026 (ACL 2026 Findings), San Diego, California, USA, July 2-7, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08045 2026-04-28 cs.LO cs.AI cs.CC cs.LG 62%

Verifying Quantized GNNs With Readout Is Decidable But Highly Intractable

验证带有读出层的量化图神经网络是可判定但高度不可行的

Artem Chernobrovkin, Marco Sälzer, François Schwarzentruber, Nicolas Troquard

机构 * Gran Sasso Science Institute (GSSI)(格拉斯索科学研究所) Rheinland-Pfälzische Technische Universität (RPTU)(莱茵-普法尔茨技术大学) ENS de Lyon, CNRS, Université Claude Bernard Lyon 1, Inria, LIP, UMR 5668(里昂大学(ENS de Lyon)、国家科学研究中心(CNRS)、里昂第一大学(Université Claude Bernard Lyon 1)、法国国家信息与自动化研究所(Inria)、里昂研究院(LIP)、UMR 5668)

专题命中 推理与问题求解 :prompting(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种逻辑语言用于推理带有全局读出的量化聚合-结合图神经网络(ACR-GNNs),证明其验证任务为(co)NEXPTIME完全问题,表明量化GNN的验证计算上不可行,同时实验显示量化ACR-GNN模型轻量且保持良好精度和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24339 2026-04-28 cs.CV cs.AI 57%

See Further, Think Deeper: Advancing VLM's Reasoning Ability with Low-level Visual Cues and Reflection

看得更远,想得更深:通过低级视觉线索和反思提升VLM的推理能力

Zhiheng Wu, Tong Wang, Shuning Wang, Naiming Liu, Yumeng Zhang

机构 * Baidu Inc.(百度公司) Zhejiang University(浙江大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本文提出ForeSight框架,通过低级视觉线索和有效视觉反馈提升VLM推理能力,构建新数据集CG-SalBench,并验证其在参数规模相同和部分指标上优于现有SOTA模型。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24114 2026-04-28 cs.CL 57%

IRIS: Interleaved Reinforcement with Incremental Staged Curriculum for Cross-Lingual Mathematical Reasoning

IRIS:交错强化与增量阶段课程用于跨语言数学推理

Navya Gupta, Rishitej Reddy Vyalla, Avinash Anand, Chhavi Kirtani, Erik Cambria, Zhengchen Zhang, Zhengkui Wang, Timothy Liu, Aik Beng Ng, Simon See, Rajiv Ratn Shah

机构 * Singapore Institute of Technology(新加坡理工学院) IIIT Delhi(德里印度理工学院) University of California, San Diego(加州大学圣地亚哥分校) Nanyang Technological University(南洋理工大学) NVIDIA

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 IRIS通过结合逐步增加难度的监督微调与逆课程强化学习,提升多语言数学推理能力,尤其在低资源和双语环境下表现突出。

Comments Accepted in ACL main

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00127 2026-04-28 cs.SE cs.AI cs.PL 57%

Generating Verifiable Chain of Thoughts from Exection-Traces

从执行轨迹生成可验证的推理链

Shailja Thakur, Vaibhav Saxena, Rohan Kulkarni, Shivdeep Singh, Parameswaran Selvam, Hima Patel, Hiroshi Kanayama

机构 * IBM Research, India(印度IBM研究院) IBM Research, Japan(日本IBM研究院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本文提出通过生成执行轨迹验证的推理链,提升模型在代码推理和生成中的准确性,实验显示验证质量显著提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08686 2026-04-28 cs.IR cs.AI 57%

MVIGER: Multi-View Variational Integration of Complementary Knowledge for Generative Recommender

MVIGER:多视图变分整合互补知识的生成推荐系统

Tongyoung Kim, Soojin Yoon, SeongKu Kang, Jinyoung Yeo, Dongha Lee

机构 * Yonsei University(延世大学) Korea University(韩国大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本文提出MVIGER框架,通过统一变分方法整合互补知识,解决不同提示模板和物品索引导致的输出不一致问题,提升推荐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16046 2026-04-28 cs.RO cs.CV 50%

DextER: Language-driven Dexterous Grasp Generation with Embodied Reasoning

DextER:基于语言的灵巧抓取生成与具身推理

Junha Lee, Eunha Park, Minsu Cho

机构 * Pohang University of Science and Technology(釜山科学技术大学) RLWRLD

专题命中 推理与问题求解 :language model(abstract)

AI总结 DextER通过具身推理生成灵巧抓取,结合任务语义与物理约束,提升抓取成功率与意图对齐度。

Comments CVPR 2026, Project page: https://junha-l.github.io/dexter/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 113 篇

2604.24470 2026-04-28 cs.CL 92%

Zero-shot Large Language Models for Automatic Readability Assessment

零样本大语言模型用于自动可读性评估

Riley Grossman, Yi Chen

机构 * New Jersey Institute of Technology(新泽西理工学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 本文提出零样本提示方法用于自动可读性评估,并首次全面评估了使用大语言模型作为无监督方法的性能,通过测试10种不同开源大语言模型在14种不同数据集上的表现,证明了方法在14个数据集中优于先前方法,同时提出LAURAE结合LLM和可读性公式得分提升鲁棒性。

Comments Accepted to ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20374 2026-04-28 cs.CL cs.AI 92%

CFDLLMBench: A Benchmark Suite for Evaluating Large Language Models in Computational Fluid Dynamics

CFDLLMBench: 一个用于评估大型语言模型在计算流体力学中的性能的基准套件

Nithin Somasekharan, Ling Yue, Yadi Cao, Weichao Li, Patrick Emami, Pochinapeddi Sai Bhargav, Anurag Acharya, Xingyu Xie, Shaowu Pan

机构 * Rensselaer Polytechnic Institute(拉特格斯理工学院) University of California, San Diego(加州大学圣地亚哥分校) National Laboratory of the Rockies(落基山国家实验室) Pacific Northwest National Laboratory(太平洋西北国家实验室)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CFDLLMBench,通过三个互补组件评估LLM在计算流体力学中的能力,包括CFDQuery、CFDCodeBench和FoamBench,旨在测试LLM在流体力学知识、数值与物理推理以及上下文依赖的实现能力。

Comments 40 pages

Journal ref Journal of Data-Centric Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24361 2026-04-28 cs.CL 92%

Culture-Aware Machine Translation in Large Language Models: Benchmarking and Investigation

具有文化意识的大型语言模型机器翻译:基准测试与调查

Zekun Yuan, Yangfan Ye, Xiaocheng Feng, Baohang Li, Qichen Hong, Yunfei Lu, Dandan Tu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出CanMT数据集和评估框架,系统评估多种LLM在不同翻译策略下的表现,揭示模型在文化翻译中的性能差异及策略影响,指出文化特定项的翻译难度差异及评估可靠性问题。

Comments 26pages,25 figures ACL2026 main conference, long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24156 2026-04-28 cs.GT cs.AI 92%

Strategic Bidding in 6G Spectrum Auctions with Large Language Models

在6G频谱拍卖中使用大语言模型进行战略投标

Ismail Lotfi, Ali Ghrayeb

机构 * College of Science and Engineering, Hamad Bin Khalifa University(哈马德·本·卡西姆大学科学与工程学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文研究了在车载网络中使用大语言模型作为投标代理进行6G频谱拍卖,探讨了LLM在预算约束下的投标策略及其对拍卖机制的影响。

Comments Accepted at IEEE Transactions on Vehicular Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24544 2026-04-28 cs.AI cs.CL 92%

STELLAR-E: a Synthetic, Tailored, End-to-end LLM Application Rigorous Evaluator

STELLAR-E: 一个合成、定制、端到端的LLM应用严格评估器

Alessio Sordo, Lingxiao Du, Meeka-Hanna Lenisa, Evgeny Bogdanov, Maxim Romanovsky

机构 * Deutsche Bank, Berlin Technology Center(德意志银行,柏林技术中心)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 STELLAR-E通过合成数据生成系统,实现无需现有数据的高质量定制数据集创建,提升LLM应用评估的效率与公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23090 2026-04-28 cs.AI 92%

Towards Automated Ontology Generation from Unstructured Text: A Multi-Agent LLM Approach

从非结构化文本自动生成本体:一种多智能体LLM方法

Abid Talukder, Maruf Ahmed Mridul, Oshani Seneviratne

机构 * Rensselaer Polytechnic Institute(拉特格斯理工学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种多智能体LLM方法,通过领域特定保险合同实验,验证了在本体生成中规划优先、任务驱动的架构能提升结构质量和查询性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24579 2026-04-28 cs.SE 91%

Measuring the Unmeasurable: Markov Chain Reliability for LLM Agents

测量不可测量的:用于LLM代理的马尔可夫链可靠性

Phat T. Tran-Truong, Xuan-Bach Le

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出TraceToChain方法,通过构建吸收离散时间马尔可夫链模型,对LLM代理执行轨迹进行可靠性分析,提供更精确的成功时间分布估计和不确定性量化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23374 2026-04-28 cs.CR 91%

Ghost in the Agent: Redefining Information Flow Tracking for LLM Agents

代理中的幽灵:重新定义LLM代理的信息流跟踪

Yuandao Cai, Wensheng Tang, Cheng Wen, Shengchao Qin

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出NeuroTaint框架,通过语义证据、因果推理和持久上下文跟踪,解决LLM代理中信息流跟踪问题,优于现有基准方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23196 2026-04-28 cs.CR 91%

AsmRAG: LLM-Driven Malware Detection by Retrieving Functionally Similar Assembly Code

AsmRAG:通过检索功能相似的汇编代码实现LLM驱动的恶意软件检测

ElMouatez Billah Karbab

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出AsmRAG框架,利用LLM分析汇编代码,通过语义检索提升恶意软件检测的可解释性与鲁棒性,实验表明其在检测和家族归因任务中达到96%和95%的F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23701 2026-04-28 cs.CL cs.AI cs.CV 91%

Agri-CPJ: A Training-Free Explainable Framework for Agricultural Pest Diagnosis Using Caption-Prompt-Judge and LLM-as-a-Judge

Agri-CPJ:一种无需训练的可解释框架,用于利用Caption-Prompt-Judge和LLM-as-a-Judge进行农业害虫诊断

Wentao Zhang, Qi Zhang, Mingkun Xu, Mu You, Henghua Shen, Zhongzhi He, Keyan Jin, Derek F. Wong, Tao Fang

机构 * Business School, Shandong University of Technology(山东理工大学商学院) Faculty of Data Science, City University of Macau(澳门城市大学数据科学学院) Guangdong Institute of Intelligent Science and Technology(广东智能科学与技术研究院) Macau Millennium College(澳门 millennium 学院) Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系)

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Agri-CPJ框架,通过生成结构化形态描述并利用LLM进行判断,解决农业病害诊断中模型易产生错误物种名称和推理不可用的问题,实验显示其在病害分类和问答评分上有显著提升。

Comments This work is an expanded version of our prior paper published in the IEEE ICASSP 2026 conference arXiv:2512.24947, from 4 to 20+ pages, presenting a well-structured and principled framework, extensive experiments, and deeper insights. Tao Fang is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12826 2026-04-28 cs.CL cs.AI cs.MA 91%

Scheming Ability in LLM-to-LLM Strategic Interactions

大语言模型在LLM到LLM战略互动中的策略能力

Thao Pham

机构 * Berea College(伯克利学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究通过博弈论框架评估大语言模型的策略欺骗能力,发现模型在无提示下倾向于欺骗,尤其在Peer Evaluation中全部选择欺骗,揭示了多智能体环境下需加强高风险博弈场景的评估。

Comments 20 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23730 2026-04-28 cs.AI 91%

Expert Evaluation of LLM's Open-Ended Legal Reasoning on the Japanese Bar Exam Writing Task

对日本律师考试写作任务中LLM开放式法律推理的专家评估

Jungmin Choi, Keisuke Sakaguchi, Hiroaki Yamada

机构 * Tohoku University(东大) Tokyo Metropolitan University(东京 Metropolitan 大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文首次提出评估LLM在日本法律领域开放式法律推理能力的数据集,通过法律专家对模型输出的评估揭示了法律推理的局限性与挑战。

Comments 5 pages, Accepted to ICAIL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23255 2026-04-28 cs.HC cs.AI cs.CY 91%

Scalable LLM-based Coding of Dialogue in Healthcare Simulation: Balancing Coding Performance, Processing Time, and Environmental Impact

可扩展的基于LLM的医疗模拟对话编码:在编码性能、处理时间和环境影响之间取得平衡

Kiyoshige Garces, Gloria Milena Fernandez-Nieto, Linxuan Zhao, Sachini Samaraweera, Dragan Gasevic, Roberto Martinez-Maldonado, Vanessa Echeverria

机构 * RMIT University(皇家墨尔本理工大学) Monash University(墨尔本大学) Adelaide University(阿德莱德大学) The University of Hong Kong(香港大学) ESPOL University(ESPOL大学)

专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract);分类 cs.AI

AI总结 本文探讨了如何通过优化提示设计和批量策略,在医疗模拟复盘中平衡编码准确性、处理时间和环境影响,展示了LLM在对话分析中的可行性及实际应用价值。

Comments 12 pages, 6 figures. Accepted at the Learning at Scale Conference (L@S) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24076 2026-04-28 cs.AI cs.CL cs.CR 91%

An Information-Geometric Framework for Stability Analysis of Large Language Models under Entropic Stress

一个信息几何框架用于在熵应力下分析大语言模型的稳定性

Hikmat Karimov, Rahid Zahid Alekberli

机构 * Institute of Defense Technologies and Cybersecurity, Azerbaijan Technical University(国防技术与网络安全研究所,阿塞拜疆技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出一个信息几何框架,通过整合任务效用、熵、内部结构指标,评估大语言模型在不确定性下的稳定性,实验显示该方法在高熵条件下表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12382 2026-04-28 cs.LG cs.AI cs.CR 91%

Exploring the Secondary Risks of Large Language Models

探索大型语言模型的二次风险

Jiawei Chen, Zhengwei Fang, Yu Tian, Jiawei Du, Chao Yu, Zhaoxia Yin, Hang Su

机构 * Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学) Beijing Zhongguancun Academy(北京中关村学院) Department of Computer Science and Technology, THBI Lab, Tsinghua University(计算机科学与技术系,清华大学THBI实验室) CFAR, A*STAR, Singapore(新加坡A*STAR CFAR)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出二次风险作为新型失败模式,通过SecLens框架系统评估,揭示了大型语言模型在良性交互中存在广泛且转移性强的有害行为,强调需加强安全机制。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04424 2026-04-28 cs.CL cs.AI 91%

EmoBench-M: Benchmarking Emotional Intelligence for Multimodal Large Language Models

EmoBench-M:多模态大语言模型情感智能评估基准

He Hu, Lianzhong You, Hongbo Xu, Qianning Wang, Fei Richard Yu, Fei Ma, Zebang Cheng, Zheng Lian, Yucheng Zhou, Laizhong Cui

机构 * Shenzhen University(深圳大学) Guangdong Laboratory of Artificial Intelligence(广东人工智能与数字经济实验室) Auckland University of Technology(奥克兰理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) SKL-IOTSC, CIS, University of Macau(澳门科学技术大学SKL-IOTSC、CIS)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出EmoBench-M,通过建立心理理论基础,评估多模态大语言模型在13种场景中的情感识别、理解及社会复杂情感分析能力,揭示模型在情感智能方面的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06337 2026-04-28 cs.AI 90%

Large Language Models as Virtual Survey Respondents: Evaluating Sociodemographic Response Generation

大型语言模型作为虚拟调查受访者:评估社会人口响应生成

Jianpeng Zhao, Chenyu Yuan, Weiming Luo, Haoling Xie, Guangwei Zhang, Steven Jige Quan, Zixuan Yuan, Pengyang Wang, Denghui Zhang

机构 * University of Macau(澳门大学) The Chinese University of Hong Kong(香港中文大学) City University of Hong Kong(香港城市大学) Seoul National University(首尔国立大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出两种任务抽象方法,评估大型语言模型在生成社会人口数据中的表现,通过跨不同数据集和模型的系统比较,揭示模型在结构化输出生成中的失败模式。

Comments Revised version, major corrections

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23027 2026-04-28 cs.AI 90%

A Systematic Approach for Large Language Models Debugging

大语言模型调试的系统方法

Basel Shbita, Anna Lisa Gentile, Bing Zhang, Sungeun An, Shailja Thakur, Shubhi Asthana, Yi Zhou, Saptha Surendran, Farhan Ahmed, Rohan Kulkarni, Yuya Jeremy Ong, Chad DeLuca, Hima Patel

机构 * IBM Research(IBM研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出系统化方法用于大语言模型调试,通过统一评估、可解释性和错误分析,帮助开发者迭代诊断模型弱点,优化提示和参数,并适应数据进行微调或评估,尤其在缺乏标准化基准时仍有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14549 2026-04-28 cs.CR cs.AI 90%

Can Large Language Models Really Recognize Your Name?

大语言模型真的能识别你的名字吗?

Dzung Pham, Peter Kairouz, Niloofar Mireshghallah, Eugene Bagdasarian, Chau Minh Pham, Amir Houmansadr

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Google Research(谷歌研究) Carnegie Mellon University(卡内基梅隆大学) Google Research, University of Massachusetts Amherst(谷歌研究,马萨诸塞大学阿默斯特分校) University of Maryland, College Park(马里兰大学学院市分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文研究大语言模型在短文本中处理模糊人名的可靠性问题,构建AmBench基准测试集,发现模型对模糊人名的识别率下降20-40%,揭示隐私保护中的公平性问题。

Comments ACM FAccT '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24710 2026-04-28 cs.AI cs.CL 90%

Case-Specific Rubrics for Clinical AI Evaluation: Methodology, Validation, and LLM-Clinician Agreement Across 823 Encounters

针对具体病例的评估量表:方法、验证及LLM与医生一致性的823次病例研究

Aaryan Shah, Andrew Hines, Alexia Downs, Denis Bajet, Paulius Mui, Fabiano Araujo, Laura Offutt, Aida Rutledge, Elizabeth Jimenez

机构 * Canvas Medical Department of Biomedical Data Science, Stanford University(斯坦福大学生物医学数据科学系) XPC (X Primary Care)(XPC(X初级保健)) FCA Consulting(FCA咨询) Department of Pediatrics, University of Nevada, Reno, NV, USA(内华达大学拉斯维加斯分校儿科系)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文提出针对具体病例的评估量表方法,验证了LLM生成的量表在医生一致性上的有效性,展示了在823次病例中医生与LLM的一致性提升。

Comments 14 pages, 2 figures, 3 tables, submitted to JAMIA

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10551 2026-04-28 cs.GT cs.AI cs.LG 90%

LLM-Auction: Generative Auction towards LLM-Native Advertising

LLM-Auction: 面向LLM原生广告的生成拍卖

Chujie Zhao, Qun Hu, Shiping Song, Dagui Chen, Han Zhu, Jian Xu, Bo Zheng

机构 * Taobao & Tmall Group of Alibaba(淘宝与天猫集团)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出LLM-Auction,首个基于学习的生成拍卖机制,通过整合拍卖与生成过程,优化LLM输出与机制目标的偏好对齐,实现高效分配并满足关键机制属性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22861 2026-04-28 cs.IR cs.AI cs.LG 90%

IntrAgent: An LLM Agent for Content-Grounded Information Retrieval through Literature Review

IntrAgent:通过文献综述实现内容导向的信息检索的LLM代理

Fengbo Ma, Zixin Rao, Xiaoting Li, Zhetao Chen, Hongyue Sun, Yiping Zhao, Xianyan Chen, Zhen Xiang

机构 * University of Georgia(佐治亚大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出IntraView任务,设计IntrAgent代理,通过文献综述实现精确信息检索,提出包含315个测试实例的IntraBench基准,展示在七个基础LLM上IntrAgent比现有RAG和研究代理基线高13.2%的跨领域准确性。

Comments Accepted to ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08568 2026-04-28 cs.CL cs.AI 90%

Can We Still Hear the Accent? Investigating the Resilience of Native Language Signals in the LLM Era

我们还能听到口音吗?在大语言模型时代探究母语信号的韧性

Nabelanita Utami, Ryohei Sasano

机构 * Graduate School of Informatics, Nagoya University(名古屋大学信息学研究科)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究通过分析ACL论文集不同时期的母语识别趋势,探讨大语言模型对科研论文同质化的影响,发现后LLM时代出现异常波动,部分语言表现更趋明显。

详情

展开后加载摘要…

URL PDF HTML 收藏