arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-12 至 2026-08-12 共收录 359 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 85 篇

2608.09939 2026-08-12 cs.HC cs.AI 新提交 81%

How to Dogfood Your AI Chat Agent: A Three-Layer Evaluation Framework with Goal-Directed NPC Simulation

如何内部试用你的AI聊天智能体:一种结合目标导向NPC模拟的三层评估框架

Alexandre Cristovão Maiorano

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 该研究提出三层评估框架,结合NPC模拟器验证LLM聊天智能体的多轮对话目标达成能力,其模拟器成本低、效率高,可用于CI/CD集成,相关资源已公开供其他团队使用。

Comments 24 pages, 11 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09273 2026-08-12 cs.AI cs.SE 版本更新 81%

Entropy-based Code Adversarial Translation for Real-world Repository Migration

基于熵的代码对抗翻译用于真实仓库迁移

Yushun Tang, Yisen Cao, Zhicheng Chen, Lin Peng, Junkang Mao, Fengyi Song, Yantao Jia

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 针对LLM迁移仓库难达可运行状态的问题,提出多智能体框架ECAT,引入A2H-RepoBench基准,迁移质量达74.7%且优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08605 2026-08-12 cs.AI 版本更新 81%

ForestBench: A Unified Graph Framework for Evaluating Multi-Agent Collaboration

ForestBench:用于评估多智能体协作的统一图框架

Guo Chen, Ziwen Li, Reed Li, Yu Lu, Haibo Shi, Bingbing Xu, Junjie Huang

机构 * Southwest University(西南大学) Tencent(腾讯) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对多智能体系统异构轨迹评估的问题,提出ForestBench框架,将MAS轨迹映射为统一协作图,筛选844个查询并预计算参考图,可快速评估MAS协作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25589 2026-08-12 cs.CV cs.AI cs.CL 版本更新 81%

Forensic Reproducibility Audit of a Radiology Vision-Language Model Benchmark: From Intended Protocol to Released Artifact

放射学视觉语言模型基准的法证可重复性审计:从预期协议到发布工件

Mateusz Kozłowski

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 对胸部X光视觉语言模型试点进行法证可重复性审计,追踪提示绑定等多方面情况,发现存在图像渲染、数据分割等问题,重建队列改变统计值,撤回原声明并指定机器可验证控制。

Comments Withdrawn by the author. On further review, the archived artifacts underlying this audit are too incomplete to support the reported statistics, and the paper's conclusions do not follow from the available evidence. The work is withdrawn in full; earlier versions should not be cited

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10645 2026-08-12 eess.SY cs.SY 新提交 80%

AIDC Microgrid Vulnerability Assessment Under Computing-Power Coordinated Attacks

算力-电力协同攻击下的AI数据中心(AIDC)微电网脆弱性评估

Ze Yu, Hongwei Zhen, Chao Shen, Mingyang Sun

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文针对低碳AI数据中心(AIDC)微电网的算力-电力协同攻击问题,提出不确定性感知脆弱性评估框架,经案例验证可识别脆弱时段,协同攻击危害大于单一攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22928 2026-08-12 cs.CR 版本更新 80%

SoK: The Attack Surface of Agentic AI - Tools and Autonomy

SoK:代理AI的攻击面——工具与自主性

Ali Dehghantanha, Sajad Homayoun

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文系统分析了代理AI的安全风险,提出攻击分类与评估指标,探讨防御措施及开放研究挑战,帮助研究人员和工程师应对代理AI的安全威胁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12727 2026-08-12 cs.IR 版本更新 80%

Training Dense Retrievers with Multiple Positive Passages

利用多正例段落训练密集检索器

Benben Wang, Minghao Tang, Hengran Zhang, Jiafeng Guo, Keping Bi

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出利用多正例段落训练检索器,通过统一对比学习框架分析不同优化目标,发现LSEPair在鲁棒性和性能上表现优异,同时揭示了不同目标对正样本质量的敏感性。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10729 2026-08-12 eess.SY cs.AI cs.SY 新提交 79%

Optimal Stopping of Self-Refining Foundation Models

自优化基础模型的最优停止

Kim Hammar, Tansu Alpcan, Emil C. Lupu

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 本文将基础模型的自优化过程形式化为最优停止问题,推导可高效计算的最优停止策略,实验表明该策略在编码基准上比现有方法成本效益更高。

Comments Accepted at 65th IEEE Conference on Decision and Control (CDC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10471 2026-08-12 cs.AI 新提交 79%

RLMOpt: Adaptive Prompt Optimization via Recursive Language Models

RLMOpt:基于递归语言模型的自适应提示优化器

Subhash Bangalore Satheesha, Nirvik Pande, Deepthi Duddempudi, Bharath Dandala

机构 * Autonomize AI Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本研究提出基于递归语言模型(RLM)的自适应提示优化器RLMOpt,在四个基准上相比GEPA表现更优,效率更高且提示更小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10408 2026-08-12 cs.CL 新提交 79%

VisEditBench: Can Vision-Language Models Edit Visualization Code from Multimodal Feedback?

VisEditBench:视觉语言模型能否基于多模态反馈编辑可视化代码?

Mizanur Rahman, Arshia Azimlu, Shadikur Rahman, Md Tahmid Rahman Laskar, Amran Bhuiyan, Shafiq Joty, Enamul Hoque Prince

机构 * York University(约克大学) Nanyang Technological University(南洋理工大学) Salesforce AI Research(Salesforce人工智能研究)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 本研究推出可视化代码编辑基准VisEditBench,评估20种VLMs的编辑能力,提出基于渲染的VisEditAgent框架,显著提升了编辑任务的通过率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09302 2026-08-12 cs.CV 版本更新 78%

Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation

用于宫腔镜手术场景分割的自举式视觉-语言模型

Jun Huang, Meiyi Chen, Zijie Yue, Yuhang Xiao, Fang Li, Hanli Wang, Xiaowen Tong, Yi Guo, Miaojing Shi

专题命中 评测与基准 :language model(title,abstract)

AI总结 本研究提出首个基于VLM的宫腔镜手术场景分割方法VLM-hyster,通过类别特定文本提示与掩码蒸馏分支提升性能,在自行构建的4020张图像数据集上表现优于现有模型,获多中心验证,具临床应用潜力。

Comments Accept by Biomedical Signal Processing and Control

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03804 2026-08-12 cs.HC 版本更新 78%

How Usable Are Geospatial Foundation Models? A Systematic Evaluation of 89 Models

地理空间基础模型的可用性如何?对89个模型的系统评估

Robin Young, Artyom Gabtraupov, Kenzy Soror, Srinivasan Keshav

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本研究针对89个地理空间基础模型(GeoFMs),结合生态学家需求与人机交互理论构建七维度评估框架,发现近三分之一模型除源代码外无从业者支持,为GeoFM的可用性优化提供了诊断依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21606 2026-08-12 cs.CV 版本更新 78%

Exploring Decoupled Spatio-Temporal Consistency Learning and Self-Prompting Evolution for Self-Supervised Tracking

探索用于自监督跟踪的解耦时空一致性学习与自提示演化

Yaozong Zheng, Bineng Zhong, Qihua Liang, Ning Li, Haiying Xia, Shuxiang Song, Rongrong Ji

专题命中 评测与基准 :prompting(title,abstract)

AI总结 本研究提出SSTrack++自监督跟踪模型,通过弱到强自监督框架、解耦时空一致性策略等,在十个基准数据集上超越SOTA自监督跟踪方法,显著缩小与全监督跟踪器的性能差距。

Comments IJCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11146 2026-08-12 cs.CL 新提交 77%

The Illusion of Cross-Lingual Safety in Low-Resource Languages

低资源语言中跨语言安全的错觉

Abigail Oppong, P Sam Sahil, Tadesse Destaw Belay, Maryam Ibrahim Mukhtar, Esmael Ahmed Abdu, Tassallah Abdullahi, Jessica Oparebea, Saminu Mohammad Aliyu, Idris Abdulmumin, Abubakar Juma Chilala, Nicholaus Dismas Ladislaus, Alfred Malengo Kondoro, Lemofouet Valdini Douglace, Shamsuddeen Hassan Muhammad, Seid Muhie Yimam

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究发现大型语言模型的跨语言安全迁移在四种非洲低资源语言中极为有限,现有多语言安全对齐仅停留在表面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17173 2026-08-12 cs.CL cs.AI cs.LG 版本更新 76%

Why Do Safety Guardrails Degrade Across Languages?

为何安全护栏在不同语言中会退化?

Max Zhang, Ameen Patel, Sang T. Truong, Sanmi Koyejo

机构 * Stanford University(斯坦福大学)

专题命中 评测与基准 :language model(abstract,comments);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究通过引入多组项目反应理论框架,揭示了语言无关的安全鲁棒性、提示内在难度、全球语言处理难度和提示特定的跨语言安全差距等因素,发现安全退化并非仅在低资源语言中发生,且文化与概念不匹配也会影响安全性能。

Comments Poster at Conference on Language Modeling (COLM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11074 2026-08-12 cs.CV 新提交 75%

CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering

CapProbe:通过全场景密集问答评估详细图像描述

Mouxiao Huang, Qiangyu Yan, Borui Jiang, Han Shu

机构 * Huawei Technologies(华为技术有限公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract)

AI总结 CapProbe是用于评估VLMs生成的详细图像描述的全场景密集问答基准,通过区域对齐的事实核查,揭示了13个VLMs的覆盖差距、能力-效率权衡及遗漏的失败模式,相关资源将很快发布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12226 2026-08-12 cs.IR 版本更新 75%

Crowd-OM: Crowdsourcing for Ontology Matching Validation

解锁众包用于本体匹配验证

Zhangcheng Qiang, Weiqing Wang, Kerry Taylor

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对本体匹配验证依赖领域专家的问题,提出一种结合差分可信度、一致性预填充和时变意见的众包系统,实现人机协同验证。

Comments 6 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10268 2026-08-12 cs.LG cs.AI cs.CY 新提交 73%

Toward Human Rights Benchmarking for LLMs: A Pilot Methodology

面向大语言模型的人权基准测试:一种试点方法

Savannah Thais, Wm. Matthew Kennedy, Abhigyan Acherjee, Matilda Wysocki, Malcolm Langford, Caitlin Kraft Buchman

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究开发了首个经专家验证的人权基准HumRightsBench,调整IRAC框架为IRAP,通过真实场景测试LLMs的人权推理能力,发现模型准确率差异显著,可推动AI评估科学发展。

Comments Best paper, honorable mention, at the ICML 2026 Workshop on AI4Law, Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10258 2026-08-12 cs.CL cs.AI 新提交 73%

TAF-MED: Multi-Turn Safety Refusal Collapse in LLMs Under Declared Self-Treatment Intent

TAF-MED:声明自我治疗意图下大语言模型的多轮安全拒绝崩溃

Waleed Jamil, Raphael Schmitt

机构 * Independent Researcher(独立研究者) School of Computation, Information and Technology, Technical University of Munich(慕尼黑工业大学计算、信息与技术学院) Institute of General Practice, Faculty of Medicine and Medical Center, University of Freiburg(弗莱堡大学医学中心医学院普通实践研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究推出TAF-MED医疗安全基准,评估8个大语言模型的多轮医疗对话安全表现,发现多数模型会在后续对话中出现安全拒绝崩溃,自动评判工具与医生标注一致性较高,将公开基准支持相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13201 2026-08-12 cs.CL cs.AI 版本更新 73%

InfiniteScienceGym: An Unbounded, Procedurally-Generated Benchmark for Scientific Analysis

InfiniteScienceGym:一个无界的、程序生成的科学分析基准

Oliver Bentham, Vivek Srikumar

机构 * Kahlert School of Computing(卡勒特计算学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出InfiniteScienceGym,通过程序生成科学仓库和可验证问答任务,评估证据推理、回避和工具分析能力,发现现有模型在回答不可答问题上存在显著缺陷。

Comments 31 pages, 5 figures, 8 tables. Accepted to COLM 2026. See https://infinitesciencegym.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11093 2026-08-12 cs.LG cs.CV 新提交 72%

Cross-View Feature Matching: Survey, Benchmarking, and Foundation-Model Perspectives

跨视图特征匹配:综述、基准测试与基础模型视角

Songlin Du, Xiaoyong Lu, Zeyu Wu, Xiaobo Lu, Guobao Xiao, Bin Fan, Jiayi Ma, Takeshi Ikenaga

机构 * School of Automation, Southeast University(东南大学自动化学院) School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) Institute of Artificial Intelligence, University of Science and Technology Beijing(北京科技大学人工智能研究院) School of Robotics, Wuhan University(武汉大学机器人学院) Graduate School of Information, Production and Systems, Waseda University(早稻田大学信息生产系统研究科)

专题命中 评测与基准 :foundation model(abstract,abstract_cn);分类 cs.LG

AI总结 本综述梳理跨视图特征匹配领域进展,构建结构化分类体系,开展统一基准测试,提炼设计原则,探讨开放挑战,为该领域发展提供全面参考。

Comments This manuscript goes beyond a conventional survey. It proposes a new taxonomy for cross-view feature matching, provides extensive benchmarking under unified datasets and protocols, and offers original analysis from the perspective of vision foundation models. These contributions provide substantive methodological synthesis, empirical findings, and new research insights

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10954 2026-08-12 cs.CV cs.AI 新提交 70%

Evidence-Grounded Trustworthy Multimodal Reasoning and Evaluation Benchmark in Complex Urban Scenes

复杂城市场景中基于证据的可信多模态推理与评估基准

Zhaoyang Wei, Bowen Jiang, Xumeng Han, Jiashu Li, Xuehui Yu, Yuling Liu, Guorong Li, Zhenjun Han, Jianbin Jiao

机构 * University of Chinese Academy of Sciences (UCAS)(中国科学院大学) Tencent CDG(腾讯云与智慧产业事业群) Institute of Information Engineering, CAS(中国科学院信息工程研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对复杂城市场景中多模态大语言模型的推理可靠性问题,提出AD2-Bench基准与EGVOR模型,提升了不利条件下的多模态推理稳定性。

Comments Accepted by IJCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10806 2026-08-12 cs.CL 新提交 70%

Assessing Reliability of BERT-Based Models on Question Answering Tasks

评估基于BERT的模型在问答任务上的可靠性

Pooja Yadav, Priyanka Harjule, Basant Agarwal, Marko Robnik Šikonja

机构 * Malaviya National Institute of Technology(马拉维亚国家理工学院) Central University of Rajasthan(拉贾斯坦中央大学) University of Ljubljana(卢布尔雅那大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究评估BERT及其变体在问答任务上的可靠性,发现RoBERTa可靠性更高,ALBERT与DistilBERT存在显著不一致,验证了MCD作为可靠性指标的有效性,强调需同时评估QA模型的准确性与稳定性。

Comments Accepted for publication in the Journal of Experimental & Theoretical Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10375 2026-08-12 cs.CE cs.AI 新提交 70%

Beyond Forecasting: Recasting Volatility Control as a Routing Problem

超越预测:将波动率控制重新定义为路由问题

Hongji Pu, Leyang Zhou

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究提出模块化框架VolRouter,将波动率控制转化为基于状态的估计器-控制器对路由问题,在四类金融场景中多数取得最优风险调整表现,证明波动率控制可视为策略选择问题。

Comments 24 pages, 6 figures, ACM ICAIF

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10224 2026-08-12 cs.AI 新提交 70%

Self-evolving Agentic Customer Support System at LinkedIn

领英的自进化智能体客户支持系统

Chih Hui Wang, Mengdie Tu, Qianyun Zhang, Wei Wu, Lili Zhou, Mingqi Shen, Changshuai Wei

机构 * LinkedIn(领英公司)

专题命中 评测与基准 :foundation model(abstract);prompting(abstract);分类 cs.AI

AI总结 领英提出一种集成检索增强生成、进化自动提示与模块化评估框架的自进化智能体客户支持系统,经测试可显著提升多项支持任务指标,为企业级自进化 AI 智能体提供可行方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07917 2026-08-12 cs.AI 版本更新 70%

TongGuOCR: A Layout-Aware and Token-Augmented OCR MLLM for Chinese Historical Documents

TongGuOCR:面向中文历史文献的布局感知与 token 增强 OCR 框架

Zhongheng Zhou, Yi Sun, Huiguo He, Yuyi Zhang, Peirong Zhang, Yulin Fang, Dezhi Peng, Minghui Liao, Lianwen Jin

机构 * School of Electronic and Information Engineering, South China University of Technology(华南理工大学电子与信息工程学院) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对中文历史文献OCR的复杂布局、生僻字等挑战,提出TongGuOCR框架,通过布局感知预处理与token增强识别模块,在M5HisDoc等基准上取得优于同类模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17441 2026-08-12 cs.HC cs.AI cs.CY 版本更新 70%

Patients With Personality: Realistic Patient Simulation through Controlled Diversity and Selective Disclosure

具有个性的患者:通过受控多样性与选择性披露实现逼真的患者模拟

Moritz Schlager, Friederike Jungmann, Samuel Schmidgall, Philipp Raffler, Franziska Hartl, Eva Wende, Paula Roßmüller, Conrad Ketzer, Avinatan Hassidim, Dale R. Webster, Yossi Matias, Yun Liu, Daniel Rueckert, Mike Schaekermann, Paul Hager

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) TUM University Hospital(慕尼黑技术大学医院) Google DeepMind(谷歌DeepMind) Google Research(谷歌研究) Imperial College London(伦敦帝国学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出PatientsWithPersonality框架,通过HEXACO人格参数化控制患者对话风格、合作性和信息披露,生成逼真且多样化的虚拟患者,在临床评估中接近真实演员表现。

Comments 22 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08991 2026-08-12 cs.CV cs.AI 版本更新 70%

PinpointQA: A Benchmark for Small Object-Centric Spatial Understanding in Indoor Videos

PinpointQA: 一个用于室内视频中微小物体中心空间理解的数据集和基准

Zhiyu Zhou, Peilin Liu, Ruoxuan Zhang, Luyang Zhang, Cheng Zhang, Hongxia Xie, Wen-Huang Cheng

机构 * Jilin University(吉林大学) National Taiwan University(国立台湾大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出PinpointQA数据集,用于评估多模态大语言模型在室内视频中对微小物体空间定位的精准理解能力,通过四个递进任务验证模型性能,并展示其作为诊断基准和训练数据集的效果。

Comments Accepted at the ECCV 2026 Workshop on Embodied Multimodal Reasoning in Physical Environments (EMR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11533 2026-08-12 cs.CL cs.CV 版本更新 70%

Checkup2Action: A Multimodal Clinical Check-up Report Dataset for Patient-Oriented Action Card Generation

Checkup2Action:面向患者行动的多模态临床检查报告数据集

Sike Xiang, Shuang Chen, Kevin Qinghong Lin, Jialin Yu, Yijia Sun, Philip Torr, Amir Atapour-Abarghouei

机构 * Durham University(杜伦大学) University of Oxford(牛津大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出Checkup2Action数据集,用于生成结构化的行动卡,通过多模态检查报告生成患者导向的行动建议,评估行动的准确性、优先级和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02319 2026-08-12 cs.CL 版本更新 70%

No Single Best Model for Diversity: Learning a Router for Sample Diversity

没有单一最佳模型用于多样性:学习一个路由器以实现样本多样性

Yuhan Liu, Fangyuan Xu, Vishakh Padmakumar, Daphne Ippolito, Eunsol Choi

机构 * New York University(纽约大学) Stanford University(斯坦福大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(abstract_cn);prompting(abstract);分类 cs.CL

AI总结 本文研究了如何通过路由器选择最佳模型以生成多样化的响应,发现无单一模型在广泛提示下表现最佳,且在不同数据集上具有泛化能力。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏