arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-20 至 2026-03-20 共收录 93 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 26 篇

2603.18892 2026-03-20 cs.CV cs.AI 79%

MultihopSpatial: Multi-hop Compositional Spatial Reasoning Benchmark for Vision-Language Model

MultihopSpatial: 用于视觉语言模型的多跳组合空间推理基准

Youngwan Lee, Soojin Jang, Yoorhim Cho, Seunghwan Lee, Yong-Ju Lee, Sung Ju Hwang

机构 * Electronics and Telecommunications Research Institute, South Korea(韩国电信研究院) Korea Advanced Institute of Science and Technology, South Korea(韩国科学技术院) Sungkyunkwan University, South Korea(成均馆大学) DeepAuto, South Korea(DeepAuto)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出MultihopSpatial基准,针对多跳组合空间推理问题,引入Acc@50IoU指标,并通过大规模训练集提升视觉语言模型的空间推理能力。

Comments Project page: https://youngwanlee.github.io/multihopspatial

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18614 2026-03-20 cs.AI 79%

ZEBRAARENA: A Diagnostic Simulation Environment for Studying Reasoning-Action Coupling in Tool-Augmented LLMs

ZEBRAARENA:一种用于研究工具增强大语言模型中推理-动作耦合的诊断模拟环境

Wanjia Zhao, Ludwig Schmidt, James Zou, Vidhisha Balachandran, Lingjiao Chen

机构 * Stanford University(斯坦福大学) Microsoft Research(微软研究院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 ZEBRAARENA通过可控难度和知识最小化设计,研究工具增强大语言模型中的推理-动作耦合,强调深度推理与精准工具调用的结合,揭示理论最优与实际工具使用间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18418 2026-03-20 cs.CV cs.AI 79%

Mind the Rarities: Can Rare Skin Diseases Be Reliably Diagnosed via Diagnostic Reasoning?

注意罕见病:罕见皮肤疾病能否通过诊断推理可靠诊断?

Yang Liu, Jiyao Yang, Hongjin Zhao, Xiaoyong Li, Yanzhe Ji, Xingjian Li, Runmin Jiang, Tianyang Wang, Saeed Anwar, Dongwoo Kim, Yue Yao, Zhenyue Qin, Min Xu

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Australian National University(澳大利亚国立大学) University of Western Australia(西澳大学) POSTECH Yale University(耶鲁大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出DermCase基准,通过多模态数据评估罕见皮肤疾病诊断推理能力,揭示现有模型在诊断准确性和临床推理中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20579 2026-03-20 cs.CV cs.AI cs.MM 79%

Open-o3-Video: Grounded Video Reasoning with Explicit Spatio-Temporal Evidence

Open-o3-Video: 基于显式时空证据的视频推理

Jiahao Meng, Xiangtai Li, Haochen Wang, Yue Tan, Tao Zhang, Lingdong Kong, Yunhai Tong, Anran Wang, Zhiyang Teng, Yujing Wang, Zhuochen Wang

机构 * PKU(北京大学) ByteDance(字节跳动) CASIA(CASIA研究院) WHU(武汉大学) NUS(新加坡国立大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出Open-o3-Video,通过显式时空证据提升视频推理的可追溯性与可验证性,基于STGR数据集和冷启动强化学习策略,在V-STAR基准上取得SOTA性能,并支持置信度感知的测试时扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18988 2026-03-20 cs.RO 78%

MERGE: Guided Vision-Language Models for Multi-Actor Event Reasoning and Grounding in Human-Robot Interaction

MERGE:面向人类机器人交互中多主体事件推理与 grounding 的引导视觉-语言模型

Joerg Deigmoeller, Nakul Agarwal, Stephan Hasler, Daniel Tanneberg, Anna Belardinelli, Reza Ghoddoosian, Chao Wang, Felix Ocker, Fan Zhang, Behzad Dariush, Michael Gienger

机构 * Honda Research Institute Europe(本田欧洲研究院) Honda Research Institute USA(本田美国研究院)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 MERGE 通过引导视觉语言模型实现动态人类机器人交互中多主体事件的推理与 grounding,提升 situational awareness 与效率,基于 GROUND 数据集验证其性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19092 2026-03-20 cs.CV cs.AI cs.CL cs.LG 67%

SAVeS: Steering Safety Judgments in Vision-Language Models via Semantic Cues

SAVeS: 通过语义线索引导视觉-语言模型中的安全判断

Carlos Hinojosa, Clemens Grange, Bernard Ghanem

机构 * King Abdullah University of Science and Technology(国王阿卜杜勒-阿齐兹大学科学与技术学院) Technical University of Munich(慕尼黑技术大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过语义线索引导视觉-语言模型的安全判断,提出SAVeS基准和评估协议,验证安全决策对语义线索的敏感性,揭示模型对视觉-语言关联的依赖及潜在安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19149 2026-03-20 cs.CL cs.LG 62%

Optimal Splitting of Language Models from Mixtures to Specialized Domains

从混合数据中语言模型的最优分割以专用于特定领域

Skyler Seto, Pierre Ablin, Anastasiia Filippova, Jiayuan Ye, Louis Bethune, Angelos Katharopoulos, David Grangier

机构 * Apple(苹果公司) National University of Singapore(新加坡国立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种方法,通过独立预训练多个模型并利用缩放定律确定预训练和继续预训练之间的最佳计算分配,从而提升不同模型大小和计算预算下的常识知识和推理基准性能。

Comments 26 pages, 11 tables, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18773 2026-03-20 cs.LG cs.AI 62%

Automatic Configuration of LLM Post-Training Pipelines

大语言模型后训练流程的自动配置

Channe Chwa, Xinle Wu, Yao Lu

机构 * National University of Singapore(新加坡国立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AutoPipe框架,通过学习历史运行数据和贝叶斯优化,有效配置大语言模型后训练流程,减少计算成本并提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18007 2026-03-20 cs.CL cs.AI 62%

Do Large Language Models Possess a Theory of Mind? A Comparative Evaluation Using the Strange Stories Paradigm

大型语言模型具备心智理论吗?使用奇怪故事范式进行比较评估

Anna Babarczy, Andras Lukacs, Peter Vedres, Zeteny Bujka

机构 * ELTE Research Centre for Linguistics(ELTE语言学研究中心) Department of Cognitive Science, Faculty of Natural Sciences, Budapest University of Technology and Economics(布达佩斯技术与经济大学自然科学学院认知科学系) Institute of Mathematics, Eötvös Lóránd University(欧多布雷尼大学数学研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过奇怪故事范式评估了大型语言模型是否具备心智理论能力,发现GPT-4o在复杂条件下表现接近人类,而早期小型模型易受相关线索影响且易受无关信息干扰。

Comments 19 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09734 2026-03-20 cs.CL cs.AI 62%

From Detection to Diagnosis: Advancing Hallucination Analysis with Automated Data Synthesis

从检测到诊断:通过自动化数据合成推进幻觉分析

Yanyi Liu, Qingwen Yang, Tiezheng Guo, Feiyu Qu, Jun Liu, Yingyou Wen

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出从检测到诊断的新范式,通过自动化数据合成生成高质量训练样本,训练出HDM-4B-RL模型,在幻觉诊断任务中超越现有检测模型,实现更可靠的生成式AI系统。

Comments Accepted at The 40th Annual AAAI Conference on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18976 2026-03-20 cs.AI 57%

Evaluating 5W3H Structured Prompting for Intent Alignment in Human-AI Interaction

评估5W3H结构提示在人机交互中的意图对齐

Peng Gang

机构 * Huizhou Lateni AI Technology Co., Ltd.(惠州拉提尼人工智能科技有限公司) Huizhou University(惠州大学)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 本文通过对比三种提示条件,评估了基于5W3H的PPS框架在人机交互中提升意图对齐的效果,发现渲染化的PPS在高歧义任务中表现更优,且揭示了结构化提示在实际应用中的价值。

Comments 27 pages, figures, tables, and appendix. Primary category: human-computer interaction / human-AI interaction. Public artifact repository and implementation resources are referenced in the manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18729 2026-03-20 cs.AI 57%

Analysis Of Linguistic Stereotypes in Single and Multi-Agent Generative AI Architectures

单Agent和多Agent生成式AI架构中语言刻板印象的分析

Martina Ullasci, Marco Rondina, Riccardo Coppola, Flavio Giobergia, Riccardo Bellanca, Gabriele Mancari Pasi, Luca Prato, Federico Spinoso, Silvia Tagliente

机构 * Politecnico di Torino(托斯卡纳理工学院)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.AI

AI总结 本文分析了生成式AI在单Agent和多Agent架构中对不同方言的刻板印象生成,探讨了通过提示工程和多Agent架构缓解偏见的效果,发现不同模型在刻板印象表现上存在显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18677 2026-03-20 cs.HC cs.AI cs.CY 57%

Cognitive Amplification vs Cognitive Delegation in Human-AI Systems: A Metric Framework

认知放大与认知委托在人机系统中的区别:一个度量框架

Eduardo Di Santi

机构 * University of Colorado Boulder(科罗拉多大学波德穆尔分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出度量框架区分认知放大与认知委托,通过定义CAI*、D、HRI和HCDR等指标,评估人机系统协同性能及人类认知可持续性。

Comments 16 pages, 2 figures. Conceptual and mathematical framework for human-AI collaboration, cognitive amplification, cognitive delegation, and cognitive sustainability

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18508 2026-03-20 cs.CV cs.AI 57%

Foundations and Architectures of Artificial Intelligence for Motor Insurance

人工智能在机动车保险中的基础与架构

Teerapong Panboonyuen

机构 * Thaivivat Insurance Public Company Limited(泰维瓦特保险公共公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文系统阐述了机动车保险中人工智能的基础与架构,结合大规模实际应用,提出统一的垂直整合AI范式,整合感知、多模态推理和生产基础设施,实现汽车风险评估和理赔流程的端到端自动化。

Comments 173 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09909 2026-03-20 cs.AI 57%

MedMASLab: A Unified Orchestration Framework for Benchmarking Multimodal Medical Multi-Agent Systems

MedMASLab:多模态医疗多智能体系统的统一协调框架

Yunhang Qian, Xiaobin Hu, Jiaquan Yu, Siyang Xin, Xiaokun Chen, Jiangning Zhang, Peng-Tao Jiang, Jiawei Liu, Hongwei Bran Li

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学) Zhejiang University(浙江大学) vivo Stanford University(斯坦福大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出MedMASLab框架,解决医疗多智能体系统中多模态整合碎片化问题,通过标准化通信协议、自动化评估器和大规模基准测试,揭示领域特定性能差距,为未来自主临床系统建立新基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19098 2026-03-20 cs.CV 50%

TAU-R1: Visual Language Model for Traffic Anomaly Understanding

TAU-R1:用于交通异常理解的视觉语言模型

Yuqiang Lin, Kehua Chen, Sam Lockyer, Arjun Yadav, Mingxuan Sui, Shucheng Zhang, Yan Shi, Bingzhang Wang, Yuang Zhang, Markus Zarbock, Florain Stanek, Adrian Evans, Wenbin Li, Yinhai Wang, Nic Zhang

机构 * University of Bath(巴斯大学) University of Washington(华盛顿大学) City of Carmel, Indiana(印第安纳州卡迈尔市) Starwit GmbH

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出TAU-R1模型,通过两层框架提升交通异常识别与推理能力,结合定制化训练策略与数据集,实现高效部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19059 2026-03-20 cs.CV 50%

SignAgent: Agentic LLMs for Linguistically-Grounded Sign Language Annotation and Dataset Curation

SignAgent:用于语言学基础的手语标注和数据集整理的代理LLM

Oliver Cory, Ozge Mercanoglu Sincan, Richard Bowden

机构 * Centre for Vision, Speech and Signal Processing(视觉、语音和信号处理中心)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出SignAgent,一种利用大语言模型进行可扩展、语言学基础的手语标注和数据集整理的新框架。通过SignAgent协调器和SignGraph,解决传统方法和手动标注的瓶颈,实现大规模语言感知数据标注。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18625 2026-03-20 cs.CV 50%

GenVideoLens: Where LVLMs Fall Short in AI-Generated Video Detection?

GenVideoLens:在AI生成视频检测中LVLMs的局限性

Yueying Zou, Pei Pei Li, Zekun Li, Xinyu Guo, Xing Cui, Huaibo Huang, Ran He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) University of California, Santa Barbara(加州大学圣巴巴拉分校) Center for Research on Intelligent Perception and Computing, NLPR, Institute of Automation, Chinese Academy of Sciences(智能感知与计算中心、国家智能感知与信息处理实验室、中国科学院自动化研究所)

专题命中 推理评测 :reasoning(abstract)

AI总结 GenVideoLens通过细粒度评估揭示LVLM在AI生成视频检测中的能力差距,发现其在光学一致性、物理交互和时间因果推理上表现不足,且模型性能在不同维度上差异显著。

Comments ECCV 2026 submission. 14 pages, 6 figures, 4 tables. Supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18753 2026-03-20 cs.CV 50%

CrossHOI-Bench: A Unified Benchmark for HOI Evaluation across Vision-Language Models and HOI-Specific Methods

CrossHOI-Bench: 一个统一的HOI评估基准,涵盖视觉-语言模型和特定HOI方法

Qinqian Lei, Bo Wang, Robby T. Tan

机构 * National University of Singapore(新加坡国立大学) University of Mississippi(密西西比大学) ASUS Intelligent Cloud Services(ASUS智能云服务)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出CrossHOI-Bench,通过显式正例和 curated 负例,统一评估VLM和HOI方法,揭示两者在多任务和细粒度交互上的互补优劣。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18516 2026-03-20 cs.IR 50%

Total Recall QA: A Verifiable Evaluation Suite for Deep Research Agents

全面回忆问答:深度研究代理的可验证评估套件

Mahta Rafiee, Heydar Soudani, Zahra Abbasiantaeb, Mohammad Aliannejadi, Faegheh Hasibi, Hamed Zamani

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出Total Recall QA评估框架,通过结构化知识库和文本语料构建精准查询,建立基于Wikidata-Wikipedia和合成电商知识库的基准测试,评估深度研究代理的检索与生成能力。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02009 2026-03-20 cs.DC 50%

STRATUS: A Multi-agent System for Autonomous Reliability Engineering of Modern Clouds

STRATUS:一种用于现代云服务自主可靠性工程的多智能体系统

Yinfang Chen, Jiaqi Pan, Jackson Clark, Yiming Su, Noah Zheutlin, Bhavya Bhavya, Rohan Arora, Yu Deng, Saurabh Jha, Tianyin Xu

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出STRATUS,一种基于LLM的多智能体系统,用于实现云服务的自主SRE。系统通过状态机组织多个专用智能体,提升故障检测、诊断和缓解的效率,并通过Transactional No-Regression规范提高自主故障缓解的成功率。

Comments 10 pages for main text

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 12 篇

2603.18718 2026-03-20 cs.AI 79%

MemMA: Coordinating the Memory Cycle through Multi-Agent Reasoning and In-Situ Self-Evolution

MemMA:通过多智能体推理和现场自进化协调内存循环

Minhua Lin, Zhiwei Zhang, Hanqing Lu, Hui Liu, Xianfeng Tang, Qi He, Xiang Zhang, Suhang Wang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Amazon(亚马逊) Microsoft(微软)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 MemMA通过多智能体推理和现场自进化协调内存循环,解决内存循环正向路径的战略盲区和反向路径的稀疏延迟监督问题,提升长周期交互性能。

Comments 23 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18325 2026-03-20 cs.LG stat.ML 70%

Learning to Reason with Curriculum I: Provable Benefits of Autocurriculum

学习与课程学习:自课程学习的可证明收益

Nived Rajaraman, Audrey Huang, Miro Dudik, Robert Schapire, Dylan J. Foster, Akshay Krishnamurthy

机构 * Microsoft Research(微软研究院)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 本文研究了自课程学习在提升语言模型推理能力方面的有效性,通过自适应数据选择技术,在监督微调和强化学习中分别减少了训练数据和计算成本。

Comments 39 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07842 2026-03-20 cs.CL cs.AI 62%

AdaSwitch: Balancing Exploration and Guidance in Knowledge Distillation via Adaptive Switching

AdaSwitch: 通过自适应切换平衡探索与引导在知识蒸馏中的应用

Jingyu Peng, Maolin Wang, Hengyi Cai, Yuchen Li, Kai Zhang, Shuaiqiang Wang, Dawei Yin, Xiangyu Zhao

机构 * University of Science and Technology of China(中国科学技术大学) City University of Hong Kong(香港城市大学) Baidu Inc(百度公司)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 AdaSwitch通过自适应切换机制动态结合在线和离线生成,解决知识蒸馏中探索与引导的平衡问题,提升模型准确性和推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18656 2026-03-20 cs.AI 57%

Balanced Thinking: Improving Chain of Thought Training in Vision Language Models

平衡思考:改进视觉语言模型中的推理链训练

Shaked Perek, Ben Wiesel, Avihu Dekel, Nimrod Shabtay, Eli Schwartz

机构 * IBM Research(IBM研究院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出SCALe方法,通过动态权重平衡推理和答案段,提升视觉语言模型的推理效率和准确性,且训练时间仅为传统方法的七分之一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18631 2026-03-20 cs.AI 57%

D-Mem: A Dual-Process Memory System for LLM Agents

D-Mem:一种用于LLM代理的双过程记忆系统

Zhixing You, Jiachen Yuan, Jason Cai

机构 * Einstein Institute of Mathematics(爱因斯坦数学研究所) The Hebrew University of Jerusalem(耶路撒冷希伯来大学) AWS AI(AWS人工智能)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出D-Mem双过程记忆系统,通过轻量向量检索与全面深入模块结合,提升长期推理准确性,实验表明其在LoCoMo基准上F1得分达53.5,优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16424 2026-03-20 cs.AI cs.MA 57%

Verifiable Semantics for Agent-to-Agent Communication

可验证的语义用于智能体间通信

Philipp Schoenegger, Matt Carlson, Chris Schneider, Chris Daly

机构 * Microsoft AI(微软人工智能) Wabash College(瓦巴什学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于刺激-意义模型的认证协议,通过验证共享事件和术语的语义一致性,减少智能体间分歧。核心 guarded 推理降低分歧72-96%,语言模型验证中减少51%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08388 2026-03-20 cs.CL 57%

If Probable, Then Acceptable? Understanding Conditional Acceptability Judgments in Large Language Models

如果可能,那么可接受?理解大型语言模型中的条件可接受性判断

Jasmin Orth, Philipp Mondorf, Barbara Plank

机构 * MaiNLP, Center for Information and Language Processing, LMU Munich(MaiNLP,信息与语言处理中心,慕尼黑大学) Munich Center for Machine Learning (MCML), Munich(慕尼黑机器学习中心(MCML),慕尼黑)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 研究探讨了大型语言模型在评估条件语句'若A则B'的可接受性时如何结合条件概率与语义相关性,发现模型对这两因素的敏感度因架构和提示策略而异,且比人类更不一致。

Comments EACL 2026 Main, 23 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17454 2026-03-20 cs.AI 57%

Automated Explanation Selection for Scientific Discovery

科学发现中的自动化解释选择

Ashlin Iser

机构 * Karlsruhe Institute of Technology, Germany(卡尔斯鲁厄理工学院,德国)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出结合机器学习和自动推理的科学发现循环,通过社会学和认知科学的洞察,构建解释选择的分类体系,扩展并完善现有解释方法。

Comments Composite AI Workshop at ECAI 2024 (accepted for publication)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18507 2026-03-20 cs.AI 57%

Expert Personas Improve LLM Alignment but Damage Accuracy: Bootstrapping Intent-Based Persona Routing with PRISM

专家人设提升LLM对齐但损害准确性:基于PRISM的意图驱动人设路由 Bootstrapping

Zizhao Hu, Mohammad Rostami, Jesse Thomason

机构 * University of Southern California(南加州大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了专家人设在不同任务类型和提示长度下的有效性,提出PRISM框架通过自蒸馏实现意图条件的人设路由,提升生成任务的人类偏好对齐,同时保持判别任务的准确性,且计算开销低。

详情

展开后加载摘要…

URL PDF HTML 收藏