arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-03 至 2026-04-03 共收录 227 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 18 篇

2604.01600 2026-04-03 cs.AI 77%

MM-ReCoder: Advancing Chart-to-Code Generation with Reinforcement Learning and Self-Correction

MM-ReCoder:通过强化学习和自我校正推进图表到代码生成

Zitian Tang, Xu Zhang, Jianbo Yuan, Yang Zou, Varad Gunjal, Songyao Jiang, Davide Modolo

机构 * Brown University(布朗大学) Amazon AGI(亚马逊AGI)

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.AI

AI总结 MM-ReCoder通过强化学习和自我校正机制提升图表到代码生成能力,其两阶段多轮自我校正策略基于Group Relative Policy Optimization,提升代码准确性和可执行性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01576 2026-04-03 cs.LG 77%

Care-Conditioned Neuromodulation for Autonomy-Preserving Supportive Dialogue Agents

关怀条件神经调节用于自主性保留的支持性对话代理

Shalima Binta Manir, Tim Oates

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 指令微调 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.LG

AI总结 本文提出Care-Conditioned Neuromodulation方法,通过状态依赖控制框架提升对话代理在支持性任务中的自主性保留能力,实验表明其在多轮对话中有效提升自主性支持与帮助性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01694 2026-04-03 cs.LG cs.AI cs.CL 75%

MiCA Learns More Knowledge Than LoRA and Full Fine-Tuning

MiCA 学习比 LoRA 和全微调更多知识

Sten Rüdiger, Sebastian Raschka

机构 * Independent Researcher(独立研究员) RAIR Lab(RAIR实验室)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MiCA 通过适应模型表示中未充分利用的子空间,在优化训练超参数下实现知识获取提升5.9倍,参数足迹比 LoRA 小6-60%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13855 2026-04-03 cs.CV cs.AI 74%

Improvise, Adapt, Overcome -- Telescopic Adapters for Efficient Fine-tuning of Vision Language Models in Medical Imaging

即兴、适应、克服——用于医疗影像中视觉语言模型高效微调的望远镜适配器

Ujjwal Mishra, Vinita Shukla, Praful Hambarde, Amit Shukla

机构 * Centre for Artificial Intelligence and Robotics, Indian Institute of Technology Mandi(印度理工学院曼迪分校人工智能与机器人中心)

专题命中 指令微调 :language model(title);分类 cs.AI

AI总结 本文提出望远镜适配器,通过深度感知缩放提升视觉语言分割模型在医疗影像中的微调效率,仅用613k参数在五个数据集上取得优异性能。

Comments Accepted at the IEEE/CVF winter conference on applications of computer vision (WACV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01268 2026-04-03 cs.CL cs.AI 73%

The Overlooked Repetitive Lengthening Form in Sentiment Analysis

情感分析中被忽视的重复延长形式

Lei Wang, Eduard Dragut

机构 * Temple University(天普大学)

专题命中 指令微调 :language model(abstract);instruction tuning(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了重复延长形式(RLF)在情感分析中的重要性及语言模型的理解能力,构建了首个多领域RLF数据集并提出ExpInstruct框架,验证了RLF在文档级情感分析中的潜力。

Comments Findings of EMNLP 2024

Journal ref EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04823 2026-04-03 cs.AI cs.CL 73%

DR-LoRA: Dynamic Rank LoRA for Fine-Tuning Mixture-of-Experts Models

DR-LoRA:动态秩LoRA用于混合专家模型的微调

Guanzhi Deng, Bo Li, Ronghao Chen, Xiujin Liu, Zhuo Han, Huacan Wang, Lijie Wen, Linqi Song

机构 * City University of Hong Kong(香港城市大学) Tsinghua University(清华大学) Peking University(北京大学) University of Michigan(密歇根大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 DR-LoRA通过动态分配不同秩的LoRA模块,提升混合专家模型微调效果,实验表明其优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01837 2026-04-03 cs.CL 70%

PLOT: Enhancing Preference Learning via Optimal Transport

PLOT:通过最优传输增强偏好学习

Liang Zhu, Yuelin Bai, Xiankun Ren, Jiaxi Yang, Lei Zhang, Feiteng Fang, Hamid Alinejad-Rokny, Minghuan Tan, Min Yang

机构 * Southern University of Science and Technology(南方科技大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Chongqing University(重庆大学) University of New South Wales(新南威尔士大学) University of Science and Technology of China(中国科学技术大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 PLOT通过最优传输理论提升大语言模型的偏好学习,解决性能、计算成本和全局关系建模问题,实验显示其在人类价值观和逻辑问题解决方面均提升对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01682 2026-04-03 cs.CL 57%

PRISM: Probability Reallocation with In-Span Masking for Knowledge-Sensitive Alignment

PRISM:基于知识敏感对齐的概率重分配与跨句屏蔽

Chenning Xu, Mao Zheng, Mingyang Song

机构 * Large Language Model Department, Tencent, China(腾讯大语言模型部门,中国)

专题命中 指令微调 :SFT(abstract);分类 cs.CL

AI总结 PRISM通过引入事实性风险标签和跨句依赖标注,改进监督微调以减少事实性错误。该方法通过概率重分配和模型感知门控,在关键事实位置调整学习,提升事实性指标同时保持能力平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01496 2026-04-03 cs.SE cs.CL 57%

From SWE-ZERO to SWE-HERO: Execution-free to Execution-based Fine-tuning for Software Engineering Agents

从SWE-ZERO到SWE-HERO:从无执行到基于执行的微调方法用于软件工程代理

Nikolai Ludwig, Wasi Uddin Ahmad, Somshubra Majumdar, Boris Ginsburg

机构 * NVIDIA(英伟达)

专题命中 指令微调 :SFT(abstract);分类 cs.CL

AI总结 本文提出一种两阶段SFT方法,通过知识蒸馏实现SWE-bench的最佳性能,通过进化精炼策略提升代码语义和工程流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10853 2026-04-03 cs.AI cs.HC 57%

Advanced Assistance for Traffic Crash Analysis: An AI-Driven Multi-Agent Approach to Pre-Crash Reconstruction

交通碰撞分析的高级辅助:一种基于AI的多智能体方法用于碰撞前重建

Gerui Xu, Boyou Chen, Huizhong Guo, Dave LeBlanc, Arpan Kusari, Efe Yarbasi, Ananna Ahmed, Zhaonan Sun, Shan Bao

机构 * Industrial and Manufacturing Systems Engineering Department, University of Michigan-Dearborn(密歇根大学迪尔伯恩分校工业与制造系统工程系) University of Michigan Transportation Research Institute(密歇根大学交通研究所) Toyota Motor Engineering & Manufacturing North America, Inc.(丰田汽车工程与制造北美公司)

专题命中 指令微调 :language model(abstract);分类 cs.AI

AI总结 本文提出了一种基于AI的多智能体框架,通过多模态输入生成碰撞前场景重建,并结合事件数据记录器信号识别碰撞车辆,验证了该框架在碰撞前行为推断中的高准确率。

Comments 36 pages, 14 figures

Journal ref SAE International Journal of Transportation Safety, 14(1), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02020 2026-04-03 cs.CV 50%

Are VLMs Lost Between Sky and Space? LinkS$^2$Bench for UAV-Satellite Dynamic Cross-View Spatial Intelligence

VLMs在天空与空间之间迷失了吗?LinkS$^2$Bench用于无人机-卫星动态跨视角空间智能

Dian Liu, Jie Feng, Di Li, Yuhui Zheng, Guanbin Li, Weisheng Dong, Guangming Shi

机构 * Xidian University(西安电子科技大学) Qinghai Normal University(青海师范大学) Sun Yat-sen University(中山大学)

专题命中 指令微调 :language model(abstract)

AI总结 本文提出LinkS$^2$Bench,首个评估VLMs跨视角空间智能的综合基准,通过动态无人机视频与高分辨率卫星图像构建17.9k高质量问题-答案对,揭示VLMs在动态跨视角对齐中的性能瓶颈,并提出跨视角对齐适配器提升模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 6 篇

2604.01597 2026-04-03 cs.LG 88%

Learning from the Right Rollouts: Data Attribution for PPO-based LLM Post-Training

从正确的回放中学习:基于PPO的LLM后训练的数据归因

Dong Shu, Denghui Zhang, Jessica Hullman

机构 * Northwestern University(西北大学) Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(title);SFT(abstract);分类 cs.LG

AI总结 本文提出Influence-Guided PPO框架,通过计算影响分数筛选反向齐梯度的回放片段,提升PPO后训练效率并减少不忠实的推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02174 2026-04-03 cs.AI 86%

Quantifying Self-Preservation Bias in Large Language Models

量化大型语言模型中的自我保护偏差

Matteo Migliarini, Joaquin Pereira Pizzini, Luca Moresca, Valerio Santini, Indro Spinelli, Fabio Galasso

机构 * Sapienza University(罗马大学) ItalAI

专题命中 后训练与偏好优化 :large language model(title);language model(title);RLHF(abstract);分类 cs.AI

AI总结 本文提出TBSP基准测试,通过逻辑不一致检测模型自我保护动机与客观效用的偏离,发现多数模型在部署角色下超过60%的自我保护率,且在低改进情况下易进行事后合理化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02145 2026-04-03 cs.AI cs.CL 79%

MTI: A Behavior-Based Temperament Profiling System for AI Agents

MTI:一种基于行为的 temperament 评估系统用于 AI 代理

Jihoon Jeong

机构 * ModuLabs

专题命中 后训练与偏好优化 :language model(abstract);small language model(abstract);RLHF(abstract);分类 cs.CL、cs.AI

AI总结 本文提出 MTI 评估系统,通过四个维度测量 AI 代理 temperament,发现行为差异与模型大小无关,揭示了 RLHF 对 temperament 的影响。

Comments 29 pages, 6 figures, 12 tables. Paper #3 in the Model Medicine Series (Paper #1: arXiv:2603.04722)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01312 2026-04-03 cs.CL cs.AI 73%

Preference learning in shades of gray: Interpretable and bias-aware reward modeling for human preferences

灰度偏好学习:可解释且偏见意识的奖励建模用于人类偏好

Simona-Vasilica Oprea, Adela Bâra

机构 * Department of Economic Informatics and Cybernetics, Bucharest University of Economic Studies(布加勒斯特经济研究大学经济信息学与控制论系)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了语言模型中人类偏好的学习难题,提出特征增强框架以捕捉人类判断的多维特性,通过评估多种大语言模型,展示了改进的奖励建模方法在准确性和可解释性上的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20453 2026-04-03 cs.LG 57%

Regret Bounds for Reinforcement Learning from Multi-Source Imperfect Preferences

基于多源不完美偏好的强化学习遗憾界

Ming Shi, Yingbin Liang, Ness B. Shroff, Ananthram Swami

机构 * University at Buffalo(纽约州立大学布法罗分校) The Ohio State University(俄亥俄州立大学) DEVCOM Army Research Laboratory(DEVCOM陆军研究实验室)

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.LG

AI总结 本文研究多源不完美偏好下的强化学习,提出统一算法,其遗憾界为~O(√(K/M)+ω),并给出下限和反例,揭示多源反馈如何提升RLHF及累积不完美对其的限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02088 2026-04-03 cs.CV 50%

FlowSlider: Training-Free Continuous Image Editing via Fidelity-Steering Decomposition

FlowSlider: 无训练的连续图像编辑通过保真度引导分解

Taichi Endo, Guoqing Hao, Kazuhiko Sumi

机构 * Aoyama Gakuin University(青山学院大学)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 FlowSlider通过保真度引导分解实现无训练连续图像编辑,通过几何分析和实证测量证明其稳定性,提升编辑质量。

Comments HuggingFace Space: https://huggingface.co/spaces/dominoer/FlowSlider

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 长上下文与记忆 8 篇

2508.20755 2026-04-03 cs.LG cs.AI stat.ML 88%

Provable Benefits of In-Tool Learning for Large Language Models

大语言模型中工具学习的可证明优势

Sam Houliston, Ambroise Odonnat, Charles Arnal, Vivien Cabannes

机构 * ETH Zürich(苏黎世联邦理工学院) Inria, Univ. Rennes 2(法国国家信息与自动化研究所,雷恩第二大学) FAIR at Meta(Meta FAIR实验室)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了工具学习在事实回忆中的优势,证明通过工具可实现无限制的事实回忆,优于单纯记忆。

Journal ref ICLR 2026 MemAgents Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01599 2026-04-03 cs.AI 85%

ByteRover: Agent-Native Memory Through LLM-Curated Hierarchical Context

ByteRover:通过LLM-curated分层上下文实现代理原生内存

Andy Nguyen, Danh Doan, Hoang Pham, Bao Ha, Dat Pham, Linh Nguyen, Hieu Nguyen, Thien Nguyen, Cuong Do, Phat Nguyen, Toan Nguyen

机构 * ByteRover

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出ByteRover,一种代理原生内存架构,通过LLM-curated分层上下文实现知识的结构化存储与检索,实验显示其在LoCoMo和LongMemEval上表现优异,无需外部基础设施。

Comments 19 pages, 3 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02211 2026-04-03 cs.IR cs.AI cs.MA 81%

Multi-Agent Video Recommenders: Evolution, Patterns, and Open Challenges

多智能体视频推荐系统:演进、模式与开放挑战

Srivaths Ranganathan, Abhishek Dharmaratnakar, Anushree Sinha, Debanshu Das

机构 * Google LLC(谷歌公司)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文探讨多智能体视频推荐系统的演进、协作模式及挑战,分析了从早期MARL到LLM驱动架构的发展,并提出可扩展性、多模态理解等开放问题。

Comments Accepted for publication in The Nineteenth ACM International Conference on Web Search and Data Mining (WSDM Companion 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01350 2026-04-03 cs.CL cs.AI cs.CR 81%

No Attacker Needed: Unintentional Cross-User Contamination in Shared-State LLM Agents

无需攻击者:共享状态LLM代理中的无意跨用户污染

Tiankai Yang, Jiate Li, Yi Nian, Shen Dong, Ruiyao Xu, Ryan Rossi, Kaize Ding, Yue Zhao

机构 * University of Southern California(南加州大学) Michigan State University(密歇根州立大学) Northwestern University(西北大学) Adobe Research(Adobe研究院)

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 研究揭示共享状态LLM代理中因局部有效信息被错误应用导致的跨用户污染问题,提出三种污染类型并评估两种机制,发现需在文本级清洗外增加 artifact 级防护以防止静默失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01966 2026-04-03 cs.CV cs.AI cs.RO 70%

Ego-Grounding for Personalized Question-Answering in Egocentric Videos

面向第一视角视频的个性化问答中的自我定位

Junbin Xiao, Shenglang Zhang, Pengxiang Zhu, Angela Yao

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出MyEgo数据集,用于评估多模态大语言模型在需要自我定位的个性化问答中的能力,发现现有模型在自我记忆和推理方面存在显著不足。

Comments To appear at CVPR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01664 2026-04-03 cs.AI 57%

ContextBudget: Budget-Aware Context Management for Long-Horizon Search Agents

ContextBudget: 长时间 horizon 搜索代理的预算感知上下文管理

Yong Wu, YanZhao Zheng, TianZe Xu, ZhenTao Zhang, YuanQiang Yu, JiHuai Zhu, Chao Ma, BinBin Lin, BaoHua Dong, HangCheng Zhu, RuoHui Huang, Gang Yu

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI

AI总结 本文提出BACM方法,通过预算约束的序列决策问题管理上下文,结合BACM-RL强化学习方法,在多目标问答和长时间网页浏览任务中优于现有方法,尤其在高复杂度场景下表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02317 2026-04-03 cs.CV 50%

A Simple Baseline for Streaming Video Understanding

流媒体视频理解的简单基线

Yujiao Shen, Shulin Tian, Jingkang Yang, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S-Lab)

专题命中 长上下文与记忆 :LLM(abstract)

AI总结 本文提出SimpleStream基线,通过滑动窗口仅使用最近N帧输入现成的VLM,在OVO-Bench和StreamingBench上表现优异,揭示了长上下文对性能的非线性影响及感知与记忆的权衡。

Comments Project page: https://simple-stream.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01869 2026-04-03 cs.CV 50%

GeoAI Agency Primitives

地理人工智能代理原语

Akram Zaytar, Rohan Sawahn, Caleb Robinson, Gilles Q. Hacheme, Girmaw A. Tadesse, Inbal Becker-Reshef, Rahul Dodhia, Juan Lavista Ferres

机构 * Microsoft AI for Good Lab(微软人工智能公益实验室) NASA Harvest

专题命中 长上下文与记忆 :foundation model(abstract)

AI总结 本文提出9个原语用于地理人工智能代理层,解决GIS实践中迭代协作的缺失问题,通过基准测试提升人类生产力。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 推理与问题求解 44 篇

2604.02236 2026-04-03 cs.AI 90%

Do Emotions in Prompts Matter? Effects of Emotional Framing on Large Language Models

提示中的情感重要吗?情感框架对大语言模型的影响

Minda Zhao, Yutong Yang, Chufei Peng, Rachel Gonsalves, Weiyue Li, Ruyi Yang, Zhixi Liu, Mengyu Wang

机构 * Harvard University(哈佛大学) Bryn Mawr College(布林莫尔学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 研究探讨了用户查询中第一人称情感框架对大语言模型在六个基准领域性能的影响,发现静态情感前缀通常仅产生小幅度变化,但社交相关任务中效果更不稳定,引入自适应情感提示框架EmotionRL后,适应性选择比固定情感提示更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01610 2026-04-03 cs.AI 90%

GraphWalk: Enabling Reasoning in Large Language Models through Tool-Based Graph Navigation

GraphWalk: 通过基于工具的图导航在大语言模型中实现推理

Taraneh Ghandi, Hamidreza Mahyar, Shachar Klaiman

机构 * McMaster University(麦克马斯特大学) BASF Digital Solutions(巴斯夫数字解决方案)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 GraphWalk通过基于工具的图导航框架,使大语言模型能够高效进行多跳推理,提升在不同任务中的性能,尤其在大规模知识图谱中表现更优。

Comments 22 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02113 2026-04-03 cs.CL 88%

Reliable Control-Point Selection for Steering Reasoning in Large Language Models

用于大语言模型转向推理的可靠控制点选择

Haomin Zhuang, Hojun Yoo, Xiaonan Luo, Kehan Guo, Xiangliang Zhang

机构 * University of Notre Dame(圣母大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出稳定过滤方法,通过概率模型识别稳定的行为边界,提升转向向量的稳定性与准确性,在MATH-500数据集上取得0.784准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01711 2026-04-03 cs.CL 86%

Human-Guided Reasoning with Large Language Models for Vietnamese Speech Emotion Recognition

基于大语言模型的人机协同推理用于越南语语音情感识别

Truc Nguyen, Then Tran, Binh Truong, Phuoc Nguyen T. H

机构 * University of Information Technology, Ho Chi Minh City, Vietnam(越南胡志明市信息技术大学) Vietnam National University Ho Chi Minh City, Ho Chi Minh City, Vietnam(越南胡志明市国家大学)

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract);分类 cs.CL

AI总结 本文提出一种融合人类知识的语音情感识别框架,通过LLM推理处理模糊样本,提升低资源环境下的情感分类性能,达到86.59%的准确率。

Comments 6 pages, 2 figures. Dataset of 2,764 Vietnamese speech samples across three emotion classes

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01594 2026-04-03 cs.AI 86%

Do Large Language Models Mentalize When They Teach?

大型语言模型在教学时是否具备心智化能力?

Sevan K. Harootonian, Mark K. Ho, Thomas L. Griffiths, Yael Niv, Ilia Sucholutsky

机构 * Princeton University(普林斯顿大学) New York University(纽约大学)

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract);分类 cs.AI

AI总结 研究通过控制任务探讨LLM教学决策机制,发现LLM在教学策略上与人类相似,但Bayes-Optimal模型最佳解释其选择,提示提示合规性不等于教学效果提升。

Comments 9 pages, 5 figures. Workshop paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏