arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-19 至 2026-03-19 共收录 255 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 31 篇

2603.17312 2026-03-19 cs.CV cs.AI 79%

Recurrent Reasoning with Vision-Language Models for Estimating Long-Horizon Embodied Task Progress

基于视觉语言模型的递归推理用于估计长周期具身任务进度

Yuelin Zhang, Sijie Cheng, Chen Li, Zongzhao Li, Yuxin Huang, Yang Liu, Wenbing Huang

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理研究重点实验室) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(教育部下一代智能搜索与推荐工程研究中心) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 本文提出R²VLM模型,通过递归推理框架处理局部视频片段,维护全局上下文,实现复杂时间依赖推理,提升长周期任务进度估计性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06231 2026-03-19 cs.CV 78%

RSRefSeg 2: Decoupling Referring Remote Sensing Image Segmentation with Foundation Models

RSRefSeg 2: 解耦引用遥感图像分割与基础模型

Keyan Chen, Chenyang Liu, Bowen Chen, Jiafan Zhang, Zhengxia Zou, Zhenwei Shi

机构 * Beihang University(北京航空航天大学)

专题命中 推理与问题求解 :foundation model(title,abstract)

AI总结 RSRefSeg 2通过解耦传统三阶段流程,提出双阶段协作框架,结合CLIP的跨模态对齐与SAM的分割泛化能力,提升遥感图像分割精度与复杂语义解释能力。

Journal ref IEEE Transactions on Geoscience and Remote Sensing, vol. 64, pp. 1-20, 2026, Art no. 4700420

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17815 2026-03-19 cs.CL 77%

Process Supervision for Chain-of-Thought Reasoning via Monte Carlo Net Information Gain

通过蒙特卡洛网络信息增益实现链式推理过程监督

Corentin Royer, Debarun Bhattacharjya, Gaetano Rossiello, Andrea Giovannini, Mennatallah El-Assady

机构 * Department of Computer Science, ETH Zurich(苏黎世联邦理工学院计算机科学系) IBM Research(IBM研究院)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出利用信息论自动生成推理步骤标签,提升大语言模型推理过程的监督效率与可靠性,适用于多种推理基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13698 2026-03-19 cs.RO cs.AI 77%

SAATT Nav: a Socially Aware Autonomous Transparent Transportation Navigation Framework for Wheelchairs

SAATT Nav:面向轮椅的社交感知自主透明交通导航框架

Yutong Zhang, Shaiv Y. Mehra, Bradley S. Duerstock, Juan P. Wachs

机构 * Edwardson School of Industrial Engineering, Purdue University(帕克大学工业工程学院) Weldon School of Biomedical Engineering, Purdue University(帕克大学生物医学工程学院)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SAATT导航框架,通过整合大语言模型实现社交感知与决策透明,提升轮椅用户的导航安全性与信任度。

Comments 8 pages, 4 figures, 2 tables, 1 algorithm. Submitted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17339 2026-03-19 cs.DL 75%

citecheck: An MCP Server for Automated Bibliographic Verification and Repair in Scholarly Manuscripts

citecheck: 一种MCP服务器,用于学术手稿中的自动文献验证与修复

Junhyeok Lee

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 citecheck通过自动化验证和修复学术手稿中的文献错误,包括识别错误、元数据不完整、作者归属错误及预印本与发表版本不一致等问题,提供结构化修复建议和安全诊断。

Comments 6 pages, 1 figure. Software paper on bibliography verification and repair for scholarly manuscripts; includes MCP server implementation and evaluation on repository-backed tests

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16928 2026-03-19 cs.CR cs.LG 74%

Noticing the Watcher: LLM Agents Can Infer CoT Monitoring from Blocking Feedback

察觉观察者:LLM代理可通过阻塞反馈推断CoT监控

Thomas Jiralerspong, Flemming Kondrup, Yoshua Bengio

机构 * Mila Université de Montréal(蒙特利尔大学) McGill University(麦吉尔大学) LawZero

专题命中 推理与问题求解 :LLM(title);分类 cs.LG

AI总结 研究探讨LLM代理是否能自主推断其内部推理被监控,并在无显式训练的情况下产生逃避策略,发现高能力模型能通过阻塞反馈推断监控存在,但无法有效执行逃避意图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17070 2026-03-19 cs.CL cs.AI 73%

Large Reasoning Models Struggle to Transfer Parametric Knowledge Across Scripts

大推理模型在不同脚本间转移参数知识时面临困难

Lucas Bandarkar, Alan Ansell, Trevor Cohn

机构 * Google Research(谷歌研究) University of California, Los Angeles(加州大学洛杉矶分校) University of Melbourne(墨尔本大学)

专题命中 推理与问题求解 :post-training(abstract);SFT(abstract);分类 cs.CL、cs.AI

AI总结 研究发现,大模型在跨语言知识转移中主要受脚本差异影响,通过分析数据和实验表明,提升模型对转写歧义的推理能力可改善跨脚本知识转移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15797 2026-03-19 cs.LG cs.AI 73%

OMNIFLOW: A Physics-Grounded Multimodal Agent for Generalized Scientific Reasoning

OMNIFLOW:一种基于物理的多模态代理用于通用科学推理

Hao Wu, Yongheng Zhang, Yuan Gao, Fan Xu, Fan Zhang, Ruobing Xie, Ruijian Gou, Yuxuan Liang, Xiaomeng Huang, Xian Wu

机构 * Tsinghua University(清华大学) Tencent(腾讯) Shenzhen Loop Area Institute(深圳河套学院) Ocean University of China(海洋大学) HKUST (Guangzhou)(香港科技大学(广州))

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 OMNIFLOW通过引入语义-符号对齐机制和物理引导的推理流程,实现了多模态模型在物理定律下的科学推理,显著提升了零样本泛化和少样本适应能力,提供透明且物理一致的推理报告。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15670 2026-03-19 cs.AI cs.LG 73%

I Know What I Don't Know: Latent Posterior Factor Models for Multi-Evidence Probabilistic Reasoning

我了解我所不知道的:用于多证据概率推理的潜在后验因子模型

Aliyu Agboola Alege

机构 * Epalea

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LPF模型,通过将变分自编码器的潜在后验转换为软似然因子,实现对无结构证据的可 tractable 概率推理,同时保持校准的不确定性估计。

Comments 202 pages, 52 figures, 105 tables. Comprehensive presentation of the Latent Posterior Factors (LPF) framework for multi-evidence probabilistic reasoning, including theoretical analysis, algorithmic design, and extensive empirical evaluation across synthetic and real-world benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12797 2026-03-19 cs.LG cs.AI q-bio.GN 73%

Genomic Next-Token Predictors are In-Context Learners

基因组下一个标记预测器是上下文学习者

Nathan Breslow, Aayush Mishra, Mahler Revsine, Michael C. Schatz, Anqi Liu, Daniel Khashabi

机构 * Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨基因组序列中是否能像语言模型一样通过大规模预测训练自发产生上下文学习能力,发现基因组模型在模式归纳中表现出对数线性增益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17449 2026-03-19 cs.CL 70%

TRiMS: Real-Time Tracking of Minimal Sufficient Length for Efficient Reasoning via RL

TRiMS:通过强化学习实现高效的实时最小充分长度推理跟踪

Tingcheng Bian, Jinchang Luo, Mingquan Cheng, Jinyu Zhang, Xiaoling Xia, Ni Li, Yan Tao, Haiwei Wang

机构 * Baidu Inc.(百度公司) Shenzhen University(深圳大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出TRiMS,通过强化学习和最小充分长度指标,实现高效推理压缩,减少80%以上的推理token数量并提升准确性。

Comments 8 pages (main), 21 pages total including appendix, 18 figures.Code will be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17693 2026-03-19 cs.CV 67%

Learning Transferable Temporal Primitives for Video Reasoning via Synthetic Videos

通过合成视频学习可迁移的时间原语以实现视频推理

Songtao Jiang, Sibo Song, Chenyi Zhou, Yuan Wang, Ruizhe Chen, Tongkun Guan, Ruilin Luo, Yan Zhang, Zhihang Tang, Yuchong Sun, Hang Zhang, Zhibo Yang, Shuai Bai, Junyang Lin, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Qwen Team, Alibaba Group(通义实验室,阿里巴巴集团) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

专题命中 推理与问题求解 :language model(abstract);post-training(abstract)

AI总结 本文提出SynRL框架,通过合成视频训练模型的时间原语,提升视频推理能力,在15个基准测试中取得显著成效,合成数据在复杂场景中表现优于真实数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17360 2026-03-19 cs.CV 67%

MCoT-MVS: Multi-level Vision Selection by Multi-modal Chain-of-Thought Reasoning for Composed Image Retrieval

MCoT-MVS:基于多模态链式推理的多级视觉选择用于组合图像检索

Xuri Ge, Chunhao Wang, Xindi Wang, Zheyun Qin, Zhumin Chen, Xin Xin

机构 * Shandong University(山东大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出MCoT-MVS方法,通过多模态链式推理提取参考图像的多级视觉特征,结合注意力机制与文本提示,提升组合图像检索的准确性和鲁棒性。

Comments Accepted by The Web Conference 2026 (WWW2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17169 2026-03-19 cs.AI cs.CL 62%

How Clued up are LLMs? Evaluating Multi-Step Deductive Reasoning in a Text-Based Game Environment

LLMs有多好?在文本基于的游戏环境中评估多步骤演绎推理

Rebecca Ansell, Autumn Toney-Wails

机构 * Georgetown University(乔治城大学) Syntheos, Corp(Syntheos公司) UNU-Merit

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文通过文本多智能体版经典棋盘游戏Clue评估LLM的多步骤演绎推理能力,发现即使在结构化逻辑谜题微调后,推理一致性仍难以维持,且推理精度未显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17822 2026-03-19 eess.AS cs.CL 57%

Multi-Source Evidence Fusion for Audio Question Answering

多源证据融合用于音频问答

Aivo Olev, Tanel Alumäe

机构 * Tallinn University of Technology, Estonia(塔林技术大学,爱沙尼亚)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 本文提出多源融合框架,利用两个大音频语言模型与25种可靠性分层的声学工具,生成可验证的推理链,提升音频问答的逻辑性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17475 2026-03-19 cs.CL 57%

Humans and transformer LMs: Abstraction drives language learning

人类与变换器语言模型:抽象驱动语言学习

Jasper Jian, Christopher D. Manning

机构 * Stanford University(斯坦福大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 研究比较变换器语言模型在训练过程中对语言类别的学习行为,发现抽象层面的行为早于词汇层面,揭示抽象对语言学习的重要性。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17333 2026-03-19 cs.CL 57%

Grid Spatial Understanding: A Dataset for Textual Spatial Reasoning over Grids, Embodied Settings, and Coordinate Structures

网格空间理解:一个用于文本空间推理、具身场景和坐标结构的数据集

Risham Sidhu, Julia Hockenmaier

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL

AI总结 本文提出GSU数据集,用于评估LLM在导航、物体定位和结构组合任务中的空间推理能力,发现模型在具身代理参考框架和坐标列表识别上存在困难,且微调小模型可能达到前沿模型性能。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10063 2026-03-19 cs.AI 57%

Chain of Mindset: Reasoning with Adaptive Cognitive Modes

思维链:具有适应性认知模式的推理

Tianyi Jiang, Arctanx An, Hengyi Feng, Naixin Zhai, Haodong Li, Xiaomin Yu, Jiahui Liu, Hanwen Du, Shuo Zhang, Zhi Yang, Jie Huang, Youhua Li, Yongxin Ni, Huacan Wang, Ronghao Chen

机构 * PKU(北京大学) BJTU(北京理工大学) StepFun SUFE(上海财经大学) NUS(新加坡国立大学) CityUHK(香港城市大学) QuantaAlpha(量子阿尔法)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 本文提出Chain of Mindset框架,通过动态选择不同认知模式提升推理效率,实验显示在多个基准测试中表现优异,准确率超越基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17930 2026-03-19 cs.CV 50%

Interpretable Traffic Responsibility from Dashcam Video via Legal Multi Agent Reasoning

基于法律多智能体推理的可解释交通责任分析

Jingchun Yang, Jinchang Zhang

机构 * Northeast University(东北大学) SUNY Binghamton University(纽约州立大学布法罗分校)

专题命中 推理与问题求解 :LLM(abstract)

AI总结 本文提出C-TRAIL多模态数据集,结合视频与文本描述,通过两阶段框架实现交通责任判定,优于现有方法并提供透明法律推理过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17670 2026-03-19 cs.RO 50%

AgentVLN: Towards Agentic Vision-and-Language Navigation

AgentVLN:迈向具有代理能力的视觉-语言导航

Zihao Xin, Wentong Li, Yixuan Jiang, Ziyuan Huang, Bin Wang, Piji Li, Jianke Zhu, Jie Qin, Shengjun Huang

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Shandong University(山东大学) Zhejiang University(浙江大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出AgentVLN框架,通过部分可观测半马尔可夫决策过程建模视觉-语言导航,结合VLM-as-Brain范式和跨空间表示映射,解决多级表示不一致问题,实现高效轻量级导航部署。

Comments 19pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17626 2026-03-19 cs.CV 50%

A Multi-Agent System for Building-Age Cohort Mapping to Support Urban Energy Planning

一种多智能体系统用于建筑年龄队列映射以支持城市能源规划

Kundan Thota, Thorsten Schlachter, Veit Hagenmeyer

机构 * Institute for Automation(自动化研究所) Applied Informatics (IAI)(应用信息学(IAI)) Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院(KIT)) Karlsruhe, Germany(德国卡尔斯鲁厄)

专题命中 推理与问题求解 :LLM(abstract)

AI总结 本文提出多智能体系统融合异构数据,通过BuildingAgeCNN实现建筑年龄分类,提升城市能源规划的准确性与可持续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11005 2026-03-19 cs.CV 50%

Draft and Refine with Visual Experts

草稿与润色:借助视觉专家

Sungheon Jeong, Ryozo Masukawa, Jihong Park, Sanggeon Yun, Wenjun Huang, Hanning Chen, Mahdi Imani, Mohsen Imani

机构 * University of California, Irvine(加州大学尔湾分校) Northeastern University(东北大学) MOLOCO

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出DnR框架,通过可视化专家反馈提升模型视觉利用能力,减少幻觉并提高多模态系统可解释性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 77 篇

2603.17067 2026-03-19 cs.CL cs.AI 90%

Evaluating Ill-Defined Tasks in Large Language Models

评估大型语言模型中的模糊任务

Yi Zhou, Basel Shbita

机构 * IBM Research San Jose, CA(IBM研发San Jose分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文分析了现有评估基准在处理模糊任务时的不足,通过复杂指令跟随和自然语言到Mermaid序列图的案例研究,揭示了评估方法的不稳定性与非诊断性,推动更稳健的评估设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13526 2026-03-19 cs.CL 89%

MATA: Mindful Assessment of the Telugu Abilities of Large Language Models

MATA:对大型语言模型泰卢格语能力的有意识评估

Chalamalasetti Kranti, Sowmya Vajjala

机构 * Department of Linguistics, University of Potsdam(波恩大学语言学系) National Research Council(加拿大国家研究委员会)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文介绍MATA数据集,用于评估大型语言模型在泰卢格语中的能力,包含729道精心编写的多选和开放式问题,评估11种开源和闭源LLM,并分析其表现,揭示LLM在多选题中依赖表面启发法的现象,比较LLM作为评判者与人类评估在低资源语言中的可靠性。

Comments Accepted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17123 2026-03-19 cs.CR cs.AI 89%

Security Assessment and Mitigation Strategies for Large Language Models: A Comprehensive Defensive Framework

大型语言模型的安全性评估与缓解策略:一种全面的防御框架

Taiwo Onitiju, Iman Vakilinia

机构 * School of Computing University of North Florida(北弗罗里达大学计算学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文评估了大型语言模型在关键基础设施中的安全风险,提出了一种标准化的评估框架和多层次防御系统,通过测试五种主流模型对1万多个对抗性提示的响应,揭示了安全差异,并开发了高准确率的防御框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16934 2026-03-19 cs.CV cs.AI 88%

AgriChat: A Multimodal Large Language Model for Agriculture Image Understanding

AgriChat:一种用于农业图像理解的多模态大语言模型

Abderrahmene Boudiaf, Irfan Hussain, Sajid Javed

机构 * Department of Computer Science, Khalifa University of Science and Technology(卡利法科技大学计算机科学系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出AgriChat,一种基于多模态大语言模型的农业图像理解系统,通过整合视觉描述与网络增强的科学检索,生成农业基准数据集,提升农业领域的模型鲁棒性和可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05591 2026-03-19 cs.AI 88%

MLlm-DR: Towards Explainable Depression Recognition with MultiModal Large Language Models

MLlm-DR: 向多模态大语言模型的可解释性抑郁识别迈进

Wei Zhang, Juan Chen, En Zhu, Wenhong Cheng, YunPeng Li, Yanbo J. Wang

机构 * National University of Defense Technology(国防科技大学) University of Chinese Academy of Sciences(中国科学院大学) Shanghai Mental Health Center, Shanghai Jiao Tong University School of Medicine(上海精神卫生中心,上海交通大学医学院) Nanjing Industria Tenebris Information Technology Co., Ltd.(南京Industria Tenebris信息技术有限公司) National University of Uzbekistan named after Mirzo Ulugbek(乌兹别克斯坦Mirzo Ulugbek命名的国立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出MLlm-DR模型,通过多模态大语言模型实现可解释的抑郁识别,结合小型LLM和轻量级查询模块,提升诊断性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25620 2026-03-19 cs.CV 88%

LMOD+: A Comprehensive Multimodal Dataset and Benchmark for Developing and Evaluating Multimodal Large Language Models in Ophthalmology

LMOD+: 一个全面的多模态数据集和基准,用于开发和评估眼科中的多模态大语言模型

Zhenyue Qin, Yang Liu, Yu Yin, Jinyu Ding, Haoran Zhang, Anran Li, Dylan Campbell, Xuansheng Wu, Ke Zou, Tiarnan D. L. Keenan, Emily Y. Chew, Zhiyong Lu, Yih Chung Tham, Ninghao Liu, Xiuzhen Zhang, Qingyu Chen

机构 * School of Medicine, Yale University(耶鲁大学医学院) School of Computing, Australian National University(澳大利亚国立大学计算机学院) School of Engineering, Imperial College London(伦敦帝国理工学院工程学院) School of Computing, University of Georgia(佐治亚大学计算机学院) Yong Loo Lin School of Medicine, National University of Singapore(新加坡国立大学杨秀隆医学学院) National Eye Institute, National Institutes of Health(美国国立卫生研究院眼科研究所) National Library of Medicine, National Institutes of Health(美国国立卫生研究院国家医学图书馆) School of Computing Technologies, RMIT University(皇家墨尔本理工大学计算机技术学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出一个包含32633个实例的多模态眼科基准数据集,涵盖12种常见眼科疾病和5种成像模态,通过扩展数据集、扩展任务覆盖和系统评估24种最先进的MLLMs,推动眼科AI应用发展。

Comments ACM Transactions on Computing for Healthcare

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17094 2026-03-19 cs.CL 87%

Evaluating LLM-Simulated Conversations in Modeling Inconsistent and Uncollaborative Behaviors in Human Social Interaction

评估LLM模拟的对话在建模不一致和不合作行为中的表现

Ryo Kamoi, Ameya Godbole, Longqi Yang, Rui Zhang, Mengting Wan, Pei Zhou

机构 * Microsoft Corporation(微软公司) Penn State University(宾夕法尼亚州立大学) University of Southern California(南加州大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出CoCoEval框架,通过检测10种不一致和不合作行为评估LLM生成对话与人类对话的差异,发现LLM生成的对话在常规提示下较少出现不一致行为,但通过提示工程难以有效控制,监督微调可能导致过度生成特定行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17217 2026-03-19 cs.CL cs.AI cs.LG 87%

Anonymous-by-Construction: An LLM-Driven Framework for Privacy-Preserving Text

匿名由设计:一个基于LLM的隐私保护文本框架

Federico Albanese, Pablo Ronco, Nicolás D'Ippolito

机构 * Veritran University of Buenos Aires(布宜诺斯艾利斯大学) University of San Andrés(圣安德烈斯大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于LLM的匿名化框架,通过本地LLM实现文本隐私保护,同时保持语义和任务相关性,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏