arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-22 至 2026-04-22 共收录 27 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 27 篇

2511.06168 2026-04-22 cs.AI 86%

Chain-of-Thought as a Lens: Evaluating Structured Reasoning Alignment between Human Preferences and Large Language Models

思维链作为镜像:评估大语言模型与人类偏好之间结构化推理的对齐

Boxuan Wang, Zhuoyun Li, Xinmiao Huang, Xiaowei Huang, Yi Dong

机构 * School of Computer Science and Informatics, University of Liverpool, United Kingdom(利物浦大学计算机科学与信息学学院)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title);分类 cs.AI

AI总结 本文提出一种量化评估大语言模型多步结构化推理与人类偏好对齐的方法,引入对齐分数指标,通过构建基于语义熵的矩阵比较模型生成的思维链与人类偏好参考,发现对齐分数在2步推理时达到峰值,支持其作为诊断信号。

Comments Accepted to ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19070 2026-04-22 cs.CL cs.LG 84%

TRN-R1-Zero: Text-rich Network Reasoning via LLMs with Reinforcement Learning Only

TRN-R1-Zero:通过仅强化学习的LLM进行文本丰富网络推理

Yilun Liu, Ruihong Qiu, Zi Huang

机构 * School of Electrical Engineering and Computer Science(电气工程与计算机科学学院) The University of Queensland(昆士兰大学) Brisbane, Queensland, Australia(昆士兰州布里斯班)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 TRN-R1-Zero通过仅强化学习训练LLM,在文本丰富网络上实现零样本推理,无需监督微调或链式思维数据,实验验证其优越性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13654 2026-04-22 cs.LG cs.AI cs.CL 82%

Input-Time Scaling: Adding Noise and Irrelevance into Less-Is-More Drastically Improves Reasoning Performance and Efficiency

输入时间扩展:添加噪声和无关信息显著提升推理性能和效率

Rapheal Huang, Weilong Guo

机构 * Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过引入噪声和无关信息,输入时间扩展方法在推理性能和效率上取得突破,无需额外设计即可提升效果,适用于更广泛场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18805 2026-04-22 cs.AI cond-mat.mtrl-sci cs.LG 81%

AI scientists produce results without reasoning scientifically

AI科学家在没有科学推理的情况下产生结果

Martiño Ríos-García, Nawaf Alampara, Chandan Gupta, Indrajeet Mandal, Sajid Mannan, Ali Asghar Aghajani, N. M. Anoop Krishnan, Kevin Maik Jablonka

机构 * Laboratory of Organic and Macromolecular Chemistry (IOMC), Friedrich Schiller University Jena(有机与大分子化学实验室(IOMC),弗里德里希-席勒耶纳大学) Department of Civil Engineering, Indian Institute of Technology Delhi(土木工程系,印度理工学院德里) School of Interdisciplinary Research, Indian Institute of Technology Delhi(跨学科研究学院,印度理工学院德里) Yardi School of Artificial Intelligence, Indian Institute of Technology Delhi(Yardi人工智能学院,印度理工学院德里) Center for Energy and Environmental Chemistry Jena, Friedrich Schiller University Jena(能源与环境化学中心(耶纳),弗里德里希-席勒耶纳大学) Helmholtz Institute for Polymers in Energy Applications Jena (HIPOLE Jena), Lessingstraße 12–14(能源应用高分子研究所(耶纳,HIPOLE耶纳),Lessingstraße 12–14)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 研究评估了基于大语言模型的科学代理在八个领域中的表现,发现基础模型主导了性能和行为,且代理推理缺乏科学推理的 epistemic 特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06211 2026-04-22 cs.CL cs.AI cs.CV 81%

PuzzleWorld: A Benchmark for Multimodal, Open-Ended Reasoning in Puzzlehunts

PuzzleWorld: 一个用于谜题 hunt 中多模态、开放式推理的基准

Hengzhi Li, Justin Zhang, Brendon Jiang, Alexander Naehu, Regan Song, Megan Tjandrasuwita, Chanakya Ekbote, Steven-Shine Chen, Adithya Balachandran, Wei Dai, Rebecca Chang, Paul Pu Liang

机构 * MIT Media Lab and MIT EECS(MIT媒体实验室和MIT电子工程与计算机科学系)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 PuzzleWorld 是一个包含667个谜题 hunt 风格问题的基准,用于评估逐步、开放式和创造性多模态推理。每个谜题都标注了最终答案、详细推理轨迹和认知技能标签,揭示了当前模型在推理中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07966 2026-04-22 cs.CV cs.CL 80%

Visual-TableQA: Open-Domain Benchmark for Reasoning over Table Images

视觉-表格问答:面向表格图像推理的开放领域基准

Boammani Aser Lompo, Marc Haraoui

机构 * École de Technologie Supérieure(埃克塞技术学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出Visual-TableQA,一个大规模开放领域多模态数据集,用于评估和提升视觉推理能力,包含2500个LaTeX渲染表格和6000对推理密集型问答对,通过多模型协作生成,验证了模型在外部基准上的鲁棒性。

Comments Accepted at the First Workshop on Foundations of Reasoning in Language Models, NeurIPS 2025. Available at: https://openreview.net/forum?id=fvJRsGwhPf

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00161 2026-04-22 cs.CV 80%

Q-Mask: Query-driven Causal Masks for Text Anchoring in OCR-Oriented Vision-Language Models

Q-Mask:面向OCR的视觉语言模型中基于查询的因果遮罩用于文本锚定

Longwei Xu, Feng Feng, Shaojie Zhang, Xin Chen, Hang Li, Anan Du, Hailong Yu, Pei Fu, Zhenbo Luo, Jian Luan

机构 * MiLM Plus(小米公司)

专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出Q-Mask框架,通过因果查询驱动的遮罩解码器提升OCR任务中文本锚定的准确性与稳定性,结合大规模标注数据集提升视觉语言模型对文本区域的识别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19172 2026-04-22 cs.AI 79%

Reasoning-Aware AIGC Detection via Alignment and Reinforcement

基于对齐与强化的学习的推理感知AIGC检测

Zhao Wang, Max Xiong, Jianxun Lian, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) Duke University(杜克大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出REVEAL框架,通过生成可解释的推理链实现AIGC检测,采用两阶段训练策略提升准确性和逻辑一致性,实验显示其在多个基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18964 2026-04-22 cs.AI cs.DB 79%

DW-Bench: Benchmarking LLMs on Data Warehouse Graph Topology Reasoning

DW-Bench:基于数据仓库图拓扑推理的大型语言模型基准测试

Ahmed G. A. H Ahmed, C. Okan Sakar

机构 * Innosol / Bahçeşehir University(Innosol / 巴赫切希尔大学) Department of Computer Engineering, Bahcesehir University, Turkey(计算机工程系,巴赫切希尔大学,土耳其)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 DW-Bench评估LLM在数据仓库模式上的图拓扑推理能力,包含1046个验证正确的问题,实验显示工具增强方法在复杂组合子类型上表现稳定。

Comments 24 pages, 6 figures. Datasets and evaluation code available at GitHub

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22673 2026-04-22 cs.AI 79%

Beyond Itinerary Planning-A Real-World Benchmark for Multi-Turn and Tool-Using Travel Tasks

超越行程规划——多轮和工具使用旅行任务的现实世界基准

Xiang Cheng, Yulan Hu, Xiangwen Zhang, Lu Xu, Lide Tan, Zheng Pan, Xin Li, Yong Liu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学光林人工智能学院) National University of Singapore(新加坡国立大学) Beihang University(北航) AMAP, Alibaba Group(阿里云实验室)

专题命中 推理评测 :planning(title,abstract);分类 cs.AI

AI总结 本文提出TravelBench,一个现实世界旅行规划基准,通过多轮对话和工具使用评估LLM的独立解决问题、隐含偏好获取和能力边界识别能力。

Comments Accepted to the ACL 2026 Main Conference. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19081 2026-04-22 cs.SE 78%

Proactive Detection of GUI Defects in Multi-Window Scenarios via Multimodal Reasoning

通过多模态推理主动检测多窗口场景中的GUI缺陷

Xinyao Zhang, Rui Wang, Jinhao Cui, Haotian Huang, Wei Xue, Wenhua Hu, Jianwen Xiang, Rui Hao

专题命中 推理评测 :reasoning(title);chain-of-thought(abstract)

AI总结 本文提出一种端到端框架,通过主动触发多窗口状态,利用多模态大语言模型检测定位GUI缺陷,实验表明多窗口设置显著增加布局缺陷暴露,方法在应用和细粒度层面均优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18829 2026-04-22 cs.CV 78%

DUALVISION: RGB-Infrared Multimodal Large Language Models for Robust Visual Reasoning

DUALVISION:用于鲁棒视觉推理的RGB-红外多模态大语言模型

Abrar Majeedi, Zhiyuan Ruan, Ziyi Zhao, Hongcheng Wang, Jianglin Lu, Yin Li

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Amazon(亚马逊) Northeastern University(东北大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出DUALVISION,通过局部化交叉注意力融合IR-RGB信息,提升多模态大语言模型在视觉退化条件下的性能,并引入DV-204K和DV-500数据集进行评估。

Comments Accepted at CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02368 2026-04-22 cs.AI cs.CL 62%

Xpertbench: Expert Level Tasks with Rubrics-Based Evaluation

Xpertbench:基于评分标准的专家级任务

Xue Liu, Xin Ma, Yuxin Ma, Yongchang Peng, Duo Wang, Zhoufutu Wen, Ge Zhang, Kaiyuan Zhang, Xinyu Chen, Yida Ding, Tianci He, Jiani Hou, Liang Hu, Ziyun Huang, Yongzhe Hui, Jianpeng Jiao, Chennan Ju, Yingru Kong, Yiran Li, Jiashuo Liu, Mengyun Liu, Luyao Ma, Fei Ni, Yiqing Ni, Pengbo Niu, Yueyan Qiu, Yanle Ren, Xinyu Shen, Zilin Shi, Zaiyuan Wang, Wenjie Yue, Chun Zhang, Shiyu Zhang, Xinyi Zhang, Kaiwen Zhao, Zhenwei Zhu, Shanshan Wu, Qi Zhao, Wenhao Huang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 XpertBench通过精心设计的高保真任务评估LLM在专业领域的能力,揭示了当前AI系统在专家级任务上的性能瓶颈,展示了模型在不同领域中的表现差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21080 2026-04-22 cs.CL cs.AI cs.CY 62%

InsideOut: Measuring and Mitigating Insider-Outsider Bias in Interview Script Generation

InsideOut: 评估和缓解面试脚本生成中的内部-外部偏见

Yixin Wan, Xingrun Chen, Kai-Wei Chang

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 推理评测 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出InsideOut基准,通过文化情境面试脚本生成任务量化LLM的内部-外部偏见,采用三种评估指标,并提出基于代理的MFA框架缓解偏见,实验表明MFA方法显著降低偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19689 2026-04-22 cs.AI 57%

A-MAR: Agent-based Multimodal Art Retrieval for Fine-Grained Artwork Understanding

A-MAR:基于代理的多模态艺术检索用于细粒度艺术作品理解

Shuai Wang, Hongyi Zhu, Jia-Hong Huang, Yixian Shen, Chengxi Zeng, Stevan Rudinac, Monika Kackovic, Nachoem Wijnberg, Marcel Worring

机构 * University of Amsterdam(阿姆斯特丹大学) University of Bristol(布里斯托大学) Amazon AGI(亚马逊人工智慧) College of Business and Economics(商学院和经济学学院) University of Johannesburg(约翰内斯堡大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出A-MAR框架,通过结构化推理计划显式指导多模态艺术检索,提升解释质量和证据 grounding 能力,在艺术领域验证了代理式多模态推理的有效性。

Journal ref ICMR 2026, ACM International Conference on Multimedia Retrieval

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19633 2026-04-22 cs.AI cs.CE 57%

Time Series Augmented Generation for Financial Applications

时间序列增强生成用于金融应用

Anton Kolonin, Alexey Glushchenko, Evgeny Bochkov, Abhishek Saxena

机构 * SingularityNET Foundation(SingularityNET基金会)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种新的评估方法和基准,用于衡量LLM在金融时间序列分析中的推理能力,通过大规模实证研究验证了工具增强范式的有效性。

Comments 11 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19516 2026-04-22 cs.AI 57%

From Experience to Skill: Multi-Agent Generative Engine Optimization via Reusable Strategy Learning

从经验到技能:通过可重用策略学习的多智能体生成引擎优化

Beining Wu, Fuyou Mao, Jiong Lin, Cheng Yang, Jiaxuan Lu, Yifu Guo, Siyu Zhang, Yifan Wu, Ying Huang, Fu Li

机构 * Hangzhou Dianzi University(杭州电子科技大学) Central South University(中南大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Sun Yat-sen University(中山大学) Ramus Hong Kong University of Science and Technology (GuangZhou)(香港科技大学(广州))

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 本文提出MAGEO框架,通过协调规划、编辑和基于保真的评估,实现生成引擎优化,结合双轴指标DSV-CF和双分支评估协议,提升内容编辑的语义可见性和归因准确性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19405 2026-04-22 cs.CL 57%

Lost in Translation: Do LVLM Judges Generalize Across Languages?

迷失在翻译中:大型视觉-语言模型(LVLM)的评判者是否能跨语言泛化?

Md Tahmid Rahman Laskar, Mohammed Saidul Islam, Mir Tafseer Nayeem, Amran Bhuiyan, Mizanur Rahman, Shafiq Joty, Enamul Hoque, Jimmy Huang

机构 * York University(约克大学) University of Alberta(阿尔伯塔大学) Nanyang Technological University(南洋理工大学) Salesforce AI Research(Salesforce AI研究)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出MM-JudgeBench,首个多语言多模态评判模型评估基准,包含60000+跨25种语言的配对偏好实例,揭示了LVLM评判器在跨语言性能上的显著差异,指出模型大小和架构并非多语言鲁棒性的良好预测因素。

Comments Accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19300 2026-04-22 cs.SD cs.AI 57%

HalluAudio: A Comprehensive Benchmark for Hallucination Detection in Large Audio-Language Models

HalluAudio:大型音频-语言模型中幻觉检测的综合基准

Feiyu Zhao, Yiming Chen, Wenhuan Lu, Daipeng Zhang, Xianghu Yue, Jianguo Wei

机构 * College of Intelligence and Computing, Tianjin University, China(天津大学智能计算学院) ASUS Intelligent Cloud Services, Singapore(ASUS智能云服务)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 HalluAudio是首个大规模评估语音、环境声音和音乐中幻觉的基准,包含5000多对人工验证的问答对,通过对抗性提示和混合音频条件系统诱导幻觉,评估准确率、幻觉率、偏差等,揭示了大型音频-语言模型在声音接地、时间推理和音乐属性理解上的缺陷。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18982 2026-04-22 cs.AI 57%

SAVOIR: Learning Social Savoir-Faire via Shapley-based Reward Attribution

SAVOIR:通过基于Shapley的奖励归因学习社交能力

Xiachong Feng, Yi Jiang, Xiaocheng Feng, Deyi Yin, Libo Qin, Yangfan Ye, Lei Huang, Weitao Ma, Yuxuan Gu, Chonghan Qin, Bing Qin, Lingpeng Kong

机构 * The University of Hong Kong(香港大学) Harbin Institute of Technology(哈尔滨工业大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出SAVOIR框架,基于合作博弈理论解决语言代理训练中的信用分配问题,通过预期效用转移和Shapley值实现公平奖励分配,实验显示其在SOTOPIA基准上达到新状态-of-the-art性能。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05437 2026-04-22 cs.CL 57%

Once Correct, Still Wrong: Counterfactual Hallucination in Multilingual Vision-Language Models

一旦正确,仍错误:多语言视觉-语言模型中的反事实幻觉

Basel Mousi, Fahim Dalvi, Shammur Chowdhury, Firoj Alam, Nadir Durrani

机构 * Qatar Computing Research Institute, HBKU(卡塔尔计算研究所,哈姆丹·本·哈马德大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 研究探讨多语言视觉-语言模型在文化背景下反事实幻觉的问题,提出M²CQA基准测试,通过17个中东国家图像和多语言对比陈述评估模型性能,发现阿拉伯语尤其在方言中反事实幻觉率显著上升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03108 2026-04-22 cs.CL 57%

ChemPro: A Progressive Chemistry Benchmark for Large Language Models

ChemPro:一种渐进式的化学基准测试用于大语言模型

Aaditya Baranwal, Shruti Vyas

机构 * Aaditya Baranwal Shruti Vyas

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 ChemPro通过4100个化学问题-答案对评估大语言模型在化学领域的表现,涵盖多个难度层级,揭示了LLM在科学推理中的局限性。

Comments Accepted at Artificial Intelligence Chemistry Journal

Journal ref Artif. Intell. Chem. 4(1), 100118 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15907 2026-04-22 cs.CL 57%

TabReX : Tabular Referenceless eXplainable Evaluation

TabReX : 不依赖参考的表格可解释性评估

Tejas Anvekar, Junha Park, Aparna Garimella, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学) Adobe Research(Adobe研究)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 TabReX 提出了一种不依赖参考的表格生成评估框架,通过图推理方法将源文本和生成表格转化为知识图谱,并计算可解释的评分,实现结构和事实的准确性评估。

Comments Accepted to ACL 2026 (Main Conference). Long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19042 2026-04-22 cs.IR 50%

STK-Adapter: Incorporating Evolving Graph and Event Chain for Temporal Knowledge Graph Extrapolation

STK-Adapter:融合演进图与事件链以实现时序知识图谱外推

Shuyuan Zhao, Wei Chen, Weijie Zhang, Xinrui Hou, Junfeng Shen, Boyan Shi, Shengnan Guo, Youfang Lin, Huaiyu Wan

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出STK-Adapter,通过融合演进图与事件链,解决时序知识图谱外推中空间-时间信息丢失和特征稀释问题,提升模型推理能力与泛化能力。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18957 2026-04-22 cs.CV 50%

Bridging Foundation Models and ASTM Metallurgical Standards for Automated Grain Size Estimation from Microscopy Images

弥合基础模型与ASTM冶金标准以实现显微图像中的晶粒尺寸自动估计

Abdul Mueez, Shruti Vyas

机构 * University of Central Florida(中央佛罗里达大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出一种结合Cellpose-SAM和ASTM E112 Jeffries平面模块的自动化管道,用于显微图像中的密集实例分割和晶粒尺寸估计,通过拓扑感知梯度追踪和适应性提示生成,实现高精度的冶金评估。

Comments Accepted at the 11th IEEE Workshop on Computer Vision for Multimodal Microscopy Image Analysis (CVMI), CVPR Workshops 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18740 2026-04-22 cs.CV 50%

Autonomous Skeletal Landmark Localization towards Agentic C-Arm Control

自主骨骼标志点定位以实现智能C臂控制

Jay Jung, Ahmad Arrabi, Jax Luo, Scott Raymond, Safwan Wshah

机构 * University of Vermont(佛蒙特大学) Cleveland Clinic(克利夫兰诊所)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文研究了利用多模态大语言模型实现C臂控制中骨骼标志点的自主定位,通过实验验证了其在准确性和推理能力上的优势,为智能C臂控制提供了新方法。

Comments Accepted at IJCARS: IPCAI 2026. Int J CARS (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17072 2026-04-22 cs.MA 50%

CogGen: A Cognitively Inspired Recursive Framework for Deep Research Report Generation

CogGen:一种受认知启发的递归框架用于深度研究报告生成

Kuo Tian, Pengfei Sun, Zhen Wu, Junran Ding, Xinyu Dai

专题命中 推理评测 :planning(abstract)

AI总结 CogGen通过递归架构模拟认知写作,实现灵活规划与全局重构,引入抽象视觉表示和认知负荷评估框架,提升多模态内容生成质量。

Comments 28 pages, 3 figures, Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏