arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-08 至 2026-04-08 共收录 38 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 38 篇

2604.05939 2026-04-08 cs.AI cs.HC 89%

Context-Value-Action Architecture for Value-Driven Large Language Model Agents

基于价值的大型语言模型代理的上下文-价值-行动架构

TianZe Zhang, Sirui Sun, Yuhang Xie, Xin Zhang, Zhiqiang Wu, Guojie Song

机构 * State Key Laboratory of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院通用人工智能国家重点实验室) Yuanpei College, Peking University(北京大学元培学院) School of Psychological and Cognitive Sciences, Peking University(北京大学心理与认知科学学院) Key Laboratory of Machine Perception (Ministry of Education), Peking University(北京大学机器感知重点实验室(教育部)) PKU-Wuhan Institute for Artificial Intelligence(北大武汉人工智能研究院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出CVA架构,通过价值验证器缓解价值极化,提升代理行为的准确性和可解释性。

Comments Accepted to Findings of the Association for Computational Linguistics: ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04942 2026-04-08 cs.CL cs.AI 88%

TDA-RC: Task-Driven Alignment for Knowledge-Based Reasoning Chains in Large Language Models

TDA-RC:基于任务驱动的知识推理链对齐方法

Jiaquan Zhang, Qigan Sun, Chaoning Zhang, Xudong Wang, Zhenzhen Huang, Yitian Zhou, Pengcheng Zheng, Chi-lok Andy Tai, Sung-Ho Bae, Zeyu Ma, Caiyan Qin, Jinyu Guo, Yang Yang, Hengtao Shen

机构 * School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院) School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院) College of Professional and Continuing Education, The Hong Kong Polytechnic University(香港理工大学专业及持续教育学院) School of Robotics and Advanced Manufacture, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)机电工程与自动化学院) School of Computing, Kyung Hee University(庆熙大学计算机学院) School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出TDA-RC方法,通过拓扑学优化提升大语言模型推理效率与准确性,结合持久同调将不同推理范式统一到拓扑空间中,实现高效且精准的推理链优化。

Comments 14 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09664 2026-04-08 cs.SE cs.AI cs.CL cs.PL 88%

CodeMind: Evaluating Large Language Models for Code Reasoning

CodeMind: 评估大型语言模型的代码推理能力

Changshu Liu, Yang Chen, Reyhaneh Jabbarvand

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CodeMind框架,通过独立执行推理、规范推理和动态语义推理任务评估LLM的代码推理能力,发现LLM在处理复杂代码时性能下降,且bug修复性能与代码推理任务无关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13909 2026-04-08 cs.CL cs.AI 88%

Knowledge Reasoning Language Model: Unifying Knowledge and Language for Inductive Knowledge Graph Reasoning

知识推理语言模型:统一知识与语言以进行归纳知识图谱推理

Xingrui Zhuo, Jiapu Wang, Gongqing Wu, Zhongyuan Wang, Jichen Zhang, Shirui Pan, Xindong Wu

机构 * The Key Laboratory of Knowledge Engineering with Big Data (the Ministry of Education of China), Hefei University of Technology, China(合肥工业大学大数据知识工程教育部重点实验室) School of Computer Science and Information Engineering, Hefei University of Technology, China(合肥工业大学计算机与信息学院) Nanjing University of Science and Technology, China(南京理工大学) China Unicom Digital Technology Co., Ltd., Beijing, China(联通数字科技有限公司) China Unicom Internet of Things Co., Ltd., Nanjing, China(联通物联网有限责任公司) Shandong Inspur Science Research Institute, Jinan, China(山东浪潮科学研究院) Griffith University, Australia(格里菲斯大学)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);foundation model(abstract)

AI总结 本文提出KRLM,通过统一语言模型知识与知识图谱上下文,解决归纳知识图谱推理中的知识扭曲和生成幻觉问题,实验表明其在25个真实数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01594 2026-04-08 cs.RO cs.CV 88%

MARS: Multi-Agent Robotic System with Multimodal Large Language Models for Assistive Intelligence

MARS:基于多模态大语言模型的多智能体机器人系统用于辅助智能

Renjun Gao

机构 * School of Computer Science and Engineering, Faculty of Innovation Engineering, Macau University of Science and Technology(澳门科技大学创新工程学院计算机科学与工程学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 MARS系统利用多模态大语言模型实现风险感知和个性化辅助,通过多智能体决策框架提升智能家庭机器人在动态环境中的表现。

Comments 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05655 2026-04-08 cs.CL cs.AI cs.LG 87%

LLM Reasoning as Trajectories: Step-Specific Representation Geometry and Correctness Signals

大语言模型推理作为轨迹:步骤特定的表示几何与正确性信号

Lihao Sun, Hang Dong, Bo Qiao, Qingwei Lin, Dongmei Zhang, Saravan Rajmohan

机构 * Microsoft(微软)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过表示空间结构揭示大语言模型的推理过程,发现推理步骤在不同层深度下逐渐分离,晚期阶段正确与错误解的分歧可预测最终答案正确性,提出轨迹引导框架控制推理。

Comments ACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05716 2026-04-08 cs.AI 86%

Can Large Language Models Reinvent Foundational Algorithms?

大语言模型能否重新发明基础算法?

Jian Zhao, Haoren Luo, Yu Wang, Yuhan Cao, Pingyue Sheng, Tianxing He

机构 * Xiongan AI Institute(雄安人工智能研究院) Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院) Shanghai Qi Zhi Institute(上海期智研究院) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract);分类 cs.AI

AI总结 本文研究大语言模型能否在受控环境中重新发明基础算法,通过Unlearn-and-Reinvent流程验证模型在无提示、低提示和高提示下的表现,发现生成验证器在推理过程中起到关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05540 2026-04-08 cs.CL 85%

Learning to Edit Knowledge via Instruction-based Chain-of-Thought Prompting

通过基于指令的思考链提示学习知识编辑

Jinhu Fu, Yan Bai, Longzhu He, Yihang Lou, Yanxiao Zhao, Li Sun, Sen Su

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学) Huawei Technologies Ltd.(华为技术有限公司) Chongqing University of Posts and Telecommunications(重庆邮电大学)

专题命中 推理与问题求解 :prompting(title);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出CoT2Edit方法,通过思考链推理提升大语言模型的知识编辑能力,解决泛化差和范围窄的问题,实验显示在六个场景中表现优异。

Comments Accepted by ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05160 2026-04-08 cs.CY 85%

A Multi-Agent Approach to Validate and Refine LLM-Generated Personalized Math Problems

一种多智能体方法用于验证和细化LLM生成的个性化数学问题

Fareya Ikram, Nischal Ashok Kumar, Junyang Lu, Hunter McNichols, Candace Walkington, Neil Heffernan, Andrew S. Lan

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出多智能体框架,通过生成-验证-修订流程提升LLM生成的个性化数学问题的现实性和可读性,实验显示单一迭代能显著减少初始问题的失败模式。

Comments Published in AIED 2026: The 27th International Conference on Artificial Intelligence in Education

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01591 2026-04-08 cs.AI 84%

ThinkTwice: Jointly Optimizing Large Language Models for Reasoning and Self-Refinement

ThinkTwice:联合优化大型语言模型以进行推理和自我完善

Difan Jiao, Qianfeng Wen, Blair Yang, Zhenwei Tang, Ashton Anderson

机构 * Department of Computer Science, University of Toronto(多伦多大学计算机科学系) Coolwei AI Lab(Coolwei AI实验室)

专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.AI

AI总结 ThinkTwice通过两阶段框架联合优化LLM,提升推理和自我完善性能,基于GRPO方法,在多个数学推理基准上优于现有基线。

Comments 27 pages,7 figures,5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15079 2026-04-08 cs.SE 83%

Assessing Coherency and Consistency of Code Execution Reasoning by Large Language Models

通过大型语言模型评估代码执行推理的连贯性与一致性

Changshu Liu, Yang Chen, Reyhaneh Jabbarvand

专题命中 推理与问题求解 :large language model(title);language model(title)

AI总结 本文提出CES任务,评估大语言模型在模拟程序执行和编程任务中的推理能力,引入连贯性概念以判断执行逻辑是否符合常识,提出新的度量标准以衡量推理一致性,发现LLM在编程任务中存在路径敏感分析的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05497 2026-04-08 cs.AI cs.CV 83%

Thinking Diffusion: Penalize and Guide Visual-Grounded Reasoning in Diffusion Multimodal Language Models

Thinking Diffusion: 通过惩罚和引导在扩散多模态语言模型中抑制和引导视觉推理

Keuntae Kim, Mingyu Kang, Yong Suk Choi

机构 * Department of Computer Science, Hanyang University(汉阳大学计算机科学系) Department of Artificial Intelligence, Hanyang University(汉阳大学人工智能系)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 本文针对扩散多模态语言模型在视觉推理中生成过早答案的问题,提出位置与步数惩罚和视觉推理引导方法,提升推理准确率并加快推理速度。

Comments CVPR 2026 - main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05681 2026-04-08 cs.AI cs.CL cs.GT cs.LG cs.MA 82%

LUDOBENCH: Evaluating LLM Behavioural Decision-Making Through Spot-Based Board Game Scenarios in Ludo

LUDOBENCH:通过基于点的棋盘游戏场景评估LLM的行为决策

Ojas Jain, Dhruv Kumar

机构 * Department of Computer Science and Information Systems, BITS Pilani(比拉理工学院皮拉尼校区计算机科学与信息系统系)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 LudoBench通过12种不同决策类别中的480个手工设计点场景,评估LLM在Ludo棋盘游戏中的战略推理能力,发现模型在行为上呈现不同特征,揭示了提示敏感性作为关键漏洞。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04838 2026-04-08 cs.CV 82%

Less Detail, Better Answers: Degradation-Driven Prompting for VQA

细节越少,答案越好:基于退化的提示方法用于视觉问答

Haoxuan Han, Weijie Wang, Zeyu Zhang, Yefei He, Bohan Zhuang

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室)

专题命中 推理与问题求解 :prompting(title,abstract);language model(abstract)

AI总结 本文提出退化驱动提示(DDP)方法,通过降低图像清晰度迫使模型关注关键结构信息,提升视觉问答性能。在物理属性和感知现象任务中,DDP通过降采样、结构辅助和提示技术实现更准确的推理。

Comments Accepted to CVPRW 2026. Project page: https://hhx-jpg.github.io/ddp/ , Code: https://github.com/ziplab/DDP

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05620 2026-04-08 cs.CV cs.AI 81%

Semantic-Topological Graph Reasoning for Language-Guided Pulmonary Screening

语义-拓扑图推理用于语言引导的肺部筛查

Chenyu Xue, Yiran Liu, Mian Zhou, Jionglong Su, Zhixiang Lu

机构 * Xi’an Jiaotong-Liverpool University(西交利物浦大学) University College London(伦敦大学学院) University of Liverpool(利物浦大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出语义-拓扑图推理框架,结合大语言模型与视觉基础模型,解决临床报告语义模糊和低对比度扫描的解歧问题,实现高精度肺部筛查。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05159 2026-04-08 cs.SE cs.AI cs.CL 81%

Planning to Explore: Curiosity-Driven Planning for LLM Test Generation

规划以探索:基于好奇心的规划用于LLM测试生成

Alfonso Amayuelas, Firas Laakom, Piotr Piękos, Wenyi Wang, Yifan Xu, Yuhui Wang, Jürgen Schmidhuber, William Wang

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) King Abdullah University of Science and Technology(阿卜杜拉国王科技大学)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CovQValue方法,通过将覆盖地图反馈给LLM生成多样化计划,并利用LLM估计的Q值选择最信息量的计划,以平衡即时分支发现与未来可达性,优于贪心策略,在测试生成任务中取得更高覆盖率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05649 2026-04-08 cs.CV cs.AI 79%

Analogical Reasoning as a Doctor: A Foundation Model for Gastrointestinal Endoscopy Diagnosis

作为医生的类比推理:一种胃肠内镜诊断的基础模型

Peixi Peng, Housheng Xie, Yanling Wei, Guangcong Ruan, Xiaoyang Zou, Qian Cao, Yongjian Nian, Guoyan Zheng

专题命中 推理与问题求解 :foundation model(title,abstract);分类 cs.AI

AI总结 本文提出RATNet基础模型,通过类比推理提升胃肠内镜诊断的泛化能力与鲁棒性,在六个场景中超越现有模型,支持联邦学习隐私保护部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04987 2026-04-08 cs.LG cs.AI math.OC stat.ML 79%

Cactus: Accelerating Auto-Regressive Decoding with Constrained Acceptance Speculative Sampling

Cactus:通过受约束的接受推测采样加速自动回归解码

Yongchang Hao, Lili Mou

机构 * Dept. Computing Science & Alberta Machine Intelligence Institute (Amii), University of Alberta(阿尔伯塔大学计算机科学系与阿尔伯塔机器智能研究所) Canada CIFAR AI Chair(加拿大CIFAR人工智能讲席)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Cactus方法,通过受约束优化框架,在保证与验证器分布可控差异的同时提升接受率,有效解决传统推测采样在分布匹配上的限制问题。

Comments Camera-ready version. Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04949 2026-04-08 cs.IR cs.AI cs.CL 79%

Learning to Retrieve from Agent Trajectories

从智能体轨迹中学习检索

Yuqi Zhou, Sunhao Dai, Changle Qu, Liang Pang, Jun Xu, Ji-Rong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) CAS Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所人工智能安全重点实验室)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出从智能体交互数据直接训练检索模型的新方法,通过分析轨迹中的行为信号,提出LRAT框架提升检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07432 2026-04-08 cs.AI 78%

TS-Agent: Understanding and Reasoning Over Raw Time Series via Iterative Insight Gathering

TS-Agent:通过迭代洞察获取理解并推理原始时间序列

Penghang Liu, Elizabeth Fons, Annita Vapsi, Mohsen Ghassemi, Svitlana Vyetrenko, Daniel Borrajo, Vamsi K. Potluru, Manuela Veloso

机构 * JPMorgan AI Research, NY, USA(摩根大通人工智能研究院,纽约,美国)

专题命中 推理与问题求解 :language model(abstract,comments);LLM(abstract);large language model(abstract);分类 cs.AI

AI总结 TS-Agent通过迭代洞察获取机制,在时间序列理解和推理任务中匹配或超越文本、视觉及时间序列语言模型基线,尤其在零样本设置下表现更优。

Comments NeurIPS 2025 Workshop on Foundations of Reasoning in Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05987 2026-04-08 cs.AI 77%

Flowr -- Scaling Up Retail Supply Chain Operations Through Agentic AI in Large Scale Supermarket Chains

Flowr -- 通过大规模超市连锁中的代理AI实现零售供应链运营的扩展

Eranga Bandara, Ross Gore, Sachin Shetty, Piumi Siyambalapitiya, Sachini Rajapakse, Isurunima Kularathna, Pramoda Karunarathna, Ravi Mukkamala, Peter Foytik, Safdar H. Bouk, Abdul Rahman, Xueping Liang, Amin Hass, Tharaka Hewa, Ng Wee Keong, Kasun De Zoysa, Aruna Withanage, Nilaan Loganathan

机构 * Old Dominion University(老道明大学) Florida International University(佛罗里达国际大学) Nanyang Technological University(南洋理工大学) University of Colombo(科伦坡大学) Center for Wireless Communications, University of Oulu(奥卢大学无线通信中心) University of Sri Jayewardenepura(斯里贾亚瓦德纳普拉大学) Accenture Technology Labs(埃森哲技术实验室)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Flowr框架,通过代理AI自动化大规模超市连锁的端到端供应链流程,减少人工协调负担,提升供需匹配度和异常处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05458 2026-04-08 cs.CR cs.AI 77%

MA-IDS: Multi-Agent RAG Framework for IoT Network Intrusion Detection with an Experience Library

MA-IDS:基于经验库的多智能体RAG框架用于物联网网络入侵检测

Md Shamimul Islam, Luis G. Jaimes, Ayesha S. Dina

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出MA-IDS框架,结合大语言模型与RAG技术,通过经验库实现自学习的入侵检测,实验表明其在物联网网络中具有高准确率和可解释性。

Comments Preprint. Submitted to IEEE conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05168 2026-04-08 cs.AI 77%

Instruction-Tuned LLMs for Parsing and Mining Unstructured Logs on Leadership HPC Systems

指令调优的LLM用于领导型HPC系统上解析和挖掘无结构日志

Ahmad Maroof Karimi, Jong Youl Choi, Charles Qing Cao, Awais Khan

机构 * Oak Ridge National Laboratory(橡树岭国家实验室) University of Tennessee(田纳西大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种基于指令调优的LLM框架,利用链式推理解析HPC日志,结合领域特定日志模板和示例对LLaMA模型进行微调,实现高精度的日志解析与挖掘,验证了其在大规模日志数据上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05266 2026-04-08 cs.MM 75%

LLM2Manim: Pedagogy-Aware AI Generation of STEM Animations

LLM2Manim: 基于教学的AI生成STEM动画

Aastha Joshi, Hongyi Ke, Meet Gajjar, Aaron Christian, Qi Wang, Jun Chen

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出一种半自动化的人工介入流程,利用大语言模型生成符合多媒体学习原理的STEM动画,实验显示动画教学在学习效果、参与度和认知负荷方面优于传统PPT。

Comments 12 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05355 2026-04-08 cs.AI cs.CL 73%

ETR: Entropy Trend Reward for Efficient Chain-of-Thought Reasoning

ETR:熵趋势奖励用于高效推理链推理

Xuan Xiong, Huan Liu, Li Gu, Zhixiang Chi, Yue Qiu, Yuanhao Yu, Yang Wang

机构 * University of Toronto(多伦多大学) McMaster University(麦克马斯特大学) Concordia University(康考迪亚大学) University of Ottawa(渥太华大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ETR,通过轨迹感知的目标促进逐步不确定性降低,提升推理效率与准确性,实验表明在多个基准上显著提升性能。

Comments ACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10815 2026-04-08 cs.AI cs.CL cs.IR cs.SC 73%

DRIFT: Decompose, Retrieve, Illustrate, then Formalize Theorems

DRIFT: 分解、检索、示例,然后形式化定理

Meiru Zhang, Philipp Borchert, Milan Gritta, Gerasimos Lampouras

机构 * Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室) Huawei Noah’s Ark Lab(华为诺亚方舟实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 DRIFT框架通过分解数学陈述并检索相关定理,提升大语言模型在形式化证明中的前提检索能力,显著提高F1分数和跨分布性能。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06079 2026-04-08 cs.CV cs.AI 70%

Scientific Graphics Program Synthesis via Dual Self-Consistency Reinforcement Learning

通过双自一致性强化学习实现科学图形程序合成

Juekai Lin, Yun Zhu, Honglin Lin, Sijing Li, Tianwei Lin, Zheng Liu, Xiaoyang Wang, Wenqiao Zhang, Lijun Wu

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory, OpenDataLab(上海人工智能实验室,OpenDataLab) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出双自一致性强化学习框架,结合高质量数据集和多维基准,提升科学图形到可编辑TikZ代码的转换能力,实现视觉与结构的高精度优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05757 2026-04-08 cs.CL 70%

Identifying Influential N-grams in Confidence Calibration via Regression Analysis

通过回归分析识别影响置信度校准的关键n-gram

Shintaro Ozaki, Wataru Hashimoto, Hidetaka Kamigaito, Katsuhiko Hayashi, Taro Watanabe

机构 * Nara Institute of Science and Technology (NAIST)(奈良先端科学技术大学院大学) The University of Tokyo(东京大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过回归分析识别与置信度相关的语言表达,发现LLM在推理时仍保持高置信度,并通过抑制这些表达可实现置信度校准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04570 2026-04-08 cs.CV cs.CL 70%

Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm

通过视频思考:视频生成作为一种有前途的多模态推理范式

Jingqi Tong, Yurong Mou, Hangcheng Li, Mingzhe Li, Yongzhuo Yang, Ming Zhang, Qiguang Chen, Tianyi Liang, Xiaomeng Hu, Yining Zheng, Xinchi Chen, Jun Zhao, Xuanjing Huang, Xipeng Qiu

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身智能研究所) Shanghai Innovation Institute(上海创新研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海市多模态具身人工智能重点实验室) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) The Chinese University of Hong Kong(香港中文大学) Central South University(中南大学) Fudan University(复旦大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出'通过视频思考'范式,利用视频生成模型实现多模态推理,通过VideoThinkBench评估显示Sora-2在视觉和文本任务中均表现出色,证明视频生成模型在统一多模态理解与生成中的潜力。

Comments 34 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05900 2026-04-08 cs.CV 67%

AICA-Bench: Holistically Examining the Capabilities of VLMs in Affective Image Content Analysis

AICA-Bench:全面评估VLMs在情感图像内容分析中的能力

Dong She, Xianrong Yao, Liqun Chen, Jinghe Yu, Yang Gao, Zhanpeng Jin

专题命中 推理与问题求解 :language model(abstract);prompting(abstract)

AI总结 本文提出AICA-Bench基准,通过情感理解、推理和生成三个任务评估VLMs在情感图像分析中的能力,发现其在强度校准和描述深度方面存在不足,并提出GAT提示方法提升性能。

Comments Accepted by Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏