arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-20 至 2026-05-20 共收录 143 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 12 篇

2506.07209 2026-05-20 cs.GR cs.CV 50%

HOI-PAGE: Zero-Shot Human-Object Interaction Generation with Part Affordance Guidance

HOI-PAGE:基于部分可及性的零样本人类-物体交互生成

Lei Li, Angela Dai

机构 * University of Virginia(弗吉尼亚大学) Technical University of Munich(慕尼黑技术大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出HOI-PAGE,一种通过部分可及性推理生成高保真4D人类-物体交互的零样本方法,利用大语言模型进行部分级机械推理,并通过结构化部分可及性图(PAG)引导三阶段合成,生成复杂多物体或多人物交互序列。

Comments ICML 2026. Project page: https://craigleili.github.io/projects/hoipage/ Video: https://www.youtube.com/watch?v=gwXjOffCFyk

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19110 2026-05-20 cs.CE 50%

IterSIMP-σ: Evaluating LLM-Assisted Spatial Interventions in Stress-Aware Topology Optimization

IterSIMP-σ:评估LLM辅助的应力感知拓扑优化中的空间干预

Shaoliang Yang, Jun Wang, Yunsheng Wang

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文研究多模态大语言模型(LLM)是否能作为可检查的空间提案模块用于应力感知拓扑优化。IterSIMP-σ保持SIMP优化器作为最小化合规性的有限元求解器,并在其周围放置一个确定性的应力传递、门控评估器和混合LLM/规则解释器。每次求解后,密度和von Mises应力场被渲染;解释器提出排名的空间干预;确定性的安全措施接受、拒绝或停止每个动作。主要动作是软密度种子,所选元素在下一次求解前被初始化为高密度,但在最优标准更新时仍保持自由。我们评估该循环在16问题2D控制器-政策基准、6问题探索性3D扩展、被动固体和输入消融、应力阈值敏感性以及固定体积归因研究中,比较LLM提案与确定性最大应力热点种子、随机应力区域种子和基于规则的控制。2D控制器-政策基准显示保留合规性差异较小(软种子LLM的几何均值低1.9%),但此诊断不显著(W=33,双侧p=0.382)且不是固定体积可行最终比较。在固定体积研究中,LLM条件完成了44/48次尝试评估;25/44次完成评估产生了全部门通过的保留状态。与基于规则的控制的可行最终评分分为4/4/1,确定性精确热点种子仍具竞争力。接受的LLM空间动作有每步记录的平均归一化种子到热点距离为0.221。结果支持IterSIMP-σ作为可检查的LLM辅助设计自动化框架用于空间干预,但尚未作为证据表明LLM视觉推理能改进应力约束优化。

Comments 44 pages, 19 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 测试时计算 10 篇

2605.20075 2026-05-20 cs.CL cs.AI 88%

CopT: Contrastive On-Policy Thinking with Continuous Spaces for General and Agentic Reasoning

CopT: 在连续空间中利用对比学习进行通用和代理推理的在线策略思考

Dachuan Shi, Hanlin Zhu, Xiangchi Yuan, Wanjia Zhao, Kejing Xia, Wen Xiao, Wenke Lee

机构 * Georgia Tech(佐治亚理工学院) UC Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) Microsoft(微软公司)

专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CopT,一种改进的推理流程,通过反转传统思考和回答的顺序,首先生成草稿答案,再基于该答案进行在线策略思考以进行反思和修正。CopT利用连续嵌入作为推理时的对比验证器,通过对比离散令牌输入和连续嵌入输入下模型对相同生成令牌的支持,得到一个序列级的反KL估计器来评估答案的可靠性。在数学、编程和代理推理任务中,CopT在保持同等或更高准确性的情况下,将峰值准确率提高了高达23%,并将令牌使用量减少了高达57%。

Comments Code: https://github.com/sdc17/CopT, Website: https://copt-web.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11262 2026-05-20 cs.LG 87%

Latent Chain-of-Thought Improves Structured-Data Transformers

潜在的链式思维提升结构化数据转换器

Carson Dudley, Samet Oymak

专题命中 测试时计算 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);test-time compute(abstract)

AI总结 本文研究了链式思维对时间序列和表格数据的影响,并提出了一种递归方案,通过压缩查询位置的隐藏状态生成反馈标记,从而在预测前进行多次潜在计算,从而提升结构化数据转换器的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10344 2026-05-20 cs.AI 83%

TMAS: Scaling Test-Time Compute via Multi-Agent Synergy

TMAS: 通过多智能体协同实现测试时间计算的扩展

George Wu, Nan Jing, Qing Yi, Chuan Hao, Ming Yang, Feng Chang, Yuan Wei, Jian Yang, Ran Tao, Bryan Dai

机构 * IQuest Research(IQuest研究) Beihang University(北航)

专题命中 测试时计算 :test-time compute(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 本文提出TMAS框架,通过多智能体协同实现测试时间计算的扩展,利用层次化记忆和混合奖励强化学习提升推理能力和探索效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18851 2026-05-20 cs.LG 83%

STRIDE: Learnable Stepwise Language Feedback for LLM Reasoning

STRIDE: 用于LLM推理的可学习分步语言反馈

Junjie Zhang, Guozheng Ma, Shunyu Liu, Zetian Hu, Yongcheng Jing, Ting-En Lin, Yongbin Li, Dacheng Tao

机构 * Generative AI Lab, College of Computing and Data Science, Nanyang Technological University, Singapore(生成式人工智能实验室,计算与数据科学学院,南洋理工大学,新加坡) Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.LG

AI总结 本文提出STRIDE框架,通过可学习的分步语言反馈提升LLM推理能力,解决了传统方法在标注成本高、信息瓶颈等问题,实验显示其在多种推理基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19317 2026-05-20 cs.LG cs.AI 73%

Inference-Time Scaling in Diffusion Models through Iterative Partial Refinement

通过迭代部分细化在扩散模型中实现推理时间扩展

Taegu Kang, Jaesik Yoon, Sungjin Ahn

机构 * KAIST(韩国科学技术院)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种无需外部验证器的扩散模型推理时间扩展方法Iterative Partial Refinement,通过在混合噪声条件下迭代部分细化生成更一致的样本,在MNIST Sudoku任务中提升了有效解率。

Comments Accepted at the ICLR 2026 Workshop on AI with Recursive Self-Improvement

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18805 2026-05-20 cs.IR cs.AI cs.LG 73%

RecoAtlas: From Semantic Plausibility to Set-Level Utility in LLM Recommendation Agents

RecoAtlas: 从语义合理性到集级效用在LLM推荐代理中

Imad Aouali, Flavian Vasile, Otmane Sakhi, Alexandre Gilotte, Benjamin Heymann

机构 * Criteo AI Lab(Criteo人工智能实验室)

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RecoAtlas,一个用于评估购物代理的基准和工具包,通过行为基础的度量标准来评估推荐代理的性能,揭示语义合理性并不一定代表行为基础的效用。

Comments Benchmark on LLM Recommendation Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19943 2026-05-20 cs.AI 70%

Probabilistic Tiny Recursive Model

概率性微型递归模型

Amin Sghaier, Ali Parviz, Alexia Jolicoeur-Martineau

机构 * Mila – Quebec AI Institute(魁北克人工智能研究所)

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.AI

AI总结 本文提出概率性微型递归模型(PTRM),通过在递归步骤中注入高斯噪声,使模型能够并行探索多样化的解决方案盆地,从而在不重新训练或进行任务特定增强的情况下,提升多个基准测试的准确性,包括Sudoku-Extreme和Pencil Puzzle Bench上的各种谜题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19932 2026-05-20 cs.AI cs.CL cs.LG 67%

PEEK: Context Map as an Orientation Cache for Long-Context LLM Agents

PEEK:上下文地图作为长上下文LLM代理的导向缓存

Zhuohan Gu, Qizheng Zhang, Omar Khattab, Samuel Madden

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Stanford University(斯坦福大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出PEEK系统,通过上下文地图缓存和维护导向知识,提升长上下文LLM代理在重复外部上下文中的交互准确性和效率,相比基线方法在推理和上下文学习任务中均取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18899 2026-05-20 cs.LG cs.AI 62%

Don't Let Bandit Feedback Pull Continual LLM-Recommender Updates Off Target

不要让多臂老虎机反馈将连续LLM推荐系统更新偏离目标

Taesan Kim, Hyeongjun Yun, Jaegul Choo, Chung Park

机构 * SK Telecom(SK电信) KAIST(韩国科学技术院)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种名为Anchored Bandit Policy Optimization (ABPO)的框架,用于持续改进基于生成式大语言模型的推荐系统,通过结合组内相对策略优化(GRPO)和显式处理曝光偏差和反馈模糊性,以减少因部署日志提供的策略形状上下文老虎机反馈导致的偏差,并提高推荐准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05431 2026-05-20 cs.CL 57%

Self-Filtered Distillation with LLMs-generated Trust Indicators for Reliable Patent Classification

基于LLM生成信任指标的自过滤蒸馏用于可靠专利分类

Yongmin Yoo, Xu Zhang, Longbing Cao

机构 * Frontier AI Research Centre, School of Computing, Faculty of Science and Engineering, Macquarie University(前沿人工智能研究中心,计算机学院,科学与工程学院,麦考瑞大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

AI总结 本文提出自过滤蒸馏方法,通过将LLM生成的推理作为信任指标而非真实标签,提升专利分类的可靠性,实验显示在USPTO-2M数据集上宏F1指标提升了38.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 复杂问题求解 15 篇

2510.05746 2026-05-20 cs.AI cs.CL cs.LG 89%

ARM: Discovering Agentic Reasoning Modules for Generalizable Multi-Agent Systems

ARM:为通用多智能体系统发现代理推理模块

Bohan Yao, Shiva Krishna Reddy Malay, Vikas Yadav

机构 * University of Washington(华盛顿大学)

专题命中 复杂问题求解 :CoT(summary_cn,abstract);reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种新的自动多智能体系统设计范式,通过优化链式推理(CoT)来发现代理推理模块(ARM),该模块通过在代码空间中进行树搜索,利用执行轨迹的反思来进化,从而提升多智能体系统的泛化能力。

Comments 29 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19433 2026-05-20 cs.CL cs.AI 88%

Backtracking When It Strays: Mitigating Dual Exposure Biases in LLM Reasoning Distillation

在偏离时回溯:缓解大语言模型推理蒸馏中的双重暴露偏差

Bing Wang, Shaotian Yan, Chen Shen, kaiyuan liu, Sinan Fan, Ximing Li, Rui Miao, Xiaosong Yuan, Zhanming Shen, Jieping Ye

机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) Key Laboratory of Symbolic Computation and Knowledge Engineering, MoE, Jilin University(吉林大学符号计算与知识工程重点实验室) Tongyi Lab, Alibaba Group(阿里集团通义实验室) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) School of Artificial Intelligence, Jilin University(吉林大学人工智能学院)

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种新的LLM推理蒸馏方法MOTAB,通过动态监控学生模型生成过程并回溯偏离安全边界的情况,缓解了传统蒸馏方法中因训练分布与推理上下文不匹配导致的双重暴露偏差问题,从而提升推理性能。

Comments 26 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19485 2026-05-20 cs.AI 79%

Attention-Guided Reward for Reinforcement Learning-based Jailbreak against Large Reasoning Models

基于注意力引导的强化学习对抗大推理模型的 jailbreak 方法

Zheng Lin, Zhenxing Niu, Haoxuan Ji, Yuzhe Huang, Haichang Gao

机构 * Xidian University(西安电子科技大学) Xi’an Jiaotong University(西安交通大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本文研究了对抗大推理模型的 jailbreak 攻击,发现攻击成功率与模型的注意力模式密切相关,并提出了一种基于强化学习的方法,通过将注意力信号纳入奖励函数设计来提升攻击效果,同时引入多样化的说服策略以提高攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00600 2026-05-20 cs.RO cs.AI cs.CV cs.LG 79%

Hybrid Training for Vision-Language-Action Models

视觉-语言-动作模型的混合训练

Pietro Mazzaglia, Cansu Sancaktar, Markus Peschl, Daniel Dijkman

机构 * Qualcomm AI Research(高通AI研究)

专题命中 复杂问题求解 :CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本文提出混合训练框架,旨在使视觉-语言-动作模型在推理时能够根据需要生成思考过程或直接预测动作,从而在保持性能提升的同时提高推理效率。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07721 2026-05-20 cs.CL cs.AI cs.LG 67%

Memory-Efficient Looped Transformer: Decoupling Compute from Memory in Looped Language Models

内存高效的循环变换器:在循环语言模型中解耦计算与内存

Victor Conchello Vendrell, Arnau Padres Masdemont, Niccolò Grillo, Jordi Ros-Giralt, Arash Behboodi, Fabio Valerio Massoli

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种内存高效的循环变换器(MELT),通过解耦推理深度与内存消耗,实现了常数内存的迭代推理,同时保持了LoopLM的性能,仅需轻量级的后训练过程。

Comments 22 pages, 5 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18830 2026-05-20 cs.CL cs.DC cs.LG 62%

MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training

MTraining: 分布式动态稀疏注意力用于高效超长上下文训练

Wenxuan Li, Chengruidong Zhang, Huiqiang Jiang, Yucheng Li, Yuqing Yang, Lili Qiu

机构 * Microsoft(微软)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出MTraining方法,通过动态稀疏注意力机制解决超长上下文训练中的计算不平衡和通信开销问题,实现了Qwen2.5-3B模型上下文窗口从32K扩展到512K,并在多个下游任务中达到6倍更高的训练吞吐量同时保持模型准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23108 2026-05-20 cs.AI cs.CL 62%

Artificial Phantasia: Emergent Mental Imagery in Large Language Models

人工幻象:大语言模型中的涌现性心智 imagery

Morgan McCarty, Jorge Morales

机构 * Khoury College of Computer Sciences, Northeastern University(东北大学克劳利计算机科学学院) Department of Psychology, Northeastern University(东北大学心理学系) Department of Philosophy, Northeastern University(东北大学哲学系)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究探讨了纯语言能否驱动视觉 imagery,发现大语言模型在视觉 imagery 任务中表现优于人类,表明可能存在非图示性的涌现性心智 imagery,挑战传统认知科学观点。

Comments 34 pages, 10 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18868 2026-05-20 cs.CR cs.AI cs.CV cs.LG 62%

DarkLLM: Learning Language-Driven Adversarial Attacks with Large Language Models

DarkLLM: 利用大语言模型学习语言驱动的对抗攻击

Ye Sun, Xin Wang, Jiaming Zhang, Yifeng Gao, Yixu Wang, Yifan Ding, Qixian Zhang, Henghui Ding, Xingjun Ma, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Nanyang Technological University(南洋理工大学) Tongji University(同济大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DarkLLM,一种基于大语言模型的对抗攻击框架,通过将自然语言攻击指令转换为潜在攻击向量,生成有效的对抗扰动,统一了多种攻击类型并实现了灵活可控的对抗生成。

Comments 23 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18822 2026-05-20 cs.LG cs.AI 62%

Hybrid-LoRA: Bridging Full Fine-Tuning and Low-Rank Adaptation for Post-Training

Hybrid-LoRA: 桥接全微调与低秩适应以实现训练后优化

Chengqian Zhang, Wei Zhu, Kyumin Lee

机构 * Worcester Polytechnic Institute(沃斯特理工学院) University of Hong Kong(香港大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Hybrid-LoRA框架,通过选择性地对部分模块进行全微调,其余模块使用LoRA进行适应,从而在训练后优化中实现高效性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18780 2026-05-20 cs.IR cs.AI cs.LG 62%

A Reproducibility Analysis of PO4ISR: Diagnosing and Mitigating Semantic Drift in LLM-Based Session Recommendation

PO4ISR的可重复性分析:诊断和缓解基于LLM的会话推荐中的语义漂移

Aditya Tiwari, Konduri Naga Lakshmi Rekha, Rajesh Kumar Mundotiya

机构 * MATRA Lab(MATRA实验室) Department of Computer Science and Engineering(计算机科学与工程系) Indian Institute of Technology Bhilai(比哈尔理工学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了PO4ISR在不同语义领域中的可重复性,发现标准推理提示在长会话中出现严重的上下文漂移,导致性能下降。为此,作者提出了PO4ISR++,通过反思提示和一致排名检测增强鲁棒性,并在多个数据集上验证了其有效性,提升了会话推荐的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20072 2026-05-20 cs.AI cs.RO 57%

Probing Embodied LLMs: When Higher Observation Fidelity Hurts Problem Solving

探查具身大语言模型:当更高的观察保真度损害问题解决

Oussama Zenkri, Oliver Brock

机构 * Robotics and Biology Laboratory, Technische Universität Berlin, Germany(柏林技术大学机器人与生物学实验室) Science of Intelligence, Research Cluster of Excellence, Berlin, Germany(柏林科学智能研究卓越集群) Robotics Institute Germany (RIG)(德国机器人研究所(RIG))

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了具身大语言模型在不同观察信息下的行为,发现高保真度观察反而降低了问题解决能力,核心方法是通过实验改变可用信息并测量行为变化,主要贡献是揭示了感知误差与推理失败的交互影响。

Comments Submitted to From Animals to Animats: The 18th International Conference on the Simulation of Adaptive Behavior (SAB)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18915 2026-05-20 cs.CR cs.AI 57%

DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs

DMN: 一种用于多图像输入多模态大语言模型的组合框架

Wenzhuo Xu, Zhipeng Wei, Zonghao Ying, Deyue Zhang, Dongdong Yang, Xiangzheng Zhang, Quanchen Zou

机构 * AI Security Lab(360人工智能安全实验室) International Computer Science Institute(国际计算机科学研究所) UC Berkeley(加州大学伯克利分校) Beihang University(北航大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出DMN框架,通过分布式指令、多模态证据和数字链任务,提升多图像输入多模态大语言模型的 jailbreak 性能,实验表明其在GPT-4o、Gemini-2.5-pro和Claude Sonnet 4上的攻击成功率超过90%。

Comments ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18853 2026-05-20 cs.LG cs.CV cs.DC 57%

INAR-VL: Input-Aware Routing for Edge-Cloud Vision-Language Inference

INAR-VL:面向边缘-云视觉-语言推断的输入感知路由

Ahmed Šabanović, Paul Joe Maliakel, Ivona Brandić

机构 * TU Wien(维也纳技术大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 本文提出INAR-VL,一种轻量级的边缘-云路由系统,用于多模态推断的两级部署。该系统通过轻量级的图像和文本复杂度信号指导路由和模型选择,在本地执行简单查询,将复杂查询卸载到云端,从而在延迟、能耗和准确性之间取得平衡。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20110 2026-05-20 cs.CV 50%

SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction

SetCon: 通过集级概念预测实现开放式的指称分割

Zhixiong Zhang, Yizhuo Li, Shuangrui Ding, Yuhang Zang, Shengyuan Ding, Long Xing, Yibin Wang, Qiaosheng Zhang, Jiaqi Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) The Chinese University of Hong Kong(香港中文大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出SetCon,通过集级概念预测实现开放式的指称分割,利用LVLM生成的自然语言概念作为语义条件进行联合掩码-集解码,提高了分割的完整性和互斥性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19950 2026-05-20 cs.CV 50%

AffectVerse: Emotional World Models for Multimodal Affective Computing

AffectVerse: 多模态情感计算中的情感世界模型

Bo Zhao, Fanghua Ye, Yixin Ji, Sicheng Zhao, Xiaojiang Peng, Zitong YU

机构 * Great Bay University(大湾大学) Tencent(腾讯) Tsinghua University(清华大学) Shenzhen Technology University(深圳技术大学)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本研究提出AffectVerse,一种基于Qwen2.5-Omni的多模态情感计算模型,通过引入情感世界模块实现短期潜在情感预测,利用未来预测作为自监督信号,提高了情感计算的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 推理评测 40 篇

2604.07035 2026-05-20 cs.CL 91%

Unified Deployment-Aware Evaluation of Open Reasoning Language Models

统一的部署感知开放推理语言模型评估

Md Motaleb Hossen Manik, Ge Wang

机构 * Department of Computer Science, Rensselaer Polytechnic Institute(理海理工学院计算机科学系) Department of Biomedical Engineering, Rensselaer Polytechnic Institute(理海理工学院生物医学工程系)

专题命中 推理评测 :reasoning(title,abstract);CoT(summary_cn,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出了一种统一的开放推理语言模型评估方法,通过四个基准测试(ARC-Challenge、GSM8K、MATH 1-3级和TruthfulQA MC1)对七种配置进行评估,结合零样本、链式思维(CoT)和少量样本CoT提示策略,分析模型在准确率、延迟、内存使用等多目标下的表现,强调部署感知的多目标优化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18956 2026-05-20 cs.CV 89%

MotionMERGE: A Multi-granular Framework for Human Motion Editing, Reasoning, Generation, and Explanation

MotionMERGE: 一种用于人体动作编辑、推理、生成和解释的多粒度框架

Bizhu Wu, Jinheng Xie, Wenting Chen, Zhe Kong, Jianfeng Ren, Linlin Shen, Ruibin Bai, Rong Qu

机构 * Computer Vision Institute, School of Computer Science and Software Engineering, Shenzhen University(计算机视觉研究院,计算机科学与软件工程学院,深圳大学) Guangdong Key Laboratory of Intelligent Information Processing, Shenzhen University(广东省智能信息处理重点实验室,深圳大学) School of Computer Science, University of Nottingham Ningbo China(Nottingham Ningbo 中国计算机科学学院) Department of Electrical and Computer Engineering, National University of Singapore(电子与计算机工程系,新加坡国立大学) Department of Radiation Oncology, Stanford University(放射肿瘤科,斯坦福大学) Sun Yat-sen University(中山大学) School of Computer Science, University of Nottingham(计算机科学学院,Nottingham大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract,abstract_cn);CoT(abstract,abstract_cn)

AI总结 本文提出MotionMERGE框架,通过细粒度语言引导的动作控制、跨粒度协同预训练和细粒度动作-语言对齐,实现了更精确的动作生成、理解和编辑,并建立了新的细粒度文本驱动动作编辑和动作引导推理基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18827 2026-05-20 cs.IR cs.LG cs.PL 87%

Code-Guided Reasoning for Small Language Models: Evaluating Executable MCQA Scaffolds

为小型语言模型引导的推理:评估可执行的多项选择题问答框架

Prateek Biswas, Dhaval Patel, Vedant Khandelwal, Shuxin Lin, Amit Sheth

机构 * IBM New York City,NY(IBM纽约市) University of South Carolina(南卡罗来纳大学) Artificial Intelligence Institute at University of South Carolina(南卡罗来纳大学人工智能学院)

专题命中 推理评测 :reasoning(title,summary_cn);分类 cs.LG

AI总结 本文提出Code-Guided Reasoning(CGR)评估协议和生成程序资源,用于衡量可执行推理框架如何提升小型语言模型在多项选择题问答任务中的表现,通过实验展示了使用可执行框架带来的性能提升。

Comments 28 Pages, 18 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏