arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-02 至 2026-03-02 共收录 87 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 22 篇

2504.17192 2026-03-02 cs.CL 57%

Paper2Code: Automating Code Generation from Scientific Papers in Machine Learning

Paper2Code: 从科学论文自动生成机器学习代码

Minju Seo, Jinheon Baek, Seongyun Lee, Sung Ju Hwang

机构 * KAIST(韩国科学技术院) LG AI Research(LG人工智能研究所)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 Paper2Code通过多代理LLM框架自动生成机器学习论文的高质量代码实现,有效提升代码生成效率和准确性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03472 2026-03-02 cs.RO cs.AI cs.MA 57%

Destination-to-Chutes Task Mapping Optimization for Multi-Robot Coordination in Robotic Sorting Systems

多机器人协同中的目的地到传送口任务映射优化

Yulun Zhang, Alexandre O. G. Barbosa, Federico Pecora, Jiaoyang Li

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出基于进化算法和混合整数线性规划的任务映射优化方法,用于提升多机器人分拣系统的吞吐量。

Comments Accepted to IEEE International Symposium on Multi-Robot and Multi-Agent Systems (MRS) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.16162 2026-03-02 cs.MA cs.AI 57%

Scaling Lifelong Multi-Agent Path Finding to More Realistic Settings: Research Challenges and Opportunities

将终身多智能体路径寻找扩展到更现实的场景:研究挑战与机遇

He Jiang, Yulun Zhang, Rishi Veerapaneni, Jiaoyang Li

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文探讨了将终身多智能体路径寻找扩展到现实场景中的三个研究挑战及未来发展方向。

Comments Accepted to Symposium on Combinatorial Search (SoCS), 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24241 2026-03-02 cs.IR cs.HC 50%

UXSim: Towards a Hybrid User Search Simulation

UXSim: 向混合用户搜索模拟迈进

Saber Zerhoudi, Michael Granitzer

专题命中 规划推理 :reasoning(abstract)

AI总结 UXSim 通过整合传统模拟器与适应性 LLM 代理,提供更准确的用户行为模拟和可解释的验证方法。

Journal ref Proceedings of the 34th ACM International Conference on Information and Knowledge Management (CIKM '25), November 10--14, 2025, Seoul, Republic of Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24087 2026-03-02 physics.comp-ph astro-ph.IM hep-ex physics.soc-ph 50%

Shaping the Digital Future of ErUM Research: Sustainability & Ethics

塑造ErUM研究的数字未来:可持续性与伦理

Luca Di Bella, Jan Bürger, Markus Demleitner, Torsten Enßlin, Johannes Erdmann, Martin Erdmann, Benjamin Fischer, Martin Gasthuber, Gabriele Gramelsberger, Wolfgang Gründinger, Prateek Gupta, Johannes Hartl, Maximilian Horzela, Vijay Kartik, Stefan Krischer, Eva Kröll, Thomas Kuhr, Katharina Kürschner, Inga Lakomiec, Valerie Lang, Kristin Lohwasser, Thomas Metcalf, Martin Möller, Saskia Nagel, Susanne Pfalzner, Rebecca Redlin, Christopher Schrader, Kathrin Schulz, Markus Schumacher, Kilian Schwarz, Fabian Sigler, Dwayne Spiteri, Achim Stahl, Judith Steinfeld, Wim Vanderbauwhede, Cyrus Walther, Angela Warkentin, Peter Wissmann, Eoin Woods

专题命中 规划推理 :planning(abstract)

AI总结 该报告探讨了ErUM研究在可持续性和伦理方面的数字化未来,强调通过技术措施、教育支持和社区倡议实现可持续的计算和数据实践。

Comments 32 pages, no figures, report for workshop "Shaping the Digital Future of ErUM Research: Sustainability & Ethics", 28 July to 1 August 2025, Aachen, Germany, see https://indico.desy.de/event/47133/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23648 2026-03-02 cs.RO 50%

FAVLA: A Force-Adaptive Fast-Slow VLA model for Contact-Rich Robotic Manipulation

FAVLA:一种力适应的快速-慢速VLA模型用于接触丰富的机械臂操作

Yao Li, Peiyuan Tang, Wuyang Zhang, Chengyang Zhu, Yifan Duan, Weikai Shi, Xiaodong Zhang, Zijiang Yang, Jianmin Ji, Yanyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Xi'an Jiaotong University(西安交通大学) Central South University(中南大学)

专题命中 规划推理 :planning(abstract)

AI总结 FAVLA通过解耦慢感知规划与快速接触感知控制,提升接触丰富任务中的反应性和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23623 2026-03-02 cs.NI 50%

Toward E2E Intelligence in 6G Networks: An AI Agent-Based RAN-CN Converged Intelligence Framework

迈向6G网络的端到端智能:一种基于AI代理的RAN-CN融合智能框架

Youbin Han, Haneul Ko, Namseok Ko, Tarik Taleb, Yan Chen

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出一种基于AI代理的RAN-CN融合智能框架,利用大语言模型和ReAct范式,实现跨域网络的统一智能控制,提升网络适应性和泛化能力。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23109 2026-03-02 cs.RO 50%

Towards Intelligible Human-Robot Interaction: An Active Inference Approach to Occluded Pedestrian Scenarios

迈向可解释的人机交互:一种主动推断方法用于遮挡行人场景

Kai Chen, Yuyao Huang, Guang Chen

机构 * Tongji University(同济大学)

专题命中 规划推理 :planning(abstract)

AI总结 本文提出基于主动推断的方法,用于解决遮挡行人场景中的安全挑战,通过结合 RBPF 和 CEM 增强的 MPPI 控制器,实现可解释的人机交互。

Comments 14 pages, 6 figures, Proceedings of the 2026 ACM/IEEE International Conference on Human-Robot Interaction (HRI'26)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 7 篇

2602.23945 2026-03-02 cs.CV cs.AI cs.MM 85%

PointCoT: A Multi-modal Benchmark for Explicit 3D Geometric Reasoning

PointCoT: 一种用于显式3D几何推理的多模态基准

Dongxu Zhang, Yiding Sun, Pengcheng Li, Yumou Liu, Hongqiang Lin, Haoran Xu, Xiaoxuan Mu, Liang Lin, Wenbiao Yan, Ning Yang, Chaowei Fang, Juanjuan Zhao, Jihua Zhu, Conghui He, Cheng Tan

机构 * Xi'an Jiaotong University(西安交通大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Institute of Automation, CASIA(中国科学院自动化研究所) Taiyuan University of Technology(太原理工大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 PointCoT通过显式链式推理提升3D几何推理能力,提出多模态基准和双流架构,实现对3D点云的高精度理解与推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23959 2026-03-02 cs.CV 85%

Thinking with Images as Continuous Actions: Numerical Visual Chain-of-Thought

通过图像作为连续动作进行思考:数值视觉链式推理

Kesen Zhao, Beier Zhu, Junbao Zhou, Xingyu Zhu, Zhongqi Yue, Hanwang Zhang

机构 * Nanyang Technological University(南洋理工大学) University of Science and Technology of China(中国科学技术大学) Chalmers University of Technology(楚克理工大学) University of Gothenburg(哥德堡大学)

专题命中 视觉空间推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract)

AI总结 NV-CoT通过将图像推理动作空间扩展为连续欧几里得空间,提升MLLMs的定位精度和回答准确性,同时加速训练收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23898 2026-03-02 cs.CV cs.AI cs.CL 81%

Ref-Adv: Exploring MLLM Visual Reasoning in Referring Expression Tasks

Ref-Adv:探索提及表达任务中的多模态大语言模型视觉推理

Qihua Dong, Kuo Yang, Lin Ju, Handong Zhao, Yitian Zhang, Yizhou Wang, Huimin Zeng, Jianglin Lu, Yun Fu

机构 * Northeastern University(东北大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 Ref-Adv 是一个旨在评估多模态大语言模型视觉推理能力的基准,通过增加表达复杂性和减少干扰项,揭示模型在视觉推理和 grounding 方面的不足。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20812 2026-03-02 cs.CV cs.AI cs.CL 81%

Small Drafts, Big Verdict: Information-Intensive Visual Reasoning via Speculation

小草稿,大结论:通过推测进行信息密集的视觉推理

Yuhan Liu, Lianhui Qin, Shengjie Wang

机构 * New York University(纽约大学) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 SV通过结合多个轻量级草稿专家和大型结论模型,提升信息密集视觉推理的效率和准确性。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02814 2026-03-02 cs.AI 70%

Radiologist Copilot: An Agentic Framework Orchestrating Specialized Tools for Reliable Radiology Reporting

放射科助手:一种协调专用工具的代理框架以实现可靠的放射学报告

Yongrui Yu, Zhongzhen Huang, Linjie Mu, Shaoting Zhang, Xiaofan Zhang

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) SenseTime Research, Shanghai, China(商汤研究) Shanghai Innovation Institute, Shanghai, China(上海创新研究院)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 放射科助手通过协调专用工具实现全面的放射学报告流程,提升报告准确性和临床标准符合度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21135 2026-03-02 cs.RO cs.AI cs.CV 70%

SocialNav: Training Human-Inspired Foundation Model for Socially-Aware Embodied Navigation

SocialNav: 为社交感知具身导航训练的人类启发式基础模型

Ziyi Chen, Yingnan Guo, Zedong Chu, Minghua Luo, Yanfen Shen, Mingchao Sun, Junjun Hu, Shichao Xie, Kuan Yang, Pei Shi, Zhining Gu, Lu Liu, Honglin Han, Xiaolong Wu, Mu Xu, Yu Zhang, Ning Guo

机构 * Amap, Alibaba Group, China(阿里集团阿地图,中国) Zhejiang University, China(浙江大学,中国)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 SocialNav通过分层架构和多阶段训练,实现了社交感知导航,显著提升了导航性能和社会合规率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23937 2026-03-02 cs.RO cs.CV 50%

Enhancing Vision-Language Navigation with Multimodal Event Knowledge from Real-World Indoor Tour Videos

通过真实世界室内游览视频的多模态事件知识增强视觉语言导航

Haoxuan Xu, Tianfu Li, Wenbo Chen, Yi Liu, Xingxing Zuo, Yaoxian Song, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tsinghua University(清华大学) Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI)(马尔代夫 bin Zayed 大学人工智能学院) Hangzhou City University(杭州城市学院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出基于多模态事件知识的视觉语言导航增强方法,通过构建大规模时空知识图谱并结合层次检索机制,提升长视界推理和粗粒度指令处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试时计算 5 篇

2602.23681 2026-03-02 cs.AI 83%

ODAR: Principled Adaptive Routing for LLM Reasoning via Active Inference

ODAR:通过主动推断实现LLM推理的原理性自适应路由

Siyuan Ma, Bo Gao, Xiaojun Jia, Simeng Qin, Tianlin Li, Ke Ma, Xiaoshuang Jia, Wenqi Ren, Yang Liu

机构 * Nanyang Technological University(南洋理工大学) Carnegie Mellon University(卡内基梅隆大学) Northeast University (Qinhuangdao Campus)(东北大学(秦皇岛校区)) Beihang University(北航) University of the Chinese Academy of Sciences(中国科学院大学) Renmin University of China(中国人民大学) Sun Yat-sen University(中山大学)

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);分类 cs.AI

AI总结 ODAR通过主动推断实现LLM推理的原理性自适应路由,优化精度-效率权衡,提升计算匹配下的准确率并降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18395 2026-03-02 cs.CL cs.AI 81%

Latent Self-Consistency for Reliable Majority-Set Selection in Short- and Long-Answer Reasoning

潜在自一致性用于短答和长答推理中可靠多数集选择

Jungsuk Oh, Jay-Yoon Lee

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 LSC通过学习token嵌入选择语义一致的响应,有效提升短答和长答推理中的多数集选择可靠性,且计算开销低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26578 2026-03-02 cs.LG 79%

Linking Process to Outcome: Conditional Reward Modeling for LLM Reasoning

将过程与结果联系起来:用于大语言模型推理的条件奖励建模

Zheng Zhang, Ziwei Shan, Kaitao Song, Yexin Li, Kan Ren

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出条件奖励建模(CRM),通过将LLM推理视为时间过程,解决奖励分配模糊性和奖励黑客问题,提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23234 2026-03-02 cs.AI cs.CL 73%

p-less Sampling: A Robust Hyperparameter-Free Approach for LLM Decoding

p-less采样:一种无需超参数的LLM解码方法

Runyan Tan, Shuang Wu, Phillip Howard

专题命中 测试时计算 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 p-less采样是一种无需超参数的LLM解码方法,通过动态截断阈值提高生成质量并减少温度对文本质量的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23556 2026-03-02 cs.LG cs.AI cs.DC cs.MA cs.PF 62%

Rudder: Steering Prefetching in Distributed GNN Training using LLM Agents

Rudder: 在分布式GNN训练中利用LLM代理进行转向预取

Aishwarya Sarkar, Sayan Ghosh, Nathan Tallent, Aman Chadha, Tanya Roosta, Ali Jannesari

机构 * Iowa State University(爱荷华州立大学) Pacific Northwest National Laboratory(太平洋西北国家实验室) Amazon GenAI(亚马逊生成人工智能) University of California, Berkeley(加州大学伯克利分校)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 Rudder利用LLM代理的生成式AI能力,通过自适应预取减少分布式GNN训练中的通信开销,提升训练性能达91%。

Comments Accepted to the 40th ACM International Conference on Supercomputing (ICS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 复杂问题求解 12 篇

2508.21048 2026-03-02 cs.CV cs.AI 87%

Veritas: Generalizable Deepfake Detection via Pattern-Aware Reasoning

Veritas:通过模式感知推理实现通用的深度伪造检测

Hao Tan, Jun Lan, Zichang Tan, Ajian Liu, Chuanbiao Song, Senyuan Shi, Huijia Zhu, Weiqiang Wang, Jun Wan, Zhen Lei

机构 * School of Advanced Interdisciplinary Sciences (SAIS), University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) Ant Group(蚂蚁集团) Shenzhen Institute of Advanced Technology (SIAT), Chinese Academy of Sciences(中国科学院深圳先进技术研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);planning(abstract)

AI总结 Veritas通过模式感知推理,基于多模态大语言模型实现通用深度伪造检测,提升对未知伪造技术和数据领域的检测能力。

Comments ICLR 2026 Oral. Project: https://github.com/EricTan7/Veritas

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08016 2026-03-02 cs.CV cs.AI 83%

FRIEDA: Benchmarking Multi-Step Cartographic Reasoning in Vision-Language Models

FRIEDA:评估视觉语言模型中多步骤制图推理的基准

Jiyoon Pyo, Yuankun Jiao, Dongwon Jung, Zekun Li, Leeje Jang, Sofia Kirsanova, Jina Kim, Yijun Lin, Qin Liu, Junyi Xie, Hadi Askari, Nan Xu, Muhao Chen, Yao-Yi Chiang

机构 * University of Minnesota-Twin Cities(明尼苏达大学双城分校) University of California, Davis(加州大学戴维斯分校) University of Southern California(南加州大学)

专题命中 复杂问题求解 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 FRIEDA 是一个评估视觉语言模型多步骤制图推理能力的基准,通过多步骤推理和跨地图定位测试,揭示了当前模型在空间智能方面的不足。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25992 2026-03-02 cs.CL cs.AI cs.LG 82%

Supervised Reinforcement Learning: From Expert Trajectories to Step-wise Reasoning

监督强化学习:从专家轨迹到逐步推理

Yihe Deng, I-Hung Hsu, Jun Yan, Zifeng Wang, Rujun Han, Gufeng Zhang, Yanfei Chen, Wei Wang, Tomas Pfister, Chen-Yu Lee

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SRL框架,通过生成逻辑动作序列提升小模型的多步推理能力,结合监督与强化学习实现更有效的训练。

Comments Paper accepted by ICLR 2026. The first two authors contribute equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12113 2026-03-02 cs.AI cs.CL 81%

Stop Unnecessary Reflection: Training LRMs for Efficient Reasoning with Adaptive Reflection and Length Coordinated Penalty

停止不必要的反思:通过自适应反思和长度协调惩罚训练高效的推理模型

Zewei Yu, Lirong Gao, Yuke Zhu, Bo Zheng, Junbo Zhao, Sheng Guo, Haobo Wang

机构 * State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全国家重点实验室) MYbank, Ant Group(蚂蚁集团MYbank) Innovation and Management Center, School of Software Technology (Ningbo), Zhejiang University(浙江大学软件学院(宁波)创新与管理中心)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 通过自适应反思和长度协调惩罚方法,提升推理效率和准确性,减少响应长度并提高性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19862 2026-03-02 cs.CL cs.LG 81%

REA-RL: Reflection-Aware Online Reinforcement Learning for Efficient Reasoning

REA-RL:面向高效推理的反思意识在线强化学习

Hexuan Deng, Wenxiang Jiao, Xuebo Liu, Jun Rao, Min Zhang

机构 * Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen, China(计算与智能学院,哈尔滨工业大学深圳学院) Zhongguancun Academy, Beijing, China(中关村学院,北京) Xiaohongshu Inc.(小红书公司)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 REA-RL通过引入反思模型和反思奖励,提升在线强化学习中推理效率和性能平衡。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23777 2026-03-02 cs.AI 79%

Reasoning-Driven Multimodal LLM for Domain Generalization

基于推理的多模态大语言模型用于领域泛化

Zhipeng Xu, Zilong Wang, Xinyang Jiang, Dongsheng Li, De Cheng, Nannan Wang

机构 * Xidian University(西安电子科技大学) Microsoft Research Asia(微软亚洲研究院) National Engineering Laboratory for Integrated Aero-Space-Ground- Ocean Big Data Application(国家一体化空天地海大数据应用工程实验室)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出RD-MLDG框架,利用多模态大语言模型的推理能力,通过引入多任务交叉训练和自我对齐的推理正则化,提升领域泛化性能。

Comments Accepted at ICLR 2026 (Poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23656 2026-03-02 cs.CL cs.AI 62%

TRIZ-RAGNER: A Retrieval-Augmented Large Language Model for TRIZ-Aware Named Entity Recognition in Patent-Based Contradiction Mining

TRIZ-RAGNER: 一种用于基于专利矛盾挖掘的TRIZ-aware命名实体识别的检索增强型大语言模型

Zitong Xu, Yuqing Wu, Yue Zhao

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 TRIZ-RAGNER通过整合TRIZ知识和检索增强技术,提升专利矛盾挖掘中命名实体识别的准确性和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00477 2026-03-02 cs.CL 57%

Intention-Adaptive LLM Fine-Tuning for Text Revision Generation

意图自适应的LLM微调用于文本修订生成

Zhexiong Liu, Diane Litman

机构 * Department of Computer Science, Learning Research & Development Center University of Pittsburgh(计算机科学系、学习研究与开发中心宾夕法尼亚大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出Intention-Tuning框架,通过意图自适应的逐层微调提升文本修订生成效果。

Comments In the Conference of the European Chapter of the Association for Computational Linguistics (EACL), March 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24532 2026-03-02 cs.CL 57%

DeepQuestion: Systematic Generation of Real-World Challenges for Evaluating LLMs Performance

DeepQuestion: 为评估LLM性能系统生成现实世界挑战

Ali Khoramfar, Ali Ramezani, Mohammad Mahdi Mohajeri, Mohammad Javad Dousti, Majid Nili Ahmadabadi, Heshaam Faili

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 DeepQuestion通过系统生成现实世界挑战,揭示LLM在复杂任务上的性能下降,强调需多样化评估以改进模型发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24027 2026-03-02 cs.CV cs.MM 50%

GuardAlign: Test-time Safety Alignment in Multimodal Large Language Models

GuardAlign: 多模态大语言模型中的测试时安全性对齐

Xingyu Zhu, Beier Zhu, Junfeng Fang, Shuo Wang, Yin Zhang, Xiang Wang, Xiangnan He

机构 * MoE Key Lab of BIPC, University of Science and Technology of China(摩埃关键实验室,中国科学技术大学) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学) Tianjin University(天津大学)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 GuardAlign通过OT增强的安全检测和跨模态注意力校准,有效提升多模态大语言模型在测试时的安全性,减少不安全响应率并提升任务表现。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏