arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-16 至 2026-06-16 共收录 31 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 31 篇

2606.14961 2026-06-16 cs.CL 新提交 89%

CoRA: Confidence-Rationale Alignment for Reliable Chain-of-Thought Reasoning

CoRA: 面向可靠思维链推理的置信度-理由对齐

Juming Xiong, Weixin Liu, Kevin Guo, Congning Ni, Junchao Zhu, Chongyu Qu, Chao Yan, Katherine Brown, Avinash Baidya, Xiang Gao, Bradley Malin, Zhijun Yin

机构 * Vanderbilt University(范德比尔特大学) Vanderbilt University Medical Center(范德比尔特大学医学中心) Intuit AI Research(Intuit AI研究)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL

AI总结 提出GRPO强化学习框架,联合奖励答案正确性、置信度与理由支持度,减少置信度与理由对齐误差,提升推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16222 2026-06-16 cs.AI cs.LG 新提交 88%

Latent Thought Flow: Efficient Latent Reasoning in Large Language Models

潜在思维流:大型语言模型中的高效潜在推理

Xiandong Zou, Jing Huang, Jianshu Li, Pan Zhou

机构 * Singapore Management University(新加坡管理大学) Ant Group(蚂蚁集团)

专题命中 其他推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 提出Latent Thought Flow (LTF)方法,将推理建模为可变长度连续轨迹,通过连续GFlowNet训练采样器匹配奖励后验,在提升准确率9.5%的同时平均减少推理长度27.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15441 2026-06-16 cs.CR cs.AI 新提交 83%

Defending against Adaptive Prompt Injection Attacks via Reasoning-enabled Task Alignment

通过推理启用的任务对齐防御自适应提示注入攻击

Lipeng He, Yihan Wang, Jiawen Zhang, N. Asokan

机构 * University of Waterloo(滑铁卢大学) Zhejiang University(浙江大学) KTH Royal Institute of Technology(皇家理工学院)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 提出RETA方法,通过基于用户任务的多目标强化学习训练防御器,利用思维链推理验证行动一致性,并采用字典学习多样性奖励生成对抗样本,在六种自适应攻击下平均攻击成功率低于4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15007 2026-06-16 cs.CL cs.AI cs.LG 新提交 82%

Nemotron 3 Ultra: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning

Nemotron 3 Ultra: 开放、高效的混合专家Mamba-Transformer模型用于智能体推理

NVIDIA, :, Aaron Blakeman, Aaron Thomas, Aastha Jhunjhunwala, Abhibha Gupta, Abhinav Khattar, Adam Rajfer, Adi Renduchintala, Adil Asif, Aditya Vavre, Adriana Flores Miranda, Ahmad Bilal, Aileen Zaman, Ajay Hotchandani, Akanksha Shukla, Akhiad Bercovich, Aleksander Ficek, Alex Gronskiy, Alex Kondratenko, Alex Steiner, Alex Ye, Alexander Bukharin, Alexandre Milesi, Ali Taghibakhshi, Alice Gatti, Alisa Liu, Alok Kumar, Amar Phanishayee, Ameya Sunil Mahabaleshwarkar, Amir Klein, Amit Zuker, Amnon Geifman, Anahita Bhiwandiwalla, Ananth Subramaniam, Andrea Santilli, Andrew Fulks, Andrew McHarg, Andrew Tao, Andrii Skliar, Anjulie Agrusa, Ankur Srivastava, Ankur Verma, Anna Shors, Anna Warno, Antoni-Joan Solergibert I Llaquet, Arham Mehta, Arkadiusz Nowaczynski, Arti Jain, Ashwath Aithal, Ashwin Poojary, Asif Ahamed, Asit Mishra, Asma Kuriparambil Thekkumpate, Atefeh Sohrabizadeh, Avinash Kaur, Avinash Vem, Ayush Dattagupta, Barath Subramaniam Anandan, Bardiya Sadeghi, Ben Lanir, Benedikt Schifferer, Besmira Nushi, Bilal Kartal, Bill Thiede, Bita Darvish Rouhani, Bo Deng, Bob Schatz, Boris Ginsburg, Boxin Wang, Brad Nemire, Brandon Norick, Brian Dang, Brian Westphal, Brian Yu, Brucek Khailany, Bryan Catanzaro, Carlo del Mundo, Caryln Aarish, Chankyu Lee, Chantal Hwang, Charbel Sakr, Charles Wang, Charlie Truong, Chen Cui, Cheng Cheng, Cheng-Ping Hsieh, Chenghao Zhang, Chenhui Deng, Chintan Patel, Chris Alexiuk, Christian Cosgrove, Christian Munley, Christine Harvey, Christopher Parisien, Chunyang Shen, Coco Li, Collin Neale, Cynthia Gao, Cyril Meurillon, Dan Gil, Dan Su, Dan Zhao, Dane Corneil, Daniel Afrimi, Daniel Egert, Daniel Korzekwa, Daniel Lo, Daniel Machlab, Daniel Serebrenik, Daniil Sorokin, Daria Gitman, Daria Levy, Darko Stosic, David Mosallanezhad, David Yu, Davit Karamyan, Deena Donia, Deep Debroy, Deepak Narayanan, Devin O'Kelly, Dheeraj Peri, Dhruv Nathawani, Di, Wu, Dima Rekesh, Divyanshu Kakwani, Donald Plummer, Dong Anh, Dongfeng Yu, Dongfu Jiang, Donnie Kim, Dorrin Poorkay, Duncan Riach, Dusan Stosic, Dustin VanStee, Eavan Meng, Edgar Minasyan, Edward Lin, Eileen Margaret Peters Long, Elad Sarafin, Elad Segal, Elena Lantz, Ellie Evans, Elliott Ning, Eric Chung, Eric Harper, Eric Pham-Hung, Eric Tramel, Eric Yang, Erick Galinkin, Erik Pounds, Erika Goncalves Goncalves, Evan Briones, Evan Wu, Evelina Bakhturina, Evgeny Tsykunov, Ewa Dobrowolska, Faisal Ladhak, Farzan Memarian, Fay Wang, Fei Jia, Felipe Soares, Felipe Vieira Frujeri, Feng Chen, Fengguang Lin, Ferenc Galko, Frank Sun, Frankie Siino, Frida Hou, Gal Hubara Agam, Gal Kaplun, Gantavya Bhatt, Gargi Prasad, Garvit Kulshreshtha, George Armstrong, Gerald Shen, Giulio Borghesi, Gordana Neskovic, Gorkem Batmaz, Grace Lam, Greg Mason, Greg Pauloski, Grigor Nalbandyan, Grzegorz Chlebus, Grzegorz Karch, Guan-Ting Liu, Guoming Zhang, Guyue Huang, Haggai Maron, Haifeng Qian, Haim Elisha, Haoxing Ren, Haran Kumar Shiv Kumar, Haribhau Hud, Harris Nover, Harrison Saturley Hall, Hayate Iso, Helen Ngo, Herbert Hum, Herman Sahota, Hexin Wang, Himanshu Soni, Hovhannes Tamoyan, Hua Li, Huanhuan Chen, Hui Li, Hui Wang, Huy Nguyen, Ian Chiles, Ido Galil, Ido Shahaf, Igor Gitman, Igor Shovkun, Ilya Loshchilov, Ingo Guehring, Itamar Schen, Itay Levy, Itay Neeman, Ivan Moshkov, Izik Golan, Izzy Putterman, Jaemin Choi, Jakub Slowikowski, Jan Kautz, Jane Polak Scowcroft, Jared Casper, Jatin Mitra, Jeffrey Glick, Jenny Chen, Jesse Oliver, Jiacheng Xu, Jiafan Zhu, Jialin Song, Jian Zhang, Jiantao Jiao, Jiaqi Zeng, Jie Lou, Jim King, Jimmy Zhang, Jingquan Wang, Jinhang Choi, Jinju Chu, Joey Conway, Joey Guman, Johan Jatko, Johannes Rausch, John Kamalu, John Roberts, Johnny Greco, Johnny Mensel, Jonah Alben, Jonas Yang, Jonathan Cohen, Jonathan Raiman, Joseph Jennings, Joshua Mabry, Joshua Pierce, Joyjit Daw, Julien Veron Vialard, Junkeun Yi, Jupinder Parmar, Kajal Jain, Kan Zhu, Kari Briski, Katherine Cheung, Katherine Luna, Keith Willowhawk, Keith Wyss, Keshav Santhanam, Kevin Shih, Kezhi Kong, Khanh Nguyen, Khushi Bhardwaj, Kirthi Shankar Sivamani, Konstantinos Krommydas, Krishna C. Puvvada, Krzysztof Pawelec, Kumar Anik, Kyle Keprios, Kylie Day, Lawrence McAfee, Leo Du, Leon Derczynski, Li Ding, Linda Liu, Lingjie Wu, Lior Kadoch, Lizzie Wei, Luis Vega, Luke Robison, Lun Su, Maarten Van Segbroeck, Maciej Jakub Mikulski, Maer Rodrigues de Melo, Magda Sypula, Mahan Fathi, Makesh Narsimhan Sreedhar, Makesh Tarun Chandran, Manoj Kilaru, Maor Ashkenazi, Marc Cuevas, Marc Romeijn, Marcin Chochowski, Mark Cai, Mark Mozolewski, Markus Kliegl, Marta Stepniewska-Dziubinska, Martyna Patelka, Mattei Machczynski, Matvei Novikov, Mauricio Ferrato, Maximilian Golub, Mehrzad Samadi, Melissa Corpuz, Mengru Wang, Mengxi Wu, Meredith Price, Meriem Boubdir, Micah Schaffer, Michael Andersch, Michael Boone, Michael Gschwind, Michael Lightstone, Michael Loh, Michal Bien, Michal Zawalski, Michelle Gill, Miguel Martinez, Mikail Khona, Mike Chrzanowski, Mike Houston, Mingyuan Ma, Minseok Lee, Mohamed Fawzy, Mohammad Dabbah, Mohammad Shoeybi, Mostofa Patwary, Nabin Mulepati, Najeeb Nabwani, Namit Dhameja, Narimane Hennouni, Natalie Hereth, Nathaniel Pinckney, Nave Algarici, Nave Assaf, Netanel Haber, Nicholas Knight, Nick Reamaroon, Nickson Quak, Nidhi Bhatia, Nikhil Desai, Nikolai Ludwig, Nima Tajbakhsh, Ning Xu, Nir Ailon, Nirmal Juluru, Nitin Nitin, Ofri Masad, Oleg Rybakov, Oleksii Hrinchuk, Oleksii Kuchaiev, Olivia Viessmann, Olivier Delalleau, Oluwatobi Olabiyi, Omer Ullman Argov, Omri Puny, Oren Tropp, Pablo Ribalta, Pallab Bhattacharya, Panos Lampropoulos, Parth Mannan, Pasha Shamis, Patrick Legresley, Paul Gibbons, Pavlo Molchanov, Pawel Morkisz, Peter Dykas, Peter Jin, Pierre-Yves Aquilanti, Pinky Xu, Piotr Januszewski, Piotr Laskiewicz, Pooya Jannaty, Prakash Gurumurthy, Pranav Prashant Thombre, Prasoon Varshney, Pritam Gundecha, Przemek Tredak, Puhui Meng, Qiyu Wan, Rabeeh Karimi Mahabadi, Rachel Oberman, Rachit Garg, Radha Sri-Tharan, Rahul Kandu, Rakshit Sanadhya, Ran El-Yaniv, Ran Zilberstein, Rasoul Shafipour, Ray Macalisang, Rayen Tian, Reka Kovacs, Renjie Pi, Rick Izzo, Rima Shahbazyan, Rishabh Garg, Rishi Puri, Rita Fernandes Neves, Ritchie Zhao, Ritika Borkar, Ritu Gala, Riyad Islam, Robert Clark, Robert Hesse, Robert Kirby, Roger Waleffe, Rohit Watve, Roi Koren, Ron Banner, Ruoxi Zhang, Russell J. Hewett, Ryan Prenger, Ryan Stewart, Ryota Egashira, Sadegh Mahdavi, Saee Paliwal, Sagar Singh, Sahil Modi, Salika Dave, Samantha Shinagawa, Samuel Kriman, Sandip Bhaskar, Sangkug Lym, Sanjay Kariyappa, Sanjeev Satheesh, Saran Vikas Murari, Satish Pasumarthi, Saurabh Mishra, Saurav Muralidharan, Scott Hara, Sean Narentharen, Selvaraj Anandaraj, Seonjin Na, Seonmeyong Bak, Seonmyeong Bak, Sepehr Sameni, Seph Mard, Serge Panev, Seth Henneman, Seth Poulos, Shahar Mor, Shantanu Acharya, Shaona Ghosh, Sharath Turuvekere Sreenivas, Sharon Mendelson, Shaun Kotek, Shawn Wang, Shay Aharon, Shaya Gharghabi, Sheng-Chieh Lin, Shi Chen, Shiqing Fan, Shirish Baskaran, Shreya Gopa, Shrimai Prabhumoye, Shubham Pachori, Shubham Toshniwal, Shuoyang Ding, Shwetha Krishnamurthy, Siddharth Singh, Simeng Sun, Sirshak Das, Sivakumar Arayandi Thottakara, Smita Ithape, Somshubra Majumdar, Soumye Singhal, Sri Harsha Singudasu, Sridhar Bhuvanapalli, Srimukh Veccham, Stas Sergienko, Stefania Alborghetti, Stephen Ge, Su Rong, Sugam Dipak Devare, Sukrit Rao, Sumeet Kumar Barua, Sungsoo Ha, Sunny Gai, Suriya Gunasekar, Suseella Panguluri, Suyog Gupta, Sviataslau Hinzburh, Sweta Priyadarshi, Syeda Nahida Akter, Talor Abramovich, Tan Bui, Tanay Varshney, Tatevik Ter-Hovhannisyan, Teodor-Dumitru Ene, Terry Kong, Thanh Do, Tianhe Zhang, Tiffany Moore, Tijmen Blankevoort, Tim Moon, Tiyasa Mitra, Tom Balough, Tomasz Grzegorzek, Tomasz Hliwiak, Tomer Asida, Tomer Bar Natan, Tomer Keren, Tomer Ronen, Tony Salim, Tony Wang, Traian Rebedea, Tugrul Konuk, Twinkle Vashishth, Udi Karpas, Ushnish De, Vahid Noorozi, Venkat Srinivasan, Venmugil Elango, Vibhor Agrawal, Victor Cui, Vijay Korthikanti, Vikas Mehta, Vinay Rao, Virginia Wu, Vitaly Kurin, Vitaly Lavrukhin, Vladimir Anisimov, Vu Pham, Wanli Jiang, Wasi Uddin Ahmad, Wataru Ishihara, Wei Du, Wei Ping, Weiheng Chai, Wenliang Dai, Wesley Helmholz, Will Jennings, Will Zhu, Wojciech Prazuch, Xiaowei Ren, Xiwen Yu, Yan Breek, Yang Chen, Yang Yu, Yangyi Chen, Yaniv Galron, Yashaswi Karnati, Yejin Choi, Yev Meyer, Yi-Fu Wu, Yian Zhang, Ying Lin, Yonatan Geifman, Yonggan Fu, Youngeun Kwon, Yu Yao, Yugi Guvvla, Yuki Huang, Yunsheng Liu, Zach Moshe, Zachary Newell, Zhilin Wang, Zhiyu Li, Zhongbo Zhu, Zhuolin Yang, Zihan Liu, Zijie Yan, Zsolt-Alon Wertheimer

机构 * NVIDIA(英伟达)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出550B总参数量、55B激活参数的混合专家Mamba-Attention语言模型Nemotron 3 Ultra,通过20T tokens预训练、1M上下文扩展及后训练,在推理吞吐量提升约6倍的同时保持与顶尖模型相当的精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16140 2026-06-16 cs.AI cs.CL 新提交 81%

VibeThinker-3B: Exploring the Frontier of Verifiable Reasoning in Small Language Models

VibeThinker-3B:探索小型语言模型中可验证推理的前沿

Sen Xu, Shixi Liu, Wei Wang, Jixin Min, Yingwei Dai, Zhibin Yin, Yirong Chen, Xin Zhou, Junlin Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出3B参数紧凑模型VibeThinker-3B,通过频谱到信号后训练范式(课程SFT、多域强化学习、离线自蒸馏)在可验证推理任务上达到前沿性能,匹配甚至超越大模型,并验证推理增强不损害指令可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13940 2026-06-16 cs.CL cs.AI 版本更新 81%

Less is More: Improving LLM Reasoning with Minimal Test-Time Intervention

少即是多:用最小测试时干预提升大语言模型推理能力

Zhen Yang, Mingyang Zhang, Feng Chen, Ganggui Ding, Liang Hou, Xin Tao, Ying-Cong Chen

机构 * HKUST(GZ)(香港科技大学(广州)) Kuaishou Technology(快手科技) AIML(人工智能实验室) ZJU(浙江大学) Ant Group(蚂蚁集团) HKUST(香港科技大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型推理中高计算成本问题,提出最小测试时干预(MTI)框架,通过仅在不确定位置应用分类器自由引导和轻量负提示引导,在保持高效的同时提升推理准确性和稳定性。

Comments Code: https://github.com/EnVision-Research/MTI

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16328 2026-06-16 cs.AI 新提交 79%

AdaSTORM: Scaling LLM Reasoning on Dynamic Graphs via Adaptive Spatio-Temporal Multi-Agent Collaboration

AdaSTORM: 通过自适应时空多智能体协作扩展动态图上的LLM推理

Bing Hao, Ruijie Wang, Haodong Qian, Yunlong Chu, Yuhang Liu, Yumeng Lin, Minglai Shao, Jianxin Li

机构 * Tianjin University, China(天津大学,中国) Beihang University, China(北航大学,中国)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出AdaSTORM框架,通过自适应分区和时空解耦的多智能体协作,将动态图推理扩展到千节点规模,准确率超90%,无需外部工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15931 2026-06-16 cs.MA cs.AI 新提交 79%

DeepRoot: A KG-Coordinated Multi-Agent System for Therapeutic Reasoning over Historical Medical Texts

DeepRoot: 一个基于知识图谱协调的多智能体系统,用于历史医学文本的治疗推理

Zijian Carl Ma, Sean J. Wang, Sijbren Kramer, Li Erran Li

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) University of Cambridge(剑桥大学) University of Toronto(多伦多大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出DeepRoot多智能体系统,通过联合构建和利用验证知识图谱,将接地与推理分离并组合,从历史医学文本中恢复药物-疾病治疗关系,显著优于基线LLM和工具调用LLM。

Journal ref ICML 2026 GenBio; ACM CAIS 2026 Workshop AI Agents for Discovery in the Wild

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15884 2026-06-16 cs.CL 新提交 79%

Neuron Level Analysis of Large Language Model in Legal Domain Reasoning

法律领域推理中大语言模型的神经元级分析

Eri Onami, Youmi Ma, Shuhei Kurita, Naoaki Okazaki

机构 * Institute of Science Tokyo(东京科学大学) NII(国立信息学研究所) AIST(产业技术综合研究所)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 通过神经元归因分数识别并抑制关键神经元,发现存在任务特异性神经元和跨任务通用神经元,法律领域神经元重叠度高且分布受输入格式影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14694 2026-06-16 cs.CL 新提交 79%

AdaSR: Adaptive Streaming Reasoning with Hierarchical Relative Policy Optimization

AdaSR: 自适应流式推理与分层相对策略优化

Junlong Tong, Wenqi Xu, Yingqi Fan, Anhao Zhao, Xuan Lu, Yang Tan, Xiaoyu Shen

机构 * Eastern Institute of Technology, Ningbo(宁波东方理工大学) Shanghai Jiao Tong University(上海交通大学) The Hong Kong Polytechnic University(香港理工大学) Southeast University(东南大学) Xi’an Jiaotong-Liverpool University(西交利物浦大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 提出AdaSR框架,通过分层相对策略优化(HRPO)实现流式输入下的自适应推理,在推理准确率、计算效率和流式延迟间取得更好平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13693 2026-06-16 cs.CY cs.AI 新提交 79%

Limited Marginal Benefit of Reasoning-Heavy LLM Deployment in ESG Narrative Scoring: A 4-Model Consensus Study on Japanese Listed Firms

ESG叙述评分中重度推理LLM部署的有限边际收益:一项关于日本上市公司的4模型共识研究

Hiroyuki Kokubu

机构 * Kansai University(关西大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 通过4模型共识设计,研究在ESG叙述评分中,重度推理模型相比非推理模型是否带来显著收益,发现其边际收益有限且成本高昂。

Comments 12 pages. Earlier version available on SSRN, Abstract ID 6683303

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13607 2026-06-16 cs.AI 新提交 79%

Reasoning as Pattern Matching: Shared Mechanisms in Human and LLM Everyday Reasoning

推理即模式匹配:人类与LLM日常推理中的共享机制

Zach Studdiford, Gary Lupyan

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究通过比较人类和25个LLM在日常因果推理中的错误模式,发现两者均表现出模式匹配而非抽象世界模型驱动的推理,并识别出LLM中驱动响应的注意力头可预测人类推理错误。

Comments 13 pages main text, 51 pages supplementary text

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21613 2026-06-16 cs.IR cs.AI 版本更新 79%

AgenticRec: A Recommendation-Oriented Agentic Framework with Progressive Tool-Integrated Reasoning Optimization

AgenticRec:面向推荐的智能体框架与渐进式工具集成推理优化

Tianyi Li, Zixuan Wang, Guidong Lei, Xiaodong Li, Hui Li

机构 * Xiamen University(厦门大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出AgenticRec框架,将推荐建模为工具集成推理过程,并设计两阶段训练范式,通过隐式反馈激活和渐进偏好细化提升推荐准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17421 2026-06-16 cs.CL 版本更新 79%

Oops, Wait: Discourse Tokens Matter in Reasoning Model

哎呀,等等:话语标记在推理模型中的重要性

Jaehui Hwang, Byeongho Heo, Sangdoo Yun, Dongyoon Han

机构 * NAVER AI Lab(NAVER人工智能实验室)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文研究话语标记(如“wait”)在推理轨迹中的作用,发现数据高效微调可部分复现其模式,但不如大规模后训练与高置信答案转换对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03503 2026-06-16 cs.CL 版本更新 79%

Understanding LLM Reasoning for Abstractive Summarization

理解大语言模型在抽象摘要中的推理能力

Haohan Yuan, Haopeng Zhang

机构 * ALOHA Lab, University of Hawaii at Manoa(夏威夷大学马诺亚分校ALOHA实验室)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究通过大规模比较8种推理策略和3种大型推理模型在8个数据集上的表现,发现推理并非万能,其效果依赖于策略和摘要设置,且存在质量与事实准确性之间的权衡。

Comments 27 pages,15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16703 2026-06-16 cs.IR 新提交 78%

Harmonizing Semantic and Collaborative in LLMs: Reasoning-based Embedding Generator for Sequential Recommendation

在LLMs中协调语义与协同:基于推理的序列推荐嵌入生成器

Qidong Liu, Mingyao Huang, Moranxin Wang, Wenxuan Yang, Haiping Zhu

专题命中 其他推理 :reasoning(title,abstract)

AI总结 提出ReaEmb框架,通过潜在推理增强对比学习和协同奖励强化学习,利用LLM推理能力并显式注入协同信号,解决序列推荐中的长尾问题。

Comments 11pages,5figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16285 2026-06-16 cs.CL cs.LG 新提交 62%

HiMPO: Hindsight-Informed Memory Policy Optimization for Less-Entangled Credit in Long-Horizon Agents

HiMPO:面向长周期智能体的后见知情记忆策略优化以减少纠缠信用分配

Jiangze Yan, Yi Shen, Wenjing Zhang, Jieyun Huang, Zhaoxiang Liu, Ning Wang, Kai Wang, Shiguo Lian

机构 * Unicom Data Intelligence, China Unicom(联通数据智能有限公司,中国联通) Data Science & Artificial Intelligence Research Institute, China Unicom(中国联通数据科学与人工智能研究院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出HiMPO框架,通过比较记忆更新前后的任务相关信息估计局部效用,并利用后见相关性作为回顾性滤波器,减少记忆写入动作的信用纠缠,提升长周期智能体性能。

Comments Preprint. 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16281 2026-06-16 cs.CL cs.AI 新提交 62%

Who Should Lead Decoding Now? Tracking Reliable Trajectories for Ensembling Masked Diffusion Language Models

现在谁应该主导解码?跟踪可靠轨迹以集成掩码扩散语言模型

Heecheol Yun, Joonhyung Park, Joowon Kim, Eunho Yang

机构 * KAIST(韩国科学技术院) AITRICS

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对掩码扩散语言模型集成问题,提出TIE框架,通过跟踪答案相关位置的置信度动态,迭代识别并传递可靠解码轨迹,实现多模型协同生成。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17106 2026-06-16 cs.CL cs.LG 版本更新 62%

HyDRA: Hybrid Dynamic Routing Architecture for Heterogeneous LLM Pools

HyDRA:异构LLM池的混合动态路由架构

Aashna Garg, Siddharth Singha Roy, Jinu Jang, Federico Brancasi, Shengyu Fu

机构 * Microsoft(微软)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出HyDRA,一种能够根据查询预测细粒度多维能力需求并匹配配置定义模型配置的混合动态路由架构,实现了在异构LLM池中高效且无需重新训练的模型选择。

Comments preprint v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01182 2026-06-16 cs.AI cs.CL cs.HC cs.IR cs.MA 62%

Question-to-Knowledge (Q2K): Multi-Agent Generation of Inspectable Facts for Product Mapping

问题到知识(Q2K):多智能体生成可检查的事实以实现产品映射

Wonduk Seo, Taesub Shin, Hyunjin An, Dokyun Kim, Seunghyun Lee

机构 * The University of Tokyo(东京大学) KISTI(韩国科学技术院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 Q2K通过多智能体框架利用大语言模型实现可靠的产品SKU映射,通过生成辨析问题、网络搜索和去重来提高准确性与鲁棒性,适用于复杂场景如捆绑识别和品牌来源辨析。

Comments Accepted by IEEE BigData 2025 Industry Track

Journal ref 2025 IEEE International Conference on Big Data (BigData), Macau, China, 2025, pp. 2646-2653

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16842 2026-06-16 cs.SE cs.AI 新提交 57%

Beyond Models: Reflections on Engineering AI-enabled Systems in a Project-Based Course

超越模型:在项目式课程中构建AI使能系统的反思

Amir Mashmool, Kishan Ravindra Sawant, Mojtaba Shahin, Nico Hochgeschwender, Rainer Koschke

机构 * Department of Mathematics and Computer Science, University of Bremen(不莱梅大学数学与计算机科学系) School of Computing Technologies, RMIT University(皇家墨尔本理工学院计算技术学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文反思了一门研究生项目式课程的设计与实施,该课程通过开发电影推荐系统,培养学生对AI使能系统的架构设计、部署和监控能力,并基于混合方法研究揭示了学生在早期架构决策、ML集成、需求演进和数据管理方面的持续困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15943 2026-06-16 cs.SE cs.AI 新提交 57%

Graphical-Probabilistic Modeling of Generative Flows in LLM-Native Software Systems

LLM原生软件系统中生成流的图形概率建模

Víctor A. Braberman, Flavia Bonomo-Braberman

机构 * Departamento de Computación, FCEN, Universidad de Buenos Aires / ICC, UBA-CONICET(布宜诺斯艾利斯大学计算机系 / UBA-CONICET)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 针对LLM原生软件开发缺乏设计级推理的问题,提出基于图形概率模型的生成网络框架,用于文档化生成流并描述系统属性。

Comments Published at 2026 IEEE/ACM 5th International Conference on AI Engineering - Software Engineering for AI (CAIN '26), April 12-13, 2026, Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15880 2026-06-16 cs.CV cs.AI 新提交 57%

Deep Residual Injection for Full-Spectrum Forensic Signal Perception in Multimodal Large Language Models

深度残差注入:多模态大语言模型的全频谱取证信号感知

Kaiqing Lin, Zhiyuan Yan, Ruoxin Chen, Ke-Yue Zhang, Yue Zhou, Caiyong Piao, Bin Li, Taiping Yao, Bo Wang, Youchang Xiao, Shouhong Ding

机构 * National University of Singapore(新加坡国立大学) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) University of Electronic Science and Technology of China(电子科技大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 针对多模态大语言模型在取证中难以同时保留语义知识和捕获低级生成器伪影的问题,提出Deep-VRM方法,通过将伪影特定视觉信号作为残差路径注入中间层,实现全频谱信号感知,达到鲁棒检测性能。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15805 2026-06-16 cs.LG 新提交 57%

Mean-Field Parallel Decoding for Discrete Diffusion Language Models

离散扩散语言模型的平均场并行解码

Tamim Zoabi, Ameen Ali, Liran Ringel, Lior Wolf

机构 * School of Electrical & Computer Engineering, Tel Aviv University(特拉维夫大学电气与计算机工程学院) School of Computer Science and AI, Tel Aviv University(特拉维夫大学计算机科学与人工智能学院) Department of Computer Science, Technion, Israel Institute of Technology(以色列理工学院计算机科学系)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 提出一种无需训练的解码框架,通过平均场变分松弛协调并行令牌更新,在单次前向传播中抑制冲突,提升质量-延迟权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15422 2026-06-16 cs.CL q-bio.BM 新提交 57%

Pepti-Agent: An AI Agent for Peptide Design and Optimization

Pepti-Agent: 一种用于肽设计与优化的人工智能代理

Houxu Chen, Achuth Chandrasekhar, Amir Barati Farimani

机构 * Biomedical Engineering, Carnegie Mellon University, Pittsburgh, PA 15213, USA(生物医学工程系,卡内基梅隆大学,匹兹堡,PA 15213,美国) Mechanical Engineering, Carnegie Mellon University, Pittsburgh, PA 15213, USA(机械工程系,卡内基梅隆大学,匹兹堡,PA 15213,美国)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 提出Pepti-Agent,一种基于模型上下文协议(MCP)的闭环肽设计框架,通过可独立检查的生成、预测和突变工具,结合大语言模型控制器和实时属性预测,实现多目标优化与可复现基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15199 2026-06-16 cs.AI 新提交 57%

CogGuard: Cognitive and Operational Profiling for Proactive Warning in Edge Intelligent Services

CogGuard:边缘智能服务中基于认知与操作画像的主动预警

Zhi Yao, Weihao Chen, Zhiqing Tang, Hanshuai Cui, Qianli Ma, Weijia Jia, Wei Zhao

机构 * Beijing Normal-Hong Kong Baptist University(北京师范大学-香港浸会大学) Guangdong Key Lab of AI and Multi-modal Data Processing(广东省人工智能与多模态数据处理重点实验室) Institute of Artificial Intelligence and Future Networks(人工智能与未来网络研究院) Engineering Center of AI and Future Education(人工智能与未来教育工程中心) Guangdong Provincial Department of Science and Technology(广东省科学技术厅) Zhuhai Science-Tech Innovation Bureau(珠海市科技创新局) Beijing Normal University at Zhuhai(北京师范大学珠海校区)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 提出CogGuard框架,通过解耦离线LLM画像构建与在线SLM评分预测,结合前缀对齐KV缓存重用和长度感知分布式微调,实现边缘智能服务的主动预警,在教育和操作任务上降低构建时间48%、微调时间19%。

Comments Accepted to ICWS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16592 2026-06-16 cs.RO cs.AI cs.CV cs.ET 版本更新 57%

Human Cognition in Machines: A Unified Perspective of World Models

机器中的人类认知:世界模型的统一视角

Timothy Rupprecht, Pu Zhao, Amir Taherin, Arash Akbari, Arman Akbari, Yumei He, Tooba Imtiaz, Sean Duffy, Juyi Lin, Yixiao Chen, Rahul Chowdhury, Enfu Nan, Yixin Shen, Yifan Cao, Haochen Zeng, Weiwei Chen, Geng Yuan, Jennifer Dy, Sarah Ostadabbas, Xuan Zhang, David Kaeli, Edmund Yeh, Yanzhi Wang

机构 * Northeastern University(东北大学) EmbodyX Inc.(EmbodyX公司) Tulane University(路易斯安那州立大学) Cornell University(康奈尔大学) University of Georgia(佐治亚大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 提出统一框架整合记忆、感知等认知功能,指出动机和元认知研究不足,并引入认知世界模型新类别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17743 2026-06-16 cs.AI cs.SY eess.SY 57%

AI- and Ontology-Based Enhancements to FMEA for Advanced Systems Engineering: Current Developments and Future Directions

基于人工智能和本体的FMEA增强:先进系统工程中的最新发展与未来方向

Haytham Younus, Sohag Kabir, Felician Campean, Pascal Bonnaud, David Delaux

机构 * School of Computing and Engineering, University of Bradford(布里斯托大学计算机与工程学院) SAFI Verse Limited(SAFI Verse有限公司) Valeo(法拉利)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨了如何利用人工智能和本体技术改进FMEA,提升其数据驱动和语义丰富性,分析了AI和本体在系统工程中的应用及挑战。

Comments This manuscript is based on research undertaken by our doctoral student at the University of Bradford. The associated PhD thesis has been formally submitted to the University and is currently awaiting final examination. The review article is being shared on arXiv to make the review accessible to the research community while the thesis examination process is ongoing

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16838 2026-06-16 cs.IR 新提交 50%

OneRank: Unified Transformer-Native Ranking Architecture for Multi-Task Recommendation

OneRank: 面向多任务推荐的统一Transformer原生排序架构

Jiakai Tang, Sunhao Dai, Kun Wang, Zhiluohan Guo, Yu Zhao, Cong Fu, Kangle Wu, Yabo Ni, Anxiang Zeng, Xu Chen, Jun Xu

专题命中 其他推理 :reasoning(abstract)

AI总结 提出OneRank,一种Transformer原生多任务排序框架,通过消除编码器-预测器分离并引入任务私有通道,实现任务专用学习并减少干扰,显著提升多任务推荐性能。

Comments KDD 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15499 2026-06-16 cs.CR 版本更新 50%

HarmRLVR: Weaponizing Verifiable Rewards for Harmful LLM Alignment

HarmRLVR: 利用可验证奖励进行有害大模型对齐

Yuexiao Liu, Lijun Li, Xingjun Wang, Jing Shao

专题命中 其他推理 :reasoning(abstract)

AI总结 提出HarmRLVR,首次系统研究可验证奖励强化学习(RLVR)的对齐可逆性风险,通过仅64个有害提示的GRPO即可快速逆转安全对齐,攻击成功率高达96.01%。

详情

展开后加载摘要…

URL PDF HTML 收藏