CommentsInvited chapter for the edited volume Artificial Intelligence and Social Justice Intersections in Library and Information Studies: Challenges and Opportunities (Emerald Group Publishing, in preparation)
Evaluating Large Language Models on Quantum Mechanics: A Comparative Study Across Diverse Models and Tasks
评估大型语言模型在量子力学中的表现:跨多样模型和任务的比较研究
S. K. Rithvik
机构
*
Quantum Science and Technology Laboratory, Physical Research Laboratory, Navrangpura, Ahmedabad 380009, India(量子科学与技术实验室,物理研究实验室,Ahmedabad)
;
Indian Institute of Technology Gandhinagar, Palaj, Gandhinagar 382055, India(印度理工学院冈达塞瓦尔)
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract);分类 cs.AI
Do Large Language Models Understand Data Visualization Rules?
大语言模型理解数据可视化规则吗?
Martin Sinnona, Valentin Bonas, Emmanuel Iarussi, Viviana Siless
机构
*
Universidad Torcuato Di Tella(托科托迪特拉大学)
;
Consejo Nacional de Investigaciones Científicas y Técnicas(国家科学与技术研究院)
;
Universidad de Buenos Aires(布宜诺斯艾利斯大学)
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract)
Do Large Language Models Understand Data Visualization Principles?
大语言模型理解数据可视化原则吗?
Martin Sinnona, Valentin Bonas, Viviana Siless, Emmanuel Iarussi
机构
*
Universidad Torcuato Di Tella(托科托迪泰拉大学)
;
Consejo Nacional de Investigaciones Científicas y Técnicas(阿根廷国家科学与技术研究院)
;
Universidad de Buenos Aires(布宜诺斯艾利斯大学)
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract)
Evaluation and Benchmarking Suite for Financial Large Language Models and Agents
金融大语言模型与代理的评估与基准测试套件
Shengyuan Lin, Kaiwen He, Jaisal Patel, Qinchuan Zhang, Chris Ding, James Tang, Keyi Wang, Yupeng Cao, Yan Wang, Kairong Xiao, Vincent Caldeira, Matt White, Xiao-Yang Liu Yanglet
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract)
AgentCAT: An LLM Agent for Extracting and Analyzing Catalytic Reaction Data from Chemical Engineering Literature
AgentCAT: 一种用于从化学工程文献中提取和分析催化反应数据的LLM代理
Wei Yang, Zihao Liu, Tao Tan, Xiao Hu, Hong Xie, Lulu Li Xin Li, Jianyu Han, Defu Lian, Mao Ye
机构
*
University of Science and Technology of China(科学技术大学)
;
State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)
;
National Engineering Research Center of Lower-Carbon Catalysis Technology(低碳催化技术国家工程研究中心)
;
Dalian Institute of Chemical Physics, Chinese Academy of Sciences(化学物理研究所,中国科学院)
;
IFLYTEK CO.LTD(IFLYTEK有限公司)
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
"The explanation makes sense": An Empirical Study on LLM Performance in News Classification and its Influence on Judgment in Human-AI Collaborative Annotation
『解释有道理』:一项关于LLM在新闻分类中的表现及其在人机协作标注中影响的实证研究
Qile Wang, Prerana Khatiwada, Avinash Chouhan, Ashrey Mahesh, Joy Mwaria, Duy Duc Tran, Kenneth E. Barner, Matthew Louis Mauriello
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract)
CommentsAccepted for publication at Transactions on Machine Learning Research (TMLR) and MLRC Journal Track, 2025. Code available at: https://github.com/joshrosie/FACT29
Journal refTransactions on Machine Learning Research (TMLR), June 2025
CommentsIn Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, pages 32074-32096, Suzhou, China. Association for Computational Linguistics. 9 pages, 5 figures, 1 table
机构
*
Shenzhen Technology University(深圳技术大学)
;
Shenzhen University of Information Technology(深圳信息科技学院)
;
University of Washington(华盛顿大学)
;
Foundation Model Team, Meituan(美团基础模型团队)
;
National University of Singapore(新加坡国立大学)
;
Tongji University(同济大学)
专题命中
评测与基准
:LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)