大模型推理加速的优化实践-2024全球机器学习技术大会.pdf
2024全球机器学习技术大会(北京站)主题涵盖大语言模型技术演进、多模态大模型前沿、大模型工程与架构、大模型应用开发实践、AI智能代理、代码大模型等12个热门专题,力求为全球开发者、研究人员、行业技术人员提供全方位、多角度的技术交流平台。
2024全球机器学习技术大会(北京站)主题涵盖大语言模型技术演进、多模态大模型前沿、大模型工程与架构、大模型应用开发实践、AI智能代理、代码大模型等12个热门专题,力求为全球开发者、研究人员、行业技术人员提供全方位、多角度的技术交流平台。
2024全球机器学习技术大会(北京站)主题涵盖大语言模型技术演进、多模态大模型前沿、大模型工程与架构、大模型应用开发实践、AI智能代理、代码大模型等12个热门专题,力求为全球开发者、研究人员、行业技术人员提供全方位、多角度的技术交流平台。
张君
昇腾生态技术专家
硕士毕业于厦门大学通信与信息系统专业,毕业后一直就职于华为公司。曾
2024全球机器学习技术大会(北京站)主题涵盖大语言模型技术演进、多模态大模型前沿、大模型工程与架构、大模型应用开发实践、AI智能代理、代码大模型等12个热门专题,力求为全球开发者、研究人员、行业技术人员提供全方位、多角度的技术交流平台。
在MR,Neurocomputing有数篇论文发表。作为核心开发者参与AI框架
(昇思)的开发,并负责动态图的自动微分以及动静结合模块。目前主要参与
大模型推理加速在昇腾硬件上的相关开发和优化工作,致力于通过优化推理
框架、模型算法和算子加速库等层面,进一步提升大模型推理的性能。
演讲主题:
大模型推理加速的优化实践
大模型推理加速的优化实践
2024全球机器学习技术大会(北京站)主题涵盖大语言模型技术演进、多模态大模型前沿、大模型工程与架构、大模型应用开发实践、AI智能代理、代码大模型等12个热门专题,力求为全球开发者、研究人员、行业技术人员提供全方位、多角度的技术交流平台。
昇腾生态技术专家张君
大模型推理的技术挑战
大模型推理加速技术发展现状
2024全球机器学习技术大会(北京站)主题涵盖大语言模型技术演进、多模态大模型前沿、大模型工程与架构、大模型应用开发实践、AI智能代理、代码大模型等12个热门专题,力求为全球开发者、研究人员、行业技术人员提供全方位、多角度的技术交流平台。
昇腾大模型推理框架MindIE-LLM加速实践
昇腾Transformer领域加速库ATB
总结与展望
PART1
2024全球机器学习技术大会(北京站)主题涵盖大语言模型技术演进、多模态大模型前沿、大模型工程与架构、大模型应用开发实践、AI智能代理、代码大模型等12个热门专题,力求为全球开发者、研究人员、行业技术人员提供全方位、多角度的技术交流平台。
大模型推理的技术挑战
挑战一:计算和内存需求高
2020-20212022202320242025
20-06GPT322-11ChatGPT23-03GPT-423-11GPT-4Turbo24H1GPT-5(预计)
OpenAI175B稠密175B稠密2万亿稀疏长序列+多模态10万亿稀疏+多模态