国产GPU问世:AIGC计算基地新极“ChatGPT”掀起生成式AI应用浪潮

日期:2023-07-12 12:32:31 / 人气:962

可以说,AI大模型已经成为AI走向通用AI的里程碑式技术。
AI大模型的应用,也让AI的三要素从“数据、算法、算力”进化为“场景、产品、算力”。随着AIGC参数膨胀到千亿量级,对AI计算能力的需求也呈指数级增长。无数经验丰富的新兵正蜂拥进入计算能力的军备竞赛。
近日,在主题为“智能世界生成未来”的2023世界人工智能大会(WAIC)上,不仅有包括商汤日日新、华为云盘古模型、阿里云依桐钱文百度文心伊彦等在内的10余个AI模型集体出现。更可喜的是,在国产通用GPU的计算能力方面,随缘科技的桂思2.0、桂思2.5,切壁、削壁系列产品,天智智芯智能铠甲100,牧溪西思N100,切壁,珠海芯力RPP-R8芯片等也首次亮相,充分展示了国产通用GPU的“芯”实力。
GPU需求不止是“计算能力”
ChatGPT的诞生,将大模型的出现和爆发推向了新的高潮,也带动了大计算GPU需求的飙升。
然而,虽然GPU的销量像火箭一样猛增,但供应链却难以满足对GPU的需求。真实感还在于,目前已经发布的国内外大型机型,大部分都是基于英伟达几代旗舰GPU产品进行模型训练,英伟达产品缺货、价格飙升的消息不绝于耳。据悉,字节跳动今年向英伟达订购了超过10亿美元的GPU,这可能接近英伟达去年在中国销售的商用GPU的总和。
对于国内通用GPU厂商来说,要把握住这一波通用AI时代的新机遇,考验的不是高计算能力那么简单。
碧波科技合伙人梁刚博士在“生成式AI与大模型:改革与创新”论坛上指出,大模型时代,除了要求通用GPU具备高计算能力,支持各种数据精度和高带宽互联能力,软件生态也非常重要,包括支持通用编程语言,支持各种大规模模型训练和推理框架,适配大规模模型算法。
随着大模型参数数量级的不断增加,对计算能力的需求也在数量级增加,计算能力集群越来越庞大。梁刚博士进一步指出,为了支持更大的参数规模,需要通过单机多卡、多机多卡的分布式平台来支持大规模的模型训练和推理。既要支持张量并行TP、流水线并行PP、DeepSpeed ZeRo数据并行参数分割策略等其他并行技术,也要支持重新计算、卸载等技术,进一步扩大参数规模,具备支持千亿级参数的能力。
而且,为了保证近千卡的同步训练,一方面如何降低通信比例,实现更高的可扩展性成为一大挑战,另一方面要努力保证大规模模型训练的稳定性,这不仅需要增强硬件本身的可靠性测试和验证,还需要加强与客户的沟通,在资源管理、调度和训练框架层面设计容错。
最后,作为大尺寸机型落地时客户最关心的问题,也要重点关注落地的性能和成本。梁刚博士指出,在训练层面,除了分布式训练性能优化,还需要优化芯片的大计算能力和分布式共享缓存,进一步提升性能,降低成本;对于推理,需要优化延迟来提升用户体验,并结合硬件特点进行软件的深度联合优化,进一步降低推理延迟。
随缘科技创始人、董事长兼CEO赵立东也指出,在通用AI时代,对通用GPU的全栈能力提出了新的要求,需要实现高性能、高带宽、高存储、高通用性、高效分布式计算和高效集群互联,以满足大型模型的计算能力需求。
还是得把重点放在收益和落地上。
大型号应用的火热直接将NVIDIA带入万亿市值俱乐部,也为计算芯片厂商迎来了一个全新的蓝海市场。
基于近几年市场的深度锤炼和对大模型时代计算能力需求的深刻洞察,国内通用GPU厂商也将WAIC作为展示“实力”的练兵场。
在WAIC展会上,不仅各大厂商展出了自己的大作——强大的GPU、加速卡等。,但也有一些企业,如汉博半导体、随缘科技、登麟科技,用自己的GPU进行了演示,运行了大型语言模型、AI绘画、文生PPT等AIGC互动演示。而且一些厂商还发布了平台服务产品和落地案例,更直观的展示了自己的强大实力。
例如,随缘科技在本次展会上发布了文圣图MaaS平台的服务产品——随缘黑曜石地图,可以为用户提供大模型的微调和MaaS服务,提高大模型应用的在线速度和效率。Biwa自主研发的suCloud机器学习平台也吸引了观众驻足。据悉,该平台可以管理千卡规模的异构GPU资源,支持资源的灵活池调度,为用户呈现一个简单易用的大模型训练平台,大大提高资源利用效率。
值得注意的是,大模型落地的投入巨大,如果能结合垂直行业落地,这个问题就迎刃而解了。有专家表示,海外主要是针对C端,如亚马逊、谷歌、OpenAI等。而国内通用生成式AI更大的应用在于垂直领域,可以与医疗、教育等行业有机结合。所以更多考虑的是整体解决方案的性能、功能和性价比。
另外,狂热的大规模模型训练和推理最终还是要回归商业逻辑,实现经济效益才是根本,而不是“不计成本”,这就涉及到计算能力能否像水电一样普及的问题。
“在AI大模型的驱动下,对计算能力的需求呈指数级增长,计算能力效益问题亟待解决。”赵立冬说,“这必须在架构、能耗、集群上下功夫,从芯片的架构创新、3D堆叠等新封装形式入手,集群是未来整个智能计算中心建设的重要单元。”
重写模式没有捷径。
虽然国产计算机芯片厂商集体走出了“加速度”,但客观来说,国产计算机芯片的产品竞争力,尤其是软件生态,与国际先进水平有一定差距。
围绕这个话题,梁刚博士指出,中国必须先跟,后赶。在目前的市场格局下,中国仍将处于跟进过程中。没有捷径,也没有弯路可走,必须脚踏实地的打磨产品,构建生态。
其中,与客户的密切合作非常重要。梁刚博士分析,只有与终端客户一起探索各行业大模型的落地,不断获取用户反馈,产品才能不断迭代优化。
对于村上来说,第一代产品的“点亮”证明了团队的产品研发能力。后续村上将继续与合作伙伴和客户紧密合作,专注于产品优化和迭代,在单卡计算能力、内存容量和带宽、多卡集群互联、安全性等方面持续提升。
在软件层面,梁刚博士强调将采取开放的态度,与大模型产业生态的合作伙伴和客户保持紧密合作,形成“应用-优化-反馈-迭代”的正向循环,加速软件生态的更新升级。
虽然NVIDIA仍然是主流的计算解决方案,但从长远来看,国产芯片必须建立第二种解决方案,为客户提供第二种选择。这无疑是国产芯努力构建自主创新框架,满足市场对性价比和能效比多重需求的绝佳时间窗口。
“芯片是‘用进废退’,用得越多,用得越好。在渐进的过程中培育计算力生态和迭代的计算力产品,是我们必须经历的过程。”赵立东直言。
也许这个跟随和追赶的过程需要几年的时间。“计算能力芯片的发展应该遵循产业规律。硬件迭代周期需要一到两年,构建软件生态圈需要很长时间。未来打造计算能力芯片的新一极,仍需要长期的耐心和不断的培育。”尽管小心翼翼,但梁刚博士的话语中包含着对国产通用GPU大发展的殷切期望。"

作者:星座娱乐




现在致电 5243865 OR 查看更多联系方式 →

COPYRIGHT 星座娱乐 版权所有