烛龙NeFrameZ100,采用10纳米工艺制程和NeFrame
架构设计,晶片面积981平方毫米,电晶体数量在620亿,内置6912个CUDA核心和512个矩阵运算加速器,内存容量为16GB,内存带宽为每秒1460GB。
余先阳不紧不慢地介绍道。
烛龙NeFrameZ100是他带著团队,经过近两年时间,才在陈延森提供的技术方案上,利用当前的生产工艺,成功将其研制投产。
目前,米湖、千岛湖和虚城数据中心的算力晶片,全是它的不完整形态,算力不及它的十分之一。
这也是天工科技迟迟没有对外发售的核心原因。
「算力能达到多少?」
马斯克追问道。
「双精度算力,即64位浮点格式下,最强可以达到23TFLOPS,在16位浮点格式,即FP16的算力,最高可达280TFLOPS。
」7
余先阳立即回答道。
64位浮点格式即FP64算力,追求算得准,FP16则追求算得快。
闻言,马斯克咽了咽口水,眼中不由地露出狂热的神情。
烛龙Ne.FrameZ100的算力性能几乎是英伟达GTXTitanX的几十倍,这不是渐进升级,而是真正的降维打击!
FP64算力能达到23TFLOPS,相当于5—6张K40卡互联性能,单晶片碾压超算节点,能让卷积神经网络的训练从几天缩短到几小时。
它唯一的缺点是制程和内存不足,否则更进一步,就能解决带宽瓶颈的问题,从而释放出更强的算力。
对算力晶片而言,带宽就是血液,算力只是心脏。
心脏再强,血不够,晶片一样会贫血瘫痪。
不过,烛龙NeFrameZ100仅仅是天工科技的第一款算力晶片,将来只要疯狂堆内存颗粒层数,把内存颗粒焊死在GPU旁边,单卡峰值带宽就能不断提升。
如果黄仁勋在这里,肯定能看出来,烛龙NeFrameZ100的框架技术,用的都是英伟达的交叉专利。
只是天工科技运用的更加精巧,还把原先的技术进行了大幅升级。
马斯克在心里默默拿烛龙Ne.FrameZ100与英伟达的产品做对比,最后发现,哪怕他买再多的显卡,都干不过天工科技的这款产品。
泽维尔站在一旁,踮著脚尖努力看向测试平台上的数据,小脸上满是崇拜。
他虽然年