可华轩这块七纳米加速卡,它原生的数据通路,是为稠密矩阵乘法而生的。
满阵的脉动单元,吞进去的是低精度的浮点和定点,乘加,乘加,一刻不停。
拿它去做矩阵乘法是完全没问题的。
可是它就是不会做大模数的精确运算。
这些卡上压根就没有这样的原生指令。
想在这块卡上,把那几个算子跑起来,就只能拿现成的乘加单元,去软件模拟那种上千比特的大整数运算。
一条精确的乘法,拆解下去,就是成百上千条指令,片上那点SRAM,转眼就会被撑爆。
更要命的是……大整数运算那条长长的进位链是一环扣着一环的,必须挨个往下捋根本并行不起来。
而加速卡赖以为生的,恰恰就是并行呀。
一条进位链压下去,满阵的脉动单元大半都得在那儿干等着。
再加上他这套符号归约,走到哪一步读哪一块内存,全都是临时才定的,而且数据相关访存又散。
说到底,基底能把他这一整套框架完整地表达出来,可是一旦跑到最底层那几个算子上,就是没办法落到加速卡的原生通路里,只能靠模拟路径来运行。
所以跑是能跑,可那个速度跟没开会员的百度网盘一样。
“这条模拟的路子,我们试过了。”王勍补了一句,“拿整块卡去跑您一个最小的算例,比一台老掉牙的服务器还慢。”
李东听完沉默了。
他确实没料到,会卡在这麽个地方。
适配会麻烦,他是有准备的。
可他没想到有这麽麻烦呀。
他那套为精确而生的东西,和这块为矩阵乘法而生的加速卡,从最底层的原生指令开始就根本不匹配。
这不是改几行代码,调几个参数,就能解决的事。
换一块卡?
可华夏手里眼下也就这一条七纳米的生产线,绕开它等於这事从头就不用谈了。
“这个问题……”李东缓缓开口,“我确实没考虑过,也没想到。”
他抬起头。
“给我几天时间,我好好想想。”
王勍点了点头。
“行,那我们也一起想想。”
……
从实验区出来,林伟见李东皱着眉头,便开口说道。
“李东教授,您这套代码是真没得挑,别的地方一点毛病没有,就这一块
本章未完,请点击下一页继续阅读!