的。”
“可注意力矩阵的谱是活的呀,我们只能靠采样去估计。”
“估计误差的上界是什麽?噪声除以谱隙。”
“偏偏负责长程检索的那几个特征向量全挤在谱的尾部里,那里的谱隙是趋於零的。”
“分母趋零。”
“各位,分母趋零意味着什麽,不用我翻译了吧?”
会议室里没人接话。
tpu平台的负责人说道。
“离线估基检索长度超过三十万词,召回当场就崩盘了。”
“在线估基,每条输入单独跑一遍特征分解,开销是它省下来的缓存的四倍。”
“我们等於花钱,买了个更慢的东西。”
“那就端对端,让模型自己学这组基。”
角落里,deepmind那位年轻研究员开口了。
“训练过了。”
马库斯终於出声。
他面前放着一个本子,正是当初在首尔和李东交流时候记下的思路。
“对特征向量求导,梯度里天然带着特征值间隙的倒数,谱一简合并这个倒数就炸。”
“两万张卡,跑到第六天,损失曲线抽搐了一整晚,天亮的时候,变成一排nan。”
“我们重启了三次,三次死在同一个位置。”
年轻研究员张了张嘴,没再出声。
“跨洋异步那条线呢?”有人问。
“停了。”马库斯翻过一页,“漂移补偿需要沿途的曲率,这一项我们给不出来,跑到第四天的时候损失曲线一切正常,下游评测全线归零。”
“还有缩放律。”预训练总监翻着手里的报表,声音发苦道,“代理模型那组曲线,小规模上确实塌缩成一条母线,漂亮得能进教科书,可放大到真实规模,一万亿词之後,曲线就全散开了。”
“散开的原因,我们说不清是噪声,还是换了区域?没有定理能回答。”
“zeta那边有解析式兜底,我们这边什麽都没有,只有拿钱烧出来的数据点。”
“说到钱。”
tpu负责人的声音冷了下来。
“这几天我们砍了两个内部项目,压缩了客户侧的容量,财务昨天第三次来问,这两万张卡这个季
第411章 李东教授,真坑人-->>(第2/3页),请点击下一页继续阅读。