第246章 openAI团队(2/3)
说,
“靠多层LSTM,目前根本做不到这个程度。”
LSTM,长短期记忆网络,是目前自然语言处理领域最主流的架构。
伊利亚在谷歌大脑的时候就是这个领域的顶尖研究者,他写过的几篇关于序列模型和循环神经网络的论文,至今还是这个领域的基石。
没有人比他更清楚LSTM能做到什么,不能做到什么。
“上下文理解?可以有。简单的多轮对话?也可以有。
但是精确的数学推理……这是两回事。
如果那个初中生跟你说他用的是标准框架,那要么是你没看清楚,要么就是他做了某种欺骗。”
格雷格在旁边点了点头,他也是从技术岗上来的,对这个问题有相同的判断:
“而且一个人写的代码量能有多大?”
萨姆没有马上表态,他靠在椅背上,手指在桌子上轻轻敲着,看着马斯克的脸,像是在判断对方是不是在夸大其词。
马斯克被三个人轮番质疑,也不着急,靠在椅背上,把脚翘起来,慢悠悠地说:
“我亲眼看到的。”
“那你问他了吗?用的什么框架?”伊利亚问。
“我没问技术细节。”
马斯克耸了耸肩,
“我当时光顾着惊讶了。再说了,就算他告诉我,我一个搞物理和商业的,也未必听得懂。”
伊利亚沉默了手无意识地转着一支笔。
格雷格忍不住又开口了:
“假设,我是说假设,那个初中生真的做出了你说的那种智能体。
那只能说明一种可能,他用的根本不是多层LSTM。”
“那能用什么?”萨姆问。
格雷格把目前主流的几个框架都过了一遍。
循环神经网络、卷积神经网络、生成对抗网络、变分自编码器……每一个他都能说出至少三个不适合做精确逻辑推理的理由。
他最后还是摇了摇头,语气里带着一种不想承认但又不得不承认的无奈:
“我不知道。但绝对不是我们已知的标准框架。”
一直沉默的伊利亚忽然开口了。
“如果他用的是别的框架模型呢?”
所有人都转头看着他。
伊利亚继续说:“我们一直用LSTM来处理序列数据,因为它在时间维度上的记忆能力是最好的。
我们在这个框架上修修补补好几年,优化了一代又一代,效果是有提升,但天花板一直在那里。”
“可是如果,如果有人从头开始就没走LSTM这条路呢?如果他觉得LSTM根本解决不了
本章还未完,请点击下一页继续阅读>>>