网易首页 > 网易数码 > 正文

谷歌Smart Compose:神经网络帮你写Gmail 邮件

0
分享至

Google I/O 2018上,谷歌介绍了 Gmail 中的一项新特性,智能预测拼写功能:Smart Compose,该新特性利用机器学习,交互式地为正在写邮件的用户提供补全句子的预测建议,从而让用户更快地撰写邮件。Smart Compose 基于此前智能回复(Smart Reply)技术开发而来,Smart Compose 提供了全新的方式来帮助用户撰写邮件,无论用户是在回一封来件还是从草稿箱起草一封新邮件。

谷歌在开发 Smart Compose 的过程中,遭遇到了以下这些关键挑战:

  • 延迟:因为 Smart Compose 需基于用户的每一次输入来提供预测,所以它必须提供100 毫秒以内的理想预测,这样用户才察觉不到任何延迟。这时候,平衡模型复杂性和推理速度就成了一个需要解决的关键难题。

  • 用户规模:Gmail 拥有超过 14 亿的各种用户。为了面向所有用户提供自动组句预测,模型必须拥有足够强的建模能力,这样它才能精细地在不同上下文中提供定制建议。

  • 公平性和用户隐私:在 Smart Compose 的开发过程中,谷歌需要在训练过程中处理潜在偏倚的来源,并遵守像 Smart Reply 功能一样严格的用户隐私标准,以确保模型不会暴露用户的隐私信息。另外,谷歌的研究人员也不具备查看用户邮件的权限,这意味着他们不得不在一个自己都无法查看的数据集上开发和训练一个机器学习系统。


找到对的模型

比如 ngram,neural bag-of-words(BoW)和 RNN language 这种典型的语言生成模型,它们是基于前缀词序列来预测下一个词的。然而,在一封邮件中,用户在当前邮件撰写会话中打下的单词会给模型一个信号,模型会利用该信号来预测下一个单词。为了结合更多用户想表达的上下文,谷歌的模型还会利用邮件主题和此前的邮件正文(假设用户正在回复一封刚刚收到的邮件)。

谷歌的方法是包含利用额外语境的一个方法,该方法是将问题转换成一个序列到序列(seq2seq)的机器翻译任务,其中源序列是邮件主题和上封邮件正文(假设存在上封邮件)的串联,用户正在写的邮件是目标序列。尽管该方法在预测质量上表现良好,但它的延迟要比谷歌严苛的延迟标准超出了好几个量级

为了提高预测质量,谷歌将一个 RNN-LM 神经网络与一个 BoW 模型结合起来,结合后的模型在速度上比 seq2seq 模型要快,且只轻微牺牲了预测质量。在该混合算法中,谷歌通过把词嵌套们平均分配在每个区域内,来对邮件主题和此前的邮件内容进行编码。随后谷歌将这些平均分配后的嵌套连接在一起,并在每次执行解码步骤时将它们提供给目标序列 RNN-LM,过程如下面的模型图解。

Smart Compose RNN-LM 模型架构。将邮件主题和此前邮件信息进行编码,采用的方法是将它们的词嵌套平均分配在每一个区域内。随后,平均后的嵌套会在每次执行解码步骤时提供给目标序列 RNN-LM。加速模型训练和服务

当然,一旦选定了这种建模方法,谷歌就必须调整各种模型超参数和使用超过数十亿的样本来训练这些模型,所有的这些操作都相当费时。为了实现加速,谷歌使用了一个完整 TPUv2 Pod 来执行实验。在这情况下,谷歌能够在一天之内将一个模型训练至收敛状态。

在谷歌训练出速度上更快的混合模型之后,初始版本的 Smart Compose 在一个标准 CPU 上运行时,依旧存在几百毫秒的平均服务延迟,这与 Smart Compose 努力预测语句来帮用户节省时间的特点是不相符的。幸运的是,谷歌可在推断期间使用 TPU 来大大地加速用户体验,通过分流 TPU 之上的大部分计算,谷歌可以将平均延迟改良至几十毫秒,同时也能大大增加单一机器可处理的服务请求数量。

公平性和隐私

由于语言理解模型会反映人类的认知偏倚,这样会导致得到多余的词汇联想和句子完成建议,所以在机器学习内实现公平至关重要。Caliskan et al. 在他们近期的「Semantics derived automatically from language corpora contain human-like biases」论文中指出,模型的词联想深陷于自然语言数据的偏倚数据中,这为打造任何一个语言模型都带来了相当的挑战。在模型训练过程中,谷歌积极地寻找方法来持续降低潜在的偏倚。另外,由于 Smart Compose 是基于数十亿的短语和句子进行训练,这与垃圾邮件机器学习模型的训练方法一致,谷歌已经进行了广泛的测试来确保,模型只记忆多种用户都使用的常识语句,关于常识语句的调查结果源自这篇论文 The Secret Sharer: Measuring Unintended Neural Network Memorization & Extracting Secrets。

未来研究

谷歌将持续地研究改良语言生成模型的预测质量,为此谷歌会通过使用最先进的构架(如 Transformer,RNMT+等)和试用最新、最先进的训练技术来实现这一目标。一旦模型的实验结果满足了谷歌的严格延迟约束条件,谷歌就会把这些更加的先进模型部署到自家产品上去。另外,谷歌还在进行结合个人语言模型的研究,该模型的目的是给系统增加一个新特性,让它能够更加准确地模拟每个用户自己的写作风格。

相关推荐
热点推荐
乌克兰情报机构:在俄罗斯多款战斗机中发现2000多个外国进口部件

乌克兰情报机构:在俄罗斯多款战斗机中发现2000多个外国进口部件

零度Military
2024-04-22 14:24:03
韩国瑜首次“挑衅”大陆,马英九警告,大陆对台作出了三个让步?

韩国瑜首次“挑衅”大陆,马英九警告,大陆对台作出了三个让步?

特特农村生活
2024-04-25 12:40:55
贡品||童颜水蛇腰大长腿!10年前她在互联网杀疯了

贡品||童颜水蛇腰大长腿!10年前她在互联网杀疯了

懂球娘娘
2024-03-19 11:45:50
纸老虎!北约改口了

纸老虎!北约改口了

世事人物解读
2024-04-24 22:42:11
媒体:美国瞄准在战争中帮助俄罗斯的中国银行

媒体:美国瞄准在战争中帮助俄罗斯的中国银行

老马拉车莫少装
2024-04-23 23:50:07
男子一家三口染上艾滋,得知这是妻子“主人的任务”后,连捅31刀

男子一家三口染上艾滋,得知这是妻子“主人的任务”后,连捅31刀

历史八卦社
2023-11-24 17:56:46
世锦赛爆冷!瑞恩戴连胜五局逆转四冠王,霍金斯怒锤球桌引热议!

世锦赛爆冷!瑞恩戴连胜五局逆转四冠王,霍金斯怒锤球桌引热议!

世界体坛观察家
2024-04-25 05:39:35
克拉拉(李成敏)一一明星风采(233)

克拉拉(李成敏)一一明星风采(233)

娱乐圈酸柠檬
2024-04-06 23:16:26
3岁儿子被拐,爸爸抑郁自杀,妈妈寻子25年后发现:儿子竟是自己的好友……

3岁儿子被拐,爸爸抑郁自杀,妈妈寻子25年后发现:儿子竟是自己的好友……

华哥视界
2024-04-25 12:01:12
上海女人真会打扮,满街都是“膝下裙+奶奶鞋”,看似随意却高级

上海女人真会打扮,满街都是“膝下裙+奶奶鞋”,看似随意却高级

疯说时尚
2024-04-20 08:00:27
火烧到莫斯科了!俄境内游击队喊话:这场战争只能在莫斯科结束

火烧到莫斯科了!俄境内游击队喊话:这场战争只能在莫斯科结束

娱宙观
2024-04-22 18:01:31
男子家中10万现金及30万金银首饰被盗,嫌疑人竟是自家女婿,已被警方抓获

男子家中10万现金及30万金银首饰被盗,嫌疑人竟是自家女婿,已被警方抓获

红星新闻
2024-04-25 16:46:31
上海,一女子将名下房产悉数变卖,拿到了近600万元后又悉数捐出

上海,一女子将名下房产悉数变卖,拿到了近600万元后又悉数捐出

娱乐洞察点点
2024-04-25 07:10:19
美国会拨款武装台湾,国台办:注定失败!丨湾区望海峡

美国会拨款武装台湾,国台办:注定失败!丨湾区望海峡

直新闻
2024-04-24 23:03:02
纪实:女子给男子炫耀私处纹身,男子看后强奸女子,女子:太猛了

纪实:女子给男子炫耀私处纹身,男子看后强奸女子,女子:太猛了

北城小畅谈
2024-04-07 13:29:03
笑不活了,山东34岁大龄剩女为让网友道歉晒出豪车,结果却遭嘲笑

笑不活了,山东34岁大龄剩女为让网友道歉晒出豪车,结果却遭嘲笑

吃货的分享
2024-04-25 10:32:22
张本美和回应被陈梦挤下看台:陈梦选手没挪位置,可能我太胖吧

张本美和回应被陈梦挤下看台:陈梦选手没挪位置,可能我太胖吧

阿牛体育说
2024-04-25 12:03:55
有没有一瞬间感觉公公婆婆虚伪的都想笑?

有没有一瞬间感觉公公婆婆虚伪的都想笑?

户外阿崭
2024-04-24 10:42:26
输球输人!联盟将介入调查詹姆斯,季后赛首笔处罚将诞生

输球输人!联盟将介入调查詹姆斯,季后赛首笔处罚将诞生

曼巴篮球one
2024-04-24 21:37:28
连雅迪生意都抢?比亚迪终于向电动自行车下手,续航500KM

连雅迪生意都抢?比亚迪终于向电动自行车下手,续航500KM

万物explorerA
2024-04-23 14:53:22
2024-04-25 17:16:49

头条要闻

沙利文证实"美国向乌军提供远程导弹":我们将送去更多

头条要闻

沙利文证实"美国向乌军提供远程导弹":我们将送去更多

体育要闻

当胜利变成意外,就不要再提未来……

娱乐要闻

心疼!伊能静曝儿子曾被狗仔追到洗手间

财经要闻

曙光已现?瑞银开始转而看好中国地产业

科技要闻

雷军:希望小米SU7能成为苹果用户购车首选

汽车要闻

全新哈弗H9亮相 大号方盒子硬派SUV入列

态度原创

家居
旅游
本地
手机
公开课

家居要闻

光影之间 空间暖意打造生活律动

旅游要闻

京都热门景点一棵樱花树突然倒下 游客被砸成重伤

本地新闻

云游中国|苗族蜡染:九黎城的“潮”文化

手机要闻

一季度中国手机市场报告出炉:荣耀/华为并列第一

公开课

睡前进食会让你发胖吗?

无障碍浏览 进入关怀版
×