我是 Leo,依图科技联合开创者,UCLA 统计学博士,从事AI研究 15 年,曾在深度学习奠基者 Yann LeCun 教授实验室担任研究员,2010 年获得 PASCAL 图像目的测试比赛冠军,2017 年获得美国国家标准与技术研究院 NIST 和美国国家情报高级研究计划局 IARPA 人脸辨别全球冠军。
近期,很多关于AI的研究报告,投资人、创业人士、学者热议 人工智能 的趋势和对社会各行业的影响,不乏对 人工智能 技术和产业进步的误解,比较容易有误导性。
宏观上,议题大体分为三个方面:人工智能 是多大的事?哪个是真的的 人工智能 player?人工智能 的场景在哪儿?从科学研究者和创业人士的双视角谈谈我的主要看法:人工智能 的边界,只有领头羊才可能准确把握和拓展;顶尖企业,由于远见造就势能;人工智能 的将来,独一无二,没历史可以借鉴,也没权威可以预测。
「S」曲线看 人工智能 格局我对 人工智能 进步历史和预测,用上图的「S」形曲线建模(Sigmoid 函数,恰好也是用来刻画神经互联网中神经元的 activation function)。
横轴表示时间,纵轴表示机器智能水平。
曲线上的点表示某个时间点的全球最高智能水平。
2013 年开始是新 人工智能 年代(深度学习),2013 年前的机器智能进步水平相较于近 5 年的进步基本可以忽视不计。
红线代表悲观派(人工智能 退潮、人工智能 泡沫等),2017 年之后非常快出现进步停顿;蓝线代表乐观派,2017 年之后还有飞速发展。
值得强调的是,蓝红两条曲线对 人工智能 历史有相同认识,但市场上不少论调或研究报告看到的是另一条曲线,非常大概率调查看到的 人工智能 水平离最高水平有非常大差距。
剖析 人工智能 格局的不同立场,可以通过解析 S 曲线的三个方面:1、人工智能 过去的进步与 人工智能 将来进步程度和速率的预测2、人工智能 进步水平和商业场景的关系3、每个 player 的所在地方和差距具体来讲,大家先从 人工智能 过去 5 年的进步状况谈起,以人脸辨别作为例子,把人脸从 N 个人中找到的概率在 95%,纵轴就是可辨别的规模(N 的大小)。
技术不是趋同,而是会放大差距、解锁场景2017 年人脸辨别最高水平可辨别规模在 20 亿人,大概比 2016 年可辨别千万提升两百倍,比 2015 年提升了数万倍。
在 2017 年全球最权威的人脸辨别测试中(NIST),大家比2、 Vocord 团队,在千万比对测试上领先 2%(Vocord 在另一测试集比腾讯优图高 10%),这个就是大伙常说的技术水平趋同,高中一年级两个百分点没意义(引申出难兑现成角逐价值)。
这个误区需要从两个方面解析:第一方面,算法在亿级、十亿级比对的领先会迅速放大到 5%,20%。
这是普通的算法性能曲线的规律。
除去可辨别规模上的重大差异,还体目前难(hard)的数据上的辨别率差异。
从算法经验来讲,黑人、女人、孩子、大年龄跨度、遮挡等是较难辨别的群体和类别。
在这类子类上,不同算法之间的性能差异会更大。
超大规模下的测评本身就是一个不简单的学术命题,还需要很多的数据支撑,真的能观测到 20 亿数据下性能的人少之又少,比如美国非常难打造 20 亿级的测试集。
这不是访谈一些人脸辨别研究从业者就能获得,这是误区的第一个来源。
第二方面,算法提升,扩大可辨别规模,就会解锁更多商业应用场景。
百万、千万辨别规模对应的是身份认证场景,远程认证、手机解锁都是此类。
「技术无差异」的论调在这个场景下倒是可以成立。
但安防刑侦破案对亿级和十亿比对有刚性需要,在这类场景下,不是多辨别出几个罪犯的问题,而是找出来概率差别十倍以上的,几乎就是行与不可以的问题。
「非重点性应用」的论断误导性最强。
在最新的安防案例中,万路甚至十万路摄像头视频的人脸搜索、归档对算法有极高需要,假定每路人流为万,要在万路视频中,搜索性能等于需要算法百亿、千亿规模上的可辨别率。
这比其他场景的性能需要再提升千倍。
以不同算法为基础的商品端体验差异就被同比率放大。
另外,全球人种的辨别,是反恐、出入境业务对辨别的覆盖面需要是非常非常高的。
总结来讲,99% 辨别率的算法和 99.99% 的算法,不同在于可解锁的应用场景。
这类新的场景解锁,是最早锋的算法团队和垂直范围的发展者(譬如公安系统的革新团队)一同努力,更不是访谈普通的安防从业者就能感知变革的最前沿,这是误区的另一个来源。
技术水平的三个层次 VIE:Vision(远见),Insight(洞见),Execution(实行)技术实力该怎么样评估比较呢?最容易见到的是测试比赛的冠军、实质案例、招投标 PK 成绩、论文等。
这类可能能区别是否前 10 名的 人工智能 团队,但非常难区别最好的团队。
我对技术的三层解构:Vision,远见,或策略格局、技术趋势判断;Insight,洞见,算法本质和客观世界分布规律的理解;Execution,实行,算法达成、数据获得、工程计算平台等。
具体来讲:最基础的 Execution 就是算法做到什么水平,尤其是大体框架已知后,能迅速达成,包含基础算法、场景数据、计算实验平台、商品应用等。
譬如,AlphaGo 出来后,多快能复现;语音辨别多快能追上全球最好的结果。
顶级的 Execution,不是开源的算法平台可以弥补。
特定范围的专家能帮助团队迅速提升对应范围 Execution 的水平。
这个层面,中国团队应该是世界先进的。
谷歌 若是世界第一的话,不论是下棋、人脸辨别、语音辨别等,中国的水平应该不会比 Facebook、Microsoft、Apple、Amazon 等差,甚至某些方面稍强些。
大部人比较技术,基本就在这个层次。
但更要紧的、威力更大的是上面的两个层次。
再往上一层是 Insight,考察对技术的深刻认知。
包含算法模型的数学讲解、客观世界分布规律的独特理解。
Insight 指导怎么用数据、计算力(就是指导怎么用算法甚至革新算法)。
这层决定能否比 谷歌 做得更好,或者能维持同一进步步伐。
假定拥有深度学习算法框架、大量数据在同样水平,但大伙对算法性能调教还有巨大差距。
以人脸辨别为例,大家用了 2 亿张人脸图片(几十亿张图片的子集)练习,有效模型参数达到 10 亿量级,借助对人脸这个对象的属性先验的合理假设,包含光照、年龄、种族、运动模糊、成像分析度等,模型定制、数据怎么样组合、计算怎么样加速在性能调优和模型学习效率上(就是上面提到的 Execution)都有重大差异。
这就是为何拥有算法、算力、数据条件的网络巨头也不见得能在单项 人工智能 任务上能做到全球前三。
Vision:预测发展势头、概念将来方向,想象对生活、生产的影响。
这除去需要对技术的深刻理解,还需要对技术的革新能力,与技术商业价值的想象力、创造力。
技术的远见,回答 人工智能 的场景在哪与多快到来。
强的 Execution,Insight 一定很好,但可能毫无 Vision;最强的 Vision,Insight 一定一流,但 Execution 可能非常差。
VIE 都非常强的团队全球极其稀缺。
用深度学习范围最强的两位大师 Hinton 和 LeCun 谈一下我的感受。
在 2010 年前,学术界不少人已经在谈云数据对机器学习的重要程度,Hinton 团队 2012 年在 LeCun 创造的算法基础上,用了百万的练习数据,在 ImageNet 上获得世界级的突破性进展;同一时期,LeCun 团队只用了不到十万的数据。
但在 Hinton 公布 ImageNet 结果的头两个月,LeCun 团队没法重现 Hinton 用自己算法的实验结果。
在 Hinton 公布算法达成和方法后,LeCun 团队的结果就轻松超越了 Hinton 团队的水平。
两位大师都拥有超先进的 Vision,在深度学习方向上坚持三十年。
但他们 Vision 的差别与以此带来的信念差别使得 Insight 的差别(是不是追求更深刻见解)在当时可能是巨大的,对深度学习算法发挥的突破条件包含练习数据规模、模型正则化达成、activation function 选取、GPU 计算等的理解还有显著差异。
这类在当时,原理还不了解时,可能完全是凭借 Hinton(包含那一期超强的博士生)的直觉。
这种 Insight 的差距,使得 LeCun 团队已知所用算法框架和目的性能但未知重点达成时,也不可以重现结果。
但之后,LeCun 团队拥有更好的 Execution(大规模系统性调优),能在短期内算法性能超越。
这种最牛高手间信念的微妙差异,到底源自什么,值得深思。
为何 Vision 非常重要?就像雷达,对其他人来讲是盲区,Vision 叫你看见,看见所以相信,相信所以平静。
不只以此获得策略优势,还有定力,排除魅惑和干扰。
Vision 怎么样分辨呢?很难,甚至几乎不可能,只能由同样有 Vision 的人赏析。
就像 taste 很难打分一样,只能由同样有 taste 的人赏析。
Vision 带你看到的,就是 99% 的专家同行都看不到、不相信的。
所以,伟大总是和误解相伴。
LeCun 在深度学习被实质测试数据验证前,也非常难被美国主流学术圈认同,甚至发表顶级会议都不是简单的事,可现在,几乎所有些论文都要贴上深度学习的标签。
但判断过滤没 Vision 的团队,倒是有迹可循。
通常来讲,无论学术还是创业,伟大的突破,都需要多年前后一致的投入和深耕。
隔年换范围或者什么模式都在做的(垂直、平台等),归类为没 Vision 应该没那些问题。
有了 VIE 的拆解,我觉得,人工智能 新年代的壁垒只有人,最顶级的人。
领头羊对 人工智能 技术和商业边界的将来分布判断没办法替代,决定 人工智能 进步基本要点(算法、算力、数据和场景)的所需程度和网站权重。
拥有顶级 Execution 和 Insight 的团队,最了解对算法有效的数据在哪、怎么样标注用。
拥有顶级 Insight 和 Vision 的团队,最早了解技术的突破带来最具商业价值的场景在哪与何时到来。
人工智能 将来:没历史可以借鉴,也没权威可以预测谈了 人工智能 进步,技术怎么样解构,谈谈 人工智能 的将来。
基于深度学习的 人工智能 新年代,大大不一样于 30 年历史上的 人工智能,这是被各种应用、在实质场景、大规模数据验证过性能的技术,而不仅仅是理论或定义。
尽管过去 5 年的进步,对得起大家的期待,今天,还有不少人担忧新 人工智能 像过去一样非常快会退潮。
但我觉得,人工智能 新年代只不过开始。
我从新 人工智能 的三个特质简要讲解:1、人工智能 是全新的维度。
这是非常重要的,决定 人工智能 到底是多大的事。
人工智能 技术怎么样革新进步,怎么样变革商业,没历史可以借鉴,也没权威能准确判断。
人工智能 不止是一个技术,人工智能 突破还能突破所有技术包含人机交互、搜索、机器人、芯片计算、医学、制药等科学范围的几乎所有学科。
2、人工智能 的进步速度快、跳跃性强从 S 曲线中,可以看到过去 5 年,人工智能 的进步及其迅猛,单门类(人脸辨别)算法有了万倍的增长。
但我对将来愈加憧憬,即 S 曲线中 2018 年之后的曲线有多陡。
人工智能 进步带来的多维度技术和各场景深度结合、叠加会带来更有冲击力的体验。
从多技术维度来讲,从视觉,到听觉、语义理解、运动控制会在之后几年都会迅速突破;和芯片结合,端智能渗透到与用户的最后 30 公分的交互体验,从 Internet Of Things 向 Internet Of Intelligence 跨越,让智能无处不在。
3、人工智能 领先一步,会带来巨大势能在 S 曲线中,处在不同地方的团队,优势不仅仅是横轴时间的差距,而是技术领先带来的累积效应(曲线积分)与更多元(多条 人工智能 技术曲线)人工智能 技术的叠加,这使得 人工智能 能有跨行业的摧毁性。
不只决定某个行业,1、和2、的差距或地方关系,还能使得 人工智能 领先的行业的领导者撬动 人工智能 意识落后的行业。
人工智能 将来,独一无二;由于看见,所以相信。




