研究怎么让电脑认识图片里的东西。这个问题很多人关心。电脑现在到处都有。手机是电脑。汽车里有电脑。工厂机器上也有电脑。这些电脑需要看懂周围的世界。它们看世界主要靠摄像头。摄像头拍下来就是图片。让电脑理解图片内容,这就是我们的研究。
图片就是很多小点。这些小点有不同的颜色。电脑一开始只知道这些小点的颜色。它不知道这些小点合起来是什么。比如一张猫的图片。电脑看到的是许多黄色、黑色、白色的小点。它不知道这是一只猫。我们的研究就是教电脑从这些小点里看出猫来。
我们想出的办法是让电脑自己学习。我们给电脑看很多很多图片。有的图片里有猫。我们告诉电脑这张图里有猫。有的图片里没有猫。我们也告诉电脑这张图里没有猫。电脑看多了,自己就能找出规律。电脑会记住猫的图片里那些小点大概怎么排列。电脑会记住猫有圆脸,有尖耳朵,有长长的胡子。再看新的图片时,电脑就去比对。如果新图片里的小点排列和它记住的猫的排列很像,电脑就说这是猫。
这个办法听起来简单。做起来很难。因为猫的样子太多了。有的猫是黄的。有的是黑的。有的猫躺着。有的猫跳起来。有的猫只拍到半边脸。光线亮一点,暗一点,图片的样子就变了。我们要让电脑在各种情况下都能认出猫。
我们研究的一个主要内容是怎么让电脑学得更快更好。以前电脑要学很多很多天。要用很贵的机器。我们想办法让电脑学一天就能认识猫。我们想办法让普通的电脑也能学。我们改变电脑学习的方法。我们调整电脑看图片的方式。电脑不再傻傻地看每一个小点。电脑先看图片里大的轮廓。再看细节。这样电脑学得快,认得也准。
研究还有一个内容是怎么让电脑不只认识猫。现实世界里东西太多了。我们要电脑认识狗,认识车,认识树,认识人,认识路标。我们给电脑看更多种类的图片。每张图片都标上名字。电脑慢慢学习这些东西的区别。猫和狗不一样。车和树也不一样。电脑学会了给图片分类。看到新图片,电脑能说出里面是什么。
我们还要让电脑看懂图片里在发生什么事。图片里不止有一个东西。东西和东西之间有关系。一个人手里拿着球。这个人在扔球。一只猫在追一个毛线团。车停在房子前面。这些是图片里的故事。我们教电脑看这些东西的位置。教电脑看这些东西的动作。电脑慢慢能看懂简单的故事。电脑能说出“小孩在骑车”或者“鸟在天上飞”。
我们的研究目标很明确。第一个目标是准确。电脑认东西要尽量少出错。不能把猫说成狗。不能把行人说成树。准确是最重要的。第二个目标是快。电脑要在很短时间里给出答案。汽车上的电脑认出前面是行人,必须马上告诉汽车刹车。慢了就出事故。手机拍照,点了就能认出花草的名字,等太久人就没耐心了。
第三个目标是让电脑能在小设备上工作。不是所有电脑都很大很贵。手表很小。手机要干很多别的事。我们要让这些小设备也能有认图片的本事。我们想办法把认图片的程序变小。让它不需要太多电。这样普通人用起来才方便。
我们做很多实验。实验就是测试我们的办法好不好。我们找很多图片。有些图片很简单。有些图片很乱,很多东西挤在一起。我们把图片给电脑看。记录电脑说得对不对。记录电脑用了多少时间。我们根据结果调整办法。电脑说错了,我们就想想为什么错。是光线问题?还是东西挡住了?我们改进学习的方法。让电脑下次遇到类似的能说对。
研究的过程很慢。需要试很多次。今天一个办法好一点。明天可能又发现新问题。我们看别人是怎么做的。学习别人的好主意。结合我们自己的想法。做出新的尝试。
这个研究很有用。它能帮盲人。手机摄像头看到路,告诉盲人前面有台阶。它能帮医生。电脑看片子,帮医生发现病人身体里的问题。它能帮农民。无人机拍下田地的照片,电脑看出哪块地缺水,哪块地有虫子。它能帮开车的人。电脑认出路上的车和行人,提醒司机注意安全。
我们的研究就是做这些事。想办法。做实验。改进。让电脑的眼睛变得更亮。让电脑更懂我们看见的世界。这就是我们每天在做的工作。很简单,也很复杂。需要耐心,也需要新想法。目标就是让机器更好地帮助人。