教育影响收入。人们都知道读书有用。读书时间长的人挣钱更多。这个现象到处都能看到。我们需要证明它。我们收集数据。我们观察现实。我们用数字说话。这是实证分析。
我们首先提出问题。多上一年学会多挣多少钱?这个问题很简单。但是答案很重要。学生需要知道。家长需要知道。政府需要知道。大家关心教育回报。我们想知道精确的数字。
我们开始找数据。数据来自生活。我们调查一些人。我们问他们上了几年学。我们问他们挣多少钱。我们记录他们的年龄。我们记录他们的工作类型。我们记录他们的居住地点。我们收集很多信息。每个人情况不同。数据有高有低。我们得到一张大表格。表格里全是数字。
数字不会直接说话。我们需要整理它们。我们清洗数据。有人上学年限填错了。我们改正它。有人收入特别高。我们检查是否真实。我们去掉不可靠的信息。我们确保数据干净。干净的数据才可信。
我们观察这些数字。受教育年限长的人收入高。这个趋势很明显。但是年龄也影响收入。年纪大的人经验多。经验多收入也高。城市工作收入高。农村工作收入低。男人和女人收入不同。我们看到的差别不全是教育造成的。我们需要排除其他影响。
我们建立一个模型。模型是数学公式。它像一把尺子。我们用它测量教育的影响。模型里收入是结果。我们用字母Y代表收入。教育是原因。我们用字母S代表上学年数。年龄也影响收入。我们用字母A代表年龄。性别也影响收入。我们用字母G代表性别。还有很多因素。我们把它们都放进模型。
模型写出来是这样的:收入=a b×教育年数 c×年龄 d×性别 … 误差。字母b最重要。它表示教育回报率。如果b等于0.1,意思就是多上一年学,收入增加10%。我们想算出b是多少。
我们开始计算。电脑帮助我们。我们把数据输入电脑。电脑运行模型。电脑告诉我们结果。我们得到b的数字。比如b是0.08。这意味着教育回报率是8%。多读一年书,平均多挣8%的钱。这个数字有意义。它回答了我们的问题。
数字算出来不代表结束。我们要检验它。这个数字可靠吗?我们检查几个问题。第一个问题是因果关系。是教育提高了收入吗?会不会是收入高的家庭更愿意让孩子上学?我们想办法区分。我们寻找工具变量。比如义务教育法。法律规定孩子必须上学。这个法律影响教育年限。但它不直接影响收入。我们用这个法律作为工具。它帮我们看清真正的因果。
第二个问题是遗漏变量。有些人能力强。能力强的人上学时间长。能力强的人收入也高。我们的数据可能没记录能力。如果遗漏了能力,b就被高估了。我们想办法控制能力。我们用考试成绩代表能力。我们用兄弟姐妹的数据作比较。我们尽力减少误差。
第三个问题是测量误差。人们可能记错上学年数。人们可能说错收入。这种误差会让b变小。我们使用更准确的数据。我们查看学校记录。我们查看税务信息。我们让测量更精确。
我们做很多检验。我们换不同的模型。我们用不同的数据子集。我们比较不同国家的结果。我们比较不同年代的结果。结果稳定吗?如果b总是接近0.08,我们就更相信它。如果b变来变去,我们就需要小心。
我们得到最终结论。在当前的中国社会,多受一年教育,平均回报率约为8%。这个数字不是绝对的。它对年轻人更高。它对高等教育更高。它在城市更高。它在快速发展的行业更高。但它总体是正的。教育是有价值的投资。
这个结论有用。学生看到这个数字,会更坚定学习的信心。家长看到这个数字,会更愿意支持孩子上学。政府看到这个数字,会明白教育投入值得。社会需要更多受教育的人。
实证分析结束了。它的过程很清楚。提出具体问题。收集现实数据。建立简单模型。计算关键数字。检验各种问题。报告可靠结论。它用最直接的方式探寻真理。它依靠证据,不靠感觉。它用普通的数据,得出有用的知识。这就是实证分析的力量。它把“读书有用”这句话,变成了“多读一年书,收入增加8%”这样一个清晰的数字。