SQL 执行顺序

所有的查询语句都是从 from 开始执行的,在执行过程中,每个步骤都会为下一个步骤生成一个虚拟表,这个虚拟表将作为下一个执行步骤的输入。
第一步:首先对 from 子句中的前两个表执行一个笛卡尔乘积,此时生成虚拟表 vt1(选择相对小的表做基础表)

第二步:接下来便是应用 on 筛选器,on 中的逻辑表达式将应用到 vt1 中的各个行,筛选出满足 on 逻辑表达式的行,生成虚拟表 vt2

第三步:如果是 outer join 那么这一步就将添加外部行,left outer jion 就把左表在第二步中过滤的添加进来,如果是 right outer join 那么就将右表在第二步中过滤掉的行添加进来,这样生成虚拟表 vt3

第四步:如果 from 子句中的表数目多余两个表,那么就将 vt3 和第三个表连接从而计算笛卡尔乘积,生成虚拟表,该过程就是一个重复 1-3 的步骤,最终得到一个新的虚拟表 vt3

第五步:应用 where 筛选器,对上一步生产的虚拟表引用 where 筛选器,生成虚拟表vt4

注意:对于包含 outer join 子句的查询,到底在 on 筛选器还是用 where 筛选器指定逻辑表达式呢?
on 和 where 的最大区别在于,如果在 on 应用逻辑表达式那么在第三步 outer join 中还可以把移除的行再次添加回来,而 where 的移除的最终的。
举个简单的例子:
有一个学生表(班级,姓名)和一个成绩表(姓名,成绩),我现在需要返回一个 x 班级的全体同学的成绩,但是这个班级有几个学生缺考,也就是说在成绩表中没有记录。
为了得到我们预期的结果我们就需要在 on 子句指定学生和成绩表的关系(学生.姓名=成绩.姓名)
那么我们是否发现在执行第二步的时候,对于没有参加考试的学生记录就不会出现在 vt2 中,因为他们被 on 的逻辑表达式过滤掉了
但是我们用 left outer join 就可以把左表(学生)中没有参加考试的学生找回来,因为我们想返回的是 x 班级的所有学生
如果在 on 中应用学生.班级=’x’的话,left outer join 会把 x 班级的所有学生记录找回
所以只能在 where 筛选器中应用学生.班级=’x’ 因为它的过滤是最终的。
总结: 最终过滤条件放在 where 语句中,on 语句做数据匹配不要做筛选!!!

第六步:group by 子句将中的唯一的值组合成为一组,得到虚拟表vt5。如果应用了 group by,那么后面的所有步骤都只能得到的 vt5 的列或者是聚合函数(count、sum、avg 等)。(原因在于最终的结果集中只为每个组包含一行

第七步:应用 cube 或者 rollup 选项,为 vt5 生成超组,生成vt6

  • ROLLUP:是 GROUP BY 子句的一种扩展,可以为每个分组返回小计记录以及为所有分组返回总计记录。
  • CUBE:也是 GROUP BY 子句的一种扩展,可以返回每一个列组合的小计记录,同时在末尾加上总计记录。

第八步:应用 having 筛选器,生成vt7。having 筛选器是第一个也是为唯一一个应用到已分组数据的筛选器

第九步:处理 select 子句。将 vt7 中的在 select 中出现的列筛选出来。生成vt8

第十步:应用 distinct 子句,vt8 中移除相同的行,生成vt9

注意:如果应用了 group by 子句那么 distinct 是多余的,原因同样在于分组的时候是将列中唯一的值分成一组,同时只为每一组返回一行记录,那么所以的记录都将是不相同的

第十一步:应用 order by 子句。按照 order_by_condition 排序 vt9,此时返回的一个游标,而不是虚拟表

游标:sql 是基于集合的理论的,集合不会预先对他的行排序,它只是成员的逻辑集合,成员的顺序是无关紧要的。对表进行排序的查询可以返回一个对象,这个对象包含特定的物理顺序的逻辑组织。这个对象就叫游标。正因为返回值是游标,那么使用 order by 子句查询不能应用于表表达式。排序是很需要成本的,除非你必须要排序,否则最好不要指定 order by,最后,在这一步中是第一个也是唯一一个可以使用 select 列表中别名的步骤。

第十二步:返回结果给请求者即用户