hivesql 谓词下推 
时间: 2023-03-10 16:54:50 浏览: 60
HiveSQL 谓词下推是在 HiveSQL 查询执行过程中的一种优化技术。它的目的是通过将谓词(如 WHERE 子句中的条件)尽早地下推到数据源(如 HDFS 文件或 HBase 表)进行过滤,减少数据传输量和计算量,提高查询性能。
相关问题
hive sql 谓词下推
谓词下推是指在Hive中,尽量将过滤条件提前执行,使得最后参与join的表的数据量更小,从而减少数据传输IO,节约资源,提升性能。无论在Hive中是否开启了CBO(Cost-Based Optimizer),无论谓词写在ON后面还是WHERE后面,内连接(Inner Join)都会进行谓词下推。
在Hive中,谓词下推也称为Predicate Pushdown。它的实现方式是在map端提前执行过滤条件,减少map端的输出数据量。这样可以减少数据的传输和IO操作,提高查询性能。默认情况下,Hive会开启谓词下推,可以通过配置hive.optimize.ppd参数为true来开启或关闭谓词下推功能。
另外,在Hive中,如果在JOIN中有不能匹配上的表,则会使用null填充该表,这个表被称为Null Supplying Table。它是一种非保留表,用于提供null值。
综上所述,Hive SQL中的谓词下推是指在不影响结果的前提下,尽量将过滤条件提前执行,减少数据传输IO,节约资源,提升性能的优化技术。<span class="em">1</span><span class="em">2</span><span class="em">3</span>
#### 引用[.reference_title]
- *1* *2* *3* [一文详解Hive的谓词下推](https://blog.csdn.net/java_atguigu/article/details/123064220)[target="_blank" data-report-click={"spm":"1018.2226.3001.9630","extra":{"utm_source":"vip_chatgpt_common_search_pc_result","utm_medium":"distribute.pc_search_result.none-task-cask-2~all~insert_cask~default-1-null.142^v93^chatsearchT3_2"}}] [.reference_item style="max-width: 100%"]
[ .reference_list ]
hive中的谓词下推
Hive中的谓词下推是一种优化技术,它可以减少数据的读取量,并提高查询性能。在Hive中,谓词下推是指将过滤条件(谓词)应用到数据源上,以减少不必要的数据读取。
当执行查询时,Hive会将查询语句转换为MapReduce作业,并扫描数据源以满足查询条件。在没有谓词下推的情况下,Hive会将整个数据源读取到内存中,然后应用过滤条件进行筛选。这种方式会导致大量的数据读取和处理,降低查询性能。
而使用谓词下推,Hive可以在读取数据之前将过滤条件下推到数据源层面。这样,Hive只会读取满足条件的数据,减少了不必要的数据读取和处理。谓词下推可以应用于多种操作,如筛选、投影和连接等,以提高查询性能。
总而言之,Hive中的谓词下推是一种优化技术,通过将过滤条件下推到数据源层面,减少不必要的数据读取和处理,从而提高查询性能。
相关推荐















