【Impala】使用 SQL

545 阅读3分钟

这是我参与11月更文挑战的第22天,活动详情查看:2021最后一次更文挑战

一、数据库语句

  1. 创建数据库

默认就会在 hive 的数仓路径下创建新的数据库名文件夹

-- CREATE DATABASE 语句用于在 Impala 中创建新数据库。
-- CREATE DATABASE IF NOT EXISTS database_name;
  1. 删除数据库

ImpalaDROP DATABASE 语句句用于从 Impala 中删除数据库。 在删除数据库之前, 建议从中删除所有表。 如果使用级联删除, Impala 会在删除指定数据库中的表之前删除它。

drop database sample cascade;

二、表特定语句

  1. create table 语句

CREATE TABLE 语句用于在 Impala 中的所需数据库中创建新表。 需要指定表名字并定义其列和每列的数据类型。 impala 支持的数据类型和 hive 类似。 默认建表的数据存储路路径跟 hive 一致, 也可以在建表的时候通过 location 指定具体路径。

create table IF NOT EXISTS database_name.table_name (
column2 data_type,
column3 data_type,
.........
column1 data_type,
columnN data_type);

CREATE TABLE IF NOT EXISTS my_db.student(name STRING, age INT, contact INT );
  1. insert 语句

ImpalaINSERT 语句有两个子句: intooverwriteinto 用于插入新记录数据, overwrite 用于覆盖已有的记录。

insert into table_name (column1, column2, column3,...columnN)
values (value1,value2, value3,...valueN);

insert into table_name values (value1, value2, value2);
  1. select 语句
select * from t1;
  1. describe 语句

Impala 中的 describe 语句用于提供表的描述。 此语句的结果包含有关表的信息, 例如列名称及其数据类型。

describe table_name;

desc table_name;
  1. alter table

Impala 中的 alter table 语句用于对给定表执行更改。 使用此语句, 可以添加, 删除或修改现有表中的列, 也可以重命名它们。 参考 Hive 实现。

  1. delete、truncate table

Impala drop table 语句用于删除 Impala 中的现有表。 此语句还会删除内部表的底层 HDFS 文件。 注意:使用此命令时必须小心, 因为删除表后, 表中可用的所有信息也将永远丢失。

drop table database_name.table_name;

ImpalaTruncate Table 语句用于从现有表中删除所有记录。 保留表结构。

truncate table_name;
  1. view 视图

视图仅仅是存储在数据库中具有关联名称的 Impala 查询语言的语句。 它是以预定义的 SQL 查询形式的表的组合。 视图可以包含表的所有行或选定的行。

-- 创建视图view、查询视图view
create view if not exists view_name as select statement;

create view if not exists employee_view AS select name, age from employee;


-- 修改视图
alter view database_name.view_name as Select语句

-- 删除视图
drop view database_name.view_name;
  1. order by 子句

Impala ORDER BY 子句用于根据一个或多个列以升序或降序对数据进行排序。 默认情况下, 一些数据库按升序对查询结果进行排序。

select * from table_name ORDER BY col_name
[ASC|DESC] [NULLS FIRST|NULLS LAST]

可以使用关键字 ASCDESC 分别按升序或降序排列表中的数据。 如果使用 NULLS FIRST ,表中的所有空值都排列列在顶行; 如果使用 NULLS LAST , 包含空值的行将最后排列。

  1. group by 子句

Impala GROUP BY 子句与 SELECT 语句协作使用, 以将相同的数据排列到组中。

select name, sum(salary) from employee group by name;
  1. having 子句

容易与 where 过滤进行混淆。 如何区分: where : 过滤的数据是原始数据,表中本来就存在的数据; having : 过滤的是查询结果数据; 按年龄对表进行分组, 并选择每个组的最大工资, 并显示大于20000的工资

select max(salary) from employee group by age having max(salary) > 20000;
  1. limit、offset

Impala 中的 limit 子句用于将结果集的行数限制为所需的数, 即查询的结果集不包含超过指定限制的记录。 一般来说, select 查询的 resultset 中的行从0开始。 使用 offset 子句, 可以决定从哪里考虑输出。

select * from employee order by salary limit 2 offset 2;