hive - 解析 json

原創

2020-06-16 12:33

內置函數：get_json_object(json串,解析路徑)

解析路徑說明：

$ :跟對象

. :子對象

[] :數組下標

* :所有

舉例：

數據樣例：

{"movie":"1190","rate":"4.8","timestamp":"978300760","uid":"145325"}

{"movie":"1191","rate":"3.7","timestamp":"978200613","uid":"234566"}

{"movie":"1190","rate":"4.5","timestamp":"977500902","uid":"474532"}

...

將數據導入hive：

create table rating(line string);#建表，只有一列數據 load data local inpath '/user/rating.json' into table rating;#從本地導數據

1)求評分次數排名前3的電影

SELECT get_json_object(t.line, '$.movie') as movieid, count(*) as tatol FROM rating t GROUP BY 1 ORDER BY 2 LIMIT 3;

t.line是要解析的json串，
$定位到第一級目錄{
.定位到第二級目錄"movie":"1190","rate":"4.8","timestamp":"978300760","uid":"145325"
movie：通過key定位到value值1190

2)將整個json文件解析成一張表

1)建一個用於存放數據的表

create table rate(movie int,rate float,time bigint,uid bigint);

2)解析並加載數據

insert into table rate select get_json_object(t.line, '$.movie') as movie, get_json_object(t.line, '$.rate') as rate, get_json_object(t.line, '$.timestamp') as time, get_json_object(t.line, '$.uid') as uid FROM rating t;

3)解析較複雜json

{

"status": 0,

"data": {"search_data":[{

"name": "奈良市",

"location": {

"lat": 34.685087

}]

}

1-解析status

get_json_object(t.line, '$.status');

2-解析name

get_json_object(t.line, '$.data.search_data.[0].name');

3-解析lat

get_json_object(t.line, '$.data.search_data.[0].location.lat');

發表評論

所有評論

還沒有人評論，想成為第一個評論的人麼? 請在上方評論欄輸入並且點擊發布.

相關文章

Hive特殊的數據類型：Array，Map，Struct

1、Array #創建一張包含array字段的表，array字段的分割符采用的是逗號 create table hive_array( name string, work_locations array<string> ) ROW

2020-07-06 17:07:03

presto搭建

1.Presto簡介 Presto是由Facebook開源，完全基於內存的並行計算以及分佈式SQL交互式查詢引擎。它可以共享Hive的元數據，然後直接訪問HDFS中的數據，同時支持Hadoop中常見的文件格式比如文本，ORC

2022-12-19 09:37:36

有哪些大數據處理工具？

雲棲號資訊：【點擊查看更多行業資訊】在這裏您可以找到不同行業的第一手的上雲資訊，還在等什麼，快來！阿里妹導讀：近幾年裏，大數據行業發展勢頭迅猛，故而相應的分佈式產品和架構層出不窮，本文分享作者在大數據系統實踐過程中接觸過的一些工具及使

雲棲號資訊小編

2020-07-22 12:37:48

Flink 1.11.0 發佈，有哪些值得關注的新特性？

雲棲號資訊：【點擊查看更多行業資訊】在這裏您可以找到不同行業的第一手的上雲資訊，還在等什麼，快來！阿里妹導讀：7 月 7 日，Flink 1.11.0 正式發佈。歷時近 4 個月，Flink 在生態、易用性、生產可用性、穩定性等方面都

雲棲號資訊小編

2020-07-14 11:49:59

Apache Hive+Kerberos安裝配置及 Kettle訪問帶 Kerberos 認證的 Hive的集成

目錄1 連接2 KDC 安裝2.1 安裝 Kerberos 服務2.2 配置 /var/kerberos/krb5kdc/kdc.conf2.3 配置 /var/kerberos/krb5kdc/kadm5.acl2.4 配置 /

2020-07-08 09:55:10

hive鎖的問題

hive鎖的問題最近在insert into 插入數據的時候遇到了hive鎖表的問題，下面是報錯信息，原因就是一張hive的臨時表被鎖造成報錯。 1.Hive中定義了兩種鎖的模式：共享鎖（S）和排它鎖（X），顧名思義，多個共

2020-07-08 09:11:58

Hive批量刪除一段時間分區和動態分區更新數據

Hive批量刪除一段時間分區和動態分區更新數據 1.hive動態分區 -- 批量刪除分區數據 alter table dm.dm_call_gateway_bill_time_detail drop partition(dt >=

2020-07-08 09:11:58

HIVE 權限配置 [沒有趟過坑的人生是不完美的]

這兩天被hive的權限問題,折騰的不輕.記錄一下 Hive的基本配置我就不細說了,自行配置,網上一堆堆的. 1.背景要求可以使用hdfs和hive用戶操作自己創建的數據庫. 權限不可亂. 要求,如下,[基本就是裸奔,沒做任何配置,但依舊

2020-07-08 02:23:22

Hive管理表和外部表的區別

前言：所謂外部表，就是Hive並非認爲其完全擁有這份數據。刪除該表並不會刪除掉這份數據，不過描述表的元數據信息會被刪除掉。關於Hive數據倉庫的管理表（MANAGED_TABLE）和外部表（EXTERNAL_TABLE）的區別，

情深不仅李义山

2020-07-08 01:13:18

hive，order by ,distribute by ,sort by ,cluster by 區別，作用，用法

0 order by 是全局排序，把所有數據放在一個reduce task中排序。sort by是在一個reduce中排序，該reduce的輸出有序，是局部有序。distriute by c1 是作用於map輸出的結果，把c1的值相同的記

二十六画生的博客

2020-07-07 23:55:04

Hive的SQL編譯源碼詳解

看圖完事：

2020-07-07 13:47:42

Hive內嵌字符處理函數：get_json_object，parse_url

1.Hive內嵌函數對Json字符和網址的解析處理 Return Type Name(Signature) Description string parse_url(string urlString, string par

2020-07-07 03:36:37

Hql取上週、上月、上季度、去年第一天和最後一天

上週一： select date_sub(current_date(),pmod(datediff(cast(current_date() as string),'2000-01-03'),7)+7) 上週日： select d

太和վ'ᴗ' ի

2020-07-07 01:50:27

分區太多引起的內存溢出

執行一個hive sql時報了一個下面的錯誤，從錯誤堆棧上來看，是在SQL編譯、解析、優化過程中出的錯，還沒有提交到YARN上執行。從Utilities.getPartitionDesc這句來看是優化的時候，在讀取分區信息時出現

2020-07-06 23:41:40

hive窗口函數（V1.0）

推薦大家去看原文博主的文章，條理清晰閱讀方便，轉載是爲了方便以後個人查閱 https://www.jianshu.com/p/12eaf61cf6e1 一：前言根據官網的介紹，hive推出的窗口函數功能是對hive sql的功能增強，確

2020-07-06 21:58:57

24小時熱門文章

最新文章

最新評論文章