transform呼叫指令碼

2021-10-03 21:58:14 字數 1631 閱讀 1115

hive專欄

主目錄【前言】

在使用hive處理資料時,除了可以使用內建函式、使用者自定義函式udf,還可以使用hql呼叫指令碼,這種呼叫指令碼的方式由hive的 transform 關鍵字提供。

乙個例項

json資料:

需求:把timestamp的值轉換成日期編號

先載入rating.json檔案到hive的乙個原始表 rate_json

create table rate_json(line string) row format delimited;  

load data local inpath '/home/hadoop/rating.json' into table rate_json;

建立rate這張表用來儲存解析json出來的字段
create  table  rate(movie  int,  rate  int,  unixtime  int,  userid  int)  row  format  delimited  fields  terminated by '\t';
insert into table rate select   

get_json_object(line,'$.movie') as movie,

get_json_object(line,'$.rate') as rate,

get_json_object(line,'$.timestamp') as unixtime, get_json_object(line,'$.uid') as userid

from rate_json;

使用transform+python指令碼的方式去轉換unixtime為weekday

建立最後的用來儲存呼叫python指令碼解析出來的資料的表:lastjsontable

create table lastjsontable(movie int, rate int, weekday int, userid int) row format delimited  fields terminated by '\t';

#!/bin/python  

import sys

import datetime

for line in sys.stdin:

line = line.strip()

movie,rate,unixtime,userid = line.split('\t')

weekday = datetime.datetime.fromtimestamp(float(unixtime)).isoweekday()

print '\t'.join([movie, rate, str(weekday),userid])

儲存檔案 。然後,將檔案加入hive的classpath:

最後查詢看資料是否正確:

select distinct(weekday) from lastjsontable;

shell指令碼中呼叫其他指令碼

目前來說有三種方法 1.指令碼絕對路徑 這個方式是最普通的,底層呼叫的是fork實現,執行的時候開乙個子shell執行呼叫的指令碼,子shell執行的時候,父shell還在 子shell執行完畢後返回父shell,子shell從父shell繼承環境變數,但是子shell中的環境變數不會帶回父shel...

Linux指令碼中呼叫SQL,RMAN指令碼

linux unix shell指令碼中呼叫或執行sql,rman 等為自動化作業以及多次反覆執行提供了極大的便利,因此通過linux unix shell來完成oracle的相關工作,也是dba必不可少的技能之一。本文針對linux unix shell指令碼呼叫sql,rman 指令碼給出了相關...

Python 呼叫shell指令碼

python呼叫shell指令碼,有兩種方法 os.system cmd 或os.popen cmd 前者返回值是指令碼的退出狀態碼,後者的返回值是指令碼執行過程中的輸出內容。實際使用時視需求情況而選擇。現假定有乙個shell指令碼test.sh bin bash 1.echo hello worl...