怎么在Python中實(shí)現(xiàn)HIVE的UDF函數(shù)

本篇文章給大家分享的是有關(guān)怎么在Python中實(shí)現(xiàn)HIVE的UDF函數(shù)，小編覺(jué)得挺實(shí)用的，因此分享給大家學(xué)習(xí)，希望大家閱讀完這篇文章后可以有所收獲，話(huà)不多說(shuō)，跟著小編一起來(lái)看看吧。

為和田縣等地區(qū)用戶(hù)提供了全套網(wǎng)頁(yè)設(shè)計(jì)制作服務(wù)，及和田縣網(wǎng)站建設(shè)行業(yè)解決方案。主營(yíng)業(yè)務(wù)為做網(wǎng)站、網(wǎng)站建設(shè)、和田縣網(wǎng)站設(shè)計(jì)，以傳統(tǒng)方式定制建設(shè)網(wǎng)站，并提供域名空間備案等一條龍服務(wù)，秉承以專(zhuān)業(yè)、用心的態(tài)度為用戶(hù)提供真誠(chéng)的服務(wù)。我們深信只要達(dá)到每一位用戶(hù)的要求，就會(huì)得到認(rèn)可，從而選擇與我們長(zhǎng)期合作。這樣，我們也可以走得更遠(yuǎn)！

簡(jiǎn)單來(lái)做個(gè)介紹

select * from(select * from table where dt='2021-03-30')a

可以寫(xiě)成

with a as (select * from table where dt='2021-03-30' ) select * from a

簡(jiǎn)單的SQL看不出這樣的優(yōu)勢(shì)(甚至有點(diǎn)多此一舉)，但是當(dāng)邏輯復(fù)雜了之后我們就能看出這種語(yǔ)法的優(yōu)勢(shì)，他能從底層抽取中間表格，讓我們只專(zhuān)注于當(dāng)前使用的表格，進(jìn)而可以將復(fù)雜的處理邏輯分解成簡(jiǎn)單的步驟。

如下面地表格記錄了用戶(hù)適用app過(guò)程中每個(gè)行為日志地時(shí)間戳，我們想統(tǒng)計(jì)一下用戶(hù)今天用了幾次app，以及每次的起始時(shí)間和結(jié)束時(shí)間是什么時(shí)候，這個(gè)問(wèn)題怎么解呢?

怎么在Python中實(shí)現(xiàn)HIVE的UDF函數(shù)

SQL實(shí)現(xiàn)方式

首先用with as 構(gòu)建一個(gè)中間表(注意看on 和 where條件)

with t1 as (select x.uid, case when x.rank=1 then y.timestamp_ms else x.timestamp_ms end as start_time, case when x.rank=1 then x.timestamp_ms else y.timestamp_ms end as end_time from (select uid, timestamp_ms, row_number()over(partition by uid order by timestamp_ms) rank from tmp.tmpx) x left outer join (select uid, timestamp_ms, row_number()over(partition by uid order by timestamp_ms) rank from tmp.tmpx) y on x.uid=y.uid and x.rank=y.rank-1 where x.rank=1 or y.rank is null or y.timestamp_ms-x.timestamp_ms>=300)

首先我們用開(kāi)窗函數(shù)錯(cuò)位相減，用where條件篩選出我們需要的列，其中

x.rank=1 抽取出第一行

y.rank is null 抽取最后一樣

y.timestamp_ms-x.timestamp_ms>=300抽取滿(mǎn)足條件的行，如下：

怎么在Python中實(shí)現(xiàn)HIVE的UDF函數(shù)

當(dāng)然這個(gè)結(jié)果并不是我們要的結(jié)果，需要將上述表格中某一行數(shù)據(jù)的end-time和下一條數(shù)據(jù)的start-time結(jié)合起來(lái)起來(lái)，構(gòu)造出時(shí)間段

怎么在Python中實(shí)現(xiàn)HIVE的UDF函數(shù)

好的，按照上面我們所說(shuō)的那么下面我們不用關(guān)心底層的邏輯，將注意力專(zhuān)注于這張中間表t1

select a.uid,end_time as start_time,start_time as end_time from (select uid,start_time,row_number()over(partition by uid order by start_time) as rank from t1) a join (select uid,end_time,row_number()over(partition by uid order by end_time) as rank from t1)b on a.uid=b.uid and a.rank=b.rank+1

同樣，排序后錯(cuò)位相減，然后就可以打完收工了~

UDF實(shí)現(xiàn)方式

首先我們假設(shè)上述數(shù)據(jù)存儲(chǔ)在csv中，

用python 處理本地文件data.csv，按照python的處理方式寫(xiě)代碼(這里就不一句句解釋了，會(huì)python的同學(xué)可以跳過(guò)，不會(huì)的同學(xué)不妨自己動(dòng)手寫(xiě)一下)

def life_cut(files): f=open(files) act_list=[] act_dict={} for line in f:     line_list=line.strip().split()     key=tuple(line_list[0:1])     if key not in act_dict:         act_dict.setdefault(key,[])         act_dict[key].append(line_list[1])     else:         act_dict[key].append(line_list[1])  for k,v in act_dict.items():     k_str=k[0]+"\t"     start_time = v[0]     last_time=v[0]     i=1     while i<len(v)-1:         if int(v[i])-int(last_time)>=300:             print(k_str+"\t"+start_time+"\t"+v[i-1])             start_time=v[i]             last_time = v[i]             i=i+1         else:             last_time = v[i]             i=i+1     print(k_str+"\t"+start_time+"\t"+v[len(v)-1])     # print(k_str + "\t" + start_time + "\t" + v[i]) if __name__=="__main__": life_cut("data.csv")

得到結(jié)果如下：

那么下面我們將上述函數(shù)寫(xiě)成udf的形式：

#!/usr/bin/env python # -*- encoding:utf-8 -*- import sys act_list=[] act_dict={} for line in sys.stdin: line_list=line.strip().split("\t") key=tuple(line_list[0:1]) if key not in act_dict:     act_dict.setdefault(key,[])     act_dict[key].append(line_list[1]) else:     act_dict[key].append(line_list[1])  for k,v in act_dict.items(): k_str=k[0]+"\t" start_time = v[0] last_time=v[0] i=1 while i<len(v)-1:     if int(v[i])-int(last_time)>=300:       print(k_str+"\t"+start_time+"\t"+v[i-1])       start_time=v[i]       last_time = v[i]       i=i+1     else:       last_time = v[i]       i=i+1 print(k_str+"\t"+start_time+"\t"+v[len(v)-1])

這個(gè)變化過(guò)程的關(guān)鍵點(diǎn)是將 for line in f 替換成 for line in sys.stdin，其他基本上沒(méi)什么變化

然后我們?cè)賮?lái)引用這個(gè)函數(shù)

先add這個(gè)函數(shù)的路徑add file /xxx/life_cut.py 加載udf路徑，然后再使用

select TRANSFORM (uid,timestamp_ms) USING "python life_cut.py" as (uid,start_time,end_time) from tmp.tmpx

以上就是怎么在Python中實(shí)現(xiàn)HIVE的UDF函數(shù)，小編相信有部分知識(shí)點(diǎn)可能是我們?nèi)粘９ぷ鲿?huì)見(jiàn)到或用到的。希望你能通過(guò)這篇文章學(xué)到更多知識(shí)。更多詳情敬請(qǐng)關(guān)注創(chuàng)新互聯(lián)行業(yè)資訊頻道。

新聞標(biāo)題：怎么在Python中實(shí)現(xiàn)HIVE的UDF函數(shù)
URL地址：http://chinadenli.net/article44/ihgihe.html

成都網(wǎng)站建設(shè)公司_創(chuàng)新互聯(lián)，為您提供建站公司、網(wǎng)站改版、云服務(wù)器、App設(shè)計(jì)、網(wǎng)頁(yè)設(shè)計(jì)公司、網(wǎng)站設(shè)計(jì)公司

聲明：本網(wǎng)站發(fā)布的內(nèi)容（圖片、視頻和文字）以用戶(hù)投稿、用戶(hù)轉(zhuǎn)載內(nèi)容為主，如果涉及侵權(quán)請(qǐng)盡快告知，我們將會(huì)在第一時(shí)間刪除。文章觀點(diǎn)不代表本網(wǎng)站立場(chǎng)，如需處理請(qǐng)聯(lián)系客服。電話(huà)：028-86922220；郵箱：631063699@qq.com。內(nèi)容未經(jīng)允許不得轉(zhuǎn)載，或轉(zhuǎn)載時(shí)需注明來(lái)源：創(chuàng)新互聯(lián)

猜你還喜歡下面的內(nèi)容

欧美一区二区三区老妇人-欧美做爰猛烈大尺度电-99久久夜色精品国产亚洲a-亚洲福利视频一区二区

怎么在Python中實(shí)現(xiàn)HIVE的UDF函數(shù)

SQL實(shí)現(xiàn)方式

UDF實(shí)現(xiàn)方式