欧美一区二区三区老妇人-欧美做爰猛烈大尺度电-99久久夜色精品国产亚洲a-亚洲福利视频一区二区

怎么在Python中實現(xiàn)HIVE的UDF函數(shù)

本篇文章給大家分享的是有關怎么在Python中實現(xiàn)HIVE的UDF函數(shù),小編覺得挺實用的,因此分享給大家學習,希望大家閱讀完這篇文章后可以有所收獲,話不多說,跟著小編一起來看看吧。

為和田縣等地區(qū)用戶提供了全套網(wǎng)頁設計制作服務,及和田縣網(wǎng)站建設行業(yè)解決方案。主營業(yè)務為做網(wǎng)站、網(wǎng)站建設、和田縣網(wǎng)站設計,以傳統(tǒng)方式定制建設網(wǎng)站,并提供域名空間備案等一條龍服務,秉承以專業(yè)、用心的態(tài)度為用戶提供真誠的服務。我們深信只要達到每一位用戶的要求,就會得到認可,從而選擇與我們長期合作。這樣,我們也可以走得更遠!

簡單來做個介紹

select * from(select * from table where dt='2021-03-30')a

可以寫成

with a as (select * from table where dt='2021-03-30' ) select * from a

簡單的SQL看不出這樣的優(yōu)勢(甚至有點多此一舉),但是當邏輯復雜了之后我們就能看出這種語法的優(yōu)勢,他能從底層抽取中間表格,讓我們只專注于當前使用的表格,進而可以將復雜的處理邏輯分解成簡單的步驟。

如下面地表格記錄了用戶適用app過程中每個行為日志地時間戳,我們想統(tǒng)計一下用戶今天用了幾次app,以及每次的起始時間和結束時間是什么時候,這個問題怎么解呢?

怎么在Python中實現(xiàn)HIVE的UDF函數(shù)

SQL實現(xiàn)方式

首先用with as 構建一個中間表(注意看on 和 where條件)

with t1 as (select x.uid, case when x.rank=1 then y.timestamp_ms else x.timestamp_ms end as start_time, case when x.rank=1 then x.timestamp_ms else y.timestamp_ms end as end_time from (select uid, timestamp_ms, row_number()over(partition by uid order by timestamp_ms) rank from tmp.tmpx) x left outer join (select uid, timestamp_ms, row_number()over(partition by uid order by timestamp_ms) rank from tmp.tmpx) y on x.uid=y.uid and x.rank=y.rank-1 where x.rank=1 or y.rank is null or y.timestamp_ms-x.timestamp_ms>=300)

首先我們用開窗函數(shù)錯位相減,用where條件篩選出我們需要的列,其中

x.rank=1 抽取出第一行

y.rank is null 抽取最后一樣

y.timestamp_ms-x.timestamp_ms>=300抽取滿足條件的行,如下:

怎么在Python中實現(xiàn)HIVE的UDF函數(shù)

當然這個結果并不是我們要的結果,需要將上述表格中某一行數(shù)據(jù)的end-time和下一條數(shù)據(jù)的start-time結合起來起來,構造出時間段

怎么在Python中實現(xiàn)HIVE的UDF函數(shù)

好的,按照上面我們所說的那么下面我們不用關心底層的邏輯,將注意力專注于這張中間表t1

select a.uid,end_time as start_time,start_time as end_time from (select uid,start_time,row_number()over(partition by uid order by start_time) as rank from t1) a join (select uid,end_time,row_number()over(partition by uid order by end_time) as rank from t1)b on a.uid=b.uid and a.rank=b.rank+1

同樣,排序后錯位相減,然后就可以打完收工了~

UDF實現(xiàn)方式

首先我們假設上述數(shù)據(jù)存儲在csv中,

用python  處理本地文件data.csv,按照python的處理方式寫代碼(這里就不一句句解釋了,會python的同學可以跳過,不會的同學不妨自己動手寫一下)

def life_cut(files): f=open(files) act_list=[] act_dict={} for line in f:     line_list=line.strip().split()     key=tuple(line_list[0:1])     if key not in act_dict:         act_dict.setdefault(key,[])         act_dict[key].append(line_list[1])     else:         act_dict[key].append(line_list[1])  for k,v in act_dict.items():     k_str=k[0]+"\t"     start_time = v[0]     last_time=v[0]     i=1     while i<len(v)-1:         if int(v[i])-int(last_time)>=300:             print(k_str+"\t"+start_time+"\t"+v[i-1])             start_time=v[i]             last_time = v[i]             i=i+1         else:             last_time = v[i]             i=i+1     print(k_str+"\t"+start_time+"\t"+v[len(v)-1])     # print(k_str + "\t" + start_time + "\t" + v[i]) if __name__=="__main__": life_cut("data.csv")

得到結果如下:

怎么在Python中實現(xiàn)HIVE的UDF函數(shù)

那么下面我們將上述函數(shù)寫成udf的形式:

#!/usr/bin/env python # -*- encoding:utf-8 -*- import sys act_list=[] act_dict={} for line in sys.stdin: line_list=line.strip().split("\t") key=tuple(line_list[0:1]) if key not in act_dict:     act_dict.setdefault(key,[])     act_dict[key].append(line_list[1]) else:     act_dict[key].append(line_list[1])  for k,v in act_dict.items(): k_str=k[0]+"\t" start_time = v[0] last_time=v[0] i=1 while i<len(v)-1:     if int(v[i])-int(last_time)>=300:       print(k_str+"\t"+start_time+"\t"+v[i-1])       start_time=v[i]       last_time = v[i]       i=i+1     else:       last_time = v[i]       i=i+1 print(k_str+"\t"+start_time+"\t"+v[len(v)-1])

這個變化過程的關鍵點是將 for line in f 替換成 for line in sys.stdin,其他基本上沒什么變化

然后我們再來引用這個函數(shù)

先add這個函數(shù)的路徑add file /xxx/life_cut.py 加載udf路徑,然后再使用

select TRANSFORM (uid,timestamp_ms) USING "python life_cut.py" as (uid,start_time,end_time) from tmp.tmpx

以上就是怎么在Python中實現(xiàn)HIVE的UDF函數(shù),小編相信有部分知識點可能是我們日常工作會見到或用到的。希望你能通過這篇文章學到更多知識。更多詳情敬請關注創(chuàng)新互聯(lián)行業(yè)資訊頻道。

新聞標題:怎么在Python中實現(xiàn)HIVE的UDF函數(shù)
URL地址:http://chinadenli.net/article44/ihgihe.html

成都網(wǎng)站建設公司_創(chuàng)新互聯(lián),為您提供建站公司、網(wǎng)站改版、云服務器、App設計、網(wǎng)頁設計公司、網(wǎng)站設計公司

廣告

聲明:本網(wǎng)站發(fā)布的內容(圖片、視頻和文字)以用戶投稿、用戶轉載內容為主,如果涉及侵權請盡快告知,我們將會在第一時間刪除。文章觀點不代表本網(wǎng)站立場,如需處理請聯(lián)系客服。電話:028-86922220;郵箱:631063699@qq.com。內容未經(jīng)允許不得轉載,或轉載時需注明來源: 創(chuàng)新互聯(lián)

成都定制網(wǎng)站網(wǎng)頁設計
日韩精品在线观看一区| 91欧美视频在线观看免费| 久久综合九色综合欧美| 又色又爽又无遮挡的视频| 99国产精品国产精品九九| 欧美国产在线观看精品| 国产一级内片内射免费看| 久久精品亚洲精品国产欧美| 午夜视频在线观看日韩| 亚洲精品国产精品日韩| 婷婷开心五月亚洲综合| 亚洲中文字幕亲近伦片| 亚洲高清中文字幕一区二区三区| 视频一区日韩经典中文字幕| 中文字幕在线五月婷婷| 日韩国产亚洲欧美激情| 九九热精彩视频在线播放| 一区二区三区免费公开| 日本一二三区不卡免费| 日韩中文字幕在线不卡一区| 国产一区欧美一区二区| 在线视频免费看你懂的| 女同伦理国产精品久久久| 99久久国产综合精品二区 | 麻豆精品在线一区二区三区| 亚洲国产婷婷六月丁香| 日韩美成人免费在线视频| 高潮日韩福利在线观看| 国产女高清在线看免费观看| 亚洲国产精品无遮挡羞羞| 日本高清二区视频久二区| 欧美日韩一区二区三区色拉拉| 高清在线精品一区二区| 国产精品第一香蕉视频| 尹人大香蕉一级片免费看| 国产欧美日产久久婷婷| 欧美日韩亚洲综合国产人 | 亚洲精品福利视频在线观看| 日本高清一区免费不卡| 九九热在线免费在线观看| 人人妻人人澡人人夜夜|