大文件的排序和去重超級簡單的實現

原創

2019-04-07 03:21

大文件的排序和去重超級簡單的實現

有一道校招生的面試題，是要給一個很大的文件（不能全部放內存，比如1T）按行來排序和去重。

一種簡單解決方案就是分而治之，先打大文件分詞大小均勻的若干個小文件，然後對小文件排好序，最後再Merge所有的小文件，在Merge的過程中去掉重複的內容。

在Linux下實現這個邏輯甚至不用自己寫代碼，只要用shell內置的一些命令: split, sort就足夠了。我們把這個流程用腳本串起來，寫到shell腳本文件裏。文件名叫sort_uniq.sh.

 1 #!/bin/bash
 2 lines=$(wc -l $1 | sed 's/ .*//g')
 3 lines_per_file=`expr $lines / 20`
 4 split -d -l $lines_per_file $1 __part_$1
 5 
 6 for file in __part_*
 7 do
 8 {
 9   sort $file > sort_$file
10 } &
11 done
12 wait
13 
14 sort -smu sort_* > $2
15 rm -f __part_*
16 rm -f sort_*

使用方法：./sort_uniq.sh file_to_be_sort file_sorted

這段代碼把大文件分詞20或21個小文件，後臺並行排序各個小文件，最後合併結果並去重。

如果只要去重，不需要排序，還有另外一種思路：對文件的每一行計算hash值，按照hash值把該行內容放到某個小文件中，假設需要分詞100個小文件，則可以按照（hash % 100）來分發文件內容，然後在小文件中實現去重就可以了。

發表評論

所有評論

還沒有人評論，想成為第一個評論的人麼? 請在上方評論欄輸入並且點擊發布.

相關文章

CentOS 安裝 SVN1.7.7

CentOS默認的yum --install subversion ，安裝的是1.6版本安裝1.7腳本爲： #!/bin/bash echo WANdisco Subversion Installer for Cen

2020-07-08 12:36:10

linux CentOS7 mysql 源碼安裝和rpm安裝

今天是安裝linux mysql第三天，終於安裝成功了。第一種方法，源碼安裝。下載 cmake-2.8.10.2.tar.gz 和 mysql-5.6.4-m7.tar.gz 上傳到服務器解壓完成 1.在cmake-2.8.10.2這

weixin_38081382

2020-07-08 12:31:47

No more authentication methods to try,Permission denied (publickey)

簡言之就是ssh client更新了，不支持rsa的私鑰，導致無法登陸。ssh登陸服務器，出現類似下面的提示：debug3: authmethod_is_enabled publickey debug1: Next authenticati

2023-11-21 09:53:05

linux有磁盤空間卻顯示不足 linux中inode使用率過高處理辦法 linux中inode使用率過高處理辦法

linux中inode使用率過高處理辦法前幾天收到監控告警，說Inode節點空間不足，之前沒處理過這種問題，所以記錄一下處理過程，便於以後查閱。 Inode使用率高並不會影響系統正常運行和新文件的創建，但是當使用率達到100%的時候，

故宮博物院

2022-12-25 14:18:39

Unixbench：簡介及使用【轉】

轉自：https://www.cnblogs.com/chenshengkai/p/12761467.html 一、安裝 1.下載 https://github.com/kdlucas/byte-unixbench/archive

2022-06-30 14:35:50

linux下kill殺死進程的命令

常規篇：　首先，用ps查看進程，方法如下： $ ps -ef … smx 1822 1 0 11:38 ? 00:00:49 gnome-terminal smx 1823 1822 0 11:38 ? 00:00:00 gnome-p

2020-11-10 13:34:45

基於tiny4412的Linux內核移植 -- 設備樹的展開【轉】

轉自：https://www.cnblogs.com/pengdonglin137/p/5248114.html 閱讀目錄(Content) 作者信息平臺簡介摘要正文一、根據設備樹創建device node鏈表二、遍歷de

2020-10-22 13:20:25

增加FastDfs多文件存儲路徑

項目需要增加聊天會話功能，涉及到上傳語音圖片等信息。考慮新增一個目錄，所有相關文件存在一個相同的目錄中。因此需要對原項目增加一個存儲的路徑。以前的項目因爲只有一個路徑，且已經運行中。走了些彎路，僅此記錄操作過程。nginx version

2020-07-08 12:37:23

supervisor管理redis，mysql進程

參考:https://blog.csdn.net/lihao21/article/details/77689790 查看supervisor的管理文件查看redis的啓動文件編寫supervisor的ini文件 [progra

2020-07-08 12:37:23

linux下禁止用戶使用密碼方式登陸，而使用密鑰方式登陸

使用putty生成密鑰和登陸根據公鑰認證的原理（見後面說明），認證雙方任何一方都可製作該鑰匙對，並且只要認證方有被認證方的公鑰信息，即可匹配成功。這裏，我們先以Windows上的putty登陸Linux服務器爲例說明。所以，該密鑰對由pu

2020-07-08 12:36:09

find的用法：find查找指定文件和文件夾，設置爲指定用戶和用戶組

find . -name js 查找當前文件夾內名稱完全是js的文件和文件夾 find . -name "*js*" 查找當前文件夾內名稱包含js的文件和文件夾 find . -type d -name "*js" 查找當前文件夾

2020-07-08 12:35:54

centos創建應用快捷方式文件的語法

以下是在創建應用程序桌面快捷方式文件的內容要求： [Desktop Entry] 文件頭 Encoding 編碼格式 Name 應用名稱 Name[xx] 不同語言的應用名稱 Comment 描述 E

2020-07-08 12:33:16

關於IP地址與主機名映射的/etc/hosts文件配置

爲什麼要這樣做？首先，在hadoop工作就像是一個社團幫派，master是老大，而slave1、slave2等就是master的小弟。但是，slave並沒有像我們那麼聰明一眼就能分辨出自己的老大，它們是以ip地址作爲辨別的。那麼

2020-07-08 12:33:16

阿里年薪破百架構師推薦：鳥哥的Linux私房菜，搭配面試題，真香

在Linux實操的過程中，你是否有過這些疑問：如何提取日誌中含有關鍵字的指定行，上一行或上幾行？ ln 做了符號鏈接，對符號鏈接進行權限修改，原文件是否會受到影響？ Shell 腳本里有很多特殊符號，到底該怎麼用？網上流傳的

毛发旺盛的程序员

2020-07-08 12:27:30

臨時設置環境變量（python和Linux命令行）

python中設置環境變量（臨時）使用os模塊 import os #當前存在的環境變量，可以在ipython中直接輸入下面這句查看keys In [3]: os.environ.keys() Out[3]: ['LC_NUM

2020-07-08 12:24:41

24小時熱門文章

最新文章

最新評論文章