原文轉載於:https://www.cnblogs.com/geek-arking/p/10213449.html
其實無論windows還是Linux,簡單地去實現兩個兩個文件夾的同步只需系統自帶的複製命令加參數就可以了。
- WINDOWS :
xcopy 源文件夾\* 目標文件夾 /s /e /y
- Linux :
cp -r 源文件夾/* 目標文件夾
這裏使用python來實現這些基本功能,並增加一些去重之類的增強功能。
1、複製源文件夾中文件至目標文件夾
要想同步兩個文件夾中的數據,基本思路首先需要遍歷源文件夾中的信息,將源文件夾中的文件複製到目標文件夾。
遍歷文件夾採用os中的listdir函數就可以了。
import os
path_s = 'F:\\test\\s'
path_t = 'F:\\test\\t'
for filename in os.listdir(path_s):
filename_s = path_s+os.sep+filename
print '[*] Source :',filename_s
filename_t = path_t+os.sep+filename
print '[*] Target :',filename_t
with open(filename_s,'rb') as f_s:
with open(filename_t,'wb') as f_t:
f_t.write(f_s.read())
但是很明顯這裏沒有考慮源文件夾中還會存在文件夾甚至多重文件夾的情況。
2、源文件夾中存在多重文件夾
一個簡單的思路就是:在遍歷源文件夾內的文件時,先判定當前文件這是文件還是文件夾。如果當前文件是文件夾的話,開始遍歷此文件夾內的文件,如果裏面還有文件夾,遍歷這個文件夾,依次類推。利用遞歸的方法,代碼如下:
import os
path_s = 'F:\\test\\s'
path_t = 'F:\\test\\t'
def copy_file(paths,patht):
for filename in os.listdir(paths):
filename_s = paths+os.sep+filename
filename_t = patht+os.sep+filename
if os.path.isdir(filename_s):
if not os.path.exists(filename_t):
os.mkdir(filename_t) #在目標文件夾中創建對應的文件夾
copy_file(filename_s,filename_t) # 遞歸
else:
print '[*] Source :',filename_s
print '[*] Target :',filename_t
with open(filename_s,'rb') as f_s:
with open(filename_t,'wb') as f_t:
f_t.write(f_s.read())
copy_file(path_s,path_t)
目前,簡單的文件夾複製功能已經實現了。
3、目標文件夾中已有文件不再複製
一個簡單的方法就是在目標文件夾中複製文件之前先利用函數“os.path.exists”判定這個文件是否存在。
import os
path_s = 'F:\\test\\s'
path_t = 'F:\\test\\t'
def copy_file(paths,patht):
for filename in os.listdir(paths):
filename_s = paths+os.sep+filename
filename_t = patht+os.sep+filename
if os.path.isdir(filename_s):
if not os.path.exists(filename_t):
os.mkdir(filename_t)
copy_file(filename_s,filename_t)
else:
if os.path.exists(filename_t):
print '[*] "%s" already exists! ' % filename_t
else:
print '[*] Source :',filename_s
print '[*] Target :',filename_t
with open(filename_s,'rb') as f_s:
with open(filename_t,'wb') as f_t:
f_t.write(f_s.read())
copy_file(path_s,path_t)
這個辦法避免了一部分已有文件的重複複製操作,減少了部分不必要的讀寫操作,但是卻無法消除內容相同但名稱、路徑不同的重複文件。
4、利用MD5判定重複文件
目前判定兩個文件是否相同,除了按字節逐個對比這個笨方法外,簡單常用的辦法就是利用MD5和CRC校驗,或是按一定規律挑取文件的指定位置的數據塊就行對比。
這次利用文件的MD5值,將目標文件夾中已有文件的MD5值保存到列表或字典中,每在源文件夾中讀取一個文件就判定該文件的MD5值是否已經存在於MD5列表,沒有的話再進行復制操作,並將該文件的MD5值寫入列表。
import os
import hashlib
path_s = 'F:\\test\\s'
path_t = 'F:\\test\\t'
list_file = {}
def create_file_list(path):
for name in os.listdir(path):
filename = path+os.sep+name
if os.path.isdir(filename):
create_file_list(filename)
else:
with open(filename,'rb') as f:
md5 = hashlib.md5(f.read()).hexdigest()
if md5 not in list_file:
list_file[md5] = 1
def copy_file(paths,patht):
for filename in os.listdir(paths):
filename_s = paths+os.sep+filename
filename_t = patht+os.sep+filename
if os.path.isdir(filename_s):
if not os.path.exists(filename_t):
os.mkdir(filename_t)
copy_file(filename_s,filename_t)
else:
if os.path.exists(filename_t):
print '[*] "%s" already exists! ' % filename_t
else:
with open(filename_s,'rb') as f_s:
data = f_s.read()
file_md5 = hashlib.md5(data).hexdigest()
if file_md5 not in list_file:
list_file[file_md5] = 1
print '[*] Source :',filename_s
print '[*] Target :',filename_t
with open(filename_t,'wb') as f_t:
f_t.write(data)
else:
print '[*] "%s"\'s MD5 already exists! ' % filename_t
create_file_list(path_t)
copy_file(path_s,path_t)
如下圖,運行後內容相同的幾個文件,只有第一次讀取到的時候才寫入目標文件夾,其他路徑下的文件並沒有複製到目標文件夾。