009：字符串的使用

字符串的定義

所謂字符串，就是由零個或多個字符組成的有限序列，一般記爲：

在Python程序中，如果把單個或多個字符用單引號或者雙引號包圍起來，就可以表示一個字符串。字符串中的字符可以是特殊符號、英文字母、中文字符、日文的平假名或片假名、希臘字母、Emoji字符等。

s1 = 'hello, world!'
s2 = "你好，世界！"
print(s1, s2)
# 以三個雙引號或單引號開頭的字符串可以折行
s3 = '''
hello, 
world!
'''
print(s3, end='')

提示：print函數中的end=''表示輸出後不換行，即將默認的結束符\n（換行符）更換爲''（空字符）。

轉義字符和原始字符串

可以在字符串中使用\（反斜槓）來表示轉義，也就是說\後面的字符不再是它原來的意義，例如：\n不是代表反斜槓和字符n，而是表示換行；\t也不是代表反斜槓和字符t，而是表示製表符。所以如果字符串本身又包含了'、"、\這些特殊的字符，必須要通過\進行轉義處理。例如要輸出一個帶單引號或反斜槓的字符串，需要用如下所示的方法。

s1 = '\'hello, world!\''
print(s1)
s2 = '\\hello, world!\\'
print(s2)

Python中的字符串可以r或R開頭，這種字符串被稱爲原始字符串，意思是字符串中的每個字符都是它本來的含義，沒有所謂的轉義字符。例如，在字符串'hello\n'中，\n表示換行；而在r'hello\n'中，\n不再表示換行，就是反斜槓和字符n。大家可以運行下面的代碼，看看會輸出什麼。

# 字符串s1中\t是製表符，\n是換行符
s1 = '\time up \now'
print(s1)
# 字符串s2中沒有轉義字符，每個字符都是原始含義
s2 = r'\time up \now'
print(s2)

Python中還允許在\後面還可以跟一個八進制或者十六進制數來表示字符，例如\141和\x61都代表小寫字母a，前者是八進制的表示法，後者是十六進制的表示法。另外一種表示字符的方式是在\u後面跟Unicode字符編碼

字符串的運算

Python爲字符串類型提供了非常豐富的運算符，我們可以使用+運算符來實現字符串的拼接，可以使用*運算符來重複一個字符串的內容，可以使用in和not in來判斷一個字符串是否包含另外一個字符串，我們也可以用[]和[:]運算符從字符串取出某個字符或某些字符。

拼接和重複

下面的例子演示了使用+和*運算符來實現字符串的拼接和重複操作。

s1 = 'hello' + ' ' + 'world'
print(s1)    # hello world
s2 = '!' * 3
print(s2)    # !!!
s1 += s2     # s1 = s1 + s2
print(s1)    # hello world!!!
s1 *= 2      # s1 = s1 * 2
print(s1)    # hello world!!!hello world!!!

用*實現字符串的重複是非常有意思的一個運算符，在很多編程語言中，要表示一個有10個a的字符串，你只能寫成"aaaaaaaaaa"，但是在Python中，你可以寫成'a' * 10。你可能覺得"aaaaaaaaaa"這種寫法也沒有什麼不方便的，那麼想一想，如果字符a要重複100次或者1000次又會如何呢？

比較運算

對於兩個字符串類型的變量，可以直接使用比較運算符比較兩個字符串的相等性或大小。需要說明的是，因爲字符串在計算機內存中也是以二進制形式存在的，那麼字符串的大小比較比的是每個字符對應的編碼的大小。例如A的編碼是65，而a的編碼是97，所以'A' < 'a'的結果相當於就是65 < 97的結果，很顯然是True；而'boy' < 'bad'，因爲第一個字符都是'b'比不出大小，所以實際比較的是第二個字符的大小，顯然'o' < 'a'的結果是False，所以'boy' < 'bad'的結果也是False。如果不清楚兩個字符對應的編碼到底是多少，可以使用ord函數來獲得，例如ord('A')的值是65，而ord('昊')的值是26122。下面的代碼爲大家展示了字符串的比較運算。

s1 = 'a whole new world'
s2 = 'hello world'
print(s1 == s2, s1 < s2)      # False True
print(s2 == 'hello world')    # True
print(s2 == 'Hello world')    # False
print(s2 != 'Hello world')    # True
s3 = '小強'
print(ord('小'), ord('強'))               # 23567 24378
s4 = '王大錘'
print(ord('王'), ord('大'), ord('錘'))    # 29579 22823 38180
print(s3 > s4, s3 <= s4)      # True False

需要強調一下的是，字符串的比較運算比較的是字符串的內容，Python中還有一個is運算符（身份運算符），如果用is來比較兩個字符串，它比較的是兩個變量對應的字符串是否在內存中相同的位置（內存地址），簡單的說就是兩個變量是否對應內存中的同一個字符串。看看下面的代碼就比較清楚is運算符的作用了。

s1 = 'hello world'
s2 = 'hello world'
s3 = s2
# 比較字符串的內容
print(s1 == s2, s2 == s3)    # True True
# 比較字符串的內存地址
print(s1 is s2, s2 is s3)    # False True

成員運算

Python中可以用in和not in判斷一個字符串中是否存在另外一個字符或字符串，in和not in運算通常稱爲成員運算，會產生布爾值True或False，代碼如下所示。

s1 = 'hello, world'
print('wo' in s1)    # True
s2 = 'goodbye'
print(s2 in s1)      # False

獲取字符串長度

獲取字符串長度沒有直接的運算符，而是使用內置函數len，我們在上節課的提到過這個內置函數，代碼如下所示。

s = 'hello, world'
print(len(s))                  # 12
print(len('goodbye, world'))    # 14

索引和切片

如果希望從字符串中取出某個字符，我們可以對字符串進行索引運算，運算符是[n]，其中n是一個整數，假設字符串的長度爲N，那麼n可以是從0到N-1的整數，其中0是字符串中第一個字符的索引，而N-1是字符串中最後一個字符的索引，通常稱之爲正向索引；在Python中，字符串的索引也可以是從-1到-N的整數，其中-1是最後一個字符的索引，而-N則是第一個字符的索引，通常稱之爲負向索引。注意，因爲字符串是不可變類型，所以不能通過索引運算修改字符串中的字符。

s = 'abc123456'
N = len(s)

# 獲取第一個字符
print(s[0], s[-N])    # a a

# 獲取最後一個字符
print(s[N-1], s[-1])  # 6 6

# 獲取索引爲2或-7的字符
print(s[2], s[-7])    # c c

# 獲取索引爲5和-4的字符
print(s[5], s[-4])    # 3 3

需要提醒大家注意的是，在進行索引操作時，如果索引越界（正向索引不在0到N-1範圍，負向索引不在-1到-N範圍），會引發IndexError異常，錯誤提示信息爲：string index out of range（字符串索引超出範圍）。

如果要從字符串中取出多個字符，我們可以對字符串進行切片，運算符是[i:j:k]，其中i是開始索引，索引對應的字符可以取到；j是結束索引，索引對應的字符不能取到；k是步長，默認值爲1，表示從前向後獲取相鄰字符的連續切片，所以:k部分可以省略。假設字符串的長度爲N，當k > 0時表示正向切片（從前向後獲取字符），如果沒有給出i和j的值，則i的默認值是0，j的默認值是N；當k < 0時表示負向切片（從後向前獲取字符），如果沒有給出i和j的值，則i的默認值是-1，j的默認值是-N - 1。如果不理解，直接看下面的例子，記住第一個字符的索引是0或-N，最後一個字符的索引是N-1或-1就行了。

s = 'abc123456'

# i=2, j=5, k=1的正向切片操作
print(s[2:5])       # c12

# i=-7, j=-4, k=1的正向切片操作
print(s[-7:-4])     # c12

# i=2, j=9, k=1的正向切片操作
print(s[2:])        # c123456

# i=-7, j=9, k=1的正向切片操作
print(s[-7:])       # c123456

# i=2, j=9, k=2的正向切片操作
print(s[2::2])      # c246

# i=-7, j=9, k=2的正向切片操作
print(s[-7::2])     # c246

# i=0, j=9, k=2的正向切片操作
print(s[::2])       # ac246

# i=1, j=-1, k=2的正向切片操作
print(s[1:-1:2])    # b135

# i=7, j=1, k=-1的負向切片操作
print(s[7:1:-1])    # 54321c

# i=-2, j=-8, k=-1的負向切片操作
print(s[-2:-8:-1])  # 54321c

# i=7, j=-10, k=-1的負向切片操作
print(s[7::-1])     # 54321cba

# i=-1, j=1, k=-1的負向切片操作
print(s[:1:-1])     # 654321c

# i=0, j=9, k=1的正向切片
print(s[:])         # abc123456

# i=0, j=9, k=2的正向切片
print(s[::2])       # ac246

# i=-1, j=-10, k=-1的負向切片
print(s[::-1])      # 654321cba

# i=-1, j=-10, k=-2的負向切片
print(s[::-2])      # 642ca

循環遍歷

如果希望從字符串中取出每個字符，可以使用for循環對字符串進行遍歷，有兩種方式。

方式一：

s1 = 'hello'
for index in range(len(s1)):
    print(s1[index])

方式二：

s1 = 'hello'
for ch in s1:
    print(ch)

字符串的方法

在Python中，我們可以通過字符串類型自帶的方法對字符串進行操作和處理，對於一個字符串類型的變量，我們可以用變量名.方法名()的方式來調用它的方法。所謂方法其實就是跟某個類型的變量綁定的函數，後面我們講面向對象編程的時候還會對這一概念詳加說明。

大小寫相關操作

下面的代碼演示了和字符串大小寫變換相關的方法。

s1 = 'hello, world!'

# 使用capitalize方法獲得字符串首字母大寫後的字符串
print(s1.capitalize())   # Hello, world!
# 使用title方法獲得字符串每個單詞首字母大寫後的字符串
print(s1.title())        # Hello, World!
# 使用upper方法獲得字符串大寫後的字符串
print(s1.upper())        # HELLO, WORLD!

s2 = 'GOODBYE'
# 使用lower方法獲得字符串小寫後的字符串
print(s2.lower())        # goodbye

查找操作

如果想在一個字符串中從前向後查找有沒有另外一個字符串，可以使用字符串的find或index方法。

s = 'hello, world!'

# find方法從字符串中查找另一個字符串所在的位置
# 找到了返回字符串中另一個字符串首字符的索引
print(s.find('or'))        # 8
# 找不到返回-1
print(s.find('shit'))      # -1
# index方法與find方法類似
# 找到了返回字符串中另一個字符串首字符的索引
print(s.index('or'))       # 8
# 找不到引發異常
print(s.index('shit'))     # ValueError: substring not found

在使用find和index方法時還可以通過方法的參數來指定查找的範圍，也就是查找不必從索引爲0的位置開始。find和index方法還有逆向查找（從後向前查找）的版本，分別是rfind和rindex，代碼如下所示。

s = 'hello good world!'

# 從前向後查找字符o出現的位置(相當於第一次出現)
print(s.find('o'))       # 4
# 從索引爲5的位置開始查找字符o出現的位置
print(s.find('o', 5))    # 7
# 從後向前查找字符o出現的位置(相當於最後一次出現)
print(s.rfind('o'))      # 12

性質判斷

可以通過字符串的startswith、endswith來判斷字符串是否以某個字符串開頭和結尾；還可以用is開頭的方法判斷字符串的特徵，這些方法都返回布爾值，代碼如下所示。

s1 = 'hello, world!'

# startwith方法檢查字符串是否以指定的字符串開頭返回布爾值
print(s1.startswith('He'))    # False
print(s1.startswith('hel'))   # True
# endswith方法檢查字符串是否以指定的字符串結尾返回布爾值
print(s1.endswith('!'))       # True

s2 = 'abc123456'

# isdigit方法檢查字符串是否由數字構成返回布爾值
print(s2.isdigit())    # False
# isalpha方法檢查字符串是否以字母構成返回布爾值
print(s2.isalpha())    # False
# isalnum方法檢查字符串是否以數字和字母構成返回布爾值
print(s2.isalnum())    # True

格式化字符串

在Python中，字符串類型可以通過center、ljust、rjust方法做居中、左對齊和右對齊的處理。

s = 'hello, world'

# center方法以寬度20將字符串居中並在兩側填充*
print(s.center(20, '*'))  # ****hello, world****
# rjust方法以寬度20將字符串右對齊並在左側填充空格
print(s.rjust(20))        #         hello, world
# ljust方法以寬度20將字符串左對齊並在右側填充~
print(s.ljust(20, '~'))   # hello, world~~~~~~~~

我們之前說過，在用print函數輸出字符串時，可以用下面的方式對字符串進行格式化。

a = 321
b = 123
print('%d * %d = %d' % (a, b, a * b))

當然，我們也可以用字符串的方法來完成字符串的格式，代碼如下所示。

a = 321
b = 123
print('{0} * {1} = {2}'.format(a, b, a * b))

從Python 3.6開始，格式化字符串還有更爲簡潔的書寫方式，就是在字符串前加上f來格式化字符串，在這種以f打頭的字符串中，{變量名}是一個佔位符，會被變量對應的值將其替換掉，代碼如下所示。

a = 321
b = 123
print(f'{a} * {b} = {a * b}')

如果需要進一步控制格式化語法中變量值的形式，可以參照下面的表格來進行字符串格式化操作。

變量值	佔位符	格式化結果	說明
`3.1415926`	`{:.2f}`	`'3.14'`	保留小數點後兩位
`3.1415926`	`{:+.2f}`	`'+3.14'`	帶符號保留小數點後兩位
`-1`	`{:+.2f}`	`'-1.00'`	帶符號保留小數點後兩位
`3.1415926`	`{:.0f}`	`'3'`	不帶小數
`123`	`{:0>10d}`	`0000000123`	左邊補`0`，補夠10位
`123`	`{:x<10d}`	`123xxxxxxx`	右邊補`x` ，補夠10位
`123`	`{:>10d}`	`' 123'`	左邊補空格，補夠10位
`123`	`{:<10d}`	`'123 '`	右邊補空格，補夠10位
`123456789`	`{:,}`	`'123,456,789'`	逗號分隔格式
`0.123`	`{:.2%}`	`'12.30%'`	百分比格式
`123456789`	`{:.2e}`	`'1.23e+08'`	科學計數法格式

修剪操作

字符串的strip方法可以幫我們獲得將原字符串修剪掉左右兩端空格之後的字符串。這個方法非常有實用價值，通常用來將用戶輸入中因爲不小心鍵入的頭尾空格去掉，strip方法還有lstrip和rstrip兩個版本，相信從名字大家已經猜出來這兩個方法是做什麼用的。

s = '   [email protected]  \t\r\n'
# strip方法獲得字符串修剪左右兩側空格之後的字符串
print(s.strip())    # [email protected]

其他方法

除了上面講到的方法外，字符串類型還有很多方法，如拆分、合併、編碼、解碼等。對於字符串類型來說，還有一個常用的操作是對字符串進行匹配檢查，即檢查字符串是否滿足某種特定的模式。例如，一個網站對用戶註冊信息中用戶名和郵箱的檢查，就屬於模式匹配檢查。實現模式匹配檢查的工具叫做正則表達式，Python語言通過標準庫中的re模塊提供了對正則表達式的支持。

009：字符串的使用

字符串的定義

轉義字符和原始字符串

字符串的運算

拼接和重複

比較運算

成員運算

獲取字符串長度

索引和切片

循環遍歷

字符串的方法

大小寫相關操作

查找操作

性質判斷

格式化字符串

修剪操作

其他方法

第2章 Scala變量

第4章 Scala程序流程控制

第1章 Scala概述

005：分支結構

009：字符串的使用

https://yachay.unat.edu.pe/blog/index.php?comment_area=format_blog&comment_component=blog&comment_co

linux以太網驅動總結