記一次單機系統(tǒng)的性能優(yōu)化:最后竟是?TCP?的鍋
[導(dǎo)讀]前言這篇文章的主題是記錄一次Python程序的性能優(yōu)化,在優(yōu)化的過程中遇到的問題,以及如何去解決的。為大家提供一個優(yōu)化的思路,首先要聲明的一點是,我的方式不是唯一的,大家在性能優(yōu)化之路上遇到的問題都絕對不止一個解決方案。如何優(yōu)化首先大家要明確的一點是,脫離需求談優(yōu)化都是耍流氓,所...
前言
這篇文章的主題是記錄一次 Python 程序的性能優(yōu)化,在優(yōu)化的過程中遇到的問題,以及如何去解決的。為大家提供一個優(yōu)化的思路,首先要聲明的一點是,我的方式不是唯一的,大家在性能優(yōu)化之路上遇到的問題都絕對不止一個解決方案。如何優(yōu)化
首先大家要明確的一點是,脫離需求談優(yōu)化都是耍流氓,所以有誰跟你說在xx機器上實現(xiàn)了百萬并發(fā),基本上可以認(rèn)為是不懂裝懂了,單純的并發(fā)數(shù)完全是無意義的。其次,我們優(yōu)化之前必須要有一個目標(biāo),需要優(yōu)化到什么程度,沒有明確目標(biāo)的優(yōu)化是不可控的。再然后,我們必須明確的找出性能瓶頸在哪里,而不能漫無目的的一通亂搞。
需求描述
這個項目是我在上家公司負(fù)責(zé)一個單獨的模塊,本來是集成在主站代碼中的,后來因為并發(fā)太大,為了防止出現(xiàn)問題后拖累主站服務(wù),所有由我一個人負(fù)責(zé)拆分出來。對這個模塊的拆分要求是,壓力測試 QPS 不能低于3萬,數(shù)據(jù)庫負(fù)載不能超過50%,服務(wù)器負(fù)載不能超過70%,單次請求時長不能超過70ms,錯誤率不能超過5%。環(huán)境的配置如下:服務(wù)器:4核8G內(nèi)存,CentOS7系統(tǒng),SSD 硬盤數(shù)據(jù)庫:MySQL 5.7,最大連接數(shù) 800
緩存: Redis,1G 容量。以上環(huán)境都是購買自騰訊云的服務(wù)。壓測工具:locust,使用騰訊的彈性伸縮實現(xiàn)分布式的壓測。需求描述如下:用戶進(jìn)入首頁,從數(shù)據(jù)庫中查詢是否有合適的彈窗配置,如果沒有,則繼續(xù)等待下一次請求、如果有合適的配置,則返回給前端。這里開始則有多個條件分支,如果用戶點擊了彈窗,則記錄用戶點擊,并且在配置的時間內(nèi)不再返回配置,如果用戶未點擊,則24小時后繼續(xù)返回本次配置,如果用戶點擊了,但是后續(xù)沒有配置了,則接著等待下一次。
重點分析
根據(jù)需求,我們知道了有幾個重要的點,1、需要找出合適用戶的彈窗配置,2、需要記錄用戶下一次返回配置的時間并記錄到數(shù)據(jù)庫中,3、需要記錄用戶對返回的配置執(zhí)行了什么操作并記錄到數(shù)據(jù)庫中。調(diào)優(yōu)
我們可以看到,上述三個重點都存在數(shù)據(jù)庫的操作,不只有讀庫,還有寫庫操作。從這里我們可以看到如果不加緩存的話,所有的請求都壓到數(shù)據(jù)庫,勢必會占滿全部連接數(shù),出現(xiàn)拒絕訪問的錯誤,同時因為 SQL 執(zhí)行過慢,導(dǎo)致請求無法及時返回。所以,我們首先要做的就是講寫庫操作剝離開來,提升每一次請求響應(yīng)速度,優(yōu)化數(shù)據(jù)庫連接。整個系統(tǒng)的架構(gòu)圖如下:
TCP 鏈接在經(jīng)過四次握手結(jié)束連接后并不會立即釋放,而是處于 timewait 狀態(tài),會等待一段時間,以防止客戶端后續(xù)的數(shù)據(jù)未被接收。好了,問題找到了,我們要接著優(yōu)化,首先想到的就是調(diào)整 TCP 鏈接結(jié)束后等待時間,但是 Linux 并沒有提供這一內(nèi)核參數(shù)的調(diào)整,如果要改,必須要自己重新編譯內(nèi)核,幸好還有另一個參數(shù) net.ipv4.tcp_max_tw_buckets, timewait 的數(shù)量,默認(rèn)是180000。我們調(diào)整為 6000,然后打開 timewait 快速回收,和開啟重用,完整的參數(shù)優(yōu)化如下:
net.ipv4.ip_local_port_range = 1024 65000
#啟用 timewait 快速回收。net.ipv4.tcp_tw_recycle = 1#開啟重用。允許將 TIME-WAIT sockets 重新用于新的 TCP 連接。net.ipv4.tcp_tw_reuse = 1 我們再次壓測,結(jié)果顯示:QPS 5萬,服務(wù)器 CPU 70%,數(shù)據(jù)庫連接正常,TCP 連接正常,響應(yīng)時間平均為 60ms,錯誤率為 0%。
結(jié)語
到此為止,整個服務(wù)的開發(fā)、調(diào)優(yōu)、和壓測就結(jié)束了?;仡欉@一次調(diào)優(yōu),得到了很多經(jīng)驗,最重要的是,深刻理解了web開發(fā)不是一個獨立的個體,而是網(wǎng)絡(luò)、數(shù)據(jù)庫、編程語言、操作系統(tǒng)等多門學(xué)科結(jié)合的工程實踐,這就要求web開發(fā)人員有牢固的基礎(chǔ)知識,否則出現(xiàn)了問題還不知道怎么分析查找。ps:服務(wù)端開啟了 tcp_tw_recycle 和 tcp_tw_reuse是會導(dǎo)致一些問題的,我們?yōu)榱藘?yōu)化選擇犧牲了一部分,獲得另一部分,這也是我們要明確的,具體的問題可以查看耗子叔的文章TCP 的那些事兒(上)