中文字幕日韩精品一区二区免费_精品一区二区三区国产精品无卡在_国精品无码专区一区二区三区_国产αv三级中文在线

Instagram中怎么提升PostgreSQL性能

本篇文章為大家展示了Instagram中怎么提升PostgreSQL性能,內(nèi)容簡明扼要并且容易理解,絕對能使你眼前一亮,通過這篇文章的詳細介紹希望你能有所收獲。

專注于為中小企業(yè)提供網(wǎng)站設(shè)計、網(wǎng)站制作服務(wù),電腦端+手機端+微信端的三站合一,更高效的管理,為中小企業(yè)雄縣免費做網(wǎng)站提供優(yōu)質(zhì)的服務(wù)。我們立足成都,凝聚了一批互聯(lián)網(wǎng)行業(yè)人才,有力地推動了成百上千家企業(yè)的穩(wěn)健成長,幫助中小企業(yè)通過網(wǎng)站建設(shè)實現(xiàn)規(guī)模擴充和轉(zhuǎn)變。

1. 局部索引

如果我們經(jīng)常需要按某個固定的特征過濾數(shù)據(jù),而且這個特征只存在于一小部分行里,在這種情況下,局部索引非常有效。

比方說,Instagram搜索標簽的時候,我們需要找出有許多照片的標簽。我們一般會用ElasticSearch之類的技術(shù)來進行高級搜索,不過這里只靠數(shù)據(jù)庫的查詢能力就完全夠了。先來看一下,按標簽查詢,并按照片數(shù)排序,Postgres是怎么做的:
 

EXPLAIN ANALYZE SELECT id from tags WHERE name LIKE 'snow%' ORDER BY media_count DESC LIMIT 10;   
QUERY PLAN 
---------                                 
 Limit (cost=1780.73..1780.75 rows=10 width=32) (actual time=215.211..215.228 rows=10 loops=1)
  -> Sort (cost=1780.73..1819.36 rows=15455 width=32) (actual time=215.209..215.215 rows=10 loops=1)
     Sort Key: media_count
     Sort Method: top-N heapsort Memory: 25kB
     -> Index Scan using tags_search on tags_tag (cost=0.00..1446.75 rows=15455 width=32) (actual time=0.020..162.708 rows=64572 loops=1)
        Index Cond: (((name)::text ~>=~ 'snow'::text) AND ((name)::text ~<~ 'snox'::text))
        Filter: ((name)::text ~~ 'snow%'::text)
 Total runtime: 215.275 ms
(8 rows)

有沒有看到,為了得到結(jié)果,Postgres不得不對15000行數(shù)據(jù)進行排序。由于標簽的分布滿足長尾模式(譯者注: 根據(jù)百度百科,「我們常用的漢字實際上不多,但因出現(xiàn)頻次高,所以這些為數(shù)不多的漢字占據(jù)了上圖廣大的紅區(qū);絕大部分的漢字難得一用,它們就屬于那長長的黃尾?!?,我們可以改為查詢超過100張照片的標簽,先建局部索引:
 
CREATE INDEX CONCURRENTLY on tags (name text_pattern_ops) WHERE media_count >= 100
然后查詢,看一下新的查詢計劃:
 

EXPLAIN ANALYZE SELECT * from tags WHERE name LIKE 'snow%' AND media_count >= 100 ORDER BY media_count DESC LIMIT 10;
 
QUERY PLAN
 Limit (cost=224.73..224.75 rows=10 width=32) (actual time=3.088..3.105 rows=10 loops=1)
  -> Sort (cost=224.73..225.15 rows=169 width=32) (actual time=3.086..3.090 rows=10 loops=1)
     Sort Key: media_count
     Sort Method: top-N heapsort Memory: 25kB
     -> Index Scan using tags_tag_name_idx on tags_tag (cost=0.00..221.07 rows=169 width=32) (actual time=0.021..2.360 rows=924 loops=1)
        Index Cond: (((name)::text ~>=~ 'snow'::text) AND ((name)::text ~<~ 'snox'::text))
        Filter: ((name)::text ~~ 'snow%'::text)
 Total runtime: 3.137 ms
(8 rows)

可以看到,Postgres只需要訪問169行,所以速度快得多。Postgres的查詢計劃器對約束的評估也很有效。如果以后想要查詢超過500張照片的標簽,由于這個結(jié)果集是上面集合的子集,所以仍然會使用這個局部索引。

2. 函數(shù)索引

在某些表上,我們需要對一些很長的字符串建立索引,比如說,64個字符的base64記號。如果直接建索引的話,會造成大量的數(shù)據(jù)重復(fù),這種情況下,可以用Postgres的函數(shù)索引:
 

CREATE INDEX CONCURRENTLY on tokens (substr(token), 0, 8)

雖然這樣會造成許多行匹配相同的前綴,但我們可以在匹配的基礎(chǔ)上再用過濾,速度很快。而且索引很小,只有大概原來的十分之一。

3. 用pg_reorg來讓數(shù)據(jù)更緊湊

隨著時間的流逝,Postgres的表會變得越來越零碎(由MVCC并發(fā)模型等原因引起)。而且,數(shù)據(jù)行插入的順序往往也不是我們希望返回的順序。比如說,如果我們經(jīng)常要按用戶來查詢照片等,那么最好是在磁盤上把這些東西放在一起,這樣就可以減少磁盤尋道的時間。

我們用pg_reorg來解決這個問題,它用三個步驟來讓“壓緊”一個表:

  1.     取得表的獨占鎖

  2.     建一個記錄變更的臨時表,在原始表上加一個觸發(fā)器,把對原始表的變更復(fù)制到臨時表上

  3.     用CREATE TABLE...SELECT FROM...ORDER BY建表,新表擁有原始表的全部數(shù)據(jù),而且是按索引順序排序的

  4.     將CREATE TABLE執(zhí)行時間點以后發(fā)生的變更從臨時表同步過來

  5.     業(yè)務(wù)切換到新表

每一步都會有很多細節(jié),不過大體上就是像上面這個樣子。我們先對這個工具進行了一些審查,運行了若干測試,然后再把它用到生產(chǎn)環(huán)境上?,F(xiàn)在,我們已經(jīng)在幾百臺機器的環(huán)境上跑過幾十次pg_reorg,沒出現(xiàn)過任何問題。


4. 用WAL-E進行WAL(寫前日志)的歸檔和備份

我們用WAL-E來歸檔WAL日志,它是Heroku寫的一個工具,我們也向它貢獻了一部分代碼。WAL-E大大簡化了數(shù)據(jù)備份和復(fù)制庫創(chuàng)建的過程。

WAL-E是利用Progres的archive_command,將PG產(chǎn)生的每個WAL文件都歸檔到Amazon的S3。利用這些WAL文件和數(shù)據(jù)庫的基準備份,我們可以將數(shù)據(jù)庫恢復(fù)到基準備份后任何一個時間點的狀態(tài)。利用這個手段,我們也可以快速創(chuàng)建只讀的復(fù)制庫或故障備用庫。

我們?yōu)閃AL-E寫了一個簡單的封裝腳本,可以監(jiān)控歸檔時的重復(fù)故障,見GitHub。
 
5. psycopg2中的自動提交模式和異步模式

我們也開始用psycopg2中的一些高級功能(psycopg2是Postgres的Python驅(qū)動)。

一個是自動提交模式。在這個模式里,psycopg2不會發(fā)出BEGIN/COMMIT,每個查詢跑在自己的單語句事務(wù)里。這對不需要事務(wù)的只讀查詢特別有用。開啟很簡單:

connection.autocommit = True

開啟自動提交后,我們的應(yīng)用服務(wù)器和數(shù)據(jù)庫之間的對話大減,數(shù)據(jù)庫服務(wù)器的CPU用量也大減。而且,我們是用PGBouncer作為連接池,開啟自動提交后,連接的歸還也更快了。

與Django的交互細節(jié)可以看這里。

上述內(nèi)容就是Instagram中怎么提升PostgreSQL性能,你們學到知識或技能了嗎?如果還想學到更多技能或者豐富自己的知識儲備,歡迎關(guān)注創(chuàng)新互聯(lián)行業(yè)資訊頻道。

新聞名稱:Instagram中怎么提升PostgreSQL性能
轉(zhuǎn)載來源:http://www.rwnh.cn/article48/gspjep.html

成都網(wǎng)站建設(shè)公司_創(chuàng)新互聯(lián),為您提供電子商務(wù)、面包屑導航小程序開發(fā)、移動網(wǎng)站建設(shè)、Google、網(wǎng)站維護

廣告

聲明:本網(wǎng)站發(fā)布的內(nèi)容(圖片、視頻和文字)以用戶投稿、用戶轉(zhuǎn)載內(nèi)容為主,如果涉及侵權(quán)請盡快告知,我們將會在第一時間刪除。文章觀點不代表本網(wǎng)站立場,如需處理請聯(lián)系客服。電話:028-86922220;郵箱:631063699@qq.com。內(nèi)容未經(jīng)允許不得轉(zhuǎn)載,或轉(zhuǎn)載時需注明來源: 創(chuàng)新互聯(lián)

成都網(wǎng)頁設(shè)計公司
泸州市| 桓台县| 滨海县| 西平县| 龙南县| 大城县| 永善县| 顺义区| 高雄县| 衡阳县| 高安市| 北海市| 盖州市| 阿合奇县| 铅山县| 同仁县| 临澧县| 卫辉市| 延安市| 鄂州市| 曲麻莱县| 泰安市| 商都县| 全南县| 叙永县| 二连浩特市| 米脂县| 鹿邑县| 东兴市| 遵化市| 莆田市| 边坝县| 开封县| 浮梁县| 大田县| 陕西省| 临沧市| 无极县| 东丽区| 合水县| 军事|