最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Instagram提升PostgreSQL性能的五個技巧

 更新時間:2015年04月21日 10:30:20   投稿:goldensun  
這篇文章主要介紹了Instagram提升PostgreSQL性能的五個技巧,Instagram的數(shù)據(jù)庫一直由PostgreSQL支撐,經(jīng)驗(yàn)很具有參考性,需要的朋友可以參考下

 隨著Instagram的規(guī)模日益擴(kuò)大,Postgres繼續(xù)充當(dāng)著Instagram的堅(jiān)實(shí)基礎(chǔ),并存儲著絕大部分的用戶數(shù)據(jù)。不到一年之前,我們還曾在博客上說Instagram“存儲著大量數(shù)據(jù)”,每秒增加90條數(shù)據(jù),現(xiàn)在,這個數(shù)據(jù)已經(jīng)增長到了峰值的10000條。而我們的基礎(chǔ)存儲技術(shù)依然保持不變。

在過去的兩年半中,我們有一些關(guān)于Postgres擴(kuò)展的經(jīng)驗(yàn)和工具,想要分享出來。真希望在當(dāng)初啟動Instagram的時候就能有這些經(jīng)驗(yàn)和工具呀。其中有些是Postgres獨(dú)有的,有些是其它數(shù)據(jù)庫也可以采用的。如果想要了解我們是如何水平分區(qū)的,可以看這篇文章。

1. 局部索引

如果我們經(jīng)常需要按某個固定的特征過濾數(shù)據(jù),而且這個特征只存在于一小部分行里,在這種情況下,局部索引非常有效。

比方說,Instagram搜索標(biāo)簽的時候,我們需要找出有許多照片的標(biāo)簽。我們一般會用ElasticSearch之類的技術(shù)來進(jìn)行高級搜索,不過這里只靠數(shù)據(jù)庫的查詢能力就完全夠了。先來看一下,按標(biāo)簽查詢,并按照片數(shù)排序,Postgres是怎么做的:
 

EXPLAIN ANALYZE SELECT id from tags WHERE name LIKE 'snow%' ORDER BY media_count DESC LIMIT 10;   
QUERY PLAN 
---------                                 
 Limit (cost=1780.73..1780.75 rows=10 width=32) (actual time=215.211..215.228 rows=10 loops=1)
  -> Sort (cost=1780.73..1819.36 rows=15455 width=32) (actual time=215.209..215.215 rows=10 loops=1)
     Sort Key: media_count
     Sort Method: top-N heapsort Memory: 25kB
     -> Index Scan using tags_search on tags_tag (cost=0.00..1446.75 rows=15455 width=32) (actual time=0.020..162.708 rows=64572 loops=1)
        Index Cond: (((name)::text ~>=~ 'snow'::text) AND ((name)::text ~<~ 'snox'::text))
        Filter: ((name)::text ~~ 'snow%'::text)
 Total runtime: 215.275 ms
(8 rows)

有沒有看到,為了得到結(jié)果,Postgres不得不對15000行數(shù)據(jù)進(jìn)行排序。由于標(biāo)簽的分布滿足長尾模式(譯者注: 根據(jù)百度百科,「我們常用的漢字實(shí)際上不多,但因出現(xiàn)頻次高,所以這些為數(shù)不多的漢字占據(jù)了上圖廣大的紅區(qū);絕大部分的漢字難得一用,它們就屬于那長長的黃尾。」),我們可以改為查詢超過100張照片的標(biāo)簽,先建局部索引:
 
CREATE INDEX CONCURRENTLY on tags (name text_pattern_ops) WHERE media_count >= 100
然后查詢,看一下新的查詢計(jì)劃:
 

EXPLAIN ANALYZE SELECT * from tags WHERE name LIKE 'snow%' AND media_count >= 100 ORDER BY media_count DESC LIMIT 10;
 
QUERY PLAN
 Limit (cost=224.73..224.75 rows=10 width=32) (actual time=3.088..3.105 rows=10 loops=1)
  -> Sort (cost=224.73..225.15 rows=169 width=32) (actual time=3.086..3.090 rows=10 loops=1)
     Sort Key: media_count
     Sort Method: top-N heapsort Memory: 25kB
     -> Index Scan using tags_tag_name_idx on tags_tag (cost=0.00..221.07 rows=169 width=32) (actual time=0.021..2.360 rows=924 loops=1)
        Index Cond: (((name)::text ~>=~ 'snow'::text) AND ((name)::text ~<~ 'snox'::text))
        Filter: ((name)::text ~~ 'snow%'::text)
 Total runtime: 3.137 ms
(8 rows)

可以看到,Postgres只需要訪問169行,所以速度快得多。Postgres的查詢計(jì)劃器對約束的評估也很有效。如果以后想要查詢超過500張照片的標(biāo)簽,由于這個結(jié)果集是上面集合的子集,所以仍然會使用這個局部索引。

2. 函數(shù)索引

在某些表上,我們需要對一些很長的字符串建立索引,比如說,64個字符的base64記號。如果直接建索引的話,會造成大量的數(shù)據(jù)重復(fù),這種情況下,可以用Postgres的函數(shù)索引:
 

CREATE INDEX CONCURRENTLY on tokens (substr(token), 0, 8)

雖然這樣會造成許多行匹配相同的前綴,但我們可以在匹配的基礎(chǔ)上再用過濾,速度很快。而且索引很小,只有大概原來的十分之一。

3. 用pg_reorg來讓數(shù)據(jù)更緊湊

隨著時間的流逝,Postgres的表會變得越來越零碎(由MVCC并發(fā)模型等原因引起)。而且,數(shù)據(jù)行插入的順序往往也不是我們希望返回的順序。比如說,如果我們經(jīng)常要按用戶來查詢照片等,那么最好是在磁盤上把這些東西放在一起,這樣就可以減少磁盤尋道的時間。

我們用pg_reorg來解決這個問題,它用三個步驟來讓“壓緊”一個表:

  1.     取得表的獨(dú)占鎖
  2.     建一個記錄變更的臨時表,在原始表上加一個觸發(fā)器,把對原始表的變更復(fù)制到臨時表上
  3.     用CREATE TABLE...SELECT FROM...ORDER BY建表,新表擁有原始表的全部數(shù)據(jù),而且是按索引順序排序的
  4.     將CREATE TABLE執(zhí)行時間點(diǎn)以后發(fā)生的變更從臨時表同步過來
  5.     業(yè)務(wù)切換到新表

每一步都會有很多細(xì)節(jié),不過大體上就是像上面這個樣子。我們先對這個工具進(jìn)行了一些審查,運(yùn)行了若干測試,然后再把它用到生產(chǎn)環(huán)境上?,F(xiàn)在,我們已經(jīng)在幾百臺機(jī)器的環(huán)境上跑過幾十次pg_reorg,沒出現(xiàn)過任何問題。


4. 用WAL-E進(jìn)行WAL(寫前日志)的歸檔和備份

我們用WAL-E來歸檔WAL日志,它是Heroku寫的一個工具,我們也向它貢獻(xiàn)了一部分代碼。WAL-E大大簡化了數(shù)據(jù)備份和復(fù)制庫創(chuàng)建的過程。

WAL-E是利用Progres的archive_command,將PG產(chǎn)生的每個WAL文件都?xì)w檔到Amazon的S3。利用這些WAL文件和數(shù)據(jù)庫的基準(zhǔn)備份,我們可以將數(shù)據(jù)庫恢復(fù)到基準(zhǔn)備份后任何一個時間點(diǎn)的狀態(tài)。利用這個手段,我們也可以快速創(chuàng)建只讀的復(fù)制庫或故障備用庫。

我們?yōu)閃AL-E寫了一個簡單的封裝腳本,可以監(jiān)控歸檔時的重復(fù)故障,見GitHub。
 
5. psycopg2中的自動提交模式和異步模式

我們也開始用psycopg2中的一些高級功能(psycopg2是Postgres的Python驅(qū)動)。

一個是自動提交模式。在這個模式里,psycopg2不會發(fā)出BEGIN/COMMIT,每個查詢跑在自己的單語句事務(wù)里。這對不需要事務(wù)的只讀查詢特別有用。開啟很簡單:

connection.autocommit = True

開啟自動提交后,我們的應(yīng)用服務(wù)器和數(shù)據(jù)庫之間的對話大減,數(shù)據(jù)庫服務(wù)器的CPU用量也大減。而且,我們是用PGBouncer作為連接池,開啟自動提交后,連接的歸還也更快了。

與Django的交互細(xì)節(jié)可以看這里。


psycopg2還有一個很有用的功能,它可以通過注冊一個等待回調(diào)(wait callback)函數(shù),提供協(xié)同程序(coroutine)支持。它可以支持跨連接查詢,對命中多個節(jié)點(diǎn)的查詢非常有用,當(dāng)有數(shù)據(jù)時,socket會被喚醒(我們利用Python的select模塊來處理喚醒)。它也可以與eventlet和gevent等多線程庫很好的協(xié)作,參考實(shí)現(xiàn)可見psycogreen。

總的來說,我們對Postgres的高性能和可靠性十分滿意。想在世界上最大之一的Postgres集群上工作嗎?想跟一群基礎(chǔ)設(shè)施高手們一起干活嗎?請聯(lián)系infrajobs@instagram.com吧。

相關(guān)文章

  • 通過一分鐘快速了解索引技巧

    通過一分鐘快速了解索引技巧

    這篇文章主要給大家介紹了如何通過一分鐘快速了解索引技巧的相關(guān)資料,文中通過示例代碼介紹的非常詳細(xì),對大家學(xué)習(xí)或者使用索引具有一定的參考學(xué)習(xí)價值,需要的朋友們下面來一起學(xué)習(xí)學(xué)習(xí)吧
    2019-12-12
  • SQL語句中公共字段的自動填充方法

    SQL語句中公共字段的自動填充方法

    這篇文章主要給大家介紹了關(guān)于SQL語句中公共字段的自動填充方法,文中通過示例代碼介紹的非常詳細(xì),對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價值,需要的朋友們下面隨著小編來一起學(xué)習(xí)學(xué)習(xí)吧
    2020-10-10
  • 解決Navicat Premium 15連接數(shù)據(jù)庫閃退的問題

    解決Navicat Premium 15連接數(shù)據(jù)庫閃退的問題

    這篇文章主要介紹了Navicat Premium 15連接數(shù)據(jù)庫閃退,本文給大家分享解決方法,對大家的學(xué)習(xí)或工作具有一定的參考借鑒價值,需要的朋友可以參考下
    2021-03-03
  • 虛擬主機(jī)ACCESS轉(zhuǎn)換成MSSQL完全攻略(圖文教程)

    虛擬主機(jī)ACCESS轉(zhuǎn)換成MSSQL完全攻略(圖文教程)

    大家都知道,ACCESS數(shù)據(jù)庫在數(shù)據(jù)量到達(dá)一定程度后,訪問速度會明顯變慢,甚至造成崩潰。目前,大多數(shù)虛擬主機(jī)服務(wù)商提供的ASP主機(jī)空間一般都同時支持MS ACCESS和MS SQL兩種類型的數(shù)據(jù)庫。
    2010-04-04
  • Navicat?premium?for?mac?12的安裝破解圖文教程

    Navicat?premium?for?mac?12的安裝破解圖文教程

    Navicat Premium是一款數(shù)據(jù)庫管理工具,將此工具連接數(shù)據(jù)庫,你可以從中看到各種數(shù)據(jù)庫的詳細(xì)信息,這篇文章主要介紹了Mac下Navicat?premium?for?mac?12的安裝破解過程,需要的朋友可以參考下
    2024-01-01
  • 如何讓Birt報表腳本數(shù)據(jù)源變得既簡單又強(qiáng)大

    如何讓Birt報表腳本數(shù)據(jù)源變得既簡單又強(qiáng)大

    這篇文章主要介紹了如何讓Birt報表腳本數(shù)據(jù)源變得既簡單又強(qiáng)大,需要的朋友可以參考下
    2018-11-11
  • 利用SQL腳本導(dǎo)入數(shù)據(jù)到不同數(shù)據(jù)庫避免重復(fù)的3種方法

    利用SQL腳本導(dǎo)入數(shù)據(jù)到不同數(shù)據(jù)庫避免重復(fù)的3種方法

    這篇文章主要給大家介紹了關(guān)于利用SQL腳本導(dǎo)入數(shù)據(jù)到不同數(shù)據(jù)庫避免重復(fù)的3種方法,文中通過示例代碼介紹的非常詳細(xì),對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價值,需要的朋友們下面隨著小編來一起學(xué)習(xí)學(xué)習(xí)吧。
    2017-10-10
  • 大數(shù)據(jù)量,海量數(shù)據(jù)處理方法總結(jié)

    大數(shù)據(jù)量,海量數(shù)據(jù)處理方法總結(jié)

    大數(shù)據(jù)量的問題是很多面試筆試中經(jīng)常出現(xiàn)的問題,比如baidu google 騰訊這樣的一些涉及到海量數(shù)據(jù)的公司經(jīng)常會問到。
    2010-11-11
  • dbeaver導(dǎo)入導(dǎo)出數(shù)據(jù)庫圖文教程(sql文件形式)

    dbeaver導(dǎo)入導(dǎo)出數(shù)據(jù)庫圖文教程(sql文件形式)

    這篇文章主要介紹了如何使用DBeaver復(fù)制數(shù)據(jù)庫,在導(dǎo)出和導(dǎo)入數(shù)據(jù)庫時,需要注意編碼一致性,以避免導(dǎo)入錯誤,文中通過代碼介紹的非常詳細(xì),需要的朋友可以參考下
    2025-02-02
  • SQL注入報錯注入函數(shù)圖文詳解

    SQL注入報錯注入函數(shù)圖文詳解

    報錯注入是SQL注入的一種,下面這篇文章主要給大家介紹了關(guān)于SQL注入報錯注入函數(shù)的相關(guān)資料,文中通過示例代碼介紹的非常詳細(xì),需要的朋友可以參考下
    2022-07-07

最新評論

西乌| 璧山县| 保康县| 黑水县| 罗源县| 乌恰县| 郯城县| 米易县| 新昌县| 东安县| 乌什县| 安达市| 周口市| 大渡口区| 根河市| 伊川县| 谢通门县| 厦门市| 教育| 永康市| 永靖县| 镶黄旗| 昌图县| 平和县| 泰州市| 德兴市| 襄城县| 巨野县| 宜丰县| 东乡县| 托里县| 富源县| 开远市| 凤城市| 北辰区| 万全县| 轮台县| 原平市| 蒙阴县| 江津市| 区。|