摘要:使用進制也能生成比較短的字符串唯一,不過還有更好的解決方案,你也看到了上面短鏈接的唯一里還包含大寫字母。接下來我們使用進制轉換,將一個十進制數字轉化為對應的進制表示。一億用進制表示出來后的結果是生成的唯一字符串足夠短。
假設你想做一個像微博短鏈接那樣的短鏈接服務,短鏈接服務生成的URL都非常短例如: http://t.cn/E70Piib, 我們應該都能想到鏈接中的E70Piib對應的就是存儲長鏈接地址的數據記錄的ID,可是這個有大小寫字母和數字構成的唯一ID是怎么生成的呢,剛學編程的時候我們用的方法都試拼接一個足夠唯一的字符串(比如時間戳加用戶ID等等)然后再用MD5或者SHA1散列算法算出一個散列值,用這種方法得到的唯一ID有可能比原始的鏈接的長度還要長,所以如何來優雅的生成足夠短的字符串唯一ID呢?
我們先來看一個數學問題,普通的數字ID是用十進制來表示的,在十進制中每位都有10種可能(0-9),所以5位的十進制數能呈現最多10 * 10 * 10 * 10 * 10 = 100,000 個ID。
現在如果用32進制來表達一個5位數字需要多少位呢?
32進制是數字和一些小些字母來組成,所以5位32進制可表達的唯一ID有 32 * 32 * 32 * 32 * 32 = 33,554,432個,數量已經很大了。
使用32進制也能生成比較短的字符串唯一ID,不過還有更好的解決方案,你也看到了上面短鏈接的唯一ID里還包含大寫字母。
接下來我們使用62進制轉換,將一個十進制數字轉化為對應的62進制表示。
(為什么用62進制?數字加大小寫字母一共是62個)
常用的這幾個編程語言里沒有提供62進制的轉換,所以就需要我們自己寫一個函數來進行10進制到62進制的轉換。
/** * Convert a numeric string from base 10 to another base. * * @param $value decimal string * @param int $b base , max is 62 * @return string */ function to_base($value, $b = 62) { $base = "0123456789abcdefghijklmnopqrstuvwxyzABCDEFGHIJKLMNOPQRSTUVWXYZ"; $r = $value % $b; $result = $base[$r]; $q = floor($value / $b); while ($q) { $r = $q % $b; $q = floor($q / $b); $result = $base[$r].$result; } return $result; } /** * Convert a 10 base numeric string to a 62 base string * * @param int $value * @return string */ function base62_encode($value) { return to_base($value, 62); }定義好上面的函數后,讓我們將100,000,000 轉換成62進制試一試:
echo base62_encode(100000000); //結果是6LAze理解了將十進制正整數轉換成62進制的字符串表示形式的原理后,在任何編程語言里都可以很輕松地實現一個轉換函數,下面再提供一個Python版本的Base62.encode
#!/usr/bin/python # -*- coding=UTF-8 -*- from __future__ import print_function, division BASE62 = "0123456789abcdefghijklmnopqrstuvwxyzABCDEFGHIJKLMNOPQRSTUVWXYZ" def encode(num, alphabet=BASE62): """Encode a positive number in Base X Arguments: - `num`: The number to encode - `alphabet`: The alphabet to use for encoding """ if num == 0: return alphabet[0] arr = [] base = len(alphabet) while num: num, rem = divmod(num, base) arr.append(alphabet[rem]) arr.reverse() return "".join(arr)Python函數注解
python的divmod函數用第一個參數num除以第二個參數base,并以元組的形式返回商和余數。
因為divmod返回兩個元素構成的元組,在python中元組可以簡寫省略兩邊地括號,所以num, rem = divmod(num, base)是一個元組賦值表達式,并不是divmod函數返回了兩個返回值。
一億用62進制表示出來后的結果是6LAze , 生成的唯一字符串ID足夠短。短鏈接只是一個應用場景,base62還可以應用到很多需要表示唯一ID的地方,這樣一來你就不用再使用那些哈希算法來生成那么冗長的字符串了,雖然只是節省了一些空間但是這在高訪問量的URL和海量數據的存儲中還是能省下來不少資源的。
文章版權歸作者所有,未經允許請勿轉載,若此文章存在違規行為,您可以聯系管理員刪除。
轉載請注明本文地址:http://specialneedsforspecialkids.com/yun/29530.html
摘要:使用進制也能生成比較短的字符串唯一,不過還有更好的解決方案,你也看到了上面短鏈接的唯一里還包含大寫字母。接下來我們使用進制轉換,將一個十進制數字轉化為對應的進制表示。一億用進制表示出來后的結果是生成的唯一字符串足夠短。 假設你想做一個像微博短鏈接那樣的短鏈接服務,短鏈接服務生成的URL都非常短例如: http://t.cn/E70Piib, 我們應該都能想到鏈接中的E70Piib對應的...
摘要:前端設置上下無效果,因為是行內元素,是沒有寬高的。求該青蛙跳上一個級的臺階總共有多少種跳法。 首先和大家說個對不起,由于總結了太多的東西,所以篇幅有點長,這也是我縫縫補補總結了好久的東西,對于Nginx的東西我沒總結在這里,大家可以Python聚焦看,點擊直達專欄哦。 前端 span設置margin上下無效果,因為span是行內元素,是沒有寬高的。 Py2 VS Py3 print成...
閱讀 3569·2021-11-15 11:36
閱讀 1060·2021-11-11 16:55
閱讀 695·2021-10-20 13:47
閱讀 2993·2021-09-29 09:35
閱讀 3428·2021-09-08 10:45
閱讀 2554·2019-08-30 15:44
閱讀 849·2019-08-30 11:10
閱讀 1428·2019-08-29 13:43