我們知道,MongoDB屬於文檔型資料庫,其存儲的文檔類型都是JSON對象。正是由於這一特性,我們在Node.js中會經常使用MongoDB進行數據的存取。但由於Node.js是非同步執行的,這就導致我們無法保證每一次的資料庫save操作都是原子型的。也就是說,如果客戶端連續兩次發起同一事件將數據.....
我們知道,MongoDB屬於文檔型資料庫,其存儲的文檔類型都是JSON對象。正是由於這一特性,我們在Node.js中會經常使用MongoDB進行數據的存取。但由於Node.js是非同步執行的,這就導致我們無法保證每一次的資料庫save操作都是原子型的。也就是說,如果客戶端連續兩次發起同一事件將數據存入資料庫,很可能會導致數據被重覆保存。高併發的情況下,哪怕是你在代碼中已經做了非常嚴格的校驗,例如插入數據前判斷要保存的數據是否已經存在,但仍然有可能會出現數據被重覆保存的風險。因為在非同步執行中,你沒有辦法保證哪個線程先執行,哪個線程後執行,客戶端發起的所有請求並非按我們想象的都是順序執行的。一個較好的解決辦法是在Mongo資料庫的所有表中創建唯一索引。事實上,MongoDB預設會為所有表創建一個_id欄位的唯一索引(可以取消)。如果你想在Node.js中通過mongoose.schema來自動創建索引,可以參考下麵的代碼:
var mongoose = require('mongoose'); var Schema = mongoose.Schema; var customerSchema = new mongoose.Schema({ cname: String, cellPhone, String, sender: String, tag: String, behaviour: Number, createTime: { type: Date, default: Date.now }, current:{ type: Boolean, default: true } }, { versionKey: false }); customerSchema.index({cname:1,cellPhone:1,sender:1,tag:1,behaviour:1}, {unique: true});
module.exports = mongoose.model('customer', customerSchema);
上面的model中我們定義了表customer的結構,並通過index()方法在欄位cname,cellPhone,sender,tag,behaviour上創建了唯一索引,這樣當包含這些欄位的重覆數據被插入時,資料庫會拋出異常。借用mongoose,如果資料庫表之前已經被創建並且程式正在運行中,當我們修改model並添加索引,然後重新啟動app,只要有對該model的訪問,mongoose會自動進行檢測並創建索引。當然,如果數據出現重覆,則索引創建會失敗。此時我們可以通過在創建索引時添加dropDups選項,讓資料庫自動將重覆的數據刪除,如:
customerSchema.index({cname:1,cellPhone:1,sender:1,tag:1,behaviour:1}, {unique: true, dropDups: true});
不過據MongoDB的官方說明,自3.0以後的版本不再使用該選項,而且也並沒有提供替代的解決辦法。貌似官方不再提供創建索引時自動刪除重覆記錄的功能。那如何才能快速有效地找出重覆的記錄並且刪除呢?首先我們要找出這些記錄,然後通過remove()方法進行刪除。下麵的查詢語句可以找出給定欄位有重覆數據的記錄:
db.collection.aggregate([ { $group: { _id: { firstField: "$firstField", secondField: "$secondField" }, uniqueIds: { $addToSet: "$_id" }, count: { $sum: 1 } }}, { $match: { count: { $gt: 1 } }} ])
替換_id屬性的值以指定你想要進行判斷的欄位。相應地,在Node.js中代碼如下:
var deferred = Q.defer(); var group = { firstField: "$firstField", secondField: "$secondField"}; model.aggregate().group({ _id: group, uniqueIds: {$addToSet: '$_id'}, count: {$sum: 1} }).match({ count: {$gt: 1}}).exec(deferred.makeNodeResolver()); return deferred.promise;
上述代碼使用了Q來替換函數執行中的回調。在Node.js的非同步編程中,使用Q來處理回調是個不錯的選擇。
下麵是返回的結果:
/* 1 */ { "result" : [ { "_id" : { "cellPhone" : "15827571111", "actId" : ObjectId("5694565fa50fea7705f01789") }, "uniqueIds" : [ ObjectId("569b5d03b3d206f709f97685"), ObjectId("569b5d01b3d206f709f97684") ], "count" : 2.0000000000000000 }, { "_id" : { "cellPhone" : "18171282222", "actId" : ObjectId("566b0d8dc02f61ae18e68e48") }, "uniqueIds" : [ ObjectId("566d16e6cf86d12d1abcee8b"), ObjectId("566d16e6cf86d12d1abcee8a") ], "count" : 2.0000000000000000 } ], "ok" : 1.0000000000000000 }
從結果中可以看到,一共有兩組數據相同的記錄,所以返回的result數組的長度為2。uniqueIds屬性為一個數組,其中存放了重覆記錄的_id欄位的值,通過該值我們可以使用remove()方法來查找並刪除對應的數據。
補充:Mongoose支持findOneAndUpdate(在MongoDB中對應的方法叫findAndModify),選項upsert=true表示當要要更新的數據不存在時會自動創建。該選項預設值為false。示例代碼如下:
var query = {'username':req.user.username}; req.newData.username = req.user.username; MyModel.findOneAndUpdate(query, req.newData, {upsert:true}, function(err, doc){ if (err) return res.send(500, { error: err }); return res.send("succesfully saved"); });
通過該方法我們可以將數據的唯一性校驗交給MongoDB來完成。