新手調香師 · 81
同一支材料有兩份搭配清單,而它們指向不同的地方
· 4 分鐘
資料庫的搭配建議分成香調與風味兩半。7,035 支材料兩份都有,而兩份的內容只有部分重疊——交集除以聯集的中位數是 0.379,交集除以較短那一份是 0.600。真正有意思的是方向:香調那半邊有 24.3% 指向花香,而風味那半邊花香只排第三、佔 10.9%,前兩名換成果香 12.1% 與柑橘 11.1%。同一個資料庫、同一批材料,兩份清單的重心不一樣。所以「這支材料配什麼」這個問題,先要問你是在做香水還是在做風味。
閱讀約 4 分鐘。
這是搭配清單的第三篇。前兩篇量的是清單被截斷在每種 60 筆,以及香調那半邊有 73.6% 跨型、四分之一指向花香。
這一篇處理我前兩篇都跳過的東西:清單有兩半,而我只看了其中一半。
兩份清單
blenders 表的 kind 欄有兩個值:
- odor(香調):336,574 列
- flavor(風味):337,088 列
幾乎對半分。而 7,035 支材料兩份都有。
它們重疊多少
把每一支材料的兩份清單當成集合,算重疊:
| 中位數 | |
|---|---|
| 交集 ÷ 聯集 | 0.379 |
| 交集 ÷ 較短的那一份 | 0.600 |
**兩份清單共用的內容大約是聯集的三分之一。**換個角度看:較短那一份裡有六成也出現在較長那一份裡。
完全沒有交集的材料只有 1 支(7,035 支裡),所以兩份清單不是各說各話——它們有實質的共同基礎,但有相當一部分不一樣。
重心不一樣
真正的差別在方向。把兩半各自的目的地分佈排出來:
| 名次 | 香調半邊 | 風味半邊 | ||
|---|---|---|---|---|
| 1 | 花香 | 24.3% | 果香 | 12.1% |
| 2 | 香脂 | 12.0% | 柑橘 | 11.1% |
| 3 | 柑橘 | 9.7% | 花香 | 10.9% |
| 4 | 果香 | 8.6% | 綠 | 7.3% |
| 5 | 草本 | 5.1% | 香脂 | 5.8% |
| 6 | 綠 | 4.0% | 草本 | 4.8% |
| 7 | 醛香 | 3.2% | 辛香 | 4.2% |
香調那半邊,花香一家獨大——24.3%,是第二名的兩倍。
風味那半邊,花香掉到第三名,只剩 10.9%,而前兩名換成果香與柑橘。
**而且風味那半邊平坦得多。**香調的第一名是 24.3%,風味的第一名只有 12.1%——沒有任何一個香調型在風味清單裡佔到八分之一以上。
這代表什麼
**一、「這支材料配什麼」要先問用途。**同一支材料,做香水時被推去配花香,做風味時被推去配果香與柑橘。
**二、風味那半邊的建議比較分散。**香調清單有一個明顯的重心,風味清單沒有。如果你想找不落俗套的組合,風味那半邊的分佈本身就比較平均。
**三、兩份清單有六成重疊,所以互相參照是有意義的。**同時出現在兩份裡的建議,是一個比較強的訊號——它在兩套不同的使用脈絡下都被列出來。
**四、前兩篇的結論要加一句限定。**我說「清單指向花香」,那句話只對香調那半邊成立。風味那半邊不是那樣,而我當時沒有檢查。
實際可以怎麼做
- **看建議的時候確認你在看哪一半。**做香水看香調那半,做食用香精看風味那半。
- **兩份都列出來的那些,優先試。**六成的重疊代表交集不是隨機的。
- **要跳脫花香的慣性,去看風味那半邊。**它的分佈平坦得多。
- **上限仍然適用。**兩半各截斷在 60 筆,所以合起來的 120 是兩份不同的排行榜,不是一份長清單。
這篇沒有建立的
- **重疊是用名稱字串比對算的。**同一支材料在兩份清單裡若用不同寫法就會被算成不重疊,所以 0.379 是下限。
- 目的地分佈用的是
grp欄,而香調與風味兩半的grp不保證是同一套分類詞彙——這跟上一篇是同一個方法缺口,而在這裡它更嚴重,因為我正在跨兩半做比較。 - 「風味清單比較平坦」是分佈的觀察,我沒有算集中度指標,也沒有做統計檢定。
- 兩半的分組欄各有大量「找不到分組」的列(香調 108,086 列以及風味那邊也有),全部排除在分佈計算之外。
- 我不知道兩份清單是怎麼產生的,也不知道它們是否來自同一個資料來源。
- **這篇仍然沒有評估任何建議的品質。**三篇都在講清單的形狀。