新手調香師 · 92
香草精有 109 家供應商,而它的香調欄只有一個詞:vanilla
· 6 分鐘
依蘭等級 I 拿到十個描述詞與 319 小時的留香資料;等級 II 與 III 加起來供應商更多,卻只拿到「floral; ylang」兩個詞。這讓我去量:描述的豐富度跟商業重要性有關嗎?整體有——6,913 筆有香調欄的紀錄裡,供應商 0 家的中位數是 3 個描述詞,50 到 99 家的是 8 個,Spearman ρ = 0.433。但有 56 筆打破這條線:供應商 20 家以上、描述詞卻只有一兩個。而那 56 筆裡有 55.4% 的描述詞就是它自己的名字——香草精寫 vanilla、薄荷油寫 peppermint、大蒜油寫 garlic。對照組(描述詞六個以上)只有 22.0%。這個欄位描述不了那些自己就是定義的東西。
閱讀約 4 分鐘。
上一篇掃 FEMA 重複組的時候,依蘭那一組讓我停下來:
| 供應商 | 紀錄 | 香調欄 | 留香 |
|---|---|---|---|
| 42 | 依蘭花油 I | 花香、花瓣、茉莉、橙花、鈴蘭、辛香、香脂、泥土、木質、酒感 | 319 小時 |
| 30 | 依蘭花油 II | 花香、依蘭 | —(空) |
| 45 | 依蘭花油 III | 花香、依蘭 | —(空) |
等級 I 拿到十個描述詞,II 與 III 各拿到兩個——而 II 與 III 加起來的供應商比 I 多。
所以我去量:這個欄位的豐富度,跟一支材料有多重要有關嗎?
整體來說:有關
6,913 筆有香調欄的紀錄,按供應商數分組:
| 供應商 | 筆數 | 描述詞中位數 | 有強度欄 | 有留香欄 |
|---|---|---|---|---|
| 0 | 1,089 | 3 | 13.8% | 12.9% |
| 1–4 | 2,452 | 3 | 12.8% | 11.9% |
| 5–9 | 1,299 | 4 | 27.5% | 26.6% |
| 10–19 | 972 | 5 | 44.1% | 42.3% |
| 20–49 | 808 | 7 | 66.8% | 66.1% |
| 50–99 | 251 | 8 | 88.0% | 88.0% |
| 100+ | 42 | 8 | 85.7% | 85.7% |
**Spearman ρ = 0.433。**描述詞從 3 個爬到 8 個,強度欄的填答率從 13.8% 爬到 88%。
這條線很清楚:有人買的東西,有人去聞。
但有 56 筆掉出這條線
供應商 20 家以上、描述詞卻只有一兩個的,有 56 筆。而它們不是冷門的東西:
| 供應商 | 材料 | 香調欄全文 |
|---|---|---|
| 109 | 香草精 | 「vanilla」 |
| 88 | 薄荷油 | 「peppermint」 |
| 71 | 玫瑰 specialty | 「rose」 |
| 67 | 桂皮油 | 「cassia; cinnamon」 |
| 66 | (±)-樟腦 | 「camphoreous」 |
| 56 | 小花茉莉原精 | 「floral; jasmin」 |
| 53 | 大蒜油 | 「garlic」 |
| 47 | 檸檬油(義大利) | 「lemon」 |
| 45 | 薑根油 CO2 萃取 | 「spicy; ginger」 |
| 45 | 依蘭花油 III | 「floral; ylang」 |
| 41 | 廣藿香油(分子蒸餾) | 「patchouli」 |
| 39 | 鳶尾根凝香體 | 「orris」 |
| 25 | 焙炒咖啡豆萃取 | 「coffee; coffee roasted coffee」 |
最後那一筆把話講完了:它把自己的名字寫了兩次。
量出來的模式
我把「描述詞與材料名重疊」定義成自我指涉(比對時先去掉 oil、absolute、extract 這類通用詞):
| 自我指涉比例 | |
|---|---|
| 描述詞 ≤2 且供應商 ≥20(56 筆) | 55.4% |
| 描述詞 ≥6 且供應商 ≥20(781 筆) | 22.0% |
| 2.5 倍 |
薄描述那一組有超過一半在重複自己的名字。
為什麼會這樣
因為氣味的描述詞就是從這些材料來的。
「玫瑰」這個描述詞之所以存在,是因為有玫瑰。「香草」這個詞是先有香草莢才有的。當你要描述玫瑰油的時候,唯一準確的那個詞,正是它自己捐出去的那個。
**這不是資料庫偷懶。這是描述系統的邊界。**一個以實物為基準的詞彙表,沒有辦法描述基準本身。
而換去評嗅欄也沒用
我原本以為 odor_descriptions(署名的評嗅紀錄)會補上細節。沒有:
| 評嗅欄字數中位數 | |
|---|---|
| 薄描述組(56 筆) | 46 字 |
| 豐描述組(781 筆) | 364 字 |
實際看那三筆:
香草精:在 100.00% 下。vanilla 薄荷油:在二丙二醇裡 10.00%。peppermint 大蒜油:在丙二醇裡 0.01%。intense garlic
大蒜那筆多了一個 intense,其餘就是同一個詞加上一個濃度。
但那個濃度是有用的
那 56 筆全部都標了評測濃度,而分布是這樣:
| 評測濃度 | 筆數 |
|---|---|
| 0.01% | 3 |
| 0.10% | 2 |
| 1.00% | 2 |
| 10.00% | 10 |
| 100.00% | 39 |
從 0.01% 到 100%,相差一萬倍。
最低那三筆是異硫氰酸烯丙酯、大蒜油、大蒜油(中國);最高那端是依蘭 II/III、香草莢萃取、白茶葉萃取。
**這個欄位沒能告訴你它聞起來如何,但它告訴了你該用多稀的濃度去聞。**而後者在實務上更常是你需要的那個數字。
實務上
- **看到只有一兩個描述詞的紀錄,先看供應商數。**如果供應商很多,那不是資料缺漏,是這支材料自己就是那個詞。
- **這種紀錄要看的是評測濃度,不是描述詞。**0.01% 與 100% 是兩種完全不同的操作方式。
- **依蘭那種同一族內部差很多的情況要小心。**等級 I 有 319 小時的留香資料,II 與 III 完全沒有——那不代表它們留香短,只代表沒有人量。
這篇沒有建立的
- 自我指涉是用字串重疊判斷的,我去掉了 oil/absolute/extract 這類通用詞並要求詞長大於三,但那仍是粗糙的近似——「cassia; cinnamon」算命中,而那兩個詞的關係比字面複雜。
- **ρ = 0.433 是相關,不是因果。**供應商多的材料也可能本來就氣味複雜。
- 描述詞數是用分號切的,不同紀錄的斷句習慣可能不同。
- 「詞彙表以實物為基準」是我的解釋,資料庫沒有說明它的描述詞從哪裡來。
- 56 這個數字取決於我選的門檻(≤2 個描述詞、≥20 家供應商),換門檻數字會變。
- 我沒有聞過任何一支上面提到的材料。