怎麼讀這些資料 · 15
分子式底下有 217 支原料,從玫瑰到蘑菇都有
· 10 分鐘
有人用分子式 C10H18O 搜尋,搜到了我們站上。我回頭查了資料庫:這個分子式底下有 217 支原料,78 支填了香調,分散在 19 個香調型裡。玫瑰的香葉醇、尤加利的桉葉素、薄荷的薄荷酮、聞起來像蘑菇和香菜的癸烯醛,分子式一模一樣,分子量全部是 154.25。留香從 1 小時到 388 小時,388 倍。全站 21,610 支填了分子式的原料裡,有 17,081 支的分子式不是自己獨有的,占 79%。這篇講分子式作為查詢條件為什麼幾乎沒有用,以及兩篇文獻:廣島的研究團隊 2000 年比較沉香醇的兩個鏡像異構物,發現不只主觀評價不同,前額腦波也不同;2023 年《Science》上的主嗅覺圖譜用圖神經網路從分子結構預測氣味描述語,準到超過受訓評測員的中位數表現。那個模型吃的是結構圖,不是分子式。
閱讀約 4 分鐘。
太長不看
- 資料庫有 21,905 支填了分子式,扣掉寫
unspecified的 295 支,剩 21,610 支分布在 6,710 個分子式上 - 其中 2,181 個分子式被兩支以上原料共用,涵蓋 17,081 支原料,占 79%
- C10H18O 底下有 217 支,78 支填了香調,散在 19 個香調型裡
- 這 217 支的分子量全部是 154.25,留香從 1 小時到 388 小時
- 拿分子式當查詢條件,回來的是一個櫃子,不是一支材料。要唯一,用 CAS
一個從分子式進來的查詢
上個月的 Search Console 裡有一筆查詢是 c₁₀h₁₈o,連下標數字都打出來了,
五次曝光,零點擊。有人在用分子式找原料。
這個查詢讓我回頭查了一件從來沒查過的事:在我們的資料庫裡,一個分子式平均綁著幾支原料?
79% 的原料,分子式不是自己獨有的
21,610 支有效的分子式紀錄,落在 6,710 個不同的分子式上。平均一個分子式 3.2 支。
但平均數在這裡沒有意義,因為分布很偏。2,181 個分子式被兩支以上共用, 而這些分子式涵蓋了 17,081 支原料。換句話說,你在資料庫裡隨手抓一支有分子式的原料, 有 79% 的機率它的分子式底下還站著別人。
最擁擠的十個:
| 分子式 | 原料數 | 這一格大概是什麼 |
|---|---|---|
| C15H24 | 293 | 倍半萜烴,雪松、廣藿香那一區的骨架 |
| C10H18O | 217 | 單萜醇與單萜醚,這篇的主角 |
| C10H16O | 210 | 單萜酮與單萜醛 |
| C15H24O | 204 | 倍半萜醇 |
| C15H26O | 175 | 飽和一階的倍半萜醇 |
| C10H18O2 | 171 | 單萜二醇與酯 |
| C12H22O2 | 141 | 中鏈酯與內酯 |
| C11H20O2 | 123 | 同上,少一個碳 |
| C8H14O2 | 105 | 短鏈酯 |
倍半萜烴那一格有 293 支。要是有人拿 C15H24 來查,他會拿到近三百個答案。
C10H18O 這一格裡站著誰
217 支之中,78 支填了香調欄。這 78 支分在 19 個香調型裡:
| 香調型 | 支數 |
|---|---|
| floral(花香) | 14 |
| herbal(草本) | 9 |
| minty(薄荷) | 9 |
| citrus(柑橘) | 8 |
| fatty(脂感) | 6 |
| woody(木質) | 6 |
| balsamic(香脂) | 4 |
| camphoreous(樟腦) | 4 |
| 其餘 11 種各 1–3 支 | 18 |
供應商最多的那幾支長這樣:
| 材料 | CAS | 供應商 | 香調型 | 香調前幾個詞 | 留香(小時) |
|---|---|---|---|---|---|
| 香葉醇 | 106-24-1 | 198 | floral | 甜、花香、果香、玫瑰 | 60 |
| 沉香醇 | 78-70-6 | 135 | floral | 柑橘、花香、甜、玫瑰木 | 12 |
| α-松油醇 | 98-55-5 | 103 | terpenic | 松、萜、紫丁香 | 20 |
| 橙花醇 | 106-25-2 | 85 | floral | 甜、橙花、柑橘、玉蘭 | 44 |
| 1,8-桉葉素 | 470-82-6 | 77 | herbal | 尤加利、草本、樟腦、藥感 | 4 |
| 香茅醛 | 106-23-0 | 70 | floral | 甜、乾、花香、草本 | 16 |
| (±)-薄荷酮 | 89-80-5 | 42 | minty | 薄荷 | 12 |
| (E)-2-癸烯醛 | 3913-81-3 | 27 | fatty | 蠟、脂、土、綠、香菜、蘑菇 | 57 |
玫瑰、尤加利、薄荷、蘑菇。同一個分子式。
分子量也全部一樣,154.25,因為分子量是分子式算出來的, 它不帶任何分子式以外的資訊。留香就分家了:這 217 支裡有 47 支填了留香, 從 1 小時到 388 小時,跨 388 倍。
差別在骨架怎麼接,不在有幾個原子
分子式只說了原子的清單:10 個碳、18 個氫、1 個氧。它沒說這些原子怎麼連起來。 同一份清單至少有三種接法會分家:
**接成不同的骨架。**1,8-桉葉素是一個雙環的醚,香葉醇是一條開鏈的醇。 一個聞起來像尤加利喉糖,一個聞起來像玫瑰。
**接法一樣但方向不同。**香葉醇與橙花醇是同一條鏈的順反異構物。 資料庫給它們的供應商數是 198 與 85,留香 60 小時與 44 小時, 香調欄第一個詞都是 sweet,但一個往玫瑰走,一個往橙花與玉蘭走。
**連方向都一樣,只是鏡像。**這就是下一節那篇論文做的事。
值得注意的是,資料庫自己也把鏡像分開收:linalool(135 家供應商,留香 12 小時)
與 laevo-linalool(25 家,16 小時)是兩筆紀錄,香調欄也不同——
前者寫柑橘、花香、玫瑰木、藍莓,後者寫清新、花香、木質、天然、薰衣草。
目錄資料承認鏡像是兩種商品。
廣島的實驗:兩個鏡像的沉香醇,連腦波都不一樣
2000 年廣島縣立女子大學的 Sugawara 等人在《Chemical Senses》上做了一件細緻的事 (PMID 10667997)。他們用反覆的快速管柱層析,從薰衣草油分離出 (R)-(−)-沉香醇 (比旋光度 −15.1°),從芫荽油分離出 (S)-(+)-沉香醇(+17.4°), 市售品則是外消旋的 (RS) 型(0°,R 型 50.9%、S 型 49.1%)。
受試者用吸入器聞這三種,時間點是工作前與工作後各一次,工作分兩類: 聽環境音,以及做心算類的腦力工作。量兩件事:主觀感受的問卷,以及前額表面腦波(IBVA-EEG)。
結果照原文講:吸入後的主觀印象會隨異構物構型與工作類型而不同。 舉例來說,聽完環境音之後聞 (R)-(−)-沉香醇,問卷上的評價明顯更好, 同時 β 波比工作前下降得更多;換成腦力工作之後聞同一支,卻傾向煩躁,β 波上升。
作者的結論是,沉香醇的對映異構專一性引發了不同的氣味知覺與反應, 而且不只依賴手性,也依賴任務。
這篇要小心讀。樣本規模小,量的是前額表面電位而不是嗅覺受體, 而且效果本身是任務相依的——同一支材料在不同前情境下走向相反。 它能支持的結論只有一句:兩個鏡像不是同一個氣味刺激。原子清單完全相同。
Science 上的模型也不吃分子式
第二篇是 2023 年《Science》上的主嗅覺圖譜(POM) (Lee 等人,PMID 37651511,Google Research 與 Monell 化學感官中心合作)。 他們用圖神經網路把分子映射到一張保留知覺關係的圖上,再用它預測沒被描述過的氣味分子。
那個成績值得抄下來:在 400 個樣本外氣味分子的前瞻驗證集上, 模型產生的氣味描述比評測小組的中位數成員更接近小組平均。 換句話說,它描述氣味的可靠度已經達到一個受訓過的人類評測員的水準。
利益揭露照原文附上:這項工作由 Google Research 資助,多位作者在審稿期間 加入了 Osmo Labs 並持有股份,論文的利益衝突聲明寫得很長。
但這裡我要指的不是它多準,是它吃什麼。圖神經網路的輸入是分子的圖: 哪個原子接哪個原子、什麼鍵、什麼立體構型。分子式是把那張圖的邊全部丟掉之後 剩下的那份清單。目前最好的結構—氣味模型,沒有一個是從分子式出發的。
所以查詢的時候該用什麼
- **要唯一,用 CAS。**C10H18O 給你 217 個候選,CAS 106-24-1 給你香葉醇那一頁。 站上的搜尋支援名稱與 CAS。
- **只知道分子式,那就當成一個香調櫃來逛。**知道自己拿到的是 217 支不是 1 支, 這個預期本身就有用。
- 同一個 CAS 底下也不保證單一。同一個 CAS、不同香調型 那篇量過這件事,CAS 比分子式嚴,但也不是完全乾淨。
→ 用香調搜尋:42,225 筆原料,用香調、名稱或 CAS 都查得到。
這篇沒有建立的
- **217 支裡只有 78 支填了香調。**其餘 139 支沒有資料,不能說「217 支的氣味各不相同」, 只能說已知的 78 支散在 19 個香調型裡。
- **分子量全部相同不是發現,是定義。**分子量由分子式算出,這一列在這裡只是用來說明 分子式帶不動的資訊有多少。
- Sugawara 那篇的樣本小,量的是前額腦波,不是嗅覺受體活性,而且效果隨任務改變。
- POM 預測的是氣味描述語,不是留香、強度或安全性。那些欄位還是得靠量測。
- 香調型的分類本身來自來源資料,不是我們重新標的,19 這個數字帶著原始標註的粒度。