新手調香師 · 122
新手調香師 #122:標了 (est) 的值反而比較一致,而那正是不能拿它當證據的理由
· 8 分鐘
這個資料庫在很多數值後面標著 est。比例差很大:xlogp3 是 100%、logP 99.7%、外觀欄 99.8%、蒸氣壓 94%、沸點 57.7%,而熔點只有 4.2%。我拿沸點與蒸氣壓的迴歸去測一件事:標了 est 的值是不是比較不準。結果跟直覺相反。限縮到有香調欄的香料材料,兩欄都是估計值的那 518 支,殘差標準差 18.7 °C、偏差超過 50 度的只有 1.0%;而兩欄都是實測值的 186 支,標準差 27.1 °C、超過 50 度的有 7.5%。估計值在每一項都比較一致。原因不難懂:兩個估計值來自同一個模型,它們同意是被設計出來的;兩份實測來自不同實驗室與不同年代,不同意才是常態。而這正是重點——一致不等於正確,所以你不能拿兩個估計值互相吻合當作它們是對的證據。這也回頭限制了我自己做過的很多跨欄位檢查。
閱讀約 5 分鐘。
太長不看
(est)的比例是一個清楚的階梯:
| 欄位 | 有值 | 標 (est) |
比例 |
|---|---|---|---|
| xlogp3 | 18,450 | 18,450 | 100.0% |
| appearance | 10,270 | 10,248 | 99.8% |
| logp | 19,667 | 19,604 | 99.7% |
| vapor_pressure | 9,020 | 8,479 | 94.0% |
| solubility | 23,941 | 20,158 | 84.2% |
| bp | 13,009 | 7,511 | 57.7% |
| flash_point | 14,316 | 8,109 | 56.6% |
| mp | 3,080 | 130 | 4.2% |
- 我測了「估計值是不是比較不準」。限縮到香料材料,答案是反過來的:
| 沸點/蒸氣壓 | 支數 | 殘差 SD | 偏差 >50 °C |
|---|---|---|---|
| 兩欄都實測 | 186 | 27.1 °C | 7.5% |
| 兩欄都估計 | 518 | 18.7 °C | 1.0% |
- 原因是兩個估計值來自同一個模型,它們同意是被設計出來的
- 而一致不等於正確——這回頭限制了我自己做過的很多檢查
這個小標記出現在哪裡
我上一輪發現 (est) 可以解決沸點衝突:
208 支同一壓力下有兩個沸點的材料裡,九成是「一個標 (est) 一個沒標」,留沒標的那個就好。
那讓我想把這個標記本身查清楚。它出現在八個欄位上,比例差很遠:
熔點只有 4.2% 是估計的,而 xlogp3 是 100%。
這個排序其實有道理。熔點好量——放一小塊在加熱台上看它什麼時候變透明, 儀器便宜、操作快、結果明確。分配係數(logP)不好量——要做兩相分配、 測兩邊的濃度,而且很多材料在水裡根本測不到,所以大家用算的。
這個欄位的估計比例,反映的是「量它有多麻煩」。
我以為估計值比較不準
這件事可以測。我用做過幾輪的沸點與蒸氣壓迴歸
當基準——8,048 支材料,沸點 ≈ 181.5 − 36.5 × log10(蒸氣壓)——
然後比較不同組合的殘差。
全庫的結果:
| 組合 | 支數 | 殘差中位數 | SD | >50 °C | >100 °C |
|---|---|---|---|---|---|
| 兩欄都實測 | 328 | 13.2° | 24.8 | 5.8% | 0.9% |
| 沸點實測、蒸氣壓估計 | 3,791 | 10.8° | 26.6 | 4.0% | 1.3% |
| 兩欄都估計 | 3,913 | 10.5° | 40.4 | 2.7% | 1.9% |
**中位數幾乎一樣,但標準差差很多。**估計值在中間表現得跟實測一樣好,尾巴卻厚得多。
那些厚尾巴是什麼?我把殘差超過 100 °C 的 74 支挑出來看: 26 支是除草劑、13 支是藥品、10 支是天然物萃取物,而 96% 的香調欄是空的。
估計式在它沒見過的化學空間裡崩掉,而那個空間佔了這個資料庫的大部分。
限縮到香料之後,結果反過來
把範圍收到有香調欄的 2,774 支:
| 組合 | 支數 | 殘差中位數 | SD | >50 °C | >100 °C |
|---|---|---|---|---|---|
| 兩欄都實測 | 186 | 10.9° | 27.1 | 7.5% | 1.6% |
| 沸點實測、蒸氣壓估計 | 2,066 | 10.5° | 26.3 | 4.9% | 1.3% |
| 兩欄都估計 | 518 | 10.2° | 18.7 | 1.0% | 0.6% |
**每一項都是估計值比較好。**偏差超過 50 度的比例是 1.0% 對 7.5%,差七倍。
為什麼
不是因為估計比較準,是因為它們來自同一個模型。
那個模型從分子結構算沸點,也從分子結構算蒸氣壓。 兩個輸出用的是同一套參數、同一個假設。它們互相吻合是被設計出來的,不是被驗證出來的。
而兩份實測值來自不同的實驗室、不同的年代、不同的純度、不同的儀器。 它們差 50 度,表示至少有一個是錯的——那是資訊。
估計值的一致沒有告訴你任何事,實測值的不一致告訴你有東西要查。
這回頭限制了我自己的很多篇
這一輪的結論,讓我得回去重新看我做過的檢查。
我這幾十輪的方法一直是「用同一筆紀錄的兩個欄位互相檢查」: 沸點與熔點、 沸點與蒸氣壓、 旋光度與去萜狀態。
當那兩個欄位都標著 (est) 的時候,它們吻合這件事本身沒有證據力。
具體來說:
- 我說 Verdox 與 Vertenex 的蒸氣壓「完全相同」。
兩個都是
(est)——同一個模型讀到兩個幾乎一樣的結構,當然給一樣的答案。 我在那篇的結尾有提到這一點,但沒有量化它有多嚴重。 - 我用蒸氣壓推論 2-甲基十一醛的沸點該是 233。 那一篇的論證主要靠同系列,蒸氣壓只是佐證,所以還站得住。
- 反過來,熔點只有 4.2% 是估計的, 所以「沸點欄與熔點欄寫著同一個數字」那個檢查特別可信—— 熔點那一邊幾乎都是實測。
你該怎麼用這個標記
- **看到
(est)不要當成「不可靠」。**在香料的化學空間裡它表現得很好 - **但不要拿兩個
(est)值互相吻合當證據。**那是同一個模型的兩個輸出 - **兩個實測值不一致才值得追。**那表示有東西錯了
- 熔點欄是這個資料庫裡最「實測」的欄位(95.8% 沒標
(est)), 拿它當基準最安全 - **xlogp3 完全沒有實測值。**那一欄是純計算的,18,450 筆全部標著
(est)
這篇沒有建立的
- **我沒有比對任何外部的真值。**整篇測的是「兩個欄位互相吻合的程度」, 那是一致性,不是準確度。估計值可能一致地錯。
- **迴歸本身有殘差標準差 34 °C(全庫)。**它不是一把精密的尺。
- **「同一個模型」是我的推論。**資料庫沒有說
(est)值是怎麼算出來的, 我只知道它們的行為像同一個來源。 - 實測值的高變異也可能來自我的解析——同一格裡有多個值時我取的是第一個
@ 760.00 mm Hg的段落,那可能挑到比較差的那個。 - 香料/非香料的分界用的是「香調欄有沒有值」,那是我上一輪定的粗判準。
- 量測誤差如何影響統計推論有專門文獻(PMID 20573762 講的迴歸稀釋就是一種), 而化學資料集的清理流程也有(PMID 27885862)。 這裡做的是一個資料集內部的比較,不是那個層級的工作。