採購 · 9
1,560 支原料有沸點、沒有留香時數。沸點能不能頂替?
· 6 分鐘
清掉設限值與估算沸點之後剩 770 列,留香中位數按沸點五分位是 8、16、44、124、252 小時——單調、大約三十倍、斯皮爾曼 0.62。它排得出順序,但預測不了:最低那一段裡也有撐 400 小時的。
供應商的規格書通常會給沸點,常常不給留香時數。在這個資料庫裡,那個缺口就是問題本身:4,620 支拿得到的原料裡,有 1,560 支有常壓沸點、完全沒有留香時數——占你買得到的東西三分之一。
所以實際要問的是:你手上有的那個數字,能不能頂替你想要的那個。「揮發性跟留香有沒有關係」是另一個問題。
這個比較在有意義之前要先做的事
兩個欄位都不能照原樣用,而清理過程比結果更值得看。
留香時數帶著它的量測濃度。1,778 筆裡有 1,601 筆是原液 100%,其餘是 20%、10%、1%。它也帶著設限值:通過第一層過濾之後,還有 180 筆寫的是 > 48 hour(s) 或 < 1 hour(s),不是一個數字。
沸點常常被記兩次,一次減壓、一次常壓;而常壓值裡有 131 筆標著 (est),是估算不是量測:
isoeugenol 125.00 °C @ 14.00 mm Hg | 266.00 °C @ 760.00 mm Hg
全部套下去——原液量測、常壓、去掉設限值、去掉估算沸點、同一個 CAS 只留一列——剩 770 列。
嚴格說它不是 770 個化合物:其中有精油與原精,那是有沸程的混合物而不是單一分子;而「100%」講的是它被聞的時候的濃度,不是它的純度。
這些沸點有三分之二是範圍值 250.00 to 258.00 °C,底下的數字取下限。改取中點,斯皮爾曼的變化不到 0.01,所以這個選擇沒有撐著結論。
排序成立
| 常壓沸點 | 列數 | 留香中位數 | 中間一半 |
|---|---|---|---|
| 37–190 °C | 154 | 8 小時 | 4–24 hr |
| 190–222 °C | 154 | 16 小時 | 8–52 hr |
| 223–250 °C | 154 | 44 小時 | 19–144 hr |
| 250–277 °C | 154 | 124 小時 | 48–284 hr |
| 277–497 °C | 154 | 252 小時 | 100–400 hr |
每一段都單調遞增,最低到最高大約 三十倍,斯皮爾曼 ρ 0.62。
所以前中後調那個排序不是民間傳說。照沸點分組,組跟組之間確實照留香長短排出來。
然後它就不好用了
中位數藏起來的是:每一段幾乎都橫跨整個範圍。最低那一段從 1 小時到 400;第三段從 3 到 746。有 19 列沸點低於 200 °C 而留香 200 小時以上,有 7 列沸點高於 280 °C 卻一天之內就沒了。
ρ = 0.62 說的是兩者的排序高度同向。它沒有說兩者貼得多緊,而把它平方成「解釋了多少變異」,是把另一個統計量的讀法借過來用。各段的全距才是誠實的鬆緊度量。沸點告訴你這一列落在調色盤的哪一端,不告訴你它會留多久。
這些數字比看起來粗
留香時數被四捨五入得很兇。乾淨集裡最常見的值是 4 小時(10.3%),接著是 400 小時(8.8%),然後是 12 與 8。沸點最高的那一段裡,154 列有 40 列剛好是 400。
要小心它代表什麼、不代表什麼。它不會把「三十倍」往某個已知方向推:那些 400 全部落在自己那一段的中位數之上,把它們換成任何更大的數,中位數都不會動。這篇文章的前一版說這個堆積讓那個倍數變成下限——那是錯的,而且算術簡單到本來就不該寫出來。
四捨五入真正代表的是:這些數字是穿著數值外衣的分類標籤。揮發曲線那一篇早就說要把留香當排序刻度而不是絕對值,那句話在這裡全部成立。
為什麼兩者會分開
這裡的留香時數量的是「試香紙上還聞得到這支材料多久」。那取決於分子跑得多快——沸點講的是這件事——同時也取決於濃度低到什麼程度你還聞得到,而沸點對這件事一個字都沒說。
一支揮發得快、但在極低濃度下仍然可辨的材料,會活得比它的沸點久。一支揮發得慢、但嗅覺閾值高的材料,會在東西還很多的時候就消失。這是對機制的推理,不是這裡量到的東西,提出來是當作那四成殘差可能的形狀,不是當作結果。
怎麼用它,以及不要怎麼用
- 拿它定位一整組,不要定位單一材料。 分組排得出來,組裡的個別列排不出來。起步調色盤那一篇用的是「實測留香超過 72 小時」而不是沸點,正是這個理由——這裡沸點落在 289 到 291 °C 之間的列,有一列只留 40 小時,另一列不到 1 小時。
- 不要拿它去訂配方比例。 同一段裡的離散,比相鄰兩段之間的差距還大。
- 有量測值就用量測值。 任何一列只要已經有非設限的留香數字,沸點就沒有加到任何東西。
這裡用到的留香時數是以原液 100% 記錄的,而那不是任何人使用香水的條件——那個數字量的是什麼、不是什麼處理的正是原料數字與使用者體驗之間的落差。
一段差點寫錯的過程
這個分析的第一版跑出來是非單調的:第二個沸點段的中位數比第一段還低,讀起來像「通說在揮發端失效」。有意思,而且值得寫成文章。
那是解析錯誤。用「字串裡有沒有 760.00 mm Hg」過濾,會讓同時帶減壓數值的材料通過;再取字串裡第一個數字,取到的是減壓值。isoeugenol 因此以 125 °C 進到分析裡,而不是 266 °C。
修好之後得到一張 1,113 列的單調表,而建立在那上面的版本寫了「61 倍」,還說 400 小時的堆積讓那個倍數變成下限。複查指出第二句在算術上就是錯的;而那 1,113 列裡還有 180 筆設限值、131 筆估算沸點、54 列重複 CAS 被當成不同材料。清掉之後就是上面那 770 列:排序活下來了,倍數掉到大約三十,下限那句話撤回。
三個錯誤都值得完整寫出來,因為它們產生的都不是雜訊——每一個都給出比事實更乾淨、更好引用的數字。那正是應該回頭去看原始欄位長什麼樣子的時候。
同一個欄位後來又咬了我第三次:那次是拿一個一成濃度的稀釋值去跟純料排名。