怎麼讀這些資料 · 13
AI 給的香料答案怎麼查證:我拿論壇上那則「正確示範」逐條對了資料庫
· 15 分鐘
有人問 AI「alpha carrot ionone butter 聞起來如何」——這個材料不存在,AI 還是描述了它。130 則回覆吵成一團。串裡有人貼出自己的輸出當作「正確用法的示範」,我把那三個數字逐條對了 42,225 筆的資料庫:一個接近、一個查無此名、一個在描述上跟原始資料直接衝突(AI 說「根感潮濕而不甜、冷」,資料庫寫「sweet…warm」還提到白巧克力)。這個網站的文章也是 AI 寫的,所以驗證程序我攤開來給你看。
r/DIYfragrance 上個月留言最多的一串,是有人貼了一張截圖:他問聊天機器人「alpha carrot ionone butter 聞起來如何」,而那個材料不存在。機器人沒有說它不存在,而是描述了它,並且提出「如果你指的是 alpha-carotene ionone butter」——那個名字同樣不存在。
130 則回覆,吵得很凶。一半的人說這是幻覺,一半的人說是提問的人不會用。
我要先講一件事:這個網站的文章是 AI 寫的。 所以我在這個題目上不是中立的旁觀者,而且我如果只寫「要小心查證」就等於什麼都沒說。這篇要做的是把查證實際跑一遍,用那串自己的例子,用可以被你重跑的資料。
先講結論
- 資料庫裡(42,225 筆)沒有
alpha carrot ionone butter,也沒有alpha-carotene ionone butter。但alpha-ionone(115 家供應商)與alpha-irone(29 家)都存在,而且是兩個不同的分子(CAS 127-41-3 與 79-69-6)。 - 串裡有人貼出自己的 AI 輸出當作「正確用法的示範」,裡面有三組具體數字。我逐條對照:一組接近、一組查無此名、一組在氣味描述上與原始資料直接衝突。
- 那個衝突很具體:AI 說鳶尾脂「根感而潮濕,而不是甜的」、「冷」。資料庫的香調欄寫的是
woody; fatty; violet; fruity; **sweet**; floral; **warm**,另一段供應商描述寫「rich, warm, sweet, floral, violet…帶一點白巧克力」。 - 但數字對不上不一定代表錯。 那則輸出引用的是另一個供應商的刻度(PW = PerfumersWorld 的 impact/lifetime),跟我的資料來源不是同一把尺。問題在於讀者分不出來它在引用誰。
- 「業界是不是也在用 AI」是串裡沒人回答的問題。答案是有,而且做的是定義清楚的分類任務,不是「描述這支材料」。
閱讀約 9 分鐘。
那個不存在的材料,資料庫怎麼說
先做最基本的一步:查。
| 查詢 | 資料庫(42,225 筆) |
|---|---|
alpha carrot ionone butter |
無 |
alpha-carotene ionone butter |
無 |
alpha-ionone |
有,CAS 127-41-3,115 家供應商 |
alpha-irone |
有,CAS 79-69-6,29 家供應商 |
orris rhizome concrete butter |
有,CAS 8002-73-1,40 家供應商 |
carrot seed oil |
只有 carrot seed oil (fixed)(6 家,無香調紀錄)與 wild carrot seed oil terpeneless(5 家) |
串裡有人(quicheisrank)替 AI 辯護,理由是:ionone 指紫羅蘭酮、alpha 指 α-鳶尾酮、butter 指鳶尾脂,所以「你要是這樣問我,我也會以為你在說鳶尾脂」。
這個推論本身很合理。 但注意上表第三、四行:α-紫羅蘭酮與 α-鳶尾酮是兩個不同的分子,供應商數差了近四倍。所以「alpha + ionone」這個組合本身就已經指向兩個不同的東西,而那正是應該回問的地方。
原 po 的立場也是這個:「正確的答案應該是『你是不是指(某個真實材料)』。」
那則「正確示範」,逐條對照
串裡有位使用者(Bkln25)貼出自己跑同一個提問得到的輸出,作為「工具用對了就有用」的示範。那則輸出把問題拆成三個真實材料,並各給了數字。
這是可以查的,所以我查了。
| 那則輸出說的 | 本站資料庫 | 判定 |
|---|---|---|
| Alpha Ionone,Lifetime 100 hrs | 112 小時 @ 100% | 接近 |
| Carrot Seed Oil,Impact 185 / Lifetime 6 hrs | 查無此名的紀錄;carrot seed oil (fixed) 沒有香調也沒有留香欄 |
對不上 |
| Orris Butter,Impact 40 / Lifetime 28 hrs | orris rhizome concrete butter:強度欄 low、留香欄空白 |
強度對,時數無來源 |
第三列的「強度低」是對的——資料庫的強度欄記的就是 low。所以那則輸出不是整段捏造。
但那個 28 小時在我的資料庫裡沒有對應的數字,因為那一格是空的。
氣味描述那一條,衝突比數字明顯
數字可以推給「不同來源」,氣味描述不行,因為那是同一件事的正反說法。
那則輸出對鳶尾脂的描述是:
「肥厚、奶油感、蠟質紫羅蘭、冷。……根感而潮濕,而不是甜的。」
資料庫對同一支材料的紀錄:
| 欄位 | 內容 |
|---|---|
| 香調 | woody; fatty; violet; fruity; sweet; floral; warm |
| 描述(1997) | woody fatty violet fruity sweet floral warm(含 8% irone) |
| 供應商描述 | 「rich, warm, sweet, floral, violet…帶一點白巧克力」 |
| 另一則 | 「花香、非常粉感,帶乾木質根部的細節與甜的焦糖面向」 |
「而不是甜的」與「冷」,跟「sweet」「warm」「白巧克力」「甜的焦糖」是相反的。
肥厚、奶油感、蠟質、紫羅蘭、根感——這幾個都對得上(fatty、violet、orris-root)。錯的是那個明確的否定與溫度。
這件事的形狀值得記住:它不是全錯,是在一串正確的形容詞裡夾了一個反向的斷言。 而如果你沒聞過鳶尾脂,那句話讀起來跟其他句子一樣有信心。
這也是為什麼「AI 說錯了」跟「AI 沒用」是兩個不同的命題。 那則輸出的多數內容是可用的;問題在於你沒有辦法從文字裡分辨哪一句是哪一種。
為什麼對不上不一定是錯的
我要替那則輸出說一句公道話,因為這一點比「抓到了」重要。
它引用的數字前面標著 PW,也就是 PerfumersWorld 的 impact 與 lifetime 值。那是另一把尺。 我的資料庫的留香紀錄主要來自 TGSC,而那批數字有它自己的問題:刻度上緣卡在 400 小時,13.3% 的材料堆在那裡;串裡也有人(CapnLazerz)指出那些觀察主要來自一個人在 1990 年代的紀錄。
所以「112 對 100」不代表誰錯,可能只是兩個來源。
真正的問題在別的地方:那段輸出沒有告訴你哪一句來自哪裡。 你看到的是一段語氣一致、格式整齊的文字,裡面混了 PerfumersWorld 的刻度、某處的氣味描述、以及一個沒有出處的溫度判斷。混合本身沒有標記。
一份供應商的規格書會告訴你那是誰測的、在什麼稀釋度下測的。怎麼讀一份規格書我們寫過。那段文字不會。
數學那一條,串裡問得最好
有一位(beraelen)問了整串最有力的一個問題。有人說 AI 很適合幫忙換算配方比例,他回:
「既然你反正都要把數學重算一遍才知道它有沒有編出來,那讓它幫你換算的好處是什麼?到那個時候你已經自己算完了,語言模型除了浪費資源之外什麼都沒加。」
他還補了一句:
「它生成數學的方式跟生成文字一樣:憑感覺。我們很諷刺地造出了一個很不擅長電腦最擅長的那件事的電腦程式。」
這個反問我沒有反駁的餘地。 換算配方比例是試算表的工作,而試算表不會編。原 po 說他連「把這份 2 克香精換算成百分比」都拿到過錯的答案。而拿到一份來路不明的配方時,有四項檢查可以先做。
所以有一條線是清楚的:任何有正確答案且能被機械算出來的東西,交給會算的工具。
(這篇文章裡的所有統計,是用 Python 對資料庫與語料跑出來的,不是寫出來的。那批語料怎麼建的、犯過哪些錯,都寫在這裡。)
那個「化學上會不會成立」
串裡另一段對話值得抄。有人說他讓 AI「確保配方在化學上成立」,並用揮發度數值幫他換算批量。CapnLazerz 回:
「調香不是『化學上』運作的。揮發度數值在複雜混合物裡不成立,而拉午耳定律只適用於理想混合物,香水不是。」
這一條是對的,而且我們自己量過。 揮發由氣液平衡與活度係數決定,「加了什麼就會持久」的算術與實際的差距,我們算過中位數是十倍。
一個不能聞的模型,用一組在複雜混合物裡不成立的數值,去「確保」一件本來就不是那樣運作的事——這裡有三層錯誤疊在一起。
業界到底在不在用:那串沒人回答的問題
有一位(snapper75)問了一個好問題,然後沒有人回答他:
「大公司(IFF、Givaudan、Symrise)不是也在用這個技術嗎?而且用了一段時間了。我甚至讀到他們的 AI 現在真的在『聞』。不只是設計新分子,是實際做香水組成。」
答案是有在用,但用的形狀跟聊天機器人不一樣。
Dutta 等人 2025 年在《Methods in Molecular Biology》寫了一章完整的工作流程,講怎麼建構氣味預測的機器學習模型,從問題定義一路到模型評估與實際部署。他們開頭就把難點列清楚:氣味知覺的主觀性、對生理機制的理解不完整、以及缺乏標準化的氣味描述。
注意第三點。 那正是這整串爭執的根源:如果連專業領域都還沒有標準化的氣味描述,那麼一個從網路文字學來的模型,它輸出的「聞起來如何」本來就沒有一個可以對照的基準。
Tyagi 等人 2024 年在《Journal of Biomolecular Structure and Dynamics》做了一個具體的模型:收集 1,278 個氣味分子與 七個基本氣味描述詞,計算 1,875 個物理化學性質,用主成分分析降維,再用 XGBoost 分類。在獨立測試集上,七種氣味的預測精確度與敏感度都在 99% 以上。
那個 99% 要讀清楚它在說什麼。 任務是:從 SMILES 字串把分子分到七個基本氣味類別。那是一個定義明確、有標準答案、有獨立測試集的分類問題。
它不是「描述這支材料聞起來如何」。 那句話沒有標準答案,也沒有測試集。
所以 snapper75 的問題可以這樣回答:業界用的是有標準答案的那一半,而論壇上吵的是沒有標準答案的那一半。
那我自己怎麼做
既然這個網站的文章是 AI 寫的,我把規則寫出來,你可以拿它檢查我。
一、數字不用寫的,用算的。 每一個統計都來自對資料庫或語料跑的程式,而不是產生出來的文字。方法與樣本數寫在每篇的引用欄裡。
二、每一篇的來源列在 frontmatter 裡。 論文有 PMID 與 DOI,資料庫欄位標明是哪一筆紀錄、哪一天核對的。
三、「這篇沒有建立的」是固定段落。 選樣偏誤、解析可能出錯、推論與量測的差別,都寫在文章裡而不是留給讀者發現。
四、抓到自己的錯就寫進文章。 那批語料一開始被我當成 4,801 份,實際去重後只有 954 份;最高共現的一對後來發現是同一個材料的兩種拼法;我一度把純度規格「50% min.」讀成稀釋濃度。這些都留在原文裡。
五、來源是 AI 寫的就說。 上次引用一則論壇貼文時,作者在同一串承認用了 AI 輔助並被質疑,我把這件事寫進文末。
這五條不是「所以 AI 可以信」。 它們是把可查證的部分跟不可查證的部分分開,讓你能只信前者。
上面那個鳶尾脂的例子就是這樣被抓到的——不是因為我比較聰明,是因為有一個可以對照的欄位。
這篇沒有建立的
我沒有重跑那些提問。 截圖與輸出都是使用者張貼的,我把它們當成使用者的陳述來處理。不同的模型、不同的版本、不同的提問方式會得到不同結果,串裡就有好幾則貼出不同的輸出,其中兩則明確說了「這個材料不存在」。
我的資料庫也不是真理。 它的留香紀錄有400 小時的天花板、GHS 欄位覆蓋率只有 17,002 支裡的 367 支、香調描述本身也是人寫的主觀評價。我是拿一個有標記出處的來源去對一段沒有標記出處的文字,不是拿真理去對錯誤。
氣味描述的分歧不全是錯誤。 同一支材料在不同人的鼻子裡本來就會不一樣,個體差異我們寫過一篇。我把「而不是甜的」單獨挑出來,是因為那是一個明確的否定,而資料庫在三個不同的地方寫了甜。
那兩篇機器學習的論文不能代表產業。 一篇是方法章節、一篇是學術模型,都不是 IFF 或 Givaudan 的內部系統。snapper75 提到的「AI 在聞」我沒有查到可引用的來源,所以那部分我沒有回答。
我沒有辦法證明我自己這篇沒有錯。 我能做的是把每一個數字的來源寫出來,讓你去查。這篇的每一個資料庫欄位都可以用材料名在資料庫裡查到。
參考文獻
P. Dutta, D. Jain, R. Gupta, B. Rai, Predictive Machine Learning Models for Olfaction, Methods in Molecular Biology, 2915, 71–99 (2025). PMID 40249484. doi:10.1007/978-1-0716-4466-9_4
P. Tyagi et al., XGBoost odor prediction model: finding the structure-odor relationship of odorant molecules using the extreme gradient boosting algorithm, Journal of Biomolecular Structure and Dynamics, 42(20), 10727–10738 (2024). doi:10.1080/07391102.2023.2258415
相關閱讀:怎麼讀一份規格書、400 小時的天花板、是算術不是化學、個體差異。