新手調香師 · 34
把留香標成「優/良/差」,是在一個沒有天然切點的分布上畫線
· 11 分鐘
論壇上有人怪罪某個資料庫「把留香從優到差評等,而不是單純顯示時數、不做價值判斷」。這件事可以看資料。本站資料庫的 2,027 筆留香紀錄裡,只有 210 個不重複的數值,而其中 12 個值就佔了 55.4%。更麻煩的是那些值正好是 4、8、12、24、400——整數本身就是堆。所以「八小時以下算差」這條線不是落在兩群之間的縫隙,是正好切過 92 筆記在 8.0 小時的紀錄。問卷方法學早就測過標籤會改變作答,只是那些研究測的是受試者,不是讀者。
「什麼事讓你覺得煩」那串裡,有一則得了 28 票,而它指名了一個對象:
「那是某個香水資料庫的錯,他們開始把留香從『優異』到『差』評等,而不是單純顯示時數、不做價值判斷。 很煩。」
底下的附議:
「就是這個!光是那一件事就影響了一整個世代剛入門的人。他們錯誤地以為,一支香水如果不是『猛獸模式』就不值得聞。」
這是一個關於評分尺度設計的抱怨,而它可以從兩個方向查:資料長什麼樣,以及標籤會不會改變判斷。
先講結論
- 本站資料庫有 2,027 筆留香紀錄,而其中只有 210 個不重複的數值。
- 12 個數值就佔了 55.4%。 最大的一堆是 400 小時,334 筆(16.5%)。
- 那些堆正好落在整數上:4 小時(8.4%)、12 小時(4.9%)、8 小時(4.5%)、24 小時(4.1%)。
- 所以任何一條「幾小時以下算差」的線,都會落在堆上而不是縫上。 以八小時為界的話,那條線正好切過 92 筆剛好記在 8.0 小時的紀錄——它們落在哪一邊,完全取決於規則寫的是「≥8」還是「>8」。
- 整體分布:中位 72 小時,四分位距 12 到 296 小時,20.1% 在 8 小時以下。
- 問卷方法學確實測過標籤的效應:與作答選項相連的文字與數字標籤,會實質影響受試者如何在給定的作答格式裡做選擇(Blais 與 Grondin 2011)。但那些研究測的是填問卷的人,不是讀資料的人。
閱讀約 9 分鐘。
那個分布長什麼樣
先把資料攤開。資料庫裡有留香紀錄的原料共 2,027 筆:
| 值 | |
|---|---|
| 中位數 | 72 小時 |
| 第一四分位 | 12 小時 |
| 第三四分位 | 296 小時 |
| 最小 | 1 小時 |
| 最大 | 901 小時 |
| 不重複的數值 | 210 個 |
兩千多筆紀錄,只有 210 個不同的數字。
而那 210 個裡面,前 12 個就佔掉一半以上:
| 留香值 | 筆數 | 佔比 |
|---|---|---|
| 400 小時 | 334 | 16.5% |
| 4 小時 | 170 | 8.4% |
| 12 小時 | 99 | 4.9% |
| 8 小時 | 92 | 4.5% |
| 24 小時 | 83 | 4.1% |
| 1 小時 | 65 | 3.2% |
| 16 小時 | 62 | 3.1% |
| 48 小時 | 62 | 3.1% |
| 168 小時 | 53 | 2.6% |
| 20 小時 | 40 | 2.0% |
| 28 小時 | 35 | 1.7% |
| 336 小時 | 27 | 1.3% |
| 合計 | 1,122 | 55.4% |
這不是一條平滑的曲線,是一排柱子。
為什麼柱子的位置很要命
因為柱子都站在整數上。
4、8、12、16、20、24、28、48、168、336、400——這些是人在記錄時會選的數字,不是自然界產生的數字。一支材料在試香紙上撐了七小時四十分,紀錄會寫 8 小時。
而畫標籤界線的人,也會選同樣的整數。
「八小時以下算差」聽起來像一條中立的線。實際上它正好切過那 92 筆記在 8.0 的紀錄。
那 92 筆材料落在「差」還是「不差」,完全取決於規則寫的是「≤8」還是「<8」。 兩種寫法都合理,而它們會給出不一樣的名單。
如果那條線落在 9 小時或 7 小時,這個問題就不存在——因為那兩個位置幾乎沒有紀錄。問題正好出在:好用的整數界線,跟資料的堆積位置是同一批數字。
累積分布:每一條線都很陡
| 界線 | 在此以下 | 佔比 |
|---|---|---|
| ≤ 4 小時 | 276 | 13.6% |
| ≤ 8 小時 | 408 | 20.1% |
| ≤ 12 小時 | 520 | 25.7% |
| ≤ 24 小時 | 729 | 36.0% |
| ≤ 48 小時 | 916 | 45.2% |
| ≤ 100 小時 | 1,115 | 55.0% |
| ≤ 200 小時 | 1,379 | 68.0% |
| ≤ 400 小時 | 2,010 | 99.2% |
從 8 小時移到 12 小時,被歸進去的材料多了 112 筆(5.6 個百分點)。 而那四小時的差距,在感官上是很小的一步。
最後一列尤其該看。 從 200 到 400 小時之間,累積比例從 68.0% 跳到 99.2%——因為 400 那根柱子。
我們寫過那件事:400 小時是很多量測的截斷點,而不是量到的值。 334 筆紀錄坐在那裡,其中很多其實是「量到停手的時候還沒消失」。
所以在高分那一端,標籤也會出問題——只是方向相反:它會把一大群「至少 400」的材料全部評成同一級,而它們之間的真實差距不知道有多大。
標籤會不會改變判斷
這一半我只能給間接的證據,而我要先把限制講清楚。
問卷方法學研究過「標籤怎麼影響作答」。Blais 與 Grondin 2011 年在《Journal of Applied Measurement》的開場就是這件事:
問卷是社會科學研究者工具箱裡最常用的資料蒐集技術之一,而許多因素會影響受訪者對題目的回答並影響資料效度。在這些因素之中,已累積的研究證明,問卷中與作答類別相連的文字與數字標籤,可能實質影響受訪者在所給定的作答格式內做出選擇的方式。
那篇自己做的事更窄:用 Andrich 的評定量表模型,看副詞「完全」用來標記極端類別時,會對受訪者的作答產生什麼影響。
Krosnick 1999 年在《Annual Review of Psychology》的調查研究回顧裡,也把這件事列為近年的進展之一:
已辨識出評定量表各點所加文字標籤的令人意外的效應,指出了量表標籤的最佳做法。
現在講限制,因為它很重要。
那些研究測的是「填問卷的人怎麼選格子」,而論壇抱怨的是「讀資料的人形成什麼期待」。 那是兩件相鄰但不相同的事。
我沒有找到直接測後者的研究。 「Fragrantica 的標籤改變了一整個世代的期待」這個說法,我沒有辦法查證,也沒有辦法反駁。 它是合理的,而它目前是一個觀察,不是一個發現。
我能做的只有:確認「標籤會影響人如何使用一個尺度」這件事在方法學上是被研究過的,然後把資料那一半查清楚。
那位留言者的替代方案
他說的是:單純顯示時數、不做價值判斷。
而那正是本站資料庫在做的事——它記的是「400 小時 @ 10% 於 DPG」這種字串,沒有形容詞。
但那個做法也有代價,而這篇前面已經展示了:
- 原始數字有堆積效應,讀的人不知道 8 小時那個值代表「大約八小時」而不是「量到 8.0」。
- 量測條件不一致。 有些是 100% 原液、有些是 10% 稀釋、有些帶大於號。我們寫過留香有兩種量法,直接把數字排序會排出錯誤的順序。
- 400 那根柱子是截斷點,不是量測值。
所以「不加標籤」不等於「中立」。 一個沒有標籤的數字欄位,仍然把讀者推向「數字大比較好」——只是它把那個推力藏起來了。
真正誠實的做法,是把量測條件跟數字一起顯示。 而那件事很難做得好看。
收起來的話
- 那條線沒有天然的位置。 資料是柱狀的,而柱子站在整數上,而整數也正是人會拿來當界線的東西。
- 八小時那條線切過 92 筆紀錄。
- 高分端的問題更大:400 小時那根柱子有 334 筆,而它是截斷點。
- 標籤會影響人怎麼用尺度,這在方法學上有研究;標籤有沒有改變一整個世代的期待,我查不到。
- 不加標籤也不是中立的,它只是把價值判斷交給讀者,而讀者手上沒有量測條件。
而對正在做東西的人來說,最實際的一句還是上一輪那位講的: 把時間記下來,在自己的皮膚上,隔幾小時回去聞。你自己的紀錄不需要標籤,因為你知道它是怎麼量的。
這篇沒有建立的
我沒有查證 Fragrantica 現在或過去怎麼顯示留香。 那是留言者的敘述,我沒有去看那個網站,也沒有查它的改版歷史。 這篇處理的是「把連續量標成優劣」這個一般問題,不是任何特定網站的做法。
2,027 筆留香紀錄的量測條件不一致。 有些是 100% 原液、有些是 10% 或 20% 稀釋於 DPG 或苯甲酸苄酯,而我們寫過這個問題。這篇的分布是把所有值混在一起看的,那對「值會堆在整數上」這個觀察沒有影響,但它意味著中位數 72 小時不是一個有意義的物理量。
「210 個不重複值」包含了小數。 例如 16.6、4.5 這種值也算一個。堆積的現象比這個數字顯示的更嚴重。
400 小時那 334 筆裡,有多少帶大於號我在這篇沒有重數。 上一篇算過全庫有 206 筆帶大於號,兩個數字不能直接相減,因為統計範圍不同。
Blais 與 Grondin 那篇我只讀到摘要。 那篇自己做的是「完全」這個副詞的效應,而我引用的是它引言裡對既有研究的概述,不是它自己的實驗結果。
Krosnick 那篇是 1999 年的回顧。 二十幾年過去了,而我只讀了摘要。
那兩篇都是問卷方法學,測的是受試者作答。 論壇講的是讀者期待。我在正文裡標明了這個落差,這裡再說一次:我沒有直接的證據。
「不加標籤也不中立」是我的論點,不是引用來的。 它建立在這篇前面的資料上,而不是在任何一篇研究上。
參考文獻
J. G. Blais, J. Grondin, The influence of labels associated with anchor points of Likert-type response scales in survey questionnaires, Journal of Applied Measurement, 12(4), 370–386 (2011). PMID 22357158
J. A. Krosnick, Survey research, Annual Review of Psychology, 50, 537–567 (1999). PMID 15012463. doi:10.1146/annurev.psych.50.1.537
相關閱讀:400 小時的天花板、留香的兩種量法、八小時這個標準、評測時的三個動作。