昨天,Music Recap 已經能把我八月的 YouTube Music 活動,和一組其他平台使用者保留在 ListenBrainz 的紀錄放在一起比較。
我的目標藝人活動量界線是 1,088–1,228 筆,在原正值集合的位置範圍是 2–13/26。這個答案仍有很多未知,但我今天先碰到另一個問題:活動筆數比較多,是否也代表這位藝人在對方的紀錄中占比較高?
今天新增的分析可以回答這個問題。它也讓我知道,有哪些結論已經能成立,哪些仍需要新的來源證據。
先承認第一輪沒有完成目標
今天第一輪做了未知紀錄盤點、來源查詢,以及既有結果的重算。重算仍然得到昨天的數字;當時沒有新增正式分析功能。
原本的目標是取得會影響個人或比較位置的證據。單純留下「查過了,沒有變」的紀錄,還不能說完成了這個目標。測試通過也只代表所測的行為通過,不能替代新的分析成果。
所以今天繼續做了兩件事:核對另一條精確來源關係,以及增加一個能實際比較的量。
活動量與占比,分別回答什麼?
活動量問的是:在這份資料裡,目標藝人留下多少筆活動?
占比問的是:在這份資料保留的全部活動裡,目標藝人占多少?
分母必須包含未確認藝人的活動。如果只除以已經辨識完成的紀錄,辨識率不同的資料集就會被換成不同口徑。
八月的個人 Music 資料共 2,215 筆:
他的目標活動總筆數確定比我多;但我的占比下界 49.12%,仍高於他的占比上界 37.35%。
因此,在這兩份各自保留的紀錄中,我的目標藝人活動占比確定較高。這是今天新增、可以直接回答的比較結論。
同樣的方法套用到整個固定集合,我的占比確定高於 8 個原正值帳號;若包含其他有保留紀錄的候選帳號,則確定高於 10 個帳號。其餘有定義的外部占比仍可能重疊,不能直接宣稱全部排在我後面。
這個結果描述的是資料的組成。不同平台的紀錄方式、匯出範圍與漏記情況,仍可能改變占比;不能把它擴張成完整聆聽偏好或誰比較喜歡這位藝人。
如果資料漏記,占比結論還能撐多久?
我接著量化這個限制。先固定目前的歸屬界線,每次只替其中一份資料補入原本未保留的活動,計算「我的占比下界仍高於對方上界」何時不再保證成立:
假設情境 最少額外活動 比較式
只替我的資料補入非目標活動 698 筆 1088 / (2215 + 698) <= 4505 / 12061
只替 meze 補入目標活動 2,790 筆 (4505 + 2790) / (12061 + 2790) >= 1088 / 2215
這兩個門檻也放進正式分析的 JSON 結果,並用精確分數驗證:少一筆時,原本的嚴格高於仍成立;到達門檻才失去保證。
這不是說我的資料真的漏了 698 筆,或對方漏了 2,790 筆。實際漏記量仍不知道,也沒有上限證據;兩邊若同時改變,可能更早失去保證。這些是一次只改變一方、且新增活動全部符合指定歸屬的假設情境,不能用來推算完整歷史排名,也不能當作剩餘 140 筆未知活動的新增判定。
零紀錄不能直接寫成 0%
外部名單仍固定為 25 個原正值帳號與 10 個觀測零目標帳號,沒有因為新結果而重選。
其中六個帳號在該月沒有任何保留紀錄。它們的占比是 0/0,必須標成「未定義」,不能當成 0%。
原正值集合加上我的資料共 26 份,全部都有占比分母;占比位置界線是 1–18/26。完整固定集合共 36 份,其中 30 份有定義的占比;在這 30 份中的位置界線是 1–20/30,另六份仍保留在名單中並標示未定義。
這些是新的占比位置,與原本的活動量位置不同:
external_lower * personal_total > personal_upper * external_total
personal_lower * external_total > external_upper * personal_total
同值不算嚴格高於。個人資料與朋友的 Spotify 仍分屬不同主體,朋友的紀錄與時長不會填進我的分子或分母。
精確來源查詢仍沒有縮小活動量範圍
140 筆個人未知活動來自 59 個來源項目;最大的五個項目占 77 筆。經授權,今天將這五個確切影片網址送到 MusicBrainz 查錄音關係,五筆都回傳 HTTP 404,沒有可用的來源到錄音連結。
另外,最接近個人活動量下界的外部帳號 kenrick95,有 157 筆確認與 970 筆未知,上界為 1,127。今天核對其來源自行提交的專輯識別碼,取得成功回應與九個專輯曲目;但是三個來源曲目識別碼與回應中的曲目識別碼沒有交集。
專輯名稱或歌名看起來一致,仍不能補上這條精確識別關係。因此這次沒有新增歸屬決定,也沒有把自動配對的錄音偷偷提升成確定來源。ListenBrainz 的官方文件也區分來源提交的識別碼與服務端的最佳猜測配對。
若未來有 39 筆個人未知活動得到可靠的目標藝人證據,個人下界會升到 1,127,與這個帳號的上界同值;在嚴格大於才算領先的規則下,可以移除它對最差位置的一個貢獻。另一條路是讓它的 39 筆未知得到可靠排除證據,上界降到 1,088;40 筆排除則會降到 1,087。今天沒有取得這些變動,不能先寫進結果。
接著我以本機已保留的回應繼續離線核對,沒有重送查詢。證據壓縮檔與目前安裝的雜湊一致,163 個列入清單的檔案通過雜湊驗證。剩餘來源的 63 次完整署名回應都沒有 Performed by 欄位,保留的 MusicBrainz 回應也沒有對應這些未知來源的精確錄音關係。十個音訊來源雖有部分藝人署名,仍不能據此排除其他共同演出者。因此,現有證據沒有支持再縮小 140 筆未知。
今天驗證了什麼?
新增的六項占比測試涵蓋未知分母、零分母、固定名單、同值規則、精確分數,以及阻止自動配對取代嚴格比較。另加五項漏記敏感度測試,核對最小門檻、同值、零與完整占比、整數精度及兩邊主體。完整回歸共 318 項通過,其中 307 項原本就存在。
用真實的本機資料經過分析與三種匯出,再以獨立分數運算核對,22 項新檢查全部通過。另外補做 21 項本機瀏覽器檢查,確認零分母顯示、兩種比較標籤、三種下載與切換條件,並檢視桌面、行動版與 HTML 匯出的五張比較區塊截圖。私人資料與歸屬輸入的雜湊沒有改變。這次沒有重新匯入原始 HTML,也沒有重新驗證所有上游署名的真實性。
續做的離線核對與敏感度檢查共 17 項通過,28 個私人輸入與證據檔案的雜湊維持一致;沒有新增網路請求或歸屬變動。
今天的成果是:Music Recap 新增了保留活動占比的比較能力,並得到一個穩健的新答案——在保留紀錄中,我的目標藝人占比確定高於活動總量最高的外部帳號。
原本活動量範圍尚未縮小。實際播放時長、合格播放、完整歷史與全球位置也仍然缺少必要資料。這些未完成項目會繼續保留,讓下一步工作能針對真正缺少的證據前進。