{"asOf":"2026-09-04","forward":{"generatedAt":"2026-09-04T13:49:22.078668+00:00","capturedTotal":78061,"maturedMarkets":30282,"baseRateYes":0.131,"design":"Forecasts captured while the market was OPEN (contamination-proof, time is the air-gap), graded as reality resolved them. The living benchmark: it grows and re-grades every time the bus refreshes; a young log grades few until its markets mature.","forecasters":{"crowd":{"n":30282,"nMarkets":30282,"brier":0.0574,"brierCI95":[0.0557,0.0592],"baseRateBrier":0.1179,"skillVsBaseRate":0.513,"logLoss":0.1878,"reliability":[{"bin":"0.0-0.1","n":20358,"meanPredicted":0.0138,"empiricalFrequency":0.0112},{"bin":"0.1-0.2","n":2295,"meanPredicted":0.143,"empiricalFrequency":0.0946},{"bin":"0.2-0.3","n":1587,"meanPredicted":0.2475,"empiricalFrequency":0.201},{"bin":"0.3-0.4","n":1369,"meanPredicted":0.3461,"empiricalFrequency":0.2849},{"bin":"0.4-0.5","n":1286,"meanPredicted":0.4494,"empiricalFrequency":0.3072},{"bin":"0.5-0.6","n":817,"meanPredicted":0.5378,"empiricalFrequency":0.4847},{"bin":"0.6-0.7","n":455,"meanPredicted":0.6468,"empiricalFrequency":0.633},{"bin":"0.7-0.8","n":368,"meanPredicted":0.7483,"empiricalFrequency":0.644},{"bin":"0.8-0.9","n":400,"meanPredicted":0.8527,"empiricalFrequency":0.855},{"bin":"0.9-1.0","n":1347,"meanPredicted":0.9667,"empiricalFrequency":0.9807}]}}},"retrospective":{"generatedAt":"2026-06-23T06:10:56.693233+00:00","windowDays":45,"horizonHours":72,"resolvedMarkets":34325,"trainMarkets":17162,"testMarkets":17163,"design":"Markets split train/test by resolution date. The deterministic engine is FIT on train (OLS residual correction on the crowd) and the leaderboard is the disjoint TEST split (clean OOS); the base-rate null is measured on train, applied to test. Every forecaster sees only snapshots with ts<=as_of (contamination guard). Reproducible, offline, no LLM in any forecaster here.","forecasters":{"base_rate":{"n":17163,"nMarkets":17163,"brier":0.1063,"brierCI95":[0.103,0.1097],"baseRateBrier":0.1063,"skillVsBaseRate":0,"logLoss":0.3699,"reliability":[{"bin":"0.1-0.2","n":17163,"meanPredicted":0.1453,"empiricalFrequency":0.1201}]},"crowd":{"n":4069,"nMarkets":4069,"brier":0.0705,"brierCI95":[0.0658,0.0756],"baseRateBrier":0.1586,"skillVsBaseRate":0.5555,"logLoss":0.2339,"reliability":[{"bin":"0.0-0.1","n":2287,"meanPredicted":0.0206,"empiricalFrequency":0.0131},{"bin":"0.1-0.2","n":325,"meanPredicted":0.1432,"empiricalFrequency":0.12},{"bin":"0.2-0.3","n":272,"meanPredicted":0.2495,"empiricalFrequency":0.1654},{"bin":"0.3-0.4","n":207,"meanPredicted":0.3474,"empiricalFrequency":0.1836},{"bin":"0.4-0.5","n":242,"meanPredicted":0.4501,"empiricalFrequency":0.2025},{"bin":"0.5-0.6","n":107,"meanPredicted":0.5369,"empiricalFrequency":0.4206},{"bin":"0.6-0.7","n":68,"meanPredicted":0.6531,"empiricalFrequency":0.6765},{"bin":"0.7-0.8","n":67,"meanPredicted":0.747,"empiricalFrequency":0.6269},{"bin":"0.8-0.9","n":70,"meanPredicted":0.8475,"empiricalFrequency":0.7857},{"bin":"0.9-1.0","n":424,"meanPredicted":0.9719,"empiricalFrequency":0.9434}]}}},"whatThisCovers":"This dataset grades the market sensor we cite, and only that: `crowd` is the prediction-market price, `base_rate` is the naive null it is scored against. No forecaster of ours is published here, in either slice. We maintain a source-traced record of the entities and events in a customer's domain and sell that maintained state; prediction-market prices are one sensor we cite and grade for accuracy, never a forecast of ours. Each price was logged while its market was open and graded when it matured, so the grade cannot be back-filled. The `design` notes describe the whole internal benchmark, graders we run included; the rows above are what is served."}