File size: 2,520 Bytes
7c594f6
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
97
98
99
100
101
102
103
104
105
106
107
108
109
110
111
112
{
  "target": 0.9,
  "threshold": 0.5,
  "validation": [
    {
      "t": 0.3,
      "answered": 1.0,
      "acc_answered": 0.846,
      "errors_flagged": "0/25",
      "severe_still_answered": 0
    },
    {
      "t": 0.35,
      "answered": 1.0,
      "acc_answered": 0.846,
      "errors_flagged": "0/25",
      "severe_still_answered": 0
    },
    {
      "t": 0.4,
      "answered": 0.988,
      "acc_answered": 0.844,
      "errors_flagged": "0/25",
      "severe_still_answered": 0
    },
    {
      "t": 0.45,
      "answered": 0.988,
      "acc_answered": 0.844,
      "errors_flagged": "0/25",
      "severe_still_answered": 0
    },
    {
      "t": 0.5,
      "answered": 0.981,
      "acc_answered": 0.849,
      "errors_flagged": "1/25",
      "severe_still_answered": 0
    },
    {
      "t": 0.55,
      "answered": 0.975,
      "acc_answered": 0.854,
      "errors_flagged": "2/25",
      "severe_still_answered": 0
    },
    {
      "t": 0.6,
      "answered": 0.938,
      "acc_answered": 0.855,
      "errors_flagged": "3/25",
      "severe_still_answered": 0
    },
    {
      "t": 0.65,
      "answered": 0.901,
      "acc_answered": 0.856,
      "errors_flagged": "4/25",
      "severe_still_answered": 0
    },
    {
      "t": 0.7,
      "answered": 0.858,
      "acc_answered": 0.871,
      "errors_flagged": "7/25",
      "severe_still_answered": 0
    },
    {
      "t": 0.75,
      "answered": 0.809,
      "acc_answered": 0.87,
      "errors_flagged": "8/25",
      "severe_still_answered": 0
    },
    {
      "t": 0.8,
      "answered": 0.753,
      "acc_answered": 0.869,
      "errors_flagged": "9/25",
      "severe_still_answered": 0
    },
    {
      "t": 0.85,
      "answered": 0.698,
      "acc_answered": 0.867,
      "errors_flagged": "10/25",
      "severe_still_answered": 0
    },
    {
      "t": 0.9,
      "answered": 0.574,
      "acc_answered": 0.86,
      "errors_flagged": "12/25",
      "severe_still_answered": 0
    },
    {
      "t": 0.95,
      "answered": 0.309,
      "acc_answered": 0.88,
      "errors_flagged": "19/25",
      "severe_still_answered": 0
    }
  ],
  "note": "The pre-set rule (answered accuracy >= 0.90 on validation) found no threshold: this model's errors are mostly confident. Chosen with the product owner: flag only genuinely split predictions (top probability < 0.50).",
  "test_at_threshold": {
    "t": 0.5,
    "answered": 0.995,
    "acc_answered": 0.833,
    "errors_flagged": "0/35",
    "severe_still_answered": 0
  }
}