{ "rms_energy": { "mean": 0.12479657847370416, "std": 0.08226979789430686, "min": 0.0006608854746446013, "max": 0.7866701483726501, "median": 0.10789120942354202, "q25": 0.07158855348825455, "q75": 0.15930695831775665, "count": 5195 }, "rms_std": { "mean": 0.05050607018266971, "std": 0.033456659440819096, "min": 0.0003003521414939314, "max": 0.25422006845474243, "median": 0.042142510414123535, "q25": 0.029126529581844807, "q75": 0.06235561892390251, "count": 5195 }, "spectral_centroid_mean": { "mean": 1567.3949259457936, "std": 547.6499884676759, "min": 117.98120158338996, "max": 3979.933658036561, "median": 1568.9044932288618, "q25": 1180.234880846297, "q75": 1959.987210770516, "count": 5195 }, "spectral_centroid_std": { "mean": 526.9199421721727, "std": 266.3469885614311, "min": 37.85721326562783, "max": 1768.3873349288347, "median": 478.55318316363906, "q25": 334.69769962714383, "q75": 674.4402371924929, "count": 5195 }, "spectral_flatness_mean": { "mean": 0.001162131007148418, "std": 0.009387173991371636, "min": 2.3324001574565045e-07, "max": 0.35150906443595886, "median": 8.8776127086021e-05, "q25": 4.088066089025233e-05, "q75": 0.00018036446999758482, "count": 5195 }, "spectral_flatness_std": { "mean": 0.005843909335025175, "std": 0.028557051528612674, "min": 4.0545373281020147e-07, "max": 0.476532518863678, "median": 0.0002519696136005223, "q25": 9.99983967631124e-05, "q75": 0.0008137073600664735, "count": 5195 }, "spectral_bandwidth_mean": { "mean": 1598.8752460745816, "std": 380.926437647066, "min": 263.40094943237943, "max": 2874.3783102683115, "median": 1643.0952218034392, "q25": 1365.139228333329, "q75": 1891.5335987405338, "count": 5195 }, "spectral_bandwidth_std": { "mean": 317.59060311539736, "std": 141.80968450781128, "min": 27.732348517535794, "max": 1055.7941813409468, "median": 295.24540938473, "q25": 212.34836948494228, "q75": 406.40729834024444, "count": 5195 }, "spectral_rolloff_mean": { "mean": 3182.183531029266, "std": 1173.5510304475201, "min": 146.47411429107004, "max": 7004.643065293992, "median": 3245.0437187318735, "q25": 2332.0458984375, "q75": 4090.4580870818736, "count": 5195 }, "spectral_rolloff_std": { "mean": 1072.8541067243364, "std": 479.58379351968154, "min": 12.927076176158439, "max": 2676.737631126898, "median": 1015.4990408699998, "q25": 710.5381234782133, "q75": 1407.5382949390591, "count": 5195 }, "spectral_contrast_mean": { "mean": 25.37715277529022, "std": 1.88859370403237, "min": 17.8294873839069, "max": 35.59656436607776, "median": 25.3031732020588, "q25": 24.192856129957, "q75": 26.48604694635319, "count": 5195 }, "spectral_contrast_std": { "mean": 16.7851478196529, "std": 2.109390766868648, "min": 8.173794858536139, "max": 22.172103928586502, "median": 17.017895126879385, "q25": 15.512727617660477, "q75": 18.325376272468255, "count": 5195 }, "mfcc_variance": { "mean": 626.5201373374726, "std": 484.63022664534884, "min": 17.18233871459961, "max": 4394.3466796875, "median": 494.20318603515625, "q25": 286.87657165527344, "q75": 817.0927734375, "count": 5195 }, "mfcc_delta_var": { "mean": 12.927284557051792, "std": 12.196982947663091, "min": 0.2994597852230072, "max": 104.51786804199219, "median": 8.91252326965332, "q25": 4.866374731063843, "q75": 16.4460391998291, "count": 5195 }, "mfcc_delta2_var": { "mean": 5.3155951403045565, "std": 5.4919478496563, "min": 0.1319909691810608, "max": 65.70378875732422, "median": 3.4405126571655273, "q25": 1.7887547016143799, "q75": 6.6852946281433105, "count": 5195 }, "mel_flatness": { "mean": 15.712596801431049, "std": 1.8017707431538184, "min": 6.295226097106934, "max": 26.440330505371094, "median": 15.704669952392578, "q25": 14.697003841400146, "q75": 16.700291633605957, "count": 5195 }, "tempo_bpm": { "mean": 121.20137209386763, "std": 31.523960393188972, "min": 0.0, "max": 287.109375, "median": 117.45383522727273, "q25": 99.38401442307692, "q75": 143.5546875, "count": 5195 }, "tempo_stability": { "mean": 0.02373506398251568, "std": 0.013973598721269624, "min": 0.0, "max": 0.24380952380952392, "median": 0.020897924515612423, "q25": 0.014085474280161145, "q75": 0.030149753497538175, "count": 5195 }, "tempo_cv": { "mean": 0.04457223696977081, "std": 0.019505758960897856, "min": 0.0, "max": 0.14886548588635073, "median": 0.04367131467411454, "q25": 0.03052829290494333, "q75": 0.056648656352572685, "count": 5195 }, "zero_crossing_rate": { "mean": 0.0798907402156489, "std": 0.03911741174167104, "min": 0.005463685782701238, "max": 0.3990759360763098, "median": 0.07482494436919504, "q25": 0.052128513475589666, "q75": 0.10135747478473298, "count": 5195 }, "zero_crossing_std": { "mean": 0.042907758584911054, "std": 0.025740262737895536, "min": 0.0020554397997909293, "max": 0.21738884549527582, "median": 0.03692390750398428, "q25": 0.02464482312756454, "q75": 0.0552102601270054, "count": 5195 }, "onset_strength_mean": { "mean": 1.3309727745462312, "std": 0.4422760801223643, "min": 0.20973721146583557, "max": 3.8121020793914795, "median": 1.2367340326309204, "q25": 1.0238069891929626, "q75": 1.5586425065994263, "count": 5195 }, "onset_strength_std": { "mean": 1.5444546876186587, "std": 0.8261170700766172, "min": 0.14404825866222382, "max": 6.709303379058838, "median": 1.386093258857727, "q25": 0.9714091420173645, "q75": 1.9558083415031433, "count": 5195 }, "rms_dynamic_range": { "mean": 0.2565029709877785, "std": 0.13508104553544945, "min": 0.0018345473799854517, "max": 0.9524823427200317, "median": 0.23001396656036377, "q25": 0.16880326718091965, "q75": 0.3165899068117142, "count": 5195 }, "beat_count": { "mean": 51.412704523580366, "std": 24.44928030259794, "min": 0.0, "max": 323.0, "median": 53.0, "q25": 41.0, "q75": 64.0, "count": 5195 }, "chroma_entropy": { "mean": 3.50788969793953, "std": 0.11374355749860636, "min": 1.499325156211853, "max": 3.5846314430236816, "median": 3.5433428287506104, "q25": 3.4947699308395386, "q75": 3.5644110441207886, "count": 5195 }, "chroma_std": { "mean": 0.2705768950140109, "std": 0.03318385864732711, "min": 0.03418326750397682, "max": 0.36671558022499084, "median": 0.2752910554409027, "q25": 0.2542284280061722, "q75": 0.2921793907880783, "count": 5195 }, "chroma_transition_rate": { "mean": 0.15086051442381185, "std": 0.05363766353520473, "min": 0.01775109734056287, "max": 0.4441647301833204, "median": 0.1513684482313452, "q25": 0.1118752464387721, "q75": 0.18616059901884843, "count": 5195 }, "harmonic_ratio": { "mean": 0.6019142853690652, "std": 0.19316313578936425, "min": 0.005342418283645681, "max": 0.9996026098989933, "median": 0.5984112237364748, "q25": 0.46264294874023143, "q75": 0.7488398446210006, "count": 5195 }, "tonnetz_std": { "mean": 0.1161088116933246, "std": 0.048276841448957095, "min": 0.020699272712005733, "max": 0.3476043745335442, "median": 0.10910226691646613, "q25": 0.07990129921576372, "q75": 0.1454097132121265, "count": 5195 }, "spectral_regularity": { "mean": 0.344320500481232, "std": 0.055313343773130665, "min": 0.152, "max": 0.607, "median": 0.354, "q25": 0.317, "q75": 0.376, "count": 5195 }, "temporal_patterns": { "mean": 0.4890128970163618, "std": 0.08793465083404313, "min": 0.156, "max": 0.745, "median": 0.495, "q25": 0.435, "q75": 0.552, "count": 5195 }, "harmonic_structure": { "mean": 0.4525944177093359, "std": 0.06509542035597579, "min": 0.317, "max": 0.824, "median": 0.444, "q25": 0.405, "q75": 0.491, "count": 5195 }, "has_vocals": { "mean": 0.8993262752646776, "std": 0.30089620450121823, "min": 0.0, "max": 1.0, "median": 1.0, "q25": 1.0, "q75": 1.0, "count": 5195 }, "vocal_confidence": { "mean": 0.7349499712021523, "std": 0.3322930971609426, "min": 0.00028087689071505683, "max": 1.0, "median": 0.9648008889211044, "q25": 0.4893051398733941, "q75": 1.0, "count": 5195 }, "vocal_ai_score": { "mean": 0.1816483156881617, "std": 0.08115369806056379, "min": 0.0, "max": 0.544, "median": 0.194, "q25": 0.159, "q75": 0.222, "count": 5195 }, "pitch_stability_score": { "mean": 0.03181366698748797, "std": 0.0775805081907468, "min": 0.0, "max": 0.852, "median": 0.005, "q25": 0.001, "q75": 0.023, "count": 5195 }, "vibrato_regularity_score": { "mean": 0.09211068334937439, "std": 0.07791276353258635, "min": 0.0, "max": 0.877, "median": 0.083, "q25": 0.079, "q75": 0.091, "count": 5195 }, "formant_consistency_score": { "mean": 0.07734090471607315, "std": 0.12647725984725186, "min": 0.0, "max": 0.777, "median": 0.018, "q25": 0.006, "q75": 0.083, "count": 5195 }, "breath_pattern_score": { "mean": 0.5079563041385948, "std": 0.2710138463698219, "min": 0.0, "max": 0.818, "median": 0.7, "q25": 0.418, "q75": 0.7, "count": 5195 }, "vocal_texture_score": { "mean": 0.39830048123195383, "std": 0.13676592337174515, "min": 0.0, "max": 0.771, "median": 0.438, "q25": 0.429, "q75": 0.443, "count": 5195 }, "pitch_mean_hz": { "mean": 158.86580726641935, "std": 111.25045231016703, "min": 0.0, "max": 1323.3146957868253, "median": 144.71786956561655, "q25": 110.41990370531421, "q75": 189.3286341095429, "count": 5195 }, "pitch_std_cents": { "mean": 648.6243712539678, "std": 388.00030800940834, "min": 0.0, "max": 2202.975261120988, "median": 646.1778656563339, "q25": 379.12905709716233, "q75": 899.2845202251592, "count": 5195 }, "vibrato_rate_hz": { "mean": 3.1845781523811727, "std": 1.1822115220547467, "min": 0.0, "max": 7.8679011418269225, "median": 3.3069526423212707, "q25": 3.096782799663588, "q75": 3.6998707328765628, "count": 5195 }, "vibrato_extent_cents": { "mean": 1226.0321726489399, "std": 732.6861362178382, "min": 0.0, "max": 4179.446836619382, "median": 1238.8006742854589, "q25": 715.3092459561394, "q75": 1716.688238484184, "count": 5195 }, "vocal_harmonic_ratio": { "mean": 0.8666058068042216, "std": 0.29155495324235886, "min": 0.0, "max": 0.9999633719623315, "median": 0.9685977234667946, "q25": 0.9400480570719125, "q75": 0.9843303045820336, "count": 5195 }, "vocal_energy_ratio": { "mean": 0.25849848118217394, "std": 0.2094576418324389, "min": 0.00028087689071505683, "max": 0.9984292230677349, "median": 0.19296017778422087, "q25": 0.09786102797467881, "q75": 0.3709309606138707, "count": 5195 }, "_by_class": { "ai": { "rms_energy": { "mean": 0.09495299907605183, "std": 0.04864507729818625, "median": 0.0919237844645977 }, "rms_std": { "mean": 0.04058875503129434, "std": 0.020694721325378532, "median": 0.037439338862895966 }, "spectral_centroid_mean": { "mean": 1517.0940014060996, "std": 572.0685683447949, "median": 1537.0177473268516 }, "spectral_centroid_std": { "mean": 536.0913214558275, "std": 264.9922598836426, "median": 496.091335162763 }, "spectral_flatness_mean": { "mean": 0.00033152801068080025, "std": 0.004767608867040372, "median": 9.211149153998122e-05 }, "spectral_flatness_std": { "mean": 0.0014251952374213154, "std": 0.011053370613932365, "median": 0.00028420158196240664 }, "spectral_bandwidth_mean": { "mean": 1567.174276681774, "std": 399.5530761259547, "median": 1621.238266367908 }, "spectral_bandwidth_std": { "mean": 334.7786220564608, "std": 149.18529560044954, "median": 316.9575551433341 }, "spectral_rolloff_mean": { "mean": 3092.6546283570833, "std": 1227.552798319225, "median": 3182.4170125786177 }, "spectral_rolloff_std": { "mean": 1104.519459952481, "std": 496.0173499998453, "median": 1086.1014541682698 }, "spectral_contrast_mean": { "mean": 24.97594754666428, "std": 1.8396141811528608, "median": 24.99197052227822 }, "spectral_contrast_std": { "mean": 16.609604437834733, "std": 2.1333933559308993, "median": 16.85117442512304 }, "mfcc_variance": { "mean": 690.5243554761156, "std": 507.4579476304517, "median": 557.3190307617188 }, "mfcc_delta_var": { "mean": 13.137848005786639, "std": 12.360452505136516, "median": 9.151309967041016 }, "mfcc_delta2_var": { "mean": 5.382926741570206, "std": 5.2921202193375665, "median": 3.6419930458068848 }, "mel_flatness": { "mean": 15.551015181225385, "std": 1.9725852294785549, "median": 15.441463947296143 }, "tempo_bpm": { "mean": 122.80642531921693, "std": 32.33342033999501, "median": 117.45383522727273 }, "tempo_stability": { "mean": 0.024646302518750517, "std": 0.01455178214512594, "median": 0.0220012297193087 }, "tempo_cv": { "mean": 0.04672771285575068, "std": 0.019211503329502687, "median": 0.04617396765671103 }, "zero_crossing_rate": { "mean": 0.0741053743090708, "std": 0.038358186149236306, "median": 0.07028302172020123 }, "zero_crossing_std": { "mean": 0.04199362697731919, "std": 0.02588695473157196, "median": 0.036719714806293775 }, "onset_strength_mean": { "mean": 1.3132489647118664, "std": 0.45324177934349225, "median": 1.2281666994094849 }, "onset_strength_std": { "mean": 1.6201429363701574, "std": 0.8689405123702203, "median": 1.4441455006599426 }, "rms_dynamic_range": { "mean": 0.21558517800048208, "std": 0.08866467458691174, "median": 0.21108443289995193 }, "beat_count": { "mean": 49.49519692603266, "std": 22.77442795481795, "median": 52.0 }, "chroma_entropy": { "mean": 3.4977119429310735, "std": 0.12833640263017523, "median": 3.5391095876693726 }, "chroma_std": { "mean": 0.2680718217878875, "std": 0.03651529865532148, "median": 0.27421605587005615 }, "chroma_transition_rate": { "mean": 0.14835559661076866, "std": 0.05854148401515303, "median": 0.1453976245804286 }, "harmonic_ratio": { "mean": 0.6151888948594679, "std": 0.19893343588724452, "median": 0.6111395928649209 }, "tonnetz_std": { "mean": 0.12020667090424135, "std": 0.05255230141882395, "median": 0.11465420213833191 }, "spectral_regularity": { "mean": 0.3393866474543708, "std": 0.050674119172316366, "median": 0.351 }, "temporal_patterns": { "mean": 0.4906748318924112, "std": 0.08601342762383081, "median": 0.494 }, "harmonic_structure": { "mean": 0.45677521613832855, "std": 0.07019074738742528, "median": 0.446 }, "has_vocals": { "mean": 0.8756003842459174, "std": 0.3300368939290261, "median": 1.0 }, "vocal_confidence": { "mean": 0.7073915025044976, "std": 0.34565969252228823, "median": 0.8763384689418741 }, "vocal_ai_score": { "mean": 0.17548126801152736, "std": 0.0860411619024508, "median": 0.191 }, "pitch_stability_score": { "mean": 0.0363967339097022, "std": 0.08163532195959054, "median": 0.006 }, "vibrato_regularity_score": { "mean": 0.08191258405379441, "std": 0.04023003075791517, "median": 0.083 }, "formant_consistency_score": { "mean": 0.0884063400576369, "std": 0.13225047596890363, "median": 0.025500000000000002 }, "breath_pattern_score": { "mean": 0.4660057636887608, "std": 0.273212682713666, "median": 0.5 }, "vocal_texture_score": { "mean": 0.38664649375600385, "std": 0.14773849768452665, "median": 0.438 }, "pitch_mean_hz": { "mean": 159.0278222774733, "std": 113.87609381035426, "median": 143.47027502082088 }, "pitch_std_cents": { "mean": 638.1957706753965, "std": 413.32580195290535, "median": 645.7505113054156 }, "vibrato_rate_hz": { "mean": 3.0933533436506546, "std": 1.2639258214682405, "median": 3.2985457454819276 }, "vibrato_extent_cents": { "mean": 1204.3627714164186, "std": 772.5073923041956, "median": 1235.604852484184 }, "vocal_harmonic_ratio": { "mean": 0.8477806853117013, "std": 0.32059383402576236, "median": 0.9723117342981026 }, "vocal_energy_ratio": { "mean": 0.24856763440749083, "std": 0.21604758816259673, "median": 0.1752676937883748 } }, "human": { "rms_energy": { "mean": 0.1447562097958732, "std": 0.0933720715030351, "median": 0.12749916315078735 }, "rms_std": { "mean": 0.05713885211172963, "std": 0.038363688161782025, "median": 0.047041501849889755 }, "spectral_centroid_mean": { "mean": 1601.0365979315445, "std": 528.0246473826304, "median": 1589.4440412555693 }, "spectral_centroid_std": { "mean": 520.7860482857063, "std": 267.0735091240253, "median": 463.0361457337967 }, "spectral_flatness_mean": { "mean": 0.001717645121714939, "std": 0.01144909121082803, "median": 8.573703962611035e-05 }, "spectral_flatness_std": { "mean": 0.00879918166114507, "std": 0.035460071195081044, "median": 0.0002262796915601939 }, "spectral_bandwidth_mean": { "mean": 1620.0771150999028, "std": 366.4155728391, "median": 1658.9803545233183 }, "spectral_bandwidth_std": { "mean": 306.0951147005905, "std": 135.4430340569113, "median": 281.2650130527243 }, "spectral_rolloff_mean": { "mean": 3242.061197384385, "std": 1132.0581496213285, "median": 3284.9468030427633 }, "spectral_rolloff_std": { "mean": 1051.6760580828338, "std": 467.0746862022744, "median": 990.4317392451001 }, "spectral_contrast_mean": { "mean": 25.645482131537946, "std": 1.8733015466051912, "median": 25.483928409711265 }, "spectral_contrast_std": { "mean": 16.90255267700768, "std": 2.0849522537649214, "median": 17.14375275185939 }, "mfcc_variance": { "mean": 583.7135899026333, "std": 463.84014671645747, "median": 448.92950439453125 }, "mfcc_delta_var": { "mean": 12.786457990952867, "std": 12.084372091853295, "median": 8.712114334106445 }, "mfcc_delta2_var": { "mean": 5.270563211671378, "std": 5.621181611260869, "median": 3.292414426803589 }, "mel_flatness": { "mean": 15.820663917803742, "std": 1.66914564129963, "median": 15.856708526611328 }, "tempo_bpm": { "mean": 120.1278992974728, "std": 30.92432800108352, "median": 117.45383522727273 }, "tempo_stability": { "mean": 0.023125620155840146, "std": 0.013538984526352734, "median": 0.02006806418282217 }, "tempo_cv": { "mean": 0.043130636971502226, "std": 0.019568052227125765, "median": 0.04197344856996826 }, "zero_crossing_rate": { "mean": 0.08376004051037926, "std": 0.03914275632295623, "median": 0.0781306688999613 }, "zero_crossing_std": { "mean": 0.04351913732150155, "std": 0.025623492663403677, "median": 0.03702394686992906 }, "onset_strength_mean": { "mean": 1.3428266043165968, "std": 0.4343844376845542, "median": 1.240199089050293 }, "onset_strength_std": { "mean": 1.4938337644253978, "std": 0.7921666119617009, "median": 1.3357794284820557 }, "rms_dynamic_range": { "mean": 0.28386912742836673, "std": 0.15272230871433878, "median": 0.2562081813812256 }, "beat_count": { "mean": 52.6951493735946, "std": 25.42757201956183, "median": 53.0 }, "chroma_entropy": { "mean": 3.514696664186754, "std": 0.10227085050671615, "median": 3.5454728603363037 }, "chroma_std": { "mean": 0.2722523085883086, "std": 0.03064095499793125, "median": 0.2761085331439972 }, "chroma_transition_rate": { "mean": 0.15253582405656352, "std": 0.050020796567588025, "median": 0.15426356589147286 }, "harmonic_ratio": { "mean": 0.59303611737709, "std": 0.18868527336898366, "median": 0.5889884181112162 }, "tonnetz_std": { "mean": 0.1133681297539964, "std": 0.04498437475554428, "median": 0.10693098051525367 }, "spectral_regularity": { "mean": 0.3476203019595246, "std": 0.057976282568655745, "median": 0.356 }, "temporal_patterns": { "mean": 0.4879013813042082, "std": 0.08917920815628536, "median": 0.497 }, "harmonic_structure": { "mean": 0.4497982653389014, "std": 0.061293371489702146, "median": 0.443 }, "has_vocals": { "mean": 0.9151943462897526, "std": 0.2785922734194632, "median": 1.0 }, "vocal_confidence": { "mean": 0.7533813016963756, "std": 0.321730263115896, "median": 1.0 }, "vocal_ai_score": { "mean": 0.18577288788949564, "std": 0.07743998729612907, "median": 0.196 }, "pitch_stability_score": { "mean": 0.028748474140700295, "std": 0.07458897772174776, "median": 0.004 }, "vibrato_regularity_score": { "mean": 0.0989312560231288, "std": 0.09450829568537007, "median": 0.083 }, "formant_consistency_score": { "mean": 0.06994025056215869, "std": 0.12190505814611481, "median": 0.016 }, "breath_pattern_score": { "mean": 0.5360131705750081, "std": 0.2658645839877038, "median": 0.7 }, "vocal_texture_score": { "mean": 0.4060947638933505, "std": 0.12831789878883954, "median": 0.438 }, "pitch_mean_hz": { "mean": 158.7574502946833, "std": 109.45912584132437, "median": 145.14234990682854 }, "pitch_std_cents": { "mean": 655.599105081332, "std": 369.9325276069022, "median": 647.5865872877907 }, "vibrato_rate_hz": { "mean": 3.2455900546545213, "std": 1.1201122718420473, "median": 3.3155726987447696 }, "vibrato_extent_cents": { "mean": 1240.5248463932735, "std": 704.4269980733538, "median": 1240.872147300784 }, "vocal_harmonic_ratio": { "mean": 0.8791962028682844, "std": 0.2696663579649654, "median": 0.9666141375830083 }, "vocal_energy_ratio": { "mean": 0.2651403131721804, "std": 0.20466327135384965, "median": 0.20548815254725214 } } } }