-1000% զբաղվածություն. ինչպես գտա բացեր իմ սեփական հրապարակված տվյալների բազայում
Հոդվածի հեղինակը կիսվում է կայանատեղիների ծանրաբեռնվածության վերաբերյալ հրապարակված բաց տվյալների բազայում հայտնաբերված կրիտիկական սխալների մասին իր փորձով: Այն բանից հետո, երբ տվյալների մեջ գրանցվեց -1000% զբաղվածության անոմալ արժեք, սկսվեց հետաքննություն, որը բացահայտեց տվյալների որակի լուրջ խնդիրներ: Գործընթացում հեղինակը բախվեց այն փաստին, որ վերահաշվարկի ստանդարտ մեթոդներն անարդյունավետ էին, իսկ բացակայող հայտարարը գտնելը պահանջում էր ոչ ստանդարտ մոտեցում: Հոդվածը մանրամասն նկարագրում է, թե ինչու մեկուկես տարի աշխատող ավտոմատացված ստուգումները չկարողացան ժամանակին հայտնաբերել անոմալիան: Այս դեպքը կարևոր հիշեցում է հրապարակումից առաջ տվյալների մանրակրկիտ վավերացման անհրաժեշտության մասին և ցույց է տալիս, որ նույնիսկ ստուգված համակարգերը կարող են թաքնված թերություններ ունենալ: Հեղինակը վերլուծում է իր սխալները և առաջարկում դասեր, որոնք կօգնեն այլ մշակողներին և վերլուծաբաններին խուսափել նման իրավիճակներից մեծ տվյալների հետ աշխատելիս:
This is a summary. Read the full article at the original source:
HabrԿապակցված
Ուղեցույց switchback-փորձարկումների վերաբերյալ. պատուհանի երկարությունը, սխալների կլաստերավորումը և հզորությունը
Habr-ի այս հոդվածը նվիրված է switchback-փորձարկումների մեթոդաբանությանը, որոնք չափազանց կարևոր են ընդհանուր ռեսուրսներ ունեցող համակարգերում փոփոխությ…
Ես ստեղծել եմ ինքնահյուրընկալվող AI տվյալների վերլուծաբան՝ 4 գործակալներով, սանդղակավորված կոդի կատարմամբ և LLM-ի ընտրությամբ
Ծրագրավորող Laban-ը թողարկել է Insight Orchestra-ն՝ բաց կոդով, ինքնահյուրընկալվող AI տվյալների վերլուծության հարթակ, որը նախատեսված է փոխարինելու ամպա…
Habr-ի այս հոդվածում հեղինակը մանրամասն վերլուծում է վիճակագրական եզրակացությունների հիմնարար խնդիրը՝ փորձի դադարեցման կանոնի ազդեցությունը p-value-ի…



