Showing posts with label statistică. Show all posts
Showing posts with label statistică. Show all posts

Thursday, May 28, 2026

Data Science nu este Statistică, bre!

Unii cred că tot ce este dată, este statistică, ceea ce este total fals. Bazele de date care includ serii de date sunt doar cazuri particulare, iar bazele de date sunt înainte de toate informatică, adică analiză, proiectare și programare de cod în diferite limbaje specifice bazelor de date, oricare ar fi tipul lor.
Și în cazul Data Science tot de informatică este vorba. Cine vrea să înțeleagă Data Science, trebuie să știe să scrie programe în limbajul PYTHON de complexitate cu mult despre medie, pentru a nu rămâne în zona folclorică, a utilizării de concepte auzite în stația de tramvai sau în ritmurile de manele din cluburi de după ora 00:00.
Cine dorește să se considere că are cât de cât habar de data science, ar trebui să fi citit vreo 10 cărți fundamentale din domeniu, vreo 30 de articole și să fi mers cu comunicări pe la 5 conferințe științifice cu factor de respingere de peste 30%, altfel totul este folclor din spațiul mioritic, cu balade cântate după ureche, la șezătoare când ard vreascurile în sobă și vinul fiert cu scorțișoară este în bărdace aburind și îmbietor în șezători cu fete și flăcăi veseli nevoie mare.
Mai ușor cu pianul pe scări!


(28 mai 2026)

Friday, October 10, 2025

Ce ne spune media aritmetică?

Dacă media aritmetică nu este reprezentativă, nu ne spune nimic.
Media aritmetică este nereprezentativă atunci când:
- seria de termeni conține prea puțini termeni,
- termenii din serie sunt neomogeni,
- culegerea de date este defectuoasă.
La școală se calculează mediile elevilor din 3 - 5 note, adică un număr absolut insuficient de termeni și de aceea media aritmetică nu este reprezentativă. Media anuală a elevului este cu atât mai puțin reprezentativă, în principal datorită faptului că termenii sunt neomogeni, ei reprezentând la rândul lor medii la materii meomogene, căci nu se compară istoria cu matematica, cu chimia și cu lucrul manual sau cu sportul sau cu nota de la purtare. Evaluarea din școală este o glumă bizară, nimic altceva, deși hotărăște soarta elevului pentru totdeauna, căci se întâmplă ca un elev să nu reușească la un concurs pentru 3 sutimi.
Ca media aritmetică să fie reprezentativă, trebuie să fie îndeplinite cerințe precum:
- seria de termeni să conțină cel puțin 16 termeni,
- culegerea termenilor să respecte o procedură,
- termenii să fie măsurați în același fel,
- termenii să nu difere foarte mult între ei,
-  coeficientul de variație să fie mai mic decât 30.
Dacă sunt îndeplinite aceste condiții, media aritmetică ne dă ceva informații, dar în niciun caz aceste informații nu trebuie luate ca literă de lege și deciziile pe care le luăm să fie motivate că media aritmetică a zis, căci media aritmetică nu zice nimic și nu garantează nimic.
Dacă avem în față un elev cu media generală de absolvire a facultății 9,50 vom concluziona că absolventul este:
- serios,
- pregătit profesional,
- cât de cât eficient,
- de încredere,
- de luat în considerare la angajare.
Este prima concluzie înainte de a-l chema pe respectivul la interviu, apoi la o probă teoretică și după aceea la o probă practică, după care îl angajăm de probă un tinterval de cel puțin 3 luni.Media aritmetică are caracter orientativ. Ierarhizările după media aritmetică sunt artificiale, bizare, ineficiente și viața ne demonstrează mereu că așa stau lucrurile, dar noi nu ne învățăm deloc minte.

(10 octombrie 2025)

Thursday, October 2, 2025

Seriile de timp și erele geologice

Eu am zis și o repet: cu statistica se demonstrează orice. Statistica, operează în practică cu indicatori statistici, pe care noi îi construim după bunul nostru plac și facem cu ei ceea ce vrem, tot după bunul nostru plac, dar dăm senzația celor din jur că prezentând niște valori numerice suntem obiectivi, riguroși și mai ales cinstiți, deși realitatea este cu totul alta, căci statistica este instrumentul la dispoziția oricui, pentru a justifica orice.
Totuși, există și o latură etică în statistică, numai că foarte puțini dintre profesioniști apelează la ea, pentru a folosi statistica pe post de știință și nu de instrument politic pentru a fundamenta decizii aberante. Ca să dau numai un exemplu, atunci când se lucrează cu serii de date, condiția de reprezentativitate a rezultatelor care folosesc metode statistice este ca datele să fie omogene. Există modalități de a verifica dacă datele sunt omogene, modalități, care în realitate sunt ocolite cu grație, pentru a nu-i îndepărta pe utilizatorii de metode pseudo-științifice de la obiectivele lor subtile, mârșave și manipulatoare.
Propovăduitorii încălzirii globale operează cu serii de date înregistrate pe termen lung, pentru a demonstra că în ultimii 100 de ani sau în ultimii 50 de ani sau în ultimii 10 ani temperaturile medii au crescut cu câteva grade. Ei uită să spună elementele esențiale care dau veridicitate indicatorilor agregați.
Pentru a calcula temperatura medie zilnică se stabilește un algoritm. Ideea este ca respectivul algoritm să se respecte tot timpul. Dacă vorbim de temperaturile medii din ultimii 50 de ani, am mari dubii, că algoritmul a fost definit atunci și a fost respectat cu strictețe an de an. Dacă într-un an nu s-a respectat, aplicăm proverbul machedonesc, care zice că dacă într-o oală de ciorbă pui o lingură de c-c-at, totul c-c-at se numește. Ca să fiu mai clar voi da un exemplu: la un examen de admitere se susțin 3 probe și candidatul a obținut nota 6,20 la prima probă, nota 8,80 la a doua probă și nota 7,60 la a treia probă. Se introduc datele de pe teză în baza de date 6,20 pentru prima probă, 7,80 din greșeală pentru a doua probă și 7,60 pentru a treia probă, fără a se face vreo verificare, căci procedura așa a fost definită. Media afișată la calculator este de 7,20 în loc de 7,53 cât i se cuvine candidatului. Cele 33 de sutimi îl aruncă pe candidat în jos cu cel puțin 100 de locuri la o concurență de 6 candidați pe un loc. În cazul seriilor de timp, lucrurile sunt extrem de importante. Trebuie stabilit algoritmul pentru calculul temperaturii medie zilnică, apoi trebuie stabilit cum se calculează temperatura medie lunară și apoi cum se obține media temperaturii anuale. În toate cazurile trebuie stabilit modul în care se va conchide că mediile temperaturilor sunt reprezentative. Se știe că atunci când seriile de timp sunt foarte lungi și apar fluctuații, pentru a identifica trendul se calculează mediile mobile. Și aici este o mare discuție legată de reprezentativitatea acestor medii mobile, căci ele sunt agregări de alte date care la rândul lor au fost agregate. Mai apare o discuție legată de  faptul că o eră geologică se întinde pe câteva milioane de ani, iar noi dispunem de date măsurate de cel mult 200 de ani, iar extrapolările se dovedesc hazardate, iar cei care se expun cu așa ceva, devin simpli scamatori, care scot din joben tot ceea ce-și doresc, mai ales că trag concluzii care nu costă bani.
(03 octombrie 2025) 

Thursday, July 3, 2025

Cum de s-a ajuns la fundul prăpastiei?

Suntem în secolul al XXI-lea.
Există teoria creșterii economice.
Există modele cibernetice pentru dezvoltarea economică.
Există analiza de date.
Există data science.
Există BNR.
Există institute de cercetări economice.
Există departamente în universități dedicate dezvoltării economice.
Există reviste de analiză cantitativă în economie.
Există teze de doctorat cu subiecte de dezvoltare sustenabilă a economiei.
În concluzie, există de toate și totuși acum suntem la fundul prăpastiei. Explicația este una singură și anume, că din toate câte am enumerat aici că există, niciun element nu a stat la baza fundamentării deciziilor pe care oamenii politici le-au luat și ei s-au bazat pe empirismul lor rudimentar, căci ei nu au văzut nici măcar cât e lungul nasului și nu au ascultat de nimeni, orbecăind în întunericul micimii lor, spre niciunde. A mima cercetarea științifică, a mima utilizarea metodelor cantitative în economie, a mima optimizarea la nivel macroeconomic, sunt căile sigure de a ne fura căciula, căci realitatea se răzbună crunt pe cei care se fac că fac ceva, dar în realitate doar mimează activități denumite pompos.
S-a ajuns pe fundul prăpastiei pentru că realitatea în care trăim este de secolul al XIX-lea, unde nu există teoria creșterii economice, unde nu există modele cibernetice de dezvoltare economică, unde nu se face analiză de date, unde nu se știe de data science, unde BNR este doar un simbol pentru moneda națională, unde nu există institute de cercetare în economie, unde nu există departamente în universități dedicate dezvoltării economice, unde nu există reviste de niciun fel, unde tezele de doctorat sustinute la Paris sau la Berlin au cu totul alte teme decât economia mioritică. Secolul al XIX-lea este secolul sărăciei, al ignoranței, al analfabetismului și al polarizării populației, polarizare dusă la extrem.

(03 iulie 2025)

Monday, March 10, 2025

Cum mai stau lucrurile cu Inteligența Artificială?

Asistăm la asaltul dezvoltatorilor de teorii, algoritmi și de software din zona Inteligenței Artificiale - IA, la un nivel fără precedent. Ceea ce este foarte important este legat de faptul că Inteligența Artificială - IA este un domeniu unde numai super-specialiștii își găsesc locul și rostul, ceea ce înseamnă:
- angrenarea de sume de bani la niveluri inimaginabile,
- utilizarea de tehnici și metode noi de cercetare și de programare,
- necesitatea de a recupera rapid investițiile prin aplicații în producție,
- transformări radicale la nivelul conștiinței cetățenilor prin avantajelor IA,
- adâncirea decalajelor între dezvoltatorii de aplicații bazate pe IA.
Inteligența Artificială are meritul de a prelua și prelucra toate informațiile selectate de criteriile definite, de a le ierarhiza și de a efectua prelucrări mecanice, obținând concluzii nebănuite în alte condiții, ceea ce joacă rolul de motor al dezvoltării calitative, datorită acumulărilor cantitative în exces. Faptul că Inteligența Artificială reușește să construiască serii de date extrase din baze de date de trilioane de înregistrări, obținând niveluri de omogenitate nebănuite în alte condiții, duce în mod firesc la prelucrări echivalente cu redescoperirea apei calde, de care oamenii se vor minuna datorită simplității soluțiilor obținute. Acum tragem concluzii din prelucrări statistice trase de păr și nu dăm prea mare credit rezultatelor. Dacă însă se prelucrează 20 de milioane de tomografii ale aceleiași părți ale corpului, obținute la computer tomograf și se fac prelucrări folosind însemnările medicilor care dau diagnostice, acuratețea concluziilor pe care Inteligența Artificială le oferă sunt de un nivel de calitate excelent și ele vor fi folosite în spitale de medici pentru a maximiza șansele de reușită ale tratamentelor.
Acum Inteligența Artificială trebuie pusă la treabă, fără prea multe comentarii și organismele statale trebuie să dea dovadă de mult mai multă aplecare în obținerea de rezultate pozitive, nu pentru a defini limitări, generate de frici imaginare sau puerile, date de aspectele spectaculoase unde apare IA, așa cum sunt clipurile generate cu diverși politicieni care spun lucruri bizare, pe care ei oricum le spun și fără IA.




(10 martie 2025)

Monday, February 3, 2025

Subiectivismul statisticii

După părerea mea, statistica este o știință politică înainte de orice, din moment ce folosind statistica zicem noi, că demonstrăm cu argumente științifice ceva, dar acel ceva este construit în așa fel încât să slujească unor scopuri politice obscure. Pe vremea când eu eram student, într-o carte am găsit că producția de tractoare de la noi ca țară socialistă a crescut cu 40% în timp ce în USA ca țară capitalistă a crescut cu doar 10%, ceea ce însemna că sistemul capitalist era inferior sistemului socialist. În lipsa valorilor absolute concluzia era clară. Numai că la noi producția crescuse de la 100 la 140 de tractoare, în timp ce în USA producția crescuse de la 1.000.000 de tractoare la 1.100.000 de tractoare.

Nici în epoca CEAUȘESCU statistica nu era altfel. Se zicea că azi piața a fost aprovizionată cu 4.000 Kg de carne, iar a doua zi a fost aprovizionată cu 8.000 de pachete de carne căci dădea mai bine la propagandă să spui 8.000 de pachete decât 4.000 Kg, căci un pachet avea 0,5 Kg. Să nu credem că în ziua de azi statistica se folosește chiar cu obiectivitate, căci schimbând structura indicatorilor se jonglează oricum vrea decidentul politic, iar neaplicând teste obligatorii, orice serie de date se prelucrează ca fiind omogenă, iar metoda celor mai mici pătrate se aplică cu mare voioșie.



(03 februarie 2025)

Friday, November 29, 2024

Absența utilizării metodelor cantitative în teoria manipulării e o catastrofă

Metodele cantitative ne ajută să identificăm corelații reale între factorii din toate domeniile unde aceste metode se folosesc și pe baza concluziilor să se treacă la utilizarea de rețete, de tehnici și metode de soluționare a problemelor în mod eficient. Despre teoria manipulării s-au scris mii și mii de volume, dar despre utilizarea metodelor cantitative în cuantificare eforturilor de manipulare, respectiv, a efectelor manipulării, nu s-au publicat rezultate cantitative, căci nimeni nu dă mură-n gură altora rezultate care pentru ei sunt vitale, căci adevărata manipulare nu se află în cărțile colorate pentru copiii de grădiniță, deși manipularea începe cu ei ca subiecți. 
Pentru manipularea trebuie luate în considerare două abordări și anume manipularea votanților care:
- votează la vedere prin ridicarea mâinii,
- intră în urnă și ștampilează pe buletinul de vot. 
Cine crede că votantul care intră în cabină și-și exercită votul secret, face obiectul unei manipulări simple, primitive fie prin vorbe, fie prin avantaje materiale sau bănești, deja pornește de la o premisă eronată, atât timp cât nu există o modalitate de a verifica votul, în condițiile în care devin cazuri penale încercările de a crea astfel de dovezi și nimeni nu riscă dosar penal de dragul a 50 de lei și nici pentru un kil de mălai.
Fără a face studii cantitative a măsurării efectelor pe care le au mesajele din mediul online care circulă pe rețelele de socializare este greu de a trage concluzii și cei ce fac studiile trebuie să utilizeze exact ceea ce în medicină se realizează cu metoda placebo. Nu spun mai mult, căci nu mă apuc să dau eu lecții celor care ar fi trebuit să dispună de aceste studii și alegerile din 24 noiembrie să nu-i prindă cu c-r-ul gol și să facă afirmații aproximative despre Tik Tok sau Facebook sau X sau Instagram. Statistica matematică are metode extrem de fine și de eficiente de a realiza sondaje și de a construi proceduri pentru a efectua măsurători, după care să testeze rezultatele în vederea verificării a tot felul de ipoteze. Totul este ca acele metode să fie folosite corect, respectând cerințe de omogenitate a datelor și de acuratețe a culegerilor de date, căci vorba proverbului machedonesc, dacă într-o oală de ciorbă, pui o lingură de c-c-t, totul c-c-t se numește.



(29 noiembrie 2024)

Wednesday, July 24, 2024

Concluzii bizare despre temperaturile caniculare

Se vorbește despre temperaturile caniculare, despre maximele istorice și toată lumea cade pe spate. Eu cred cu probabilitate de peste 80% că totul este o aiureală, să nu spun o goană după senzațional, căci cu o probabilitate de peste 90% datele folosite sunt nereprezentative și comparabile și punct. 
Să mă explic: pentru a avea medii aritmetice reprezentative în ceea temperaturile este nevoie de:
- proceduri clare,
- aparate de măsură calibrate,
- personal instruit,
- sistem de transmitere,
- program orar fixat,
- locații stabilite,
- teste statistice.
Am mari îndoieli că acum 20 de ani aparatele de măsură au fost calibrate, că punctele unde au fost măsurate temperaturile au fost aceleași ca punctele de azi, că procedurile de măsurare au rămas aceleași. Dacă nu stau așa lucrurile, datele înregistrate acum 20 sau 40 de ani nu sunt omogene cu datele măăsurate azi, deci nu au cum să fie agregate pentru a da medie aritmetică, deci media aritmetică este nereprezentativă, ca si cum am aduna mere cu pere.
Nu este târziu nici acum să fie definite procedurile, să fie calibrate aparatele și să se definească tehnici de corectare a erorilor de măsurare, pentru a face datele din seriile lungi culese de-a lungul anilor, să fie omogene, comparabile și seriile să intre în calculul mediilor aritmetice. Nu este exclus ca rezultatele să nu mai fie pe placul celor care delirează asupra temei încălzirii globale. Să nu uităm că media aritmetică este reprezentativă dacă datele sunt omogene, comparabile și culese după aceeași procedură.

(24 iulie 2024)

Tuesday, July 9, 2024

Statistica nu are instrumentele pentru...

Pandemia ne-a arătat că atât statistica teoretică, cât și statistica practică, nu are instrumentele necesare tratării datelor provenind din colectivități imense. Interpretările eronate din timpul pandemiei, în care la zeci de milioane de persoane vaccinate, au fost analizate necorespunzător situațiile extreme ale unor efecte adverse, cu discuțiile absurde derulate prin televiziuni, din partea unor profani.
Dacă era situația în care restricțiile de stocare a datelor impuneau abordări trunchiate, aș fi înțeles. Numai că acum când orice puști are posibilitatea de a avea un telefon cu 256 Gb memorie și orice specialist se consideră un amator jalnic dacă nu are un laptop cu cel puțin 1 Tb memorie SSD, este impardonabil că știința, dar și practica  statisticii nu a ținut seama cu acestă realitate, astfel încât să discutăm de pe cu totul alte poziții atunci când avem o colectivitate de 50.000 de subiecți și trebuie să facem un sondaj, căci realitatea impune să să extragem de acolo un eșantion de 1.200 de înregistrări, să facem oarece prelucrări și să considerăm că dacă vom concluziona cumva, rezultatul s-ar referi la întreaga colectivitate. 
Acum avem:
- memorie unde stocăm oricât de multe date,
- serii de date de zeci de milioane de termeni,
- proceduri care asigură reprezentativitatea datelor.
Nu știm ce să facem cu aceste date și folosim metode vechi la noul context, ceea ce ne duce sfre fundături unde comportamentul nostru este de-a dreptul lamentabil, iar deciziile sunt de un penibil profund, colorat, dezamăgitor, instabil, extins și dinamic.
Pentru a face ceva acceptabil, din noianul celor câteva sute de milioane de date, trebuie extrase câteva sute de mii, care îndeplinesc cerințe care ne îndreptățesc să considerăm că prelucrările au sens. Nu mă voi apuca eu aici să mă dau rotund că dețin adevărul absolut, dar faptul că pe colectivități finite, oamenii aplică metodele statistice de la eșantionare, mă îndreptățesc să resping moduri de lucru aberante, cu efecte grotești în zona concluziilor aberante care se desprind în mod mecanic și neverosimil.
Interpretarea eronată a seriilor de date legate de variațiile de temperatură de pe glob, corelațiile absurde dintre încălzirea globală și pârțurile vacilor, arată că omenirea respinge deja lucrurile elementare și se îndreaptă spre o direcție greșită, atât timp cât automobilul electric nu are autonomie egală cu cea a unui rezervor de combustibil fosil și proveniența energiei lor nu este garantat 100% din energia verde.


(09 iulie 2024)

Sunday, May 26, 2024

Limitele manipulării prin sondajele preelectorale

Teoria matematică a sondajelor este una, practica realizării sondajelor este altceva, iar sondajele făcute la comandă, este o altă mâncare de pește. Există nenumărate case de sondaje, există nenumărați decidenți care cred că dispun de bani cu care să plătească efectuarea sondajelor, ca și cum nu ar ști că statistica este o știință politică, în sensul că folosind statistica se crează premisele pentru a demonstra orice, din moment ce construirea seriilor de date este încărcată de subiectivismul, superficialitatea și mai ales ignoranța, dictate de calitatea îndoielnică a persoanelor care efectuează culegerea datelor.
Atât timp cât nu există analize serioase ale calității rezultatelor obținute din sondaje, prin comparație cu ceea ce se obține în realitate și nici nu se publică seriile de date inițiale folosite în prelucrările specifice teoriei sondajelor și nici rezultatele intermediare pentru a se asigura reproductibilitatea calculelor efectuate, totul se află pe nisipuri mișcătoare, iar rezultatele oricărui sondaj sunt privite cu multe rețineri.
Înainte de orice alegeri se publică și se discută rezultatele oferite de tot felul de case de sondare a opiniei publice și cetățenii chiar nu mai știu ce să creadă, din moment ce folosind același popor ca sursă de construire a seriilor de date, se obțin ierarhizări extrem de variate și de contradictorii, dacă se fac analize comparate. În plus, lumea nici nu știe ce înseamnă acea eroare pe care o dă sondajul, iar explicațiile acelei erori sunt halucinante, așa cum sunt date de a-a-zișii sociologi care apar pe sticlă și chipurile interpretează acele rezultate.
Sfătuiesc pe cei interesați să deschidă o carte de teoria sondajelor și să vadă că o eroare de 3% nu înseamnă în niciun caz că un nene care apare în sondaj cu 14%, în realitate are o poziție cuprinsă undeva între 11% și 17%, intervalul fiind obținut prin scăderea lui 3 din 14, adică 11, respectiv, din adunarea lui 3 la 14, adică 17, ci cu totul altceva.
Sondajele sunt nocive atunci când sunt infectate de subiectivismul plătitorului, căci cel care culege date și le prelucrează, dacă dorește să ofere celui ce plătește, exact ceea ce vrea să vadă, oricât de științifică este metoda folosită, trucarea sistematică și conștientă a seriilor de date prin eliminare de termeni, duce la obținerea de rezultate din burtă, cu scopul de a manipula. Lumea este sătulă de manipulările grosolane și de aceea evită bălăcăreala politică bazată pe numerele rezultate din sondaje scoase din joben asemeni scamatoriilor de prost gust, pe care unii le cred că joacă rolul unui trăznet, dar ele sunt bumerang.



(26 mai 2024)

Sunday, November 26, 2023

Clasamentul FIFA al echipelor naționale și EURO 2024

Trebuie să credem în clasamentul FIFA al echipelor naționale, căci are la bază foarte mulți parametri care chiar definesc performanța acestor echipe pe termen scurt și mediu. Echipa națională de fotbal a României a evoluat în cadrul unei grupe din care au făcut parte:
Elveția ocupantă a locului  14 în clasamentul FIFA
România ocupantă a locului 48 în clasamentul FIFA
Israel ocupant a locului  71 în clasamentul FIFA
Belarus ocupantă a locului 100 în clasamentul FIFA
Kosovo ocupantă a locului  105  în clasamentul FIFA
Andorra ocupantă a locului 159 în clasamentul FIFA
Nivelul mediu al pozițiilor este de 82,83 abaterea standard este 50,34 iar coeficientul de variație este 60,78% ceea ce arată că cele șase echipe reprezintă o colectivitate neomogenă. Coeficientul de corelație este de -0,89 ceea ce arată că poziția în clasament influențează decisiv poziția în grupă, adică dacă o echipă are un rang mai bun și numărul de puncte este mai mare, ceea ce este normal, căci echipele din fruntea clasamentului sunt mai bune, în timp cele din partea de jos a clasamentului sunt mai slabe.
Folosind datele statistice, vom avea la sfârșitul săptămânii viitoare și o imagine a ceea ce se va întâmpla din punct de vedere statistic la EURO 2024.



(26 noiembrie 2023)

Monday, May 29, 2023

În statistică, toată lumea este deșteaptă. [ ]

Mie îmi plac la nebunie de persoanele care scriu despre statistică, dar care nu au făcut niciodată o cercetare statistică și nu au folosit acea cercetare statistică pentru a fundamenta o decizie cu care să meargă cu ea până în pânzele albe. De aceea, mie mi se pare că în statistică toată lumea este deșteaptă, dar când îi iei pe oameni la bani mărunți vezi că doar teoria este de ei și practica lor este zero barat.
Am stat și m-am întrebat că privind o foaie matricolă a unui absolvent de facultate cu media șase și un pic foarte mic, un decident a hotărât că respectivul absolvent are calitățile necesare derulării unui stagiu doctoral. Cum tot așa, un alt decident a hotărât că un absolvent cu restanțe repetitive la o anumită disciplină, are tot ce trebuie să devină doctor în acea disciplină.
Vreți numele? Le am și foile matricole ale nefericiților stau mărturie, dar totul costă.
La viața mea, un lucru am făcut și eu în ale statisticii și anume:
- am luat peste 450 de studenți,
- i-am întrebat ce înțeleg ei prin student bun,
- le-am dat suficient de multe indicații,
- răspunsurile au fost anonime,
- am făcut prelucrări statistice primare,
- a rezultat intervalul (7,80; 9,20) pentru studentul bun,
- a rezultat intervalul [9,20; 10] pentru studentul foarte bun,
- am aplicat teste statistice,
- cu 95% încredere studentul cu media în acest interval e considerat bun.
Eu am aplicat ceea ce am obținut în evaluările mele, atunci când a fost nevoie să aleg colaboratori, nu neapărat după mediile de la școală, ci după rezultatele oricăror serii reprezentative de termeni. Dacă din 20 de întâlniri omul era punctual în 17 dintre ele rezulta  = (17/20)*10 = 8,65, deci omul este bun. Când a fost punctual i-am acordat nota 10, când nu a fost punctual i-am acordat nota 1.
Am mai făcut o cercetare statistică pe care am explicat-o și altora, dar eu o folosesc cu succes în practică, referitor la calculul ponderilor asociate calității, respectiv, cantității, când vreau să agreg performanțele indivizilor cu indicatorul IA:
IA = p*min(A,B)/max(A,B) + q*min(X,Y)/max(X,Y)
unde:
A - nivelul cantitativ planificat de realizat,
B - nivelul cantitativ efectiv realizat,
X - nivelul calitativ planificat de realizat,
Y - nivelul calitativ efectiv realizat,
p  - coeficientul de importanță al cantității, 
q - coeficientul de importanță al calității.
Folosind foarte multe serii de studenți de la masterele pe unde am predat, am obținut p = 0,4 și q = 0,6 coeficienți pe care i-am testat și a rezultat că sunt reprezentativi și pe care eu îi folosesc cu succes atunci când vreau să văd cât de tare în parcare e câte un nene cu care eu aș vrea să colaborez, dar mai ales, mi se impune să colaborez și dacă IA < 0,78 am suficiente metode elegante de a nu-l include într-un proiect, căci eu nu sunt omul riscurilor.


(29 mai 2023)

Curba lui GAUSS, rețelele de socializare și manipularea

Cine face manipulare după ureche, să nu se aștepte să aibă și rezultate. Manipularea este precedată de o analiză cantitativă, unde intervine statistica la greu. Toată lumea știe despre:
- curba lui GAUSS,
- media aritmetică,
- abaterea medie standard,
- intervale de încredere,
- rețele de socializare,
- grupuri țintă,
- definire de obiective,
- manipulare,
- calcule de eficiență,
- groaznic de multă informatică,
- bani, foarte mulți bani.
Toate acestea trebuie puse la treabă, folosind echipe interdisciplinare, formate din specialiști adevărați, nu din gargaragii care știu doar să-i îmbrobodească pe fraieri și să le ia banii.
Mai întâi se definește obiectivul. De exemplu, câștigarea alegerilor prezidențiale de către un nene cu nume și prenume.
După aceea, se stabilește grupul țintă. Aici nu vin cu detalii, căci detaliile costă și nu prestez gratis nimic. Spun doar că pornind de la grupul țintă, se construiesc mesajele, căci membrilor grupului țintă trebuie să le spui ce vor să audă, nu ceea ce vrei tu de pe poziția de candidat, că votul este la ei, nu la tine, nene cu nume și prenume.
Grupul țintă trebuie cunoscut și acest lucru se realizează folosind rețelele de socializare. Partidul AUR a dovedit că intrarea în parlament folosind Internetul și rețelele de socializare, a fost o realitate. Un informatician bun care știe să folosească conținutul digital din câteva rețele de socializare va defini profilul prin vocabular, vârstă, profesii, simpatii politice, ale membrilor grupului țintă care fac obiectul manipulării.
Chiar și construirea mesajelor are la bază o analiză statistică a cuvintelor cheie, care trebuie să fie puternice, de mare impact asupra membrilor grupului țintă. Ca să dau fugitiv un exemplu, trebuie văzute din paleta de culori, acele culori agreate de potențialii membri ai grupului țintă și mesajele puse pe rețele de socializare sau pe bannere să aibă dominante acele culori.
Într-un fel se pune problema când grupul țintă cuprinde pe cei aflați în intervalul (-σ, +σ) sau în intervalul (-3σ, +3σ), căci una este să vrei șanse de câștig mai mici și alta este să vrei aproape o cwertitudine în ceea ce privește rezultatul manipulării.



(29 mai 2023)

Monday, March 27, 2023

1.000 de oameni care m-au impresionat: Miruna MAZURENCU MARINESCU PELE

Pe profesoara Miruna MAZURENCU MARINESCU PELE o cunoscut de când era asistentă universitară și ne întâlneam pe la examenele de admitere de la ASE și discutam tot felul de chestii de statistică, pentru că pe mine mă interesa statistica din moment ce eu aveam de lucru cu metrici de calitate software.
Nu vreau să scriu aici despre profesionista în ale  statisticii Miruna MAZURENCU MARINESCU PELE, ci vreau să scriu despre omul Miruna MAZURENCU MARINESCU PELE, care atunci când am avut mare nevoie, a știut să-mi sară în ajutor și acest lucru m-a impresionat definitiv.
Împreună cu colegul meu mai tânăr Claudiu HERȚELIU, pe când lucram amândoi în ministerul educației, am hotărât să facem un jurnal, JAQM - Journal of Applied Quantitative Methods, un jurnal online, cu articole în limba engleză, dar nu în orice limbă engleză, ci într-o liombă engleză de calitate. Noi fiind la început, aveam nevoie de cineva care să cizeleze textele. Am discutat cu Miruna, ea a fost de acord și a adus textele primelor numere ale jurnalului la acel nivel de calitate, care le-a făcut competitive. Acest lucru nu se uită și de aceea profesoara Miruna MAZURENCU MARINESCU PELE este pentru mine un om care m-a impresionat, adică un om deosebit, căci atunci când am avut nevoie, a spus: prezent!


(27 martie 2023)

1.000 de oameni care m-au impresionat: Ion IVĂNESCU

Când eram student în anul al III-lea am făcut disciplina de Statistică teoretică cu doamna profesoară Elena BIJI. Un timp, doamna profesoară Elena BIJI a lipsit, fiind în concediu de maternitate, timp în care au înlocuit-o mai mulți profesori, dintre care unul a fost profesorul Ion IVĂNESCU. Din start trebuie să spun că profesorul Ion IVĂNESCU era un om cu totul special. Preda un curs ca nimeni altul și avea un fel al său de a ni se adresa, astfel încât să înțelegem totul din sala de curs.
Profesorul Ion IVĂNESCU m-a impresionat prin sobrietatea cu care apărea în sala de curs și prin modul în care scria pe tablă, căci statistica înseamnă formule, iar formulele sale erau exact ceea ce eu înțelegeam foarte bine. Mi-a plăcut că mi-a deschis apetitul spre a dezvolta propriile mele formule de care aveam nevoie la programare. Dacă profesorul Ion IVĂNESCU mi-a vorbit de formula mediei sau a dispersiei, atunci când mi se enunțau probleme de programare, imediat eram în stare să scriu formulele ce decurgeau din enunțul problemelor pentru care trebuia să scriu programe. Așa se face că eram în stare să construiesc tabele și să scriu formule pentru calcul pe linie, dar și pentru calcule pe coloane, ceea ce mi-au ușurat nespus de mult munca de programator. Profesorului Ion IVĂNESCU îi datorez claritatea de a scrie formule, inclusiv de a pune condiții sub semnul de sumă, dacă se impunea ca termenii să fie pozitivi, dar și alte condiționalități.
Dacă am scris și eu ceva formule, profesorului Ion IVĂNESCU i-o datorez.


(27 martie 2023) 

1.000 de oameni care m-au impresionat: Eugenia LILEA

Au fost multe dăți când am avut ocazia să merg spre casă cu profesoara Eugenia LILEA, căci aveam apartamentele în aceeași mahala, mă refer la mahalaua Berceni, undeva la capătul Bucureștiului, spre Bulevardul BRÂNCOVEANU, respectiv strada Dumitru PETRESCU. Discutam diverse, ca persoane destul de amărâte, căci vremurile bolșevice pe care le-am trăit, nu duceau spre nicio direcție, din moment ce așteptam mai mult să murim decât să promovăm de la lector spre altă direcție.Noroc că a venit Revoluția în decembrie 1989 și s-au descătușat energiile de am ajuns și noi profrsori.
Eugenia LILEA era cadru didactic la Catedra de Statistică, iar eu eram la Catedra de Cibernetică Economică, fiecare fără vreo șansă de a promova înainte de 1989.
Eugenia LILEA a susținut a susținut în anul 1979 teza de doctorat de 155 pagini intitulată Metode statistico-matematice folosite in studierea factorilor care influenteaza productia agricola animala și coordonată de profesorul universitar Mircea BIJI.
Eugenia LILEA a scris cărți pe care lea publicat, din care enumer aici:  Statistica realizată împreună cu Zizi GOSCHIN, Doinea BOLDEANU, Mihaela VĂTUI - 2001,  Statistica aplicata realizată împreună cu Zizi GOSCHIN,  Mihaela VĂTUI - 2002,  Statistica economica realizată împreună cu Vergil VOINEAGU, Zizi GOSCHIN, Doinea BOLDEANU, Mihaela VĂTUI - 2001, Statistica : Indicatori, definitii, formule de calcul realizată îmtreună cu Zizi GOSCHIN, Doinea BOLDEANU, Mihaela VĂTUI - 1999, dar și multe altele.
Pe mine m-a impresionat Eugenia LILEA prin puterea ei de muncă, prin caracterul ei direct de a pune problemele și prin caracterul realist al abordărilor, atunci când era vorba de a realiza un proiect, căci înainte de toate făcea o analiză amănunțită și abia după aceea trecea la treabă, fără a se lăsa pradă unui entuziasm care nu are baze reale. Dovadă stă faptul că la realizarea lucrărilor a făcut parte dintr-o echipă care a avut foarte mici fluctuații structurale, tocmai datorită cunoașterii stilului de lucru al colegelor sale Zizi GOSCHIN, Doinea BOLDEANU și Mihaela VĂTUI.


(27 martie 2023)

Thursday, February 23, 2023

1.000 de oameni care m-au impresionat: Adrian COSTEA

Adrian COSTEA a fost studentul meu la Secția de Informatică Economică, Facultatea de Cibernetică, Statistică și Informatică Economică, promoția 1998. Eu i-am fost coordonator al lucrării de licență, o lucrare notată de comisia de examen de licență cu 10.
În anul 2007, Adrian COSTEA a susținut teza de doctorat de 140 pagini intitulată, Metode statistice pentru măsurarea si optimizarea fiabilității softwarecoordonată de profesorul universitar Alexandru ISAIC-MANIU, iar eu am fost referent în comisia de susținere în ședință publică a tezei.
Pentru mine Adrian COSTEA este Adi COSTEA.
Adi COSTEA a mers cu mine la o mobilitate la Turku Centre for Computer Scirence - TUCS,  în orașul Turku din Finlanda unde s-a remarcat rapid prin cercetări pe probleme de informatică aplicate în economie. El a elaborat lucrarea Computational Intelligence Methods for Quantitative  Data Mining, pe care a prezentat-o cu succes, obținând un titlul științific de PhD, la Universitatea Abo.
La Adrian COSTEA am remarcat seriozitatea de a munci, perseverența de a zăbovi pe o problemă pentru a aprofunda și pentru a obține rezultate.
Adrian COSTEA a elaborat o serie de cărți precum Statistica avansata : modelarea fiabilitatii softwarepulicată în anul 2008 la Editura ASE, Studiu statistico-econometric privind starea pietei produselor agricole in Roman, publicată în anul 2008 împreună cu Tudorel ANDREI și Iulian NĂSTAC la Editura Economică, dar și multe altele.
Adrian COSTEA m-a impresionat prin modestia cu care apare în colectivități, prin respectul pe care-l arată față de colegi și prin modul corect cu care tratează problemele cu care se întâlnește. El este acum profesor universitar, dar evoluția sa are la bază o muncă susținută, continuă și bine dozată.


(23 februarie 2023)


Friday, February 17, 2023

1000 de oameni care m-au impresionat: Vlad BOLOVĂNEANU

Vlad BOLOVĂNEANU a fost studentul meu în anul universitar  2018 -2019 la un curs de master de Securitate Informatică și s-a remarcat prin abordări extrem de interesante la problematica de care ne ocupam acolo. Am observat dorința lui de a formaliza, de a construi demonstrații riguroase. Am observat că are preocupări într-o direcție de cercetare extrem de interesantă și mai ales, de mare perspectivă, în contextul lucrului cu masive imense de date, de ordinul trilioanelor de înregistrări, din care extragerea de componente omogene, trebuie făcută prin constituirea de eșantioane aleatoare.
Aând am discutat cu el, a dorit să înceapă un stagiu doctoral cu tentă de matematică, dar el fiind absolvent de Informatică Economică, lucrurile se văd altfel. Din aproape în aproape a fost ferm în a-și alege un conducător dedoctorat matematician la bază, care lucrează în zona metodelor cantitative. Vlad BOLOVĂNEANU a făcut o pauză de un an, ca un om care vrea să facă ceva temeinic și după un an de la terminarea masterului, a dat admitere la doctorat și a început un stagiu doctoral exact cu profesorul cu care a dorit să facă acest lucru. 
M-a impresionat la Vlad BOLOVĂNEANU faptul că și-a definit un obiectiv și nu a făcut niciun rabat în a-l atinge, așa cum fac mulți, care cedează din prima, la apariția unei mici abateri din exterior. El a stabilit ce vrea să facă. El a stabilit cu cine vrea să facă. El a stabilit când să facă. Și-a făcut un plan de muncă pe care l-a respectat pas cu pas și până acum a reușit. Voi urmări parcursul lui pe toată durata stagiului doctoral și sunt sigur că el nu se va abate niciun milimetru de la drumul trasat.


(17 februarie 2023)

Monday, February 13, 2023

1000 de oameni care m-au impresionat: Emilia ȚIȚAN

Emilia ȚIȚAN mi-a fost studentă acum ceva timp. Ea este absolventă a Facultății de Planificare și Cibernetică Economică, promoția 1986.
După terminarea facultății a lucrat în economie până în 1991.
În intervalul 1991 - 1994, Emilia ȚIȚAN a fost asistent universitar.
În intervalul 1994 - 1997, Emilia ȚIȚAN a fost lector universitar.
În intervalul 1997 - 2003, Emilia ȚIȚAN a fost conferențiar universitar.
Din anul 2003 Emilia ȚIȚAN este profesor universitar.
În anul 1995, Emilia ȚIȚAN a susținut teza de doctorat de 183 pagini intitulată  Metode și tehnici statistice folosite în investigarea nivelelor de imunitate față de unele boli infecțioase, în România, coordonată de profesoara universitară Elena BIJI.
Profesoara universitară Emilia ȚIȚAN a elaborat numeroase materiale care au fost publicate în edituri de specialitate. Unele dintre cărțile publicate de ea mi-au fost dăruite de autoare cu autografe, ceea ce m-a bucurat nespus de mult.
Emilia ȚIȚAN m-a impresionat ca studentă acum mulți ani, dar și ca om al catedrei, dăruit studenților săi. Cu mult calm, cu mult tact și cu talent își desfășoară activitățile didactice, fiind apreciată de studenții săi și de colegi. ori de câte ori am avut ocazia, am recomandat studenților cu care am lucrat programare în C++ să citească lucrări scrise de profesoara Emilia ȚIȚAN, din care vor vedea practic cum se folosesc metodele statistice și cum se interpretează rezultatele, căci în cărțile ei se vede cu claritate ce înseamnă cu adevărat statistica aplicată și care este caracterul relativ al rezultatelor, fără ca ceva să fie bătut în cuie.
Ori de câte ori am avut ocazia să stau de vorbă cu Emilia am găsit noi și noi aspecte care evidențiază că ea este un om deosebit. Mai acum câțiva ani, îi spuneam că atunci când ajung lângă Viena la Designer Outlet Parndorf  merg să beau o cafea, iar Emilia mi-a zis că numai acolo se bea o cafea ILLY cu adevărat, ceea ce mi-a certificat că avem gusturi asemănătoare și mai ales, batem cam aceleași drumuri prin Europa.





(13 februarie 2023)

Sunday, January 15, 2023

Studiul corelațiilor pe colectivități extrem de mari

Să ne imaginăm o bază de date:
- pe un interval de 5 ani cu culegeri de date,
- de un miliard de înregistrări,
- cu proceduri unice de culegere a datelor,
- având structură foarte complexă,
- din care se extrag orice combinații de sub-colectivități,
- cu care calculăm o puzderie de indicatori,
- cu intervale de timp de evenimente.
Numai dacă avem date omogene din punct de vedere al culegerii și garantate calitativ vom începe să facem analiză. Cu cârpeli, așa cum se procedează acum, prelucrările sunt afectate de erori grosolane în:
- culegerea datelor,
- stocarea datelor,
- calculul indicatorilor,
- asigurarea omogenității,
- garantarea comparabilității,
- agregarea corectă a seriilor.
Pentru a studia un fenomen complet, vedem comportamentul miliardului de indivizi și stabilim tot felul de ponderi, tot felul de vârfuri sau abisuri și abia după ce facem testele de rigoare ne vom lansa în a face corelații folosind sub-mulțimi absolut omogene.  Văd acum cum se trag concluzii că un vaccin cauzează posibile complicații, de parcă știința la astfel de concluzii ca reporterii retardați care se tem să nu fie târâți în judecată folosesc cuvântul posibile sau verbele la condițional sau forme foarte vagi. În știință lucrurile trebuie să fie clare:
- spui metoda folosită,
- definești setul de date,
- faci descrierea indicatorilor,
- estimezi probabilitatea,
- concluzionezi.
nu se lasă nimic la voia întâmplării. Numai că la ora actuală OMS nu are un sistem unic de culegere a datelor, pentru a obține serii de date care prin concatenare să dea garanția că prelucrările sunt semnificative și rezultatele sunt reprezentative. Mai trebuie să curgă apă pe Dunăre sau pe Rin sau pe Volga sau pe Mississippi până se se ajungă acolo. Până una-alta pe adte eronate, se obțin rezultate eronate și se trag concluzii scandalos de eronate și viața fluctuează asemeni unei găini bete în direcții bizare.


(15 ianuarie 2023)