Referencia
Módszertan
Tartalom9 szakasz
Röviden
A HírSpektrum azt méri, kiről és hogyan ír a magyar média. A követett hírportálok (jelenleg 24.hu, 444.hu, Blikk, HVG, Index, Origo, Portfolio, Ripost és Telex) cikkeit dolgozzuk fel teljesen automatikusan, a hírciklustól függően naponta nagyjából ezer–kétezer cikket.
Minden cikkből kinyerjük a megnevezett személyeket, szervezeteket és helyszíneket, és rögzítjük, milyen szerepben és milyen megítéléssel jelennek meg. Ezekből épülnek fel a szereplők és a lapok adatlapjai. Minden szám mögött ott vannak a cikkek, amelyekből számoltuk: egy kattintással ellenőrizhető, mire épül.
Alapelvünk: nem mondjuk meg, mit gondolj egy hírről. Megmutatjuk, ki írja, hogyan írja, és hogyan változik ez az idő során.
A feldolgozás lépései
Gyűjtés
A követett hírportálok új cikkeit nagyjából húszpercenként gyűjtjük be, a címmel, a szerzővel és a megjelenés idejével együtt.
Tisztítás
Kinyerjük a cikk szövegét, és eltávolítjuk belőle a hirdetéseket, ajánlókat és navigációs elemeket.
Cikkelemzés
Egy nagy nyelvi modell részletes utasítások alapján minden cikkről rögzíti a hangvételt és annak erősségét, a domináns érzelmet, a keretezést, a témát, valamint a megnevezett szereplőket, mindegyiknél a szerepével és a megítélésével.
Azonosítás
A szereplők névváltozatait egy adatlapra vonjuk össze, és ahol egyértelmű, a Wikidata megfelelő elemével kapcsoljuk össze őket.
Összesítés
Minden cikk azonnal beszámít a szereplők és a lapok napi számlálóiba. Az adatlapok összesítései legfeljebb 15 percenként frissülnek, és egy éjszakai ellenőrzés újraszámolja az elmúlt napokat.
Megítélés és pontszám
Két dolgot mérünk külön. A cikk hangvétele az egész szöveg érzelmi iránya. Egy szereplő megítélése azt írja le, hogy a cikk nyelvezete jó vagy rossz színben tünteti-e fel őt: minősítő szóhasználattal, iróniával, a kínos részletek kiemelésével, vagy épp elismerő jelzőkkel.
A megítélés nem az eseményekről szól. Egy korrupciós perről szóló, tárgyilagos tudósítás a vádlottat semlegesen ábrázolja, egy kórházavatásról szóló gúnyos kommentár pedig negatívan, pedig maga az esemény kedvező.
A pontszám
Cikkenként a pozitív megítélés +1, a semleges 0, a negatív −1, szorozva a cikk hangvételének erősségével (erős: 1, közepes: 0,66, visszafogott: 0,33). Egy szereplő pontszáma a róla szóló cikkek pontjainak átlaga a kiválasztott időszakban (7, 30 vagy 90 nap, illetve a teljes időszak). Egy cikk egy szereplőnél egyszer számít, akárhányszor említi.
| Pontszám | Címke | Szín |
|---|---|---|
| +0,50 – +1,00 | Nagyon pozitív | |
| +0,20 – +0,50 | Pozitív | |
| −0,20 – +0,20 | Semleges | |
| −0,50 – −0,20 | Negatív | |
| −1,00 – −0,50 | Nagyon negatív |
A „–” nem nulla. Ha egy időszakban nincs cikk, amelyből pontszámot lehetne számolni, gondolatjelet mutatunk. A 0,00 azt jelenti, hogy a cikkek összességében semlegesen írtak valakiről; a gondolatjel azt, hogy nincs miből számolni.
Szereplők és szerepek
Szereplő minden név szerint említett személy, szervezet vagy helyszín. A cikkszám azt mutatja, hány cikk említette az adott időszakban, a forrásszám pedig azt, hány lap.
Megnevezett személy: politikus, közéleti szereplő, szakértő vagy bárki, akit a cikk név szerint említ.
Intézmény: párt, kormányzati szerv, vállalat, civil szervezet, sportklub vagy maga egy médium.
Földrajzi hely: ország, település, régió, vagy egy konkrét helyszín.
Szerepek
A szerep azt írja le, milyen pozícióban szerepel valaki a cikkben, nem azt, hogy jó vagy rossz színben. Egy felelősként beállított politikusról is lehet tárgyilagosan írni.
A cikk középpontjában áll: a történet arról szól, amit tett vagy tesz. Önmagában nem jelent sem jó, sem rossz megítélést.
A cikk felelősként, egy probléma okozójaként vagy ellenfélként állítja be.
Elszenvedőként jelenik meg: az események vagy mások kárt okoznak neki.
Nyilatkozik, idézik, vagy szakértőként hivatkoznak rá.
Előfordul a szövegben, de nem meghatározó a cikk szempontjából.
Keretezés, érzelem, téma
A keretezés azt mutatja, hogyan meséli el a cikk a történetet. A kategóriák Semetko és Valkenburg (2000) széles körben használt keretrendszerén alapulnak. Minden cikk egy elsődleges keretet kap; a lapok adatlapján ezek megoszlása látható.
Szembenálló felek, vita, küzdelem.
Ki tehet róla, és kinek kellene megoldania.
Anyagi hatások: költség, haszon, veszteség.
Személyes történet, egyéni sors.
Erkölcsi ítélet, értékek és normák.
Veszély, kockázat, fenyegetettség.
Tehetetlenség, kiszolgáltatottság.
Előrelépés, megoldás, fejlődés.
Egyik fenti keretbe sem illik egyértelműen.
Érzelem
A cikk hangvételének domináns érzelme, Plutchik érzelemmodellje alapján: harag, félelem, szomorúság, undor, meglepetés, bizalom, öröm, egyéb.
Téma
Arról, miről szól a cikk, és független a keretezéstől: egy kórházi várólistákról szóló cikk, amelyet a minisztérium és a szakszervezet vitájaként mesélnek el, témája szerint egészségügy, kerete szerint konfliktus. Témák: belpolitika, gazdaság, külpolitika, egészségügy, oktatás, bűnügy és igazságszolgáltatás, környezet, energia, társadalom, kultúra, sport, technológia, média, egyéb.
A témabesorolást később vezettük be, ezért a korábbi cikkeknek nincs témájuk. A témamegoszlást mindig csak a besorolt cikkekből számoljuk, és kiírjuk, ha ez a cikkek csak egy része.
Szereplők azonosítása
Ugyanarra a szereplőre a lapok többféleképpen hivatkoznak („Orbán”, „Orbán Viktor”). A névváltozatokat egy adatlapra vonjuk össze. A hasonló nevű szereplőpárokat a cikkek kontextusa alapján (kik szerepelnek mellettük, milyen cikkekben) ellenőrizzük, mielőtt összevonnánk őket; bizonytalan esetben inkább külön hagyjuk őket.
Ahol egyértelmű az egyezés, a szereplőt a Wikidata megfelelő eleméhez kapcsoljuk. Innen származnak az adatlapok tényadatai (foglalkozás, párt, ország, alapítás éve, koordináták), a Wikipédia-hivatkozás és a Wikimedia Commonsból származó fénykép, amely mellett a szerzőt és a licencet is feltüntetjük, ahol ezek ellenőrizhetők.
A Wikidata nem minden szereplőről tartalmaz adatot. Ezek a szereplők is megjelennek az oldalon, csak tényadatok nélkül; a személyek, szervezetek és helyszínek oldalán a „Nincs adat” csoport mutatja, mekkora ez a rész.
Lapok összevetése
Minden szereplő pontszámát lapok szerint is kiszámoljuk, így látható, hogy ugyanarról a szereplőről ki hogyan ír. A Médiatérképen ezekből az értékekből három összevetés készül:
- Kedvencek és céltáblák: kiről ír egy lap a legkedvezőbben és a legkritikusabban. Csak azok a szereplők kerülhetnek a listára, akikről a lap legalább három cikket írt, és a sorrendnél a kevés cikkre épülő átlagokat a lap saját átlaga felé húzzuk, hogy néhány véletlenszerű cikk ne vigye senkit az élre. A kiírt szám a nyers átlag.
- Megosztó szereplők: akiknek a megítélésében a legnagyobb a különbség a legkedvezőbben és a legkritikusabban író lap között, ugyanezzel a korrekcióval.
- Vakfoltok: akikről egy lap alig ír, pedig a többiek rendszeresen. Az elvárt cikkszámot a többi lap arányából és az adott lap teljes cikkmennyiségéből számoljuk, így egy kisebb lap nem számít hallgatónak csak azért, mert kevesebbet publikál.
Amikor egy lap önmagáról ír (például egy helyreigazításban), az nem számít bele abba, hogyan írnak róla mások, és a lap saját listáiban sem szerepel.
Felkapott és legtöbbet szerepelt
A főoldal két listája ugyanarra az időszakra vonatkozik, de mást mér. A Felkapott lista azokat mutatja, akikről a cikkek száma a legtöbbet nőtt az előző, ugyanilyen hosszú időszakhoz képest. A változás mellett a két cikkszámot is kiírjuk, mert egyről öt cikkre nőni négyszeres növekedés, de ritkán érdekes. A Legtöbbet szerepelt lista egyszerűen a cikkszám szerinti sorrend az adott időszakban.
Korlátok
- Az elemzést nyelvi modell végzi, ezért tévedhet: félreérthet iróniát, rossz szerepet adhat, vagy kihagyhat egy említést. Egy-egy cikknél ez előfordul; sok cikk átlagában kevésbé számít, ezért a kevés cikkre épülő számokat óvatosan kezeljük.
- A szereplőket név alapján azonosítjuk. Két azonos nevű ember addig egy adatlapon szerepelhet, amíg a hibát kézzel szét nem választjuk. A cikklista ilyenkor is pontos: minden cikk valóban említ valakit ezen a néven.
- Csak a követett lapokat látjuk, nem a teljes magyar sajtót. Ami ezekben nem jelenik meg, az nálunk sem látszik.