Changes for README.md: 48 added lines, 69 removed lines.
Original line number
Diff line number
Diff line
@@ -8,7 +8,7 @@ Ensuite nous utilisons les différentes méthodes de regroupement que propose ce
Extraction
----------
Le fichier d'extraction de la base de données du DES (qui est accessible via un contrat de prêt pour la recherche, contacter crisco.webestre @ unicaen.fr)se présente sous cette forme :
Le fichier d'extraction de la base de données du DES (syno_paires_<mois><annee>.txt est accessible via un contrat de prêt pour la recherche, contacter crisco.webestre @ unicaen.fr)se présente sous cette forme :
Pour chacun des synonymes de sec ci-dessus, nous extrayions du fichier les lignes où mot1 et mot2 sont synonymes de SEC.
Pour chacun des synonymes de sec ci-dessus, nous extrayions du fichier les lignes où mot1 et mot2 sont synonymes de SEC.
Création de la matrice d'adjacence
----------------------------------
Pour créer la matrice d'adjacence, nous utilisons ce code :
fichier = open (path+"syno_paires_mars2020.txt","r",encoding="iso-8859-1")
for ligne in fichier:
i1=ligne.index("\t")
mot1=ligne[0:i1]
ligne=ligne[i1+1:]
i2=ligne.index("\t")
mot2=ligne[0:i2]
i1=0
for m1 in lm: # on compare le mot lu à la vedette et à tous ses synonymes
if (m1 == mot1):
#print(i1,'-',m1,'-',mot2)
MatAdj[i1][i1]=1 # chaque synonyme de la vedette est synonyme de lui-même (diagonale)
#print(i1,'-',m1,'-',i1,'-',m1,'- à garder')
i2=0
for m2 in lm:
if (m2 == mot2):
print(i1,'-',m1,'-',i2,'-',m2,'- à garder')
MatAdj[i1][i2]=1
i2=i2+1
i1=i1+1
#MatAdj[5]=6
return(MatAdj)
et obtenons la matrice suivante :
>>> MatAdj
array([[0, 1, 1, ..., 1, 1, 1],
[1, 0, 1, ..., 0, 0, 0],
[1, 1, 0, ..., 0, 0, 0],
...,
[1, 0, 0, ..., 0, 1, 0],
[1, 0, 0, ..., 1, 0, 0],
[1, 0, 0, ..., 0, 0, 0]])
>>> MatAdj.shape
(68, 68)
>>>
Sur [l'interface publique](https://crisco2.unicaen.fr/des/synonymes/sec), SEC a bien 67 synonymes + lui-même. La matrice d'adjacence a 68 lignes et colonnes