2017-10-05 6 views
1

J'ai un data.frame avec une colonne "infraction". Toute infraction est constituée d'un article (Art), un paragraphe (Abs) et un sous-paragraphe (Ziff):Division de la colonne en plusieurs colonnes par séparateur

df<-data.frame(offence=c("Art. 110 Abs. 3 StGB","Art. 10 Abs. 1 StGB", "Art. 122 SVG", "Art. 1 Ziff. 2 UWG")) 

> df 
       offence 
1 Art. 110 Abs. 3 StGB 
2 Art. 10 Abs. 1 StGB 
3   Art. 122 SVG 
4 Art. 1 Ziff. 2 UWG 

Mais je dois avoir sous cette forme:

Art Ziff Abs Law 
1 110 NA 3 StGB 
2 10 NA 1 StGB 
3 122 NA NA SVG 
4 1 2 NA UWG 

Qu'est-ce le meilleur moyen d'obtenir ce résultat? lapply?

Merci!

Répondre

1

Vous pouvez utiliser str_extract de stringr:

library(stringr) 
library(dplyr) 

df$offence %>% 
    {data.frame(Art = str_extract(., "(?<=Art[.]\\s)\\d+"), 
       Ziff = str_extract(., "(?<=Ziff[.]\\s)\\d+"), 
       Abs = str_extract(., "(?<=Abs[.]\\s)\\d+"), 
       Law = str_extract(., "\\w+$"))} 

Résultat:

Art Ziff Abs Law 
1 110 <NA> 3 StGB 
2 10 <NA> 1 StGB 
3 122 <NA> <NA> SVG 
4 1 2 <NA> UWG 
+0

Très bien, merci beaucoup! –

1

convertir en forme dcf (à savoir de mot-clé: valeur) en utilisant gsub puis le lire à l'aide read.dcf. A la fin, convertissez la matrice que read.dcf produit en une trame de données et convertissez n'importe quelle colonne numérique en numérique. Aucun paquet n'est utilisé.

s <- gsub("(\\S+)[.] (\\d+)", "\\1: \\2\n", df[[1]]) # convert to keyword: value 
s <- sub(" (\\D+)$", "Law: \\1\n\n", s) # handle Law column 
us <- trimws(unlist(strsplit(s, "\n"))) # split into separate components 
DF <- as.data.frame(read.dcf(textConnection(us)), stringsAsFactors = FALSE) 
DF[] <- lapply(DF, type.convert) 

donner:

Art Abs Law Ziff 
1 110 3 StGB NA 
2 10 1 StGB NA 
3 122 NA SVG NA 
4 1 NA UWG 2