From 072aa6ce12c505ff28deef6d4e46963635a9100d Mon Sep 17 00:00:00 2001 From: Miro Mannino Date: Wed, 16 Aug 2023 10:43:28 +0400 Subject: [PATCH] Updating clean_markup function to be compatible with Extractor.__init__() and Extractor.clean_text() --- wikiextractor/clean.py | 5 ++--- 1 file changed, 2 insertions(+), 3 deletions(-) diff --git a/wikiextractor/clean.py b/wikiextractor/clean.py index 3320c19a..0e03aa91 100644 --- a/wikiextractor/clean.py +++ b/wikiextractor/clean.py @@ -33,13 +33,12 @@ def clean_markup(markup, keep_links=False, ignore_headers=True): if not keep_links: ignoreTag('a') - extractor = Extractor(0, '', []) + extractor = Extractor(0, '', [], '', '') # returns a list of strings paragraphs = extractor.clean_text(markup, mark_headers=True, - expand_templates=False, - escape_doc=True) + expand_templates=False) resetIgnoredTags() if ignore_headers: