From f0e2e61269e4a4241b8ec3a238b91690149a102e Mon Sep 17 00:00:00 2001 From: Mark Eaton Date: Sat, 16 May 2026 00:18:12 -0400 Subject: [PATCH] add (review) to stopwords --- parse.py | 12 +++++++----- 1 file changed, 7 insertions(+), 5 deletions(-) diff --git a/parse.py b/parse.py index 499829c..dd5ed79 100644 --- a/parse.py +++ b/parse.py @@ -7,6 +7,7 @@ from collections import Counter from pprint import pprint stop_words = [ + "(review)", "of", "and", "the", @@ -62,7 +63,7 @@ def extract_journal_titles(data): for row in data: if "(edited volume)" not in row[3]: journal_titles.append(row[3]) - count_journal_titles = Counter(journal_titles).most_common(20) + count_journal_titles = Counter(journal_titles).most_common(30) pprint(count_journal_titles) print("Total journals: " + str(len(set(journal_titles)))) @@ -85,7 +86,7 @@ def extract_title_keywords(data): def print_title_keywords(data): title_keywords = extract_title_keywords(data) title_keywords = [word[0] for word in title_keywords] - count_title_words = Counter(title_keywords).most_common(20) + count_title_words = Counter(title_keywords).most_common(30) pprint(count_title_words) @@ -105,8 +106,9 @@ def names(data): for name in name_parts: name = name.rstrip(",") if name not in stop_words: - names.append(name) - count_names = Counter(names).most_common(20) + if "." not in name: + names.append(name) + count_names = Counter(names).most_common(30) pprint(count_names) @@ -115,5 +117,5 @@ if __name__ == "__main__": data = data[1:] extract_journal_titles(data) print_title_keywords(data) - names(data) + # names(data) histogram(data)