Topic Area 1: Automated Literature Survey Using AI Technology
Résumé de section
-
Grundidee: In diesem Projekt soll eine Software entworfen und implementiert werden, die folgendes leistet:
- Phase 1: Eine web-basierte Platform zum Crawling von ausgewählten Literaturdatenbanken (z.B. AIS, ACM, IEEE, Springer, Elsevier; Google Scholar, Researchgate) soll entworfen und implementiert werden.
- Moderne Frameworks aus dem Bereich Data Science & Webentwicklung sollten dafür sondiert werden.
- Cloud-basierter Grundansatz interessant (VM / Container).
- Die Auswahl verwendeter Technologien sollte jeweils nachvollziehbar begründet sein.
- Vorgehensweise kann in Eigenregie des Teams agil erfolgen, solange die groben Anforderungen und Projektphasen berücksichtig werden.
- Diese Plattform sollte modular sein, so dass Änderungen an den Literaturdatenbanken einfach mit kleinen Updates berücksichtigt und neue hinzugefügt werden können.
- Moderne Frameworks aus dem Bereich Data Science & Webentwicklung sollten dafür sondiert werden.
-
-
- Es soll die Möglichkeit geben, Keywords zu Suche vorzugeben.
- Minimum: Titel, Abstract und Name des Journals bzw. Conference sollten in einer Datenbank gespeichert werden können (ggf. NoSQL DBs interessant auszuprobieren!).
- Weiterer Schritt: wo es möglich ist, sollt der Artikel selbst auch heruntergeladen werden können und in der DB gespeichert.
- Dazu ggf. nötig: Passwort / Login Management für die einzelnen Plattformen.
In dieser Phase sollen auch Andock- und Integrationsmöglichkeiten an andere Projekt wie WILBERT oder Literatursuche mit Mendeley, Zotero etc. geprüft werden.
- Ziel ist es aber vor allem, für jede Suche eine eigene Datenbasis aufbauen zu können, auf der Phase 2 aufsetzt.
-
- Phase 2 (teilweise auch parallel zu Phase 1 möglich): Auf Basis der gesammelten Artikel soll eine automatische Kategorisierung und Zusammenfassung von Texten entworfen, implementiert und evaluiert werden.
- Hierzu soll erstmal ein gründlicher Überblick über relevante Untergebiete von Text Mining und frei verfügbare Tools erstellt werden.
- Möglicherweise interessant, sich z.B. diese Kurse anzusehen:
- Udemy --> NLP-Natural language processing with Python
- Udemy --> Hands-on Natural Language Processing with Python
- Udemy --> Project-based Text Mining with Python
-
- Dann sollen diese Tools mit Test-Datasets (gerne manuell zusammengestellt) zunächst ausprobiert und evaluiert werden werden (z.B. automatische vs. manuelle Klassifikation; Qualität der Summaries).
- Dann soll eine mögliche Gesamt-Architektur (Phase 1 + Phase 2) entworfen werden.
- Diese prototypisch umgesetzt und Software aus Phase 2 mit der Software aus Phase 1 integriert werden.
- Weitere Ausbau- und Evaluierungsrunden.
- Phase 1: Eine web-basierte Platform zum Crawling von ausgewählten Literaturdatenbanken (z.B. AIS, ACM, IEEE, Springer, Elsevier; Google Scholar, Researchgate) soll entworfen und implementiert werden.