Please use this identifier to cite or link to this item: http://artemis.cslab.ece.ntua.gr:8080/jspui/handle/123456789/17928
Full metadata record
DC FieldValueLanguage
dc.contributor.authorΓιαννούλη, Χρυσάνθη-
dc.date.accessioned2021-04-24T14:00:00Z-
dc.date.available2021-04-24T14:00:00Z-
dc.date.issued2021-03-22-
dc.identifier.urihttp://artemis.cslab.ece.ntua.gr:8080/jspui/handle/123456789/17928-
dc.description.abstractΟ υπολογισμός της ομοιότητας μεταξύ κειμένων είναι μία σημαντική μέθοδος της ανάλυσης δεδομένων, η οποία μπορεί να χρησιμοποιηθεί περαιτέρω σε πολλές και διαφορετικές εφαρμογές της ΕΦΓ όπως είναι η ανάκτηση πληροφορίας, η ανάλυση συναισθημάτων, η μηχανική μετάφραση κτλ. Η παρούσα εργασία μελετά διάφορες μεθόδους για τον υπολογισμό της σημασιολογικής ομοιότητας κειμένων. Βασικό χαρακτηριστικό των μεθόδων αυτών, είναι η αναπαράσταση της φυσικής γλώσσας ενός κειμένου σε αριθμητική μορφή, με τρόπο που να συλλαμβάνεται πληροφορία για την σημασία του (embedding). Οι μέθοδοι βασίζονται στην μηχανική μάθηση για την δημιουργία των embeddings των λεκτικών όρων και εξετάζονται με κριτήριο την ικανότητα τους να εκτιμούν την ανθρώπινη κρίση για το νόημα του κειμένου.Συγκεκριμένα, στην εργασία μελετώνται κωδικοποιητές για την δημιουργία embeddings λέξεων (word embeddings) και πως μπορούν να συνδυαστούν για να συλλάβουν το νόημα μιας πρότασης, καθώς και προ-εκπαιδευμένοι κωδικοποιητές για την δημιουργία embeddings προτάσεων (sentence embeddings). Για την πειραματική αξιολόγηση χρησιμοποιήθηκαν μικρά ειδησεογραφικά κείμενα, αντιπροσωπευτικά της αγγλικής γλώσσας, και ένα σετ ανθρώπινες μετρήσεις για την ομοιότητα των κειμένων. Τα αποτελέσματα των μετρήσεων δείχνουν πως η γενική επίδοση των μοντέλων να εκτιμούν την ανθρώπινη αντίληψη είναι καλή, χωρίς ιδιαίτερα κακές επιδόσεις. Αν και κάποια μοντέλα, πέτυχαν πολύ υψηλή απόδοση, η καλύτερη επίδοση επιτεύχθηκε στην περίπτωση που λάβαμε υπόψη το dataset μας, κάνοντας fine-tuning ένα μοντέλο σε αυτό.en_US
dc.languageelen_US
dc.subjectομοιότητα κειμένωνen_US
dc.subjectσημασιολογική ομοιότηταen_US
dc.subjectword embeddingsen_US
dc.subjectsentence embeddingsen_US
dc.subjectπρο-εκπαιδευμένοι κωδικοποιητέςen_US
dc.titleΜελέτη Μεθόδων Υπολογισμού Σημασιολογικής Ομοιότητας Κειμένωνen_US
dc.description.pages70en_US
dc.contributor.supervisorΣτάμου Γιώργοςen_US
dc.departmentΤομέας Τεχνολογίας Πληροφορικής και Υπολογιστώνen_US
Appears in Collections:Διπλωματικές Εργασίες - Theses



Items in Artemis are protected by copyright, with all rights reserved, unless otherwise indicated.