Ιδρυματικό Αποθετήριο
Πολυτεχνείο Κρήτης
EN  |  EL

Αναζήτηση

Πλοήγηση

Ο Χώρος μου

Διερευνώντας την αποτελεσματικότητα και την απόδοση του υποτιτλισμού εικόνας

Frechat Nantia-Efthymia

Απλή Εγγραφή


URIhttp://purl.tuc.gr/dl/dias/8C58FB2B-27F0-4FDF-B00F-15346E1477C1-
Αναγνωριστικόhttps://doi.org/10.26233/heallink.tuc.83634-
Γλώσσαen-
Μέγεθος79 pagesen
ΤίτλοςExploring efficiency and performance of image captioningen
ΤίτλοςΔιερευνώντας την αποτελεσματικότητα και την απόδοση του υποτιτλισμού εικόναςel
ΔημιουργόςFrechat Nantia-Efthymiaen
ΔημιουργόςΦρεχατ Ναντια-Ευθυμιαel
Συντελεστής [Επιβλέπων Καθηγητής]Lagoudakis Michailen
Συντελεστής [Επιβλέπων Καθηγητής]Λαγουδακης Μιχαηλel
Συντελεστής [Μέλος Εξεταστικής Επιτροπής]Pnevmatikatos Dionysiosen
Συντελεστής [Μέλος Εξεταστικής Επιτροπής]Πνευματικατος Διονυσιοςel
Συντελεστής [Μέλος Εξεταστικής Επιτροπής]Zervakis Michailen
Συντελεστής [Μέλος Εξεταστικής Επιτροπής]Ζερβακης Μιχαηλel
ΕκδότηςΠολυτεχνείο Κρήτηςel
ΕκδότηςTechnical University of Creteen
Ακαδημαϊκή ΜονάδαTechnical University of Crete::School of Electrical and Computer Engineeringen
Ακαδημαϊκή ΜονάδαΠολυτεχνείο Κρήτης::Σχολή Ηλεκτρολόγων Μηχανικών και Μηχανικών Υπολογιστώνel
ΠερίληψηΟ υποτιτλισμός εικόνας είναι ένα πολύπλοκο πρόβλημα που συνδυάζει τον τομέα της μηχανικής όρασης και της επεξεργασίας φυσικής γλώσσας. Στοχευει στην παραγωγή προτάσεων σε φυσική γλώσσα που περιγράφουν το περιεχόμενο κάποιας εικόνας. Ο υποτιτλισμός εικόνας έχει αρκετές εφαρμογές στον πραγματικό κόσμο με σημαντικό πρακτικό αντίκτυπο, από την παροχή βοήθειας σε χρήστες με προβλήματα όρασης έως προσωπικούς βοηθούς μέσω της αλληλεπίδρασης ανθρώπου-ρομπότ. Η πρόοδος στον υποτιτλισμό εικόνας είναι μια σημαντική επιτυχία της Τεχνητής Νοημοσύνης. Έχει αναφερθεί ότι υπο ορισμένες μετρικές, όπως το BLUE ή το CIDEr, οι πιο σύγχρονες τεχνικές ξεπερνούν ακόμα και τις ανθρώπινες επιδόσεις. Σε αυτή τη διπλωματική εργασία, υλοποιούμε και παρουσιάζουμε ένα μοντέλο βασισμένο σε τεχνικές μηχανικής μάθησης που συνδυάζει τις πιο σύγχρονες εξελίξεις στην μηχανική όραση και τη μηχανική μετάφραση και που μπορεί να χρησιμοποιηθεί για τη δημιουργία φυσικών προτασεων που περιγράφουν μια εικόνα. Συγκεκριμένα, χρησιμοποιήθηκε ένας συνδυασμός συνελικτικών νευρωνικών δικτύων μαζί με ανατροφοδούμενα νευρωνικά δίκτυα για την απόκτηση των επιθυμητών αποτελέσματων. Τα μοντέλα εκπαιδεύτηκαν έτσι ώστε να μεγιστοποιούν την πιθανότητα περιγραφής στόχου δεδομένης της εικόνας εκπαίδευσης. Πειράματα σε ένα πολύ μεγάλο σύνολο δεδομένων εκπαίδευσης, όπως το MSCOCO που χρησιμοποιήθηκε σε αυτή τη διπλωματική, δείχνουν την ακρίβεια του μοντέλου και την ευχέρεια που αποκτά η γλώσσα αποκλειστικά μέσα από τις περιγραφές των εικόνων. Το μοντέλο, το οποίο ελέγθηκε ποιοτικά και ποσοτικά, είναι συχνά αρκετά ακριβές.el
ΠερίληψηImage captioning is a complex problem that combines the fields of computer vision and natural language processing. It generates natural language sentences that describe the content of an image. Image captioning has several applications in the real world with significant practical impact, from assisting users with visual impairments to personal assistants through human-robot interaction. The progress in image captioning is a major success of Artificial Intelligence. It has been reported that under some metrics, such as BLUE or CIDEr, the most up-to-date techniques even outperform human performance. In this thesis, we implement and present a model based on machine learning techniques that combines the latest developments in computer vision and machine translation that can be used to create natural sentences that describe an image. Specifically, a combination of Convolutional Neural Networks together with Recurrent Neural Networks was used to obtain the desired results. The models were trained to maximize the likelihood of a target description given the training image. Experiments on a huge set of training data, such as the MSCOCO 2015 used in this thesis, demonstrate the accuracy of the model and the fluency of the language that is acquired through the image descriptions alone. It has been tested qualitatively and quantitatively that the model is often quite accurate.en
ΤύποςΔιπλωματική Εργασίαel
ΤύποςDiploma Worken
Άδεια Χρήσηςhttp://creativecommons.org/licenses/by/4.0/en
Ημερομηνία2019-10-11-
Ημερομηνία Δημοσίευσης2019-
Θεματική ΚατηγορίαMachine learning en
Θεματική ΚατηγορίαRecurrent neural networksen
Θεματική ΚατηγορίαConvolutional neural networksen
Βιβλιογραφική ΑναφοράNantia-Efthymia Frechat, "Exploring efficiency and performance of image captioning", Diploma Work, School of Electrical and Computer Engineering, Technical University of Crete, Chania, Greece, 2019en
Βιβλιογραφική ΑναφοράΝάντια-Ευθυμία Φρεχάτ, "Διερευνώντας την αποτελεσματικότητα και την απόδοση του υποτιτλισμού εικόνας", Διπλωματική Εργασία, Σχολή Ηλεκτρολόγων Μηχανικών και Μηχανικών Υπολογιστών, Πολυτεχνείο Κρήτης, Χανιά, Ελλάς, 2019el

Διαθέσιμα αρχεία

Υπηρεσίες

Στατιστικά