Έκθεμα 6.1
1Συλλογή δεδομένων
Τεράστιες ποσότητες κειμένου: ιστοσελίδες, βιβλία, κώδικας. Η επιλογή και ο καθαρισμός τους καθορίζουν τι θα «ξέρει» το μοντέλο, και ποιες προκαταλήψεις θα κουβαλά.
Γιατί βρίσκεται στο μουσείο
Ένα σύγχρονο γλωσσικό μοντέλο δεν εμφανίζεται έτοιμο. Περνά από δεδομένα, εκπαίδευση, προσαρμογή, αξιολόγηση και τελικά παραγωγή απάντησης.
Τι στηρίζει το έκθεμα
Επιμελητική σύνθεση τεχνικής βιβλιογραφίας
Ότι η επιλογή και ο καθαρισμός δεδομένων επηρεάζουν γνώσεις, ποιότητα και προκαταλήψεις.
Κύρια πηγή: Βιβλιογραφία για pretraining, data curation και scaling σύγχρονων LLM.
Δεν υπάρχει ακόμη άμεσος σύνδεσμος στο μητρώο. Η βιβλιογραφική αναφορά παραμένει διαθέσιμη εδώ.
Τι χρειάζεται προσοχή: Γενική διαδικασία · διαφέρει ανά μοντέλο
Ρώτησε το έκθεμα
Ο μικρός ξεναγός αυτής της σελίδας χρησιμοποιεί μόνο όσα υπάρχουν στον φάκελο του εκθέματος. Αν η ερώτηση ζητά κάτι που δεν τεκμηριώνεται εδώ, δεν θα το συμπληρώσει μόνος του.
Μπορείς να ξεκινήσεις με μία από τις ερωτήσεις που βλέπεις πιο πάνω.