自然語言處理 (NLP):斷開中文的鎖鍊!
research.sinica.edu.tw · 183 words · saved by 1 readers
這篇不會撩妹,但會聊聊自然語言處理 (NLP)
「自然語言處理」是什麼 讓電腦擁有理解人類語言的能力,就是自然語言處理 (Natural Language Processing,縮寫 NLP)。然而,人和人之間就會誤會彼此的語言了,電腦要如何理解語義?中研院資訊科學研究所的馬偉雲助研究員說明:以中文來說,最基本的,要先教電腦學會「斷詞」和「理解詞的意思」。 如何理解一種語言? 小時候學習中文,會背誦課文詞彙的注釋,在作業簿練習這個詞的寫法。到了國中時期學英文,面對像天書般的英文文章,會把不懂的單字圈起來,拿出字典查這個字的意思。為什麼這樣做? 因為,詞彙是語言的最小單位。 然而,中文有一個特殊現象,就是「詞」和「詞」之間沒有邊界,整句串起來像條鎖鏈,不像英文有空格將每個字斷開。所以,若要理解一篇中文文章,必須先學會斷詞,而要學會斷詞,必須先知道這是一個詞、以及這個詞的意思。否則可能會產生這種令人「難過」的情況: 中文的詞沒有邊界,若誤解「詞的意思」與「句法結構」,會寫出這般造句練習。 圖│網路趣聞 那麼,問題來了,如果聰明的人類都會誤解複雜的語言,那麼只懂 011000110 的電腦有可能學會斷詞、甚至理解同一個詞在不同上下文的意思嗎?其實,這就是自然語言處理 (Natural Language Processing) 的研究目標。本文專訪中研院中文詞知識庫小組計畫主持人馬偉雲,聊聊自然語言處理究竟是什麼。…
related reading
- 讓電腦聽懂人話: 直觀理解 Word2Vec 模型. Word2Vec 是 Google 於 2013 年由 Tomas… | by TengYuan Chang | Mediumtengyuanchang.medium.com
- 1301.3781arxiv.org
- 常念錯的幾個英文字 -- by tsaiwn@cs.nctu.edu.twiottalk.vip
- www.nltk.orgnltk.org
- [2112.10508] Between words and characters: A Brief History of Open-Vocabulary Modeling and Tokenization in NLParxiv.org
- Word2vec from scratch (Skip-gram & CBOW) | by PoCheng Lin | Mediummedium.com
- 淺談神經機器翻譯 & 用 Transformer 與 TensorFlow 2 英翻中leemeng.tw
- Stanford CS224N: Natural Language Processing with Deep Learning Course | Winter 2019 - YouTubeyoutube.com
- The Illustrated BERT, ELMo, and co. (How NLP Cracked Transfer Learning) – Jay Alammar – Visualizing machine learning one concept at a time.jalammar.github.io
- Retrieval Augmented Generation: Streamlining the creation of intelligent natural language processing modelsai.facebook.com
- Bag-of-words model - Wikipediaen.wikipedia.org
- What Are Stemming and Lemmatization? | IBMibm.com