我請求您的善意幫助和幫助,以解決「Java命令失敗」的錯誤,當我嘗試標記大小爲2 MB的阿拉伯語語料庫時,該錯誤會持續發生。我已經搜索了網站和stanford POS tagger郵件列表。但是,我沒有找到解決方案。我閱讀了一些關於類似問題的帖子,並建議使用內存。我不確定這一點。我仍然擁有19GB的可用內存。我嘗試了所有可能的解決方案,但同樣的錯誤不斷顯示。Java命令在NLTK Stanford POS Tagger中失敗
我有Python的平均命令和Linux上的良好命令。我爲阿拉伯語使用LinuxMint17 KDE 64位,Python3.4,NLTK alpha和Stanford POS tagger模型。這是我的代碼:
import nltk
from nltk.tag.stanford import POSTagger
arabic_postagger = POSTagger("/home/mohammed/postagger/models/arabic.tagger", "/home/mohammed/postagger/stanford-postagger.jar", encoding='utf-8')
print("Executing tag_corpus.py...\n")
# Import corpus file
print("Importing data...\n")
file = open("test.txt", 'r', encoding='utf-8').read()
text = file.strip()
print("Tagging the corpus. Please wait...\n")
tagged_corpus = arabic_postagger.tag(nltk.word_tokenize(text))
如果語句大小小於1MB(= 100,000個單詞),則不會有錯誤。但是當我嘗試要標記2MB語料庫,那麼下面的錯誤信息顯示:
Traceback (most recent call last):
File "/home/mohammed/experiments/current/tag_corpus2.py", line 17, in <module>
tagged_lst = arabic_postagger.tag(nltk.word_tokenize(text))
File "/usr/local/lib/python3.4/dist-packages/nltk-3.0a3-py3.4.egg/nltk/tag/stanford.py", line 59, in tag
return self.batch_tag([tokens])[0]
File "/usr/local/lib/python3.4/dist-packages/nltk-3.0a3-py3.4.egg/nltk/tag/stanford.py", line 81, in batch_tag
stdout=PIPE, stderr=PIPE)
File "/usr/local/lib/python3.4/dist-packages/nltk-3.0a3-py3.4.egg/nltk/internals.py", line 171, in java
raise OSError('Java command failed!')
OSError: Java command failed!
我打算標籤300萬個字我的博士使用研究項目。如果我一次標記10萬字,我將不得不重複3000次。它會殺了我!
我真的很感謝你的幫助。
順便說一句,你過於貪婪地爲300多萬句子做標記和POS標記。我會分批完成它。嘗試每次通話100萬次,然後只運行300次。 – alvas 2014-11-25 01:09:01
@alvas感謝您的評論。事實上,我會做你的建議。但是我忘了在問題中清楚地說明。 – Mohammed 2014-11-25 01:17:04