Top > Search of Japanese Patents > E-MAIL SYSTEM WITH UNWANTED E-MAIL FILTERING FUNCTION

E-MAIL SYSTEM WITH UNWANTED E-MAIL FILTERING FUNCTION meetings

Patent code P08P005631
File No. IP367
Posted date Jun 13, 2008
Application number P2006-320004
Publication number P2008-135926A
Patent number P4686724
Date of filing Nov 28, 2006
Date of publication of application Jun 12, 2008
Date of registration Feb 25, 2011
Inventor
  • (In Japanese)杉井 学
  • (In Japanese)松野 浩嗣
Applicant
  • (In Japanese)国立大学法人山口大学
Title E-MAIL SYSTEM WITH UNWANTED E-MAIL FILTERING FUNCTION meetings
Abstract PROBLEM TO BE SOLVED: To accurately and efficiently filter unwanted e-mail by using learning decision tree algorithm.
SOLUTION: An e-mail system 1 includes an e-mail reception part 2, an unwanted e-mail determination part 3, an unwanted e-mail filter part 4, and an e-mail transmission part 5. The unwanted e-mail determination part includes: a word coding part for converting all words in e-mail to codes corresponding to frequencies in appearance by a word appearance frequency database preliminarily generated by a decision tree learning part 6; and a determination part for determining whether the e-mail is unwanted e-mail or not by applying a decision tree preliminarily generated by the decision tree learning part to e-mail coded data resulting from coding in the word coding part. The decision tree learning part generates the word appearance frequency database and a decision tree most suitable for the sorting of unwanted e-mail and normal e-mail, and the unwanted e-mail determination part and the decision tree learning part process a header and a text in the e-mail by one algorithm without dividing them.
Outline of related art and contending technology (In Japanese)


インターネット上を流れる迷惑メールの割合は、全電子メール中の60%を越えると言われており、現在では、迷惑メール対策として、さまざまな自動分類方法が用いられている。開発初期のもっとも単純な方法に、メールヘッダに記述される特定の迷惑メール送信サーバやメールのFrom行記載のメールアドレスを、管理者やユーザがひとつひとつ登録し、合致するメールを排除する方法がある。しかし迷惑メール送信者は、このような対策をかいくぐる新しい方法で次々に迷惑メールを送信してくるため、手作業で分類やアドレスの登録などを行うには作業コストが大きすぎ、現実的ではなくなってきている。また、これまでの方法では、通常の電子メールを迷惑メールと間違えて判断するケースおよびその逆のケースも増えている。近年、メール本文などの単語の出現頻度による特徴を分類に役立てるベイズ理論を応用した方法が注目されているが、未だ利用者および管理者の作業コストは大きく、分類精度もそれほど高くない。



従来技術として、特許文献1乃至3が挙げられる。
特許文献1には、文字列の一部をわざと間違えたり文字間に無意味な記号を挿入した電子メールであっても、迷惑メール等の電子メールを効果的に分類できる電子メール処理装置が記載されている。電子メールに含まれる単語について単語情報データベース内の迷惑メール対象文字列と相同性検索をすることによって迷惑メールの判定を行っている。
特許文献2には、電子メールのヘッダ情報に含まれるメール中継装置によって、該当電子メールが迷惑メールか否かをベイズ確率モデルを用いて判定する電子メールフィルタリングシステムが記載されている。
特許文献3には、ユーザが通常メールと迷惑メールとを分類し、その分類された内容を分析してフィルタルールを追加する電子メールフィルタリングシステムが記載されている。
特許文献1乃至3のいずれにも、迷惑メールの判定に学習型の決定木アルゴリズムを用いることついて記載されていない。
【特許文献1】
特開2006-293573号公報
【特許文献2】
特開2006-260515号公報
【特許文献3】
特開2006-245813号公報

Field of industrial application (In Japanese)


本発明は、学習型の決定木アルゴリズムを用いた、迷惑メールのフィルタ機能を有する電子メールシステム及びプログラムに関する。

Scope of claims (In Japanese)
【請求項1】
 
外部からの電子メールを受信する電子メール受信部と、
前記電子メール受信部によって受信された電子メールが迷惑メールか否かを判定する迷惑メール判定部と、
前記迷惑メール判定部の判定結果に応じて前記電子メールをフィルタリングする迷惑メールフィルタ部と、
前記迷惑メールフィルタ部によってフィルタリングされた前記電子メールをローカルメールボックス又は外部に送信する電子メール送信部と、
を有する電子メールシステムであって、
前記迷惑メール判定部は、
決定木学習部によって予め生成された単語出現頻度データベースにより、前記電子メール中の全ての単語を出現頻度に応じた符号に変換する単語符号化部と、
前記単語符号化部により符号化された電子メール符号化データに、決定木学習部によって予め生成された決定木を適用することにより迷惑メールか否かを判定する判定部と、
を有し、
前記決定木学習部は、
前記迷惑メール判定部と同一サーバ内又は異なるサーバ内にあり、
迷惑メールを保存した迷惑メールデータベースと、通常メールを保存した通常メールデータベースと、
前記迷惑メールデータベース及び前記通常メールデータベース内の電子メール中の単語の出願頻度を求めて前記単語出現頻度データベースを生成する単語出現頻度データベース生成部と、
前記単語出現頻度データベースにより、前記迷惑メールデータベース及び前記通常メールデータベース内の電子メール中の全ての単語を出現頻度に応じた符号に変換する単語符号化部と、
前記単語符号化部により符号化された電子メール符号化データのパターンに基づいて、迷惑メールと通常メールとを振り分ける最適な決定木を生成する学習部と、
を有し、
前記迷惑メール判定部及び前記決定木学習部における電子メールはヘッダ部分及び本文の両方を含むものであり、前記迷惑メール判定部及び前記決定木学習部は、前記電子メールにおけるヘッダ部分及び本文を分けずに同一アルゴリズムにより処理する
ことを特徴とする電子メールシステム。

【請求項2】
 
前記単語出現頻度データベース生成部は、単語の出現頻度とともに、前記単語が迷惑メールと通常メールのどちらに多く含まれるかを示す出現偏りも求めて前記単語出現頻度データベースを生成し、
前記単語符号化部は、前記電子メール中の全ての単語を前記出現頻度及び前記出現偏りに応じた符号に変換する
ことを特徴とする請求項1記載の電子メールシステム。

【請求項3】
 
前記学習部は、前記電子メール符号化データ内の符号を、最適な決定木を求められるグループに分け、前記グループ分けの結果により前記符号をさらに第2の符号に変換する機能を有することを特徴とする請求項1又は2記載の電子メールシステム。

【請求項4】
 
前記学習部に、BONSAIプログラムを用いることを特徴とする請求項3記載の電子メールシステム。

【請求項5】
 
外部からの電子メールを受信する電子メール受信部と、
前記電子メール受信部によって受信された電子メールが迷惑メールか否かを判定する迷惑メール判定部と、
前記迷惑メール判定部の判定結果に応じて前記電子メールをフィルタリングする迷惑メールフィルタ部と、
前記迷惑メールフィルタ部によってフィルタリングされた前記電子メールをローカルメールボックス又は外部に送信する電子メール送信部と、
を有する電子メールプログラムであって、
前記迷惑メール判定部は、
決定木学習部によって予め生成された単語出現頻度データベースにより、前記電子メール中の全ての単語を出現頻度に応じた符号に変換する単語符号化部と、
前記単語符号化部により符号化された電子メール符号化データに、決定木学習部によって予め生成された決定木を適用することにより迷惑メールか否かを判定する判定部と、
を有し、
前記決定木学習部は、
前記迷惑メール判定部と同一サーバ内又は異なるサーバ内にあり、
迷惑メールを保存した迷惑メールデータベースと、通常メールを保存した通常メールデータベースと、
前記迷惑メールデータベース及び前記通常メールデータベース内の電子メール中の単語の出願頻度を求めて前記単語出現頻度データベースを生成する単語出現頻度データベース生成部と、
前記単語出現頻度データベースにより、前記迷惑メールデータベース及び前記通常メールデータベース内の電子メール中の全ての単語を出現頻度に応じた符号に変換する単語符号化部と、
前記単語符号化部により符号化された電子メール符号化データのパターンに基づいて、迷惑メールと通常メールとを振り分ける最適な決定木を生成する学習部と、
を有し、
前記迷惑メール判定部及び前記決定木学習部における電子メールはヘッダ部分及び本文の両方を含むものであり、前記迷惑メール判定部及び前記決定木学習部は、前記電子メールにおけるヘッダ部分及び本文を分けずに同一アルゴリズムにより処理する
ことを特徴とする電子メールプログラム。

【請求項6】
 
前記単語出現頻度データベース生成部は、単語の出現頻度とともに、前記単語が迷惑メールと通常メールのどちらに多く含まれるかを示す出現偏りも求めて前記単語出現頻度データベースを生成し、
前記単語符号化部は、前記電子メール中の全ての単語を前記出現頻度及び前記出現偏りに応じた符号に変換する
ことを特徴とする請求項5記載の電子メールプログラム。

【請求項7】
 
前記学習部は、前記電子メール符号化データ内の符号を、最適な決定木を求められるグループに分け、前記グループ分けの結果により前記符号をさらに第2の符号に変換する機能を有することを特徴とする請求項5又は6記載の電子メールプログラム。

【請求項8】
 
前記学習部に、BONSAIプログラムを用いることを特徴とする請求項7記載の電子メールプログラム。
IPC(International Patent Classification)
F-term
Drawing

※Click image to enlarge.

JP2006320004thum.jpg
State of application right Registered
Please contact us by E-mail or facsimile if you have any interests on this patent.


PAGE TOP

close
close
close
close
close
close
close