ACODE

プロジェクトの概要

本研究プロジェクトでは、次の研究課題に取り組みます:「モバイルアプリの説明文が、プライバシーに関わるリソースの利用に言及しない主な理由は何か?」

この研究課題に答えるため、静的コード解析とテキスト解析を組み合わせたフレームワーク ACODE(Analyzing COde and DEscription)を開発しました。数十万件の異なる説明文を扱えるよう、軽量な手法を開発しています。なお、本テキスト解析手法は人手でラベル付けされた説明文を必要としないため、コストの高いラベル付け作業を行わずに大規模な計測研究を実施できます。

公式およびサードパーティのAndroidマーケットから収集した20万件のアプリと多言語の説明文を分析した結果、説明文とプライバシーに関わるリソースの利用との不整合に関連する、次の4つの主な要因が明らかになりました:

  1. APIパーミッションやコードを不必要に追加しがちなアプリ作成サービス/フレームワークの存在
  2. パーミッションやコードを不必要に組み込んだアプリを多数公開する多作な開発者の存在
  3. 説明文で言及されにくい副次的な機能の存在
  4. プライバシーに関わるリソースにアクセスするサードパーティ製ライブラリの存在

これらの知見は、モバイルソフトウェアの配布プラットフォームにおけるユーザのプライバシー意識の向上に役立つと考えています。

データセット

ACODEデータセットを研究コミュニティに公開しています。データセットは20万件のAndroidアプリの説明文から構成されます。説明文は英語と中国語で書かれており、それぞれ公式のGoogle Playとサードパーティのマーケットから収集したものです。また、人手でラベル付けした説明文も含まれます。ラベルは、その説明文が特定のパーミッションの利用に言及しているかどうかを示します。このラベル付きデータは、キーワードベースのテキスト分類器の性能検証に用いました。生の説明文に加えて、説明文の分類に利用できる抽出済みキーワードも公開しています。これらのキーワードを用いれば、他の研究者も私たちの結果を容易に再現できるはずです。データの一覧は次のとおりです:

    • Androidアプリの説明文
      • 英語の説明文 100,000件(JSON形式)
      • 中国語の説明文 100,000件(JSON形式)
    • ラベル付きのAndroidアプリ説明文
      • 英語のラベル付き説明文 3,000件(1,000件 × 3パーミッション、JSON形式)
      • 中国語のラベル付き説明文 3,000件(1,000件 × 3パーミッション、JSON形式)
    • 説明文の分類に利用できる抽出済みキーワード
      • 英語:11種類のパーミッションそれぞれについて上位10語
      • 中国語:11種類のパーミッションそれぞれについて上位10語
    • 抽出したドメイン固有のストップワード
      • 英語のストップワード 100語
      • 中国語のストップワード 100語

ACODEデータセットの利用を希望される方は、大学または企業のメールアカウントからメールでご連絡ください。

メール: acode@nsl.cs.waseda.ac.jp

メールには、氏名、所属、データセットの利用目的を記載してください。これらの情報は確認のために使用します。学生の方は、指導教員の氏名と所属もお知らせください。
データセットを利用した論文や記事では、以下のSOUPS 2015の論文を引用してください。

発表文献

  • T. Watanabe, M. Akiyama, T. Sakai, H. Washizaki, and T. Mori, “Understanding the Inconsistency between Behaviors and Descriptions of Mobile Apps,” IEICE Transactions on Information and Systems, Vol. Vol.E101-D, No. 11, pp. 2584–2599, November 2018. [PDF]

謝辞

本研究の一部は、JSPS科研費 基盤研究(B)(課題番号 JP16H02832)の助成を受けたものです。