Ruri: Japanese General Text Embeddings
Paper • 2409.07737 • Published • 8
cl-nagoya/ruri-v3-130m(日本語汎用テキスト埋め込みモデル)を、iOS/macOS (Core ML) で直接動かせるように変換したものです。
input_ids / attention_mask を該当の長さまでパディング/切り詰めしてください。| ファイル | 系列長 | 精度 | サイズ目安 |
|---|---|---|---|
ruri-v3-130m_seq128_fp16.mlpackage |
128 | fp16 | 265MB |
ruri-v3-130m_seq256_fp16.mlpackage |
256 | fp16 | 265MB |
ruri-v3-130m_seq512_fp16.mlpackage |
512 | fp16 | 265MB |
ruri-v3-130m_seq128_int8.mlpackage |
128 | int8(重みのみ量子化) | 133MB |
ruri-v3-130m_seq256_int8.mlpackage |
256 | int8(重みのみ量子化) | 133MB |
ruri-v3-130m_seq512_int8.mlpackage |
512 | int8(重みのみ量子化) | 133MB |
短いクエリやチャンクで検索するなら seq128、長めの文書チャンクなら seq256/512 を選んでください。モバイルアプリには int8版 を推奨します。
computeUnits = .all)で動作。定常状態の推論は1文あたり約5ms(Apple標準の NLContextualEmbedding は約9〜10ms)。fp16版とint8版の類似度スコア差は最大0.0042で、検索結果の順位はほぼ同一。詳しい検証結果は REPORT.md を参照してください。
ruri-v3 は "1+3 prefix scheme" を採用しているため、埋め込み対象のテキストに応じて以下のプレフィックスを付けてからトークナイズしてください(元モデルと同じ挙動にするため必須です)。
トピック: : 分類・クラスタリング用検索クエリ: : 検索クエリ側検索文書: : 検索対象の文書側ダウンロードしたモデルをXcodeプロジェクトに追加する手順・完全な実装例は MANUAL.md を参照してください。
import CoreML
let configuration = MLModelConfiguration()
configuration.computeUnits = .all
let model = try MLModel(
contentsOf: Bundle.main.url(forResource: "ruri-v3-130m_seq128_int8", withExtension: "mlmodelc")!,
configuration: configuration
)
// トークナイザは別途用意する必要があります。huggingface/swift-transformers の
// Tokenizers、もしくは tokenizer.json を読み込める同等の実装を推奨します。
let inputIDs: MLMultiArray = ... // shape [1, 128], Int32
let attentionMask: MLMultiArray = ... // shape [1, 128], Int32
let input = try MLDictionaryFeatureProvider(dictionary: [
"input_ids": MLFeatureValue(multiArray: inputIDs),
"attention_mask": MLFeatureValue(multiArray: attentionMask),
])
let output = try model.prediction(from: input)
let embedding = output.featureValue(for: "sentence_embedding")!.multiArrayValue!
// [1, 512] の L2 正規化済みベクトル(dtype は float16。Swift の Float16 として読み取る)
トークナイザは元モデルの tokenizer.json(ModernBERT-Ja / PLaMo系トークナイザ)をそのまま使う必要があります。
import coremltools as ct
import numpy as np
from transformers import AutoTokenizer
tokenizer = AutoTokenizer.from_pretrained("cl-nagoya/ruri-v3-130m")
model = ct.models.MLModel("ruri-v3-130m_seq128_int8.mlpackage")
text = "検索文書: 瑠璃色(るりいろ)は、紫みを帯びた濃い青のことである。"
encoded = tokenizer([text], return_tensors="np", padding="max_length", truncation=True, max_length=128)
output = model.predict({
"input_ids": encoded["input_ids"].astype(np.int32),
"attention_mask": encoded["attention_mask"].astype(np.int32),
})
print(output["sentence_embedding"].shape) # (1, 512)
このリポジトリのモデルは ruri_coreml_convert 変換ツールで生成されています。手順の概要:
transformers の AutoModel で ModernBERT ベースの ruri-v3 をロードnn.Module でラップtorch.jit.trace でトレース(transformers.masking_utils.and_masks/or_masks が Tensor.new_ones/new_zeros を使っており Core ML コンバータが未対応のため、torch.ones/torch.zeros ベースの実装に差し替えてからトレース)coremltools.convert(..., convert_to="mlprogram") で .mlpackage を生成coremltools.optimize.coreml.linear_quantize_weights で int8 版も生成ベースモデル cl-nagoya/ruri-v3-130m と同じ Apache License 2.0 です。オリジナルモデルの著作権は名古屋大学 conversational AI research group (cl-nagoya) に帰属します。本リポジトリは重みフォーマットの変換のみを行ったものです。
@misc{ruri2024,
title={{Ruri}: {J}apanese {G}eneral {T}ext {E}mbeddings},
author={Hayato Tsukagoshi and Ryohei Sasano},
year={2024},
eprint={2409.07737},
archivePrefix={arXiv},
primaryClass={cs.CL},
}
Base model
sbintuitions/modernbert-ja-130m