Initial upload: laal-embedding-v1 (Sentence-Transformers, instruction model)

Browse files

Files changed (13) hide show

.gitattributes +1 -0
1_Pooling/config.json +10 -0
README.md +184 -0
config.json +27 -0
config_sentence_transformers.json +14 -0
model.safetensors +3 -0
modules.json +20 -0
sentence_bert_config.json +4 -0
sentencepiece.bpe.model +3 -0
special_tokens_map.json +51 -0
tokenizer.json +3 -0
tokenizer_config.json +56 -0
training_summary.json +13 -0

.gitattributes CHANGED Viewed

@@ -33,3 +33,4 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
 *.zip filter=lfs diff=lfs merge=lfs -text
 *.zst filter=lfs diff=lfs merge=lfs -text
 *tfevents* filter=lfs diff=lfs merge=lfs -text

 *.zip filter=lfs diff=lfs merge=lfs -text
 *.zst filter=lfs diff=lfs merge=lfs -text
 *tfevents* filter=lfs diff=lfs merge=lfs -text
+tokenizer.json filter=lfs diff=lfs merge=lfs -text

1_Pooling/config.json ADDED Viewed

	@@ -0,0 +1,10 @@

+{
+    "word_embedding_dimension": 1024,
+    "pooling_mode_cls_token": false,
+    "pooling_mode_mean_tokens": true,
+    "pooling_mode_max_tokens": false,
+    "pooling_mode_mean_sqrt_len_tokens": false,
+    "pooling_mode_weightedmean_tokens": false,
+    "pooling_mode_lasttoken": false,
+    "include_prompt": true
+}

README.md ADDED Viewed

	@@ -0,0 +1,184 @@

+---
+language:
+- ko
+- en
+license: apache-2.0
+library_name: sentence-transformers
+tags:
+- sentence-transformers
+- text-embeddings
+- retrieval
+- mteb
+- korean
+- multilingual
+- e5
+pipeline_tag: sentence-similarity
+---
+# laal-embedding-v1
+**laal-embedding-v1** is a Sentence-Transformers embedding model fine-tuned from
+**`intfloat/multilingual-e5-large-instruct`** for improved **retrieval-oriented semantic search**, with a focus on **Korean fire-safety and legal-domain text**.
+* **Base model:** `intfloat/multilingual-e5-large-instruct`
+* **Embedding dimension:** 1024
+* **Similarity function:** cosine
+* **Max tokens:** 512
+* **Architecture:** XLM-RoBERTa (24 layers)
+* **HF repo:** [https://huggingface.co/jjp97/laal-embedding-v1](https://huggingface.co/jjp97/laal-embedding-v1)
+> ⚠️ **Important**
+> This model uses **fixed instruction prefixes** defined in `config_sentence_transformers.json`.
+> **Always pass raw text to `encode()`**.
+> Do **NOT** manually prepend instruction strings.
+---
+## Prompting (Important)
+This model applies different fixed prefixes depending on the input type.
+### Query prefix
+```
+Instruct: Given a web search query, retrieve relevant passages that answer the query.
+Query:
+```
+### Passage prefix
+```
+title: none
+text:
+```
+These prefixes are **automatically applied** by Sentence-Transformers via
+`config_sentence_transformers.json`.
+### Correct usage ✅
+```python
+from sentence_transformers import SentenceTransformer
+model = SentenceTransformer("jjp97/laal-embedding-v1")
+q_emb = model.encode("화재 시 대피 방법")
+p_emb = model.encode("화재가 발생하면 즉시 119에 신고하고 안전한 경로로 대피해야 한다.")
+```
+### Incorrect usage ❌ (double-prefixing)
+```python
+# Do NOT do this
+q = "Instruct: Given a web search query, retrieve relevant passages...\nQuery: 화재 시 대피 방법"
+emb = model.encode(q)
+```
+---
+## Training
+### Objective
+* Contrastive learning (InfoNCE)
+* In-batch negatives
+* Temperature (`tau`): **0.05**
+* Regularization: **GOR (spread-out loss)**
+  * `gor_lambda = 0.001`
+  * `gor_max_samples = 64`
+### Data
+* Training examples: **43,983**
+* Format: (query, positive passage)
+* Hard negatives: **enabled**
+  * `max_hn_per_example_train = 2`
+> Training data consists of domain-specific Korean fire-safety and legal documents
+> (private / curated dataset).
+### Hyperparameters (summary)
+* Batch size: **512**
+* Epochs: **3**
+* Learning rate: **1e-5**
+* Warmup ratio: **0.1**
+* Approx. total steps: **255**
+---
+## Model Architecture
+This model follows the standard Sentence-Transformers pipeline:
+1. **Transformer**: XLM-RoBERTa (24 layers, hidden size 1024)
+2. **Pooling**: mean pooling
+3. **Normalization**: L2 normalization
+---
+## Intended Use
+* Retrieval and semantic search (RAG pipelines)
+* Domain-specific QA (fire safety, legal text)
+* Embedding-based similarity and clustering
+  (best performance in retrieval-style settings)
+---
+## Evaluation
+### Sanity check
+Query–passage cosine similarity shows reasonable separation between relevant and irrelevant passages.
+### MTEB
+This model is intended for evaluation on the **MTEB leaderboard**.
+When reporting results, please specify:
+* model name: `jjp97/laal-embedding-v1`
+* exact revision (commit hash)
+* benchmark suite used
+---
+## Limitations
+* Performance may degrade if instruction prefixes are manually added (double-prefixing).
+* Fine-tuned primarily for retrieval; performance on classification/STS tasks may vary.
+* Domain bias toward Korean fire-safety / legal text.
+---
+## License
+* Released under **Apache-2.0**, following the base model license.
+---
+## Acknowledgements
+* Base model: **Multilingual E5**
+  Liang Wang et al., *Multilingual E5 Text Embeddings*, arXiv:2402.05672
+* Sentence-Transformers library
+---
+## Citation
+If you use this model, please cite:
+```bibtex
+@misc{laal_embedding_v1_2025,
+  title = {laal-embedding-v1},
+  author = {Park, Jeongjae},
+  year = {2025},
+  howpublished = {Hugging Face model card},
+}
+```

config.json ADDED Viewed

	@@ -0,0 +1,27 @@

+{
+  "architectures": [
+    "XLMRobertaModel"
+  ],
+  "attention_probs_dropout_prob": 0.1,
+  "bos_token_id": 0,
+  "classifier_dropout": null,
+  "dtype": "float32",
+  "eos_token_id": 2,
+  "hidden_act": "gelu",
+  "hidden_dropout_prob": 0.1,
+  "hidden_size": 1024,
+  "initializer_range": 0.02,
+  "intermediate_size": 4096,
+  "layer_norm_eps": 1e-05,
+  "max_position_embeddings": 514,
+  "model_type": "xlm-roberta",
+  "num_attention_heads": 16,
+  "num_hidden_layers": 24,
+  "output_past": true,
+  "pad_token_id": 1,
+  "position_embedding_type": "absolute",
+  "transformers_version": "4.56.1",
+  "type_vocab_size": 1,
+  "use_cache": false,
+  "vocab_size": 250002
+}

config_sentence_transformers.json ADDED Viewed

	@@ -0,0 +1,14 @@

+{
+  "__version__": {
+    "sentence_transformers": "5.1.0",
+    "transformers": "4.56.1",
+    "pytorch": "2.8.0+cu128"
+  },
+  "model_type": "SentenceTransformer",
+  "prompts": {
+    "query": "Instruct: Given a web search query, retrieve relevant passages that answer the query.\nQuery: ",
+    "passage": "title: none\ntext: "
+  },
+  "default_prompt_name": null,
+  "similarity_fn_name": "cosine"
+}

model.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:5438aef6c99a7765c6126ced5a2902a95525b12bb2bf5ed2ee1008f515ea9476
+size 2239607176

modules.json ADDED Viewed

	@@ -0,0 +1,20 @@

+[
+  {
+    "idx": 0,
+    "name": "0",
+    "path": "",
+    "type": "sentence_transformers.models.Transformer"
+  },
+  {
+    "idx": 1,
+    "name": "1",
+    "path": "1_Pooling",
+    "type": "sentence_transformers.models.Pooling"
+  },
+  {
+    "idx": 2,
+    "name": "2",
+    "path": "2_Normalize",
+    "type": "sentence_transformers.models.Normalize"
+  }
+]

sentence_bert_config.json ADDED Viewed

	@@ -0,0 +1,4 @@

+{
+    "max_seq_length": 512,
+    "do_lower_case": false
+}

sentencepiece.bpe.model ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:cfc8146abe2a0488e9e2a0c56de7952f7c11ab059eca145a0a727afce0db2865
+size 5069051

special_tokens_map.json ADDED Viewed

	@@ -0,0 +1,51 @@

+{
+  "bos_token": {
+    "content": "<s>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  },
+  "cls_token": {
+    "content": "<s>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  },
+  "eos_token": {
+    "content": "</s>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  },
+  "mask_token": {
+    "content": "<mask>",
+    "lstrip": true,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  },
+  "pad_token": {
+    "content": "<pad>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  },
+  "sep_token": {
+    "content": "</s>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  },
+  "unk_token": {
+    "content": "<unk>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  }
+}

tokenizer.json ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:883b037111086fd4dfebbbc9b7cee11e1517b5e0c0514879478661440f137085
+size 17082987

tokenizer_config.json ADDED Viewed

	@@ -0,0 +1,56 @@

+{
+  "added_tokens_decoder": {
+    "0": {
+      "content": "<s>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "1": {
+      "content": "<pad>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "2": {
+      "content": "</s>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "3": {
+      "content": "<unk>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "250001": {
+      "content": "<mask>",
+      "lstrip": true,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    }
+  },
+  "additional_special_tokens": [],
+  "bos_token": "<s>",
+  "clean_up_tokenization_spaces": true,
+  "cls_token": "<s>",
+  "eos_token": "</s>",
+  "extra_special_tokens": {},
+  "mask_token": "<mask>",
+  "model_max_length": 512,
+  "pad_token": "<pad>",
+  "sep_token": "</s>",
+  "tokenizer_class": "XLMRobertaTokenizer",
+  "unk_token": "<unk>"
+}

training_summary.json ADDED Viewed

	@@ -0,0 +1,13 @@

+{
+  "model": "intfloat/multilingual-e5-large-instruct",
+  "train_examples": 43983,
+  "batch_size": 512,
+  "epochs": 3,
+  "learning_rate": 1e-05,
+  "total_steps_approx": 255,
+  "warmup_ratio": 0.1,
+  "tau": 0.05,
+  "gor_lambda": 0.001,
+  "gor_max_samples": 64,
+  "max_hn_per_example_train": 2
+}