Feature Extraction
Transformers
Safetensors
sentence-transformers
bert
contrastive
binary-code-search
sbom
bsca
text-embeddings-inference
Instructions to use Labradorlabs/bsca-bge-micro-v2-contrastive-v14-fresh-clean-v3-eb256-t005-e1-384 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use Labradorlabs/bsca-bge-micro-v2-contrastive-v14-fresh-clean-v3-eb256-t005-e1-384 with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("feature-extraction", model="Labradorlabs/bsca-bge-micro-v2-contrastive-v14-fresh-clean-v3-eb256-t005-e1-384")# Load model directly from transformers import AutoTokenizer, AutoModel tokenizer = AutoTokenizer.from_pretrained("Labradorlabs/bsca-bge-micro-v2-contrastive-v14-fresh-clean-v3-eb256-t005-e1-384") model = AutoModel.from_pretrained("Labradorlabs/bsca-bge-micro-v2-contrastive-v14-fresh-clean-v3-eb256-t005-e1-384", device_map="auto") - sentence-transformers
How to use Labradorlabs/bsca-bge-micro-v2-contrastive-v14-fresh-clean-v3-eb256-t005-e1-384 with sentence-transformers:
from sentence_transformers import SentenceTransformer model = SentenceTransformer("Labradorlabs/bsca-bge-micro-v2-contrastive-v14-fresh-clean-v3-eb256-t005-e1-384") sentences = [ "The weather is lovely today.", "It's so sunny outside!", "He drove to the stadium." ] embeddings = model.encode(sentences) similarities = model.similarity(embeddings, embeddings) print(similarities.shape) # [3, 3] - Notebooks
- Google Colab
- Kaggle
bsca-bge-micro-v2-contrastive-v14-fresh-clean-v3-eb256-t005-e1-384
BSCA ๋ฐ์ด๋๋ฆฌโ์์ค ํจ์ ์ ๋ ฌ์ฉ contrastive ์๋ฒ ๋ฉ ๋ชจ๋ธ. TaylorAI/bge-micro-v2๋ฅผ
๋์ปดํ์ผ ํจ์์ ์์ค ํจ์๋ฅผ ๊ฐ์ ๊ณต๊ฐ์ ์ ๋ ฌํ๋๋ก contrastive ํ์ธํ๋ํ v14
์ฑํผ์ธ(epoch-1) ์ฒดํฌํฌ์ธํธ์
๋๋ค.
- Base:
TaylorAI/bge-micro-v2 - Dataset:
Labradorlabs/bsca-binary-source-aligned-v3-clean-v3(fingerprint220d988ac0980dca) - Embedding dim: 384 (max_length 384)
- ES vector field:
bge_v14_fresh_e1_384_vector
Full-index ์ฑ๋ฅ (15M source-function, 120 queries, query_set_id 943346736accac8b)
| metric | value |
|---|---|
| source-function MRR | 0.16672 |
| Recall@1 / @10 / @100 / @1000 | 0.133 / 0.250 / 0.342 / 0.392 |
| component MRR | 0.17792 |
| component Recall@1 / @10 / @100 | 0.142 / 0.258 / 0.375 |
epoch-1 โ ์ฑํผ์ธ ์น๊ฒฉ ์ source-function MRR +47.7% (relative).
Training
- contrastive batch 256 (physical 256, grad-accum 1), lr 2e-5, warmup 0.05
- temperature 0.05, bf16, preprocess
v5:both:light - in-batch hardest-negative margin 0.2 (weight 0.3), explicit safe-HN ๋ฏธ์ฌ์ฉ
- planned 2 epochs, epoch-1 ์น๊ฒฉ (epoch-2๋ fixed-pool ํดํ์ผ๋ก ๊ธฐ๊ฐ)
training_state.pt(์ตํฐ๋ง์ด์ ยท์ค์ผ์ค๋ฌยทRNG ์ํ)๊ฐ ํฌํจ๋์ด epoch-2 strict resume๊ฐ ๊ฐ๋ฅํฉ๋๋ค.
Usage
import torch, torch.nn.functional as F
from transformers import AutoModel, AutoTokenizer
name = "Labradorlabs/bsca-bge-micro-v2-contrastive-v14-fresh-clean-v3-eb256-t005-e1-384"
tok = AutoTokenizer.from_pretrained(name)
model = AutoModel.from_pretrained(name).eval()
def embed(texts):
enc = tok(texts, padding=True, truncation=True, max_length=384, return_tensors="pt")
with torch.no_grad():
out = model(**enc)
emb = out.last_hidden_state[:, 0] # CLS
return F.normalize(emb, p=2, dim=1)
- Downloads last month
- 99
Model tree for Labradorlabs/bsca-bge-micro-v2-contrastive-v14-fresh-clean-v3-eb256-t005-e1-384
Base model
TaylorAI/bge-micro-v2