handsker-retrieval-300d


This is a GloVe model pretrained on the entirety of Danish Dynaword for 10 epochs converted into a sentence-transformers model with mean pooling, then finetuned on Synthetic Nordic Retrieval data. The model was trained using the GlovPy Python library. The model uses a Bert-style tokenizer that was also trained on Dynaword.

Model Details

Model Description

  • Model Type: Sentence Transformer
  • Base model: kardosdrur/handsker-pretrained-300d
  • Maximum Sequence Length: inf tokens
  • Output Dimensionality: 300 dimensions
  • Similarity Function: Cosine Similarity
  • Supported Modality: Text
  • Training Dataset:
    • retrieval

Model Sources

Full Model Architecture

SentenceTransformer(
  (0): StaticEmbedding({})
)

Usage

Direct Usage (Sentence Transformers)

First install the Sentence Transformers library:

pip install -U sentence-transformers

Then you can load this model and run inference.

from sentence_transformers import SentenceTransformer

# Download from the 🤗 Hub
model = SentenceTransformer("kardosdrur/handsker-retrieval-300d")
# Run inference
sentences = [
    'hvorfor åbner min fil ikke',
    'Hej alle, jeg har et problem med et dokument, som jeg ikke kan åbne. Det er en .docx fil, og jeg bruger Microsoft Word til at åbne det. Når jeg dobbeltklikker på filen, sker der intet. Jeg har prøvet at genstarte computeren, men det hjalp ikke. Har I nogen idé om, hvad der kan være galt?',
    'Jeg har lige købt en ny computer, og jeg er virkelig glad for den. Den er hurtig og har et flot design. Skærmen er stor og klar, og tastaturet er behageligt at skrive på. Jeg er meget tilfreds med mit køb.',
]
embeddings = model.encode(sentences)
print(embeddings.shape)
# [3, 300]

# Get the similarity scores for the embeddings
similarities = model.similarity(embeddings, embeddings)
print(similarities)
# tensor([[ 1.0000,  0.5796, -0.1226],
#         [ 0.5796,  1.0000,  0.1226],
#         [-0.1226,  0.1226,  1.0000]])

Training Details

Training Dataset

retrieval

  • Dataset: retrieval
  • Size: 94,067 training samples
  • Columns: anchor, positive, negative, and instruction
  • Approximate statistics based on the first 100 samples:
    anchor positive negative instruction
    type string string string string
    modality text text text text
    details
    • min: 9 characters
    • mean: 92.28 characters
    • max: 232 characters
    • min: 236 characters
    • mean: 927.02 characters
    • max: 1864 characters
    • min: 186 characters
    • mean: 547.52 characters
    • max: 1113 characters
    • min: 53 characters
    • mean: 73.99 characters
    • max: 115 characters
  • Samples:
    anchor positive negative instruction
    Find mig en opskrift på en vegetarisk lasagne med spinat, ricottaost og en cremet tomatsauce, som jeg kan lave til min families fødselsdag. For at lave en lækker vegetarisk lasagne til 6 personer, skal du starte med at forberede tomatsaucen. Steg hakket løg og hvidløg i olivenolie, til de er klare. Tilsæt hakkede dåsetomater, tomatpuré, friske eller tørrede krydderurter (basilikum, oregano, timian) og et nip sukker. Lad saucen simre i 30 minutter, og smag til med salt og peber. Opvarm en skefuld ricottaost sammen med et par spiseskefulde flødeost og et æg for at skabe en cremet fyldning. Bland ricottafylden med hakkede friske blade af spinat og et drys revet parmesanost. Hæld et lag tomatsauce i en ildfast form, top med lasagneplader, ricottafyldning, og gentag lagdeling indtil alle ingredienser er brugt. Drys med revet mozzarellaost og bage i en forvarmet ovn ved 180 grader i omkring 30-40 minutter, eller indtil lasagnen er gylden og boblende. Lasagne er en populær italiensk ret, der typisk består af lag af pasta, kødsovs og ost. Der findes mange variationer af lasagne, herunder vegetariske versioner, som ofte erstatter kød med grøntsager eller oste. Lasagne kan tilberedes i ovnen og serveres varm. Retrieve recipes containing a specific ingredient from a collection of cookbooks.
    Hvordan påvirker kronisk søvnunderskud hos ældre voksne med let kognitiv svekkelse specifikke aspekter af hukommelse, såsom episodisk hukommelse og procedurglædelig hukommelse? Tidligere undersøgelser har vist, at kronisk søvnunderskud kan have en negativ indflydelse på kognitive funktioner hos ældre voksne, herunder hukommelse. En nylig undersøgelse, der blev offentliggjort i tidsskriftet "Neurology", inddrog 1.500 deltagere over 65 år, og fandt et signifikant sammenhæng mellem kronisk søvnunderskud og svækkelse af episodisk hukommelse, som er evnen til at huske specifikke begivenheder og oplevelser. Forskerne fandt også en sammenhæng mellem søvnunderskud og svækkelse af procesuel hukommelse, som er evnen til at huske hvordan man udfører opgaver og færdigheder. Den neurobiologiske baggrund for disse effekter kan være relateret til søvnens rolle i konsolidering af minder, da søvn er vigtig for at overføre information fra korttids- til langtidshukommelse. Undersøgelsen antyder, at interventioner, der forbedrer søvnkvalitet hos ældre voksne, potentielt kan hjælpe med at forebygge eller bremse kognitiv svækkelse. Søvnmangel er et fremtrædende problem i moderne samfundet og kan have betydelige konsekvenser for helbred og velvære. En undersøgelse fra 2022 viste, at næsten 40% af voksne danskere rapporterede om at føle sig trætte eller udmattede i løbet af dagen, hvilket kan tyde på søvnunderskud. Kronisk søvnunderskud er forbundet med en forøget risiko for en række sundhedsproblemer, herunder hjertekarsygdomme, diabetes og depression. Det er vigtigt at opretholde en sund søvnhygiejne for at sikre tilstrækkelig hvile og restitution. Nogle tips til at forbedre søvnkvaliteten kan omfatte at etablere regelmæssige søvn- og vågnetider, skabe et afslappende sovemiljø og undgå koffein og alkohol inden sengetid. Find scientific papers exploring the relationship between sleep patterns and cognitive function.
    Find mig et digt af én dansk forfatter fra 1800-tallet om temaet kærlighed og tab Den kølige aftenluft nipped ved hans kind, da han stod ved gravstedet. sociétés hustru, Anna, lå dernede i den kolde jord, og hans hjerte var tungt som bly. Han genkendte hendes gravsted straks, selvom det var over et år siden, hun forlod denne verden. Han huskede tydeligt den dag, hvor han første gang så hende, en sommerdag i Tivoli. Hun var omgivet af blomster, hendes røde kjole virkede som en flamme i den solskin. Han var straks betaget. De havde hygget sig i Tivoli i mange timer, ihre første kys havde smag af slik og karruselmusik. Han havde elsket Anna med en ild, der brændte stærkt, men også ødelagde alt andet i hans vej. Hun havde været hans hele verden, hans inspiration, hans grund til at leve. Nu var hun væk, og han var tabt og alene. Han tog et dybt suk og læste indskriften på gravstenen: "Anna, elskede hustru og mor. For evigt i vore hjerter." Tårerne trillede ned ad hans kinder, men han var ikke ked af det. Det var grusomt hårdt, men han ville ære hendes hukommelse ved at f... Ved udgangen af 1800-tallet udviklede dansk litteratur sig i mange nye retninger. Romantikken var på retur, og realismen var ved at vinde frem. Forfattere som Henrik Pontoppidan og Herman Bang skrev værker, der beskrev den danske samfunds virkelighed med stor detalje. Disse fortællinger var ofte dystre og pessimistiske, men også realiztiske og tankevækkende. En anden vigtig retning i dansk litteratur på denne tid var naturalismen. Forfattere som J.P. Jacobsen og Karl Adolph Gjellerup skrev værker, der fokuserede på den menneskelige psykologi og samfundets indflydelse på individet. De brugte ofte symboler og allegorier for at udtrykke komplekse idéer. Disse forfattere og mange flere banede vejen for den moderne danske litteratur, som vi kender den i dag. "Find literary works by a specific author or in a specific genre.",
  • Loss: MultipleNegativesRankingLoss with these parameters:
    {
        "scale": 20.0,
        "similarity_fct": "cos_sim",
        "gather_across_devices": false,
        "directions": [
            "query_to_doc"
        ],
        "partition_mode": "joint",
        "hardness_mode": null,
        "hardness_strength": 0.0
    }
    

Evaluation Dataset

retrieval

  • Dataset: retrieval
  • Size: 1,000 evaluation samples
  • Columns: anchor, positive, negative, and instruction
  • Approximate statistics based on the first 100 samples:
    anchor positive negative instruction
    type string string string string
    modality text text text text
    details
    • min: 9 characters
    • mean: 95.37 characters
    • max: 254 characters
    • min: 322 characters
    • mean: 885.12 characters
    • max: 2118 characters
    • min: 145 characters
    • mean: 530.42 characters
    • max: 1237 characters
    • min: 43 characters
    • mean: 71.71 characters
    • max: 103 characters
  • Samples:
    anchor positive negative instruction
    Hvordan påvirker kunstig intelligens udviklingen af selvstyrende våben, og er det etisk forsvarligt? Udviklingen af kunstig intelligens (KI) har ført til en række etiske dilemmaer, især inden for militære applikationer. En af de mest kontroversielle diskussioner drejer sig om selvstyrende våben, også kendt som autonome våbensystemer (AWS). Disse systemer er designet til at vælge og angribe mål uden menneskelig intervention. Adopteringen af AWS rejser alvorlige etiske bekymringer. En primær bekymring er ansvarlighed. Hvem bærer ansvaret, hvis et autonomt våbensystem forårsager uskyldige tab eller begår krigsforbrydelser? Er det producentoren, den militære leder, eller selve systemet? Der er også bekymringer vedrørende potentiel eskalation af konflikter. AWS kan føre til hurtigere beslutningsprocesser og potentielt øge risikoen for uforudsete konflikter. Manglende kontrol over autonome våbensystemer er en yderligere bekymring. Hvordan sikrer man, at disse systemer ikke falder i forkerte hænder eller bruges til terroristiske formål? Udviklingen af etikker og internationale regler for bru... Kunstig intelligens har et enormt potentiale til at revolutionere sundhedsvæsnet. Med sine evner til at analysere store datamængder og identificere mønstre kan KI hjælpe læger med at stille diagnoser, udvikle personlige behandlings planer og accelerere opdagelsen af nye lægemidler. En af de mest lovende anvendelser af KI i sundhedsvæsnet er i diagnostikken af sygdomme. KI-algoritmer kan trænes til at analysere medicinske billeder, såsom røntgenbilleder og CT-scanninger, for at identificere tegn på sygdomme som kræft eller lungeemboli. Dette kan føre til tidligere og mere nøjagtige diagnoser, hvilket kan forbedre behandlingsresultaterne. KI kan også spille en rolle i udviklingen af personlige behandlings planer. Ved at analysere patienters medicinske historik, genetiske data og livsstilsfaktorer kan KI-algoritmer hjælpe læger med at identificere den mest effektive behandling for den enkelte patient. Desuden kan KI bidrage til at accelerere opdagelsen af nye lægemidler og behandlinger. K... Locate scientific papers discussing a specific research topic and its ethical implications.
    Hvad er den octavo-poetiske, post-kvante mekaniske indflydelse af eksterne faktorer på den geometriske ydeevne af spektral analyser af virksomhedsfinansielle rapporter i danske selskaber, der opererer inden for den farmaceutiske industri? Selskabet rapporterer en robust vækst i omsætningen, drevet af en stærk efterspørgsel efterSpecialiteter. Det analytiske performance i tredje kvartal af 2023 viser en positiv tendens i forhold til samme periode sidste år. Vores team af eksperter har gennemført en grundig analyse af det danske medicinske marked og identificeret væsentlige muligheder for fremtidig vækst. Vi har investeret betydeligt i forskning og udvikling, og vi forventer at lancere en række nye produkter i løbet af de kommende år. Ud over den organisk vækst, vil vi fortsat udforske strategiske akquisitioner for at styrke vores position på markedet. Finansielle rapportering er et komplekst område, der kræver ekspertise og nøjagtighed. Dataanalyse spiller en afgørende rolle i at forstå en virksomheds finansielle situation. Ved at analysere historiske data kan virksomheder identificere tendenser, forudsige fremtidige resultater og træffe informerede beslutninger. "Retrieve financial reports for a specific company.",
    Hvad er symptomerne på fibromyalgi hos ældre, og er der effektive behandlingsmetoder, der er særligt gode for denne gruppe? Fibromyalgi er en kronisk smertetilstand, der kan påvirke mennesker i alle aldre, inklusive ældre. Symptomerne kan variere fra person til person, men almindelige symptomer omfatter bredt spredt muskelsmerter, træthed, søvnproblemer, morgenstevhed, hukommelses- og koncentrationsbesvær. Behandling af fibromyalgi hos ældre fokuserer ofte på at mindske smerter, forbedre søvnkvaliteten og øge funktionsevnen. Fysioterapi kan være gavnlig til at styrke musklerne, forbedre fleksibiliteten og reducere smerter. Medikamenter, såsom smertestillende og antidepressiva, kan også ordineres for at håndtere smerter og forbedre humøret. Modelleringsteknikker, såsom mindfulness og kognitiv adfærdsterapi, kan hjælpe ældre med at håndtere smerte og stress. Smerter, især kroniske smerter, er et almindeligt problem hos ældre. Årsagerne til kroniske smerter hos ældre er mange, og de kan omfatte LED, artrose, nerveskader og kroniske betændelser. Behandling af kroniske smerter hos ældre kan være kompleks og kræver en individuel tilgang. Retrieve medical articles discussing the symptoms and treatment of a particular disease.
  • Loss: MultipleNegativesRankingLoss with these parameters:
    {
        "scale": 20.0,
        "similarity_fct": "cos_sim",
        "gather_across_devices": false,
        "directions": [
            "query_to_doc"
        ],
        "partition_mode": "joint",
        "hardness_mode": null,
        "hardness_strength": 0.0
    }
    

Training Hyperparameters

Non-Default Hyperparameters

  • num_train_epochs: 5
  • learning_rate: 0.2
  • warmup_steps: 0.1
  • batch_sampler: no_duplicates

All Hyperparameters

Click to expand
  • per_device_train_batch_size: 8
  • num_train_epochs: 5
  • max_steps: -1
  • learning_rate: 0.2
  • lr_scheduler_type: linear
  • lr_scheduler_kwargs: None
  • warmup_steps: 0.1
  • optim: adamw_torch_fused
  • optim_args: None
  • weight_decay: 0.0
  • adam_beta1: 0.9
  • adam_beta2: 0.999
  • adam_epsilon: 1e-08
  • optim_target_modules: None
  • gradient_accumulation_steps: 1
  • average_tokens_across_devices: True
  • max_grad_norm: 1.0
  • label_smoothing_factor: 0.0
  • bf16: False
  • fp16: False
  • bf16_full_eval: False
  • fp16_full_eval: False
  • tf32: None
  • gradient_checkpointing: False
  • gradient_checkpointing_kwargs: None
  • torch_compile: False
  • torch_compile_backend: None
  • torch_compile_mode: None
  • use_liger_kernel: False
  • liger_kernel_config: None
  • use_cache: False
  • neftune_noise_alpha: None
  • torch_empty_cache_steps: None
  • auto_find_batch_size: False
  • log_on_each_node: True
  • logging_nan_inf_filter: True
  • include_num_input_tokens_seen: no
  • log_level: passive
  • log_level_replica: warning
  • disable_tqdm: False
  • project: huggingface
  • trackio_space_id: None
  • trackio_bucket_id: None
  • trackio_static_space_id: None
  • per_device_eval_batch_size: 8
  • prediction_loss_only: True
  • eval_on_start: False
  • eval_do_concat_batches: True
  • eval_use_gather_object: False
  • eval_accumulation_steps: None
  • include_for_metrics: []
  • batch_eval_metrics: False
  • save_only_model: False
  • save_on_each_node: False
  • enable_jit_checkpoint: False
  • push_to_hub: False
  • hub_private_repo: None
  • hub_model_id: None
  • hub_strategy: every_save
  • hub_always_push: False
  • hub_revision: None
  • load_best_model_at_end: False
  • ignore_data_skip: False
  • restore_callback_states_from_checkpoint: False
  • full_determinism: False
  • seed: 42
  • data_seed: None
  • use_cpu: False
  • accelerator_config: {'split_batches': False, 'dispatch_batches': None, 'even_batches': True, 'use_seedable_sampler': True, 'non_blocking': False, 'gradient_accumulation_kwargs': None}
  • parallelism_config: None
  • dataloader_drop_last: False
  • dataloader_num_workers: 0
  • dataloader_pin_memory: True
  • dataloader_persistent_workers: False
  • dataloader_prefetch_factor: None
  • dataloader_multiprocessing_context: None
  • dataloader_in_order: True
  • remove_unused_columns: True
  • label_names: None
  • train_sampling_strategy: random
  • length_column_name: length
  • ddp_find_unused_parameters: None
  • ddp_bucket_cap_mb: None
  • ddp_broadcast_buffers: False
  • ddp_static_graph: None
  • ddp_backend: None
  • ddp_timeout: 1800
  • fsdp: None
  • fsdp_config: None
  • deepspeed: None
  • debug: []
  • skip_memory_metrics: True
  • do_predict: False
  • resume_from_checkpoint: None
  • local_rank: -1
  • prompts: None
  • batch_sampler: no_duplicates
  • multi_dataset_batch_sampler: proportional
  • router_mapping: {}
  • learning_rate_mapping: {}
  • warmup_ratio: None

Training Logs

Epoch Step Training Loss retrieval loss
0.0001 1 0.8973 -
0.0850 1000 0.5837 0.3740
0.1701 2000 0.3656 0.3898
0.2551 3000 0.3665 0.3423
0.3402 4000 0.3414 0.3449
0.4252 5000 0.3159 0.3354
0.5102 6000 0.3219 0.3394
0.5953 7000 0.2944 0.3381
0.6803 8000 0.2958 0.3179
0.7654 9000 0.2839 0.2892
0.8504 10000 0.2723 0.2773
0.9355 11000 0.2424 0.2552
1.0205 12000 0.2535 0.2545
1.1055 13000 0.2267 0.2437
1.1906 14000 0.1669 0.2444
1.2756 15000 0.1427 0.2322
1.3607 16000 0.1181 0.2315
1.4457 17000 0.0767 0.2230
1.5307 18000 0.0587 0.2306
1.6158 19000 0.0538 0.2282
1.7008 20000 0.0405 0.2273
1.7859 21000 0.0326 0.2296
1.8709 22000 0.0292 0.2179
1.9559 23000 0.0266 0.2201
2.0410 24000 0.0215 0.2241
2.1260 25000 0.0193 0.2245
2.2111 26000 0.0163 0.2185
2.2961 27000 0.0149 0.2055
2.3812 28000 0.0138 0.2101
2.4662 29000 0.0101 0.2019
2.5512 30000 0.0096 0.2049
2.6363 31000 0.0087 0.1979
2.7213 32000 0.0067 0.2035
2.8064 33000 0.0066 0.2016
2.8914 34000 0.0059 0.1970
2.9764 35000 0.0057 0.1997
3.0615 36000 0.0042 0.1957
3.1465 37000 0.0041 0.1969
3.2316 38000 0.0031 0.1954
3.3166 39000 0.0026 0.1869
3.4016 40000 0.0037 0.1815
3.4867 41000 0.0028 0.1832
3.5717 42000 0.0029 0.1758
3.6568 43000 0.0020 0.1766
3.7418 44000 0.0026 0.1786
3.8269 45000 0.0019 0.1814
3.9119 46000 0.0018 0.1810
3.9969 47000 0.0013 0.1786
4.0820 48000 0.0012 0.1787
4.1670 49000 0.0013 0.1795
4.2521 50000 0.0010 0.1797
4.3371 51000 0.0009 0.1791
4.4221 52000 0.0011 0.1807
4.5072 53000 0.0010 0.1805
4.5922 54000 0.0015 0.1812
4.6773 55000 0.0010 0.1808
4.7623 56000 0.0010 0.1805
4.8474 57000 0.0006 0.1799
4.9324 58000 0.0010 0.1797
5.0 58795 - 0.1798

Training Time

  • Training: 11.0 minutes

Framework Versions

  • Python: 3.14.7
  • Sentence Transformers: 6.0.1
  • Transformers: 5.17.0
  • PyTorch: 2.14.0+cu130
  • Accelerate: 1.15.0
  • Datasets: 5.0.1
  • Tokenizers: 0.23.2

Additional Resources

Citation

BibTeX

Sentence Transformers

@inproceedings{reimers-2019-sentence-bert,
    title = "Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks",
    author = "Reimers, Nils and Gurevych, Iryna",
    booktitle = "Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing",
    month = "11",
    year = "2019",
    publisher = "Association for Computational Linguistics",
    url = "https://arxiv.org/abs/1908.10084",
}

MultipleNegativesRankingLoss

@misc{oord2019representationlearningcontrastivepredictive,
      title={Representation Learning with Contrastive Predictive Coding},
      author={Aaron van den Oord and Yazhe Li and Oriol Vinyals},
      year={2019},
      eprint={1807.03748},
      archivePrefix={arXiv},
      primaryClass={cs.LG},
      url={https://arxiv.org/abs/1807.03748},
}
Downloads last month

-

Downloads are not tracked for this model. How to track
Safetensors
Model size
9M params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for kardosdrur/handsker-retrieval-300d

Finetuned
(1)
this model

Dataset used to train kardosdrur/handsker-retrieval-300d

Collection including kardosdrur/handsker-retrieval-300d

Papers for kardosdrur/handsker-retrieval-300d