Qwen3-Embedding - a Qwen Collection
Qwen3-Reranker - a Qwen Collection
Qwen3-Embedding-8B
传统BERT模型([CLS]策略):[CLS] 句子A [SEP] 句子B [SEP]
Qwen3模型([EOS]策略):[EOS] 标记的最终向量能够代表整句话的含义
- 词元嵌入(Token Embedding)
- 上下文感知(Contextualization)——Word2Vec/BERT/Qwen
- 句子嵌入(Sentence Embedding)
Qwen3-Embedding-8B部署
1、拉取官方镜像1
docker pull vllm/vllm-openai:v0.9.2
2、Qwen3-Embedding-8B服务启动命令(首次大约150秒)
1 | sudo docker run -itd --gpus 'device=3' --restart always --name qwen3-8b-embd -p 8006:8000 -v /data/models/Qwen3-Embedding-8B:/models vllm/vllm-openai:v0.9.2 --served-model-name qwen3-8b-embd --model /models --tensor-parallel-size 1 --trust-remote-code --task embed --max-model-len 8192 --api-key <YOUR_API_KEY> |

3、启动日志
1 | INFO 07-11 01:03:23 [__init__.py:244] Automatically detected platform cuda. |

4、服务调用
1 | curl --location 'http://10.39.214.102:8006/v1/embeddings' \ |

5、返回结果(8B为4096维的向量,0.6B为1024维的向量)
1 | { |
Qwen3-Reranker
传统rerank拼接方式:[CLS]Query[SEP]Document
qwen3-reranker拼接方式:
1 | <|im_start|>system |
具体做法是:模型的主要任务是预测 assistant 后最可能出现的词元,即”yes”或”no”,并计算它们各自的概率。最终的相关性分数通过如下公式归一化得到:
score = P(“yes”) / (P(“yes”) + P(“no”))
Qwen3-Reranker-8B部署
1、拉取官方镜像
1 | docker pull vllm/vllm-openai:v0.9.2 |
2、Qwen3-Reranker-8B服务启动命令
1 | sudo docker run -itd --gpus 'device=3' --restart always --name qwen3-reranker-8b -p 8007:8000 -v /data/models/Qwen3-Reranker-8B:/models --name qwen3-reranker-8b vllm/vllm-openai:v0.9.2 --task score --model /models --served-model-name qwen3-reranker-8b --tensor-parallel-size 1 --trust-remote-code --max-model-len 8192 --api-key <YOUR_API_KEY> |
1 | python3 -m vllm.entrypoints.openai.api_server --host 0.0.0.0 --port 8080 --max-model-len 8192 --tensor-parallel-size 1 --served-model-name qwen3-reranker-8b --model /data/modelRepository/reranker/reranker_qwen3-8b --trust-remote-code --api-key <YOUR_API_KEY> --task score |

3、启动日志
1 | INFO 07-11 01:14:23 [__init__.py:244] Automatically detected platform cuda. |

4、服务调用
1 | curl --location 'http://10.39.214.102:8007/v1/rerank' \ |

5、返回结果
1 | { |
Qwen3-Reranker-0.6B部署
1、拉取官方镜像
1 | docker pull vllm/vllm-openai:v0.9.2 |
2、Qwen3-Reranker-0.6B服务启动命令
1 | sudo docker run -itd --gpus 'device=1' --restart always --name qwen3-reranker-0.6b -p 30001:8000 -v /data/models/Qwen3-Reranker-0.6B:/models --name qwen3-reranker-0.6b vllm/vllm-openai:v0.9.2 --task score --model /models --served-model-name qwen3-reranker-0.6b --tensor-parallel-size 1 --gpu-memory-utilization 0.1 --trust-remote-code --max-model-len 8192 --api-key <YOUR_API_KEY> |
3、启动日志
4、服务调用
1 | curl --location 'http://10.39.214.102:30001/v1/rerank' \ |
Qwen3-Reranker-0.6B接口文档
- 请求地址:http://10.39.214.102:30001/v1/rerank
- 调用方式:HTTP post
- 接口描述:重排序接口,计算query和documents的相似度
- 请求参数:
1
2
3
4
5
6
7
8
9
10{
"query": "用户赞扬客服",
"documents": [
"客户表扬",
"客户漫骂",
"客户一直漫骂",
"客户骂人",
"客户举报"
]
}
- 参数说明:
- query:用户查询
- documents:待查询匹配的文档
- 返回参数:
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44{
"id": "rerank-c5a62003353d4db8afb9e48cc694128b",
"model": "qwen3-0.6b-reanker",
"usage": {
"total_tokens": 34
},
"results": [
{
"index": 0,
"document": {
"text": "客户表扬"
},
"relevance_score": 0.798099935054779
},
{
"index": 4,
"document": {
"text": "客户举报"
},
"relevance_score": 0.7582945227622986
},
{
"index": 1,
"document": {
"text": "客户漫骂"
},
"relevance_score": 0.711263120174408
},
{
"index": 2,
"document": {
"text": "客户一直漫骂"
},
"relevance_score": 0.6950579881668091
},
{
"index": 3,
"document": {
"text": "客户骂人"
},
"relevance_score": 0.6752427816390991
}
]
}
- 参数说明:
- id:模型请求id
- model:模型名称
- usage:总token数目
- results:返回结果
- index:文档索引
- document:文档内容
- relevance_score:相似度分数(从高往低排序)

