快速部署：使用FastAPI构建大型语言模型——LLAMA2实战

【代码】快速部署：使用FastAPI构建大型语言模型——LLAMA2实战。

xuezhangdaima

283人浏览 · 2024-06-11 21:05:04

xuezhangdaima · 2024-06-11 21:05:04 发布

Fastapi部署llama

服务端代码

import uvicorn
from fastapi import FastAPI
from pydantic import BaseModel
from transformers import AutoTokenizer, LlamaForCausalLM
import torch

app = FastAPI()

class Query(BaseModel):
    text: str

device = torch.device("cuda:0")

model_path = 'llama-2-7b-chat-hf'
model = LlamaForCausalLM.from_pretrained(model_path, device_map="auto")
tokenizer = AutoTokenizer.from_pretrained(model_path)

@app.post("/chat/")
async def generate_response(query: Query):
    inputs = f"[INST] {query.text.strip()} [/INST]"

    input_ids = tokenizer(inputs, return_tensors="pt").input_ids.to(device)
    generate_ids = model.generate(
        input_ids,
        max_new_tokens=500,
        do_sample=True,
        top_p=0.85,
        temperature=1.0,
        repetition_penalty=1.,
        eos_token_id=2,
        bos_token_id=1,
        pad_token_id=0)

    output = tokenizer.batch_decode(generate_ids)[0]
    return {"result": output}

if __name__ == "__main__":
    uvicorn.run(app, host="0.0.0.0", port=6006)

客户端代码

import requests

url = "https://xxxxxxxxxxxx/chat/"
# 使用新的输入格式，包裹用户输入
query = {"text": "[INST] introduce china[/INST]"}  # 修改为使用[INST]标签

response = requests.post(url, json=query)

if response.status_code == 200:
  result = response.json()
  print("chat:", result["result"])
else:
  print("Error:", response.status_code, response.text)

魔乐社区

魔乐社区（Modelers.cn) 是一个中立、公益的人工智能社区，提供人工智能工具、模型、数据的托管、展示与应用协同服务，为人工智能开发及爱好者搭建开放的学习交流平台。社区通过理事会方式运作，由全产业链共同建设、共同运营、共同享有，推动国产AI生态繁荣发展。

更多推荐

【计算机视觉】Pixel逐像素分类&Mask掩码分类理解摘要

魔乐社区

计算机视觉（opencv）实战三十二——CascadeClassifier 人脸微笑检测（摄像头）

本文从原理到实现，详细介绍了基于 OpenCV Haar 分类器的人脸与微笑检测：讲解了 Haar 特征和级联检测原理。对代码逐行拆解并解释参数含义。画出完整流程图，帮助理解执行过程。给出了常见问题和优化建议，甚至扩展到深度学习方法。这种方法简单、轻量、实时性好，非常适合入门和小型应用项目。但如果需要更高准确率和更强鲁棒性，建议使用深度学习检测器替代 Haar 分类器。