常见向量数据库的安装与使用
发表于|nlp
|总字数:15|阅读时长:1分钟|浏览量:
常见向量数据库的安装与使用
vector-database
文章作者: 小鱼吃猫
版权声明: 本博客所有文章除特别声明外,均采用 CC BY-NC-SA 4.0 许可协议。转载请注明来源 小鱼吃猫!
相关推荐
2023-08-18
基于BERT+LSTM+CRF的命名实体识别
基于BERT+LSTM+CRF的命名实体识别定义参数12345678910111213141516171819202122232425262728293031class CommonConfig: bert_dir = "hfl/chinese-macbert-base" output_dir = "./checkpoint/" data_dir = "./data"class NerConfig: def __init__(self): cf = CommonConfig() self.bert_dir = cf.bert_dir self.output_dir = cf.output_dir # self.output_dir = os.path.join(self.output_dir) if not os.path.exists(self.output_dir): os.mkdir(self.out...
2024-08-30
Pypi本地镜像服务器搭建
Pypi本地镜像服务器搭建主要功能 全镜像同步(可以指定镜像源) 下载指定依赖包 定时同步 快速开始 安装依赖 1pip install pip2pi==0.8.2 执行main.py 原理其实是下载依赖,然后执行 dir2pi -S . 1python main.py 此时可以看到packages目录下有所有的包和一个sample文件夹,如果需要在内网环境下使用,请把sample拷贝进内网机即可。 3.配置pypi索引服务器可以使用python,也可以使用Nginx,当然,也可以使用对象存储(做一个静态映射即可) 123#在下载目录里创建server服务,8080为端口号,可以随意设置:cd packagespython -m http.server 8080 nginx配置如下: 12345678server { listen 80; server_name example.com; root /sample; index index.html index.htm;} 4.打开网页就可以看所有的包了 1http:/...
2023-08-18
基于BERT的命名实体识别
基于BERT的命名实体识别先配置一下模型路径 1model_path="/data1/model/chinese-macbert-base" Step1 导入相关包1234import evaluatefrom datasets import load_datasetfrom transformers import AutoTokenizer, AutoModelForTokenClassification, TrainingArguments, Trainer, DataCollatorForTokenClassificationfrom seqeval.metrics import classification_report Step2 加载数据集123456# 如果可以联网,直接使用load_dataset进行加载ner_datasets = load_dataset("peoples_daily_ner")# 如果无法联网,则使用下面的方式加载数据集# from datasets import DatasetDict# ner_da...

2023-08-01
Transformers 框架学习——持续更新
Transformers 框架学习——持续更新一、概述 官方文档 Transformers快速入门 二、组件 Transformers框架之分词器(Tokenizer)学习 Transformers框架之Model学习 Transformers框架之Datasets 组件 Transformers学习之Evaluate组件 Transformers学习之Trainer组件 三、实战文本 Transformers框架实战——商品评价的情感分析实战 命名实体识别 基于BERT的命名实体识别 基于BERT+LSTM+CRF的命名实体识别 预训练模型分类及代码实战 文本摘要 文本摘要之前缀语言模型-GLM 文本摘要之序列到序列模型-t5 检索式问答-综述 文本相似度匹配 向量数据库的安装与使用 基于向量匹配的检索式问答实战 图像 图像分类之——阿猫阿狗的识别 四、其他 Module ‘XXX‘ doesn‘t exist on the Hugging Face Hub 五、附件 代码地址: https://github.com/Lyn4ever29/transfor...
2023-09-11
基于向量匹配的检索式问答实战
基于向量匹配的检索式问答实战可以先看一看检索式问答的综述,《检索式问答综述》,这篇是实战,直接上代码。 准备工作 数据集:wangrui6/Zhihu-KOL,包含10w条知乎通用问答数据,以下是两个示例: INSTRUCTION (string) RESPONSE (string) 从北大光华读完MBA的人都去了哪里工作? 这里我们根据北大光华的数据给大家分析一下。 Python3中如何得到Unicode码对应的中文? “看的头晕啊!编码真是把人绕晕了啊!” 模型:哈工大的一个中文BERThfl/chinese-macbert-base 分析可以根据要问的问题和知识库里的句子计算相似度进行答案的搜索,但这要求需要有成对的相似句子对作为训练数据集。这需要每个文法都需要有至少两个以上的句子,这很不现实。所以在实际中,可以直接计算问题和答案之间的相似度,以此来完成答案的索引。 代码实现模型训练 利用问答对训练一个文本相似度计算模型用做编码器 这部分和之前的文章是一样的,可以参考文本相似度匹配中问题2的代码 存储数据 利用上一步训练来的编...
2023-08-07
Transformers框架实战——商品评价的情感分析实战
Transformers框架实战——商品评价的情感分析实战 Transformers框架基础教程及更多实战内容 以商品评价数据集为例,使用bert进行情感分析。数据集来源:https://github.com/SophonPlus/ChineseNlpCorpus Step1 导包12from transformers import AutoTokenizer, AutoModelForSequenceClassification, Trainer, TrainingArgumentsfrom datasets import load_dataset,load_from_disk Step2 加载数据集1dataset = load_dataset("csv", data_files="./JD.com_comments.csv", split='train') 这个数据集共包含720 万条评论,包含用户ID,商品ID,评分,时间,评论标题,评论内容这六个字段。看一下第一条数据。 12345678{'...
公告

