频道导航

python – Scipy稀疏 – 距离矩阵(Scikit或Scipy)

2019-04-08 Python 前端之家

前端之家收集整理的这篇文章主要介绍了python – Scipy稀疏 – 距离矩阵(Scikit或Scipy)，前端之家小编觉得挺不错的，现在分享给大家，也给大家做个参考。

我试图在scikit-learn的DictVectorizer返回的Scipy稀疏矩阵上计算最近邻居聚类.但是,当我尝试使用scikit-learn计算距离矩阵时,我通过pairwise.euclidean_distances和pairwise.pairwise_distances使用’euclidean’距离得到错误消息.我的印象是scikit-learn可以计算这些距离矩阵.

我的矩阵非常稀疏,形状为：< 364402x223209稀疏矩阵类型< class'numpy.float64'>
使用压缩稀疏行格式的728804存储元素>.

我也在Scipy中尝试了诸如pdist和kdtree之类的方法,但是还收到了其他无法处理结果的错误.

任何人都可以请我指出一个有效地允许我计算距离矩阵和/或最近邻结果的解决方案吗？

一些示例代码：

import numpy as np
from sklearn.feature_extraction import DictVectorizer
from sklearn.neighbors import NearestNeighbors
from sklearn.metrics import pairwise
import scipy.spatial

file = 'FileLocation'
data = []
FILE = open(file,'r')
for line in FILE:
    templine = line.strip().split(',')
    data.append({'user':str(int(templine[0])),str(int(templine[1])):int(templine[2])})
FILE.close()

vec = DictVectorizer()
X = vec.fit_transform(data)

result = scipy.spatial.KDTree(X)

Traceback (most recent call last):
  File "


同样,如果我跑：

scipy.spatial.distance.pdist(X,'euclidean')

我得到以下内容：

Traceback (most recent call last):
  File "

最后,在scikit-learn中运行NearestNeighbor会导致内存错误,使用：

nbrs = NearestNeighbors(n_neighbors=10,algorithm='brute')


最佳答案
首先,你不能使用稀疏矩阵的KDTree和pdist,你必须将它转换为密集(你的选择是否是你的选择)：

>>> X
<2x3 sparse matrix of type '

第二,从the docs：


Efficient brute-force neighbors searches can be very competitive for small data samples. However,as the number of samples N grows,the brute-force approach quickly becomes infeasible.

您可能想尝试’ball_tree’算法并查看它是否可以处理您的数据.

 原文链接：https://www.f2er.com/python/439703.html


      numpy
      
                 
        上一篇：python  – 使用SQLAlchemy防止在单下一篇：使用`pip`维护Python包最安全的方法


          
          
          
            
              


            
          

          
            
              
                  
    猜你在找的Python相关文章

                                    爬虫实战：探索XPath爬虫技巧之热榜新闻
                                在这篇文章中，我们深入学习了XPath作为一种常见的网络爬虫技巧。XPath是一种用于定位和选...
                                作者：努力的小雨 时间：2024-09-28
                                
                            

                                    谁说后端不能画出美丽的动图？让我来给大家拜个年！
                                祝福大家龙年快乐！愿你们的生活像龙一样充满力量和勇气，愿你们在新的一年里，追逐梦想，...
                                作者：努力的小雨 时间：2024-09-28
                                
                            

                                    爬虫实战：从网页到本地，如何轻松实现小说离线阅读
                                今天在爬虫实战中，除了正常爬取网页数据外，我们还添加了一个下载功能，主要任务是爬取小...
                                作者：努力的小雨 时间：2024-09-28
                                
                            

                                    爬虫实战+数据分析：全国消费支出分析及未来预测
                                完美收官，本文是爬虫实战的最后一章了，所以尽管本文着重呈现爬虫实战，但其中有一大部分...
                                作者：努力的小雨 时间：2024-09-28
                                
                            

                                    Java开发者的Python进修指南：JSON利器之官方json库、demjson和orjson的实用指南
                                JSON是一种流行的数据传输格式，Python中有多种处理JSON的方式。官方的json库是最常用的，...
                                作者：努力的小雨 时间：2024-09-28
                                
                            




                                    使用Python的turtle模块绘制美丽的樱花树
                                通过本文的学习和实践，我们掌握了使用Python的turtle模块来创作樱花树图画的技巧，这个过...
                                作者：努力的小雨 时间：2024-09-28
                                
                            

                                    利用大型语言模型轻松打造浪漫时刻
                                在这篇文章中，我们介绍了如何利用大型语言模型为情人节营造难忘的氛围。通过上传图片并进...
                                作者：努力的小雨 时间：2024-09-28
                                
                            

                                    成为一个合格程序员所必备的三种常见LeetCode排序算法
                                排序算法是一种通过特定的算法因式将一组或多组数据按照既定模式进行重新排序的方法。通过...
                                作者：努力的小雨 时间：2024-09-28
                                
                            

                                    5分钟上手Python爬虫：从干饭开始，轻松掌握技巧
                                本文的重点在于引导读者如何初步掌握爬虫技术。初步掌握爬虫技术并不难，但是在实际操作中...
                                作者：努力的小雨 时间：2024-09-28
                                
                            

                                    AI实用指南：5分钟搭建你自己的LLM聊天应用
                                本文介绍了如何快速搭建一个基于大型语言模型（LLM）的混元聊天应用。强调了开发速度的重要...
                                作者：努力的小雨 时间：2024-09-28


        
        
        
        
          
          
            
              
                编程分类
                PHPJavaJava SEPythonC#C&C++RubyVBasp.NetGoPerlnettyDjangoDelphiJsp.NET CoreSpringFlaskSpringbootSpringMVCLuaLaravelMybatisAspGroovyThinkPHPYiiswoole
                
              
            
          
          
         
          
            
               



              
            
          
          
          
          
          
            
              
                最新文章
                • 爬虫实战：探索XPath爬虫技
• 谁说后端不能画出美丽的动
• 爬虫实战：从网页到本地，
• 爬虫实战+数据分析：全国消
• Java开发者的Python进修指
• Java开发者的Python快速进
• 使用Python的turtle模块绘
• 利用大型语言模型轻松打造
• 成为一个合格程序员所必备
• 5分钟上手Python爬虫：从干

              
            
          
          


          
          
            
              
                热门标签
                  
                    更多 ►
                
                文件时间pythonm相等性PHP Warning时间问题问题解决pcntl_signal采样点wav模块动态文本调用频率限制对外暴露多个访问请求更新数据表模型结构type()方法比较速度手写体sobel算子保存模型Image类nn.Conv2dpytorch1.0kaggleDCGAN交并比range()用法打印模型反卷积卷积



     
    
        
             
                最近更新
· jQuery选择伪元素：after10-20
· JavaScript随机颜色生成器10-20
· JavaScript指数10-20
· addResourceHandlers无法解析静态资源10-20
· 如何将字节数组转换为MultipartFile10-20
· 在java中如何创建一个文件并写入内容？10-20
· 星号*在Python中是什么意思？10-20
· Flask框架：MVC模式10-20
· 在JavaScript对象数组中按ID查找对象10-20
· 使用Javascript / jQuery下载文件10-20

            
           
                好站推荐
 菜鸟教程
 编程之家
 前端之家

            
                商务合作
                联系我们
            

        
        
            Copyright © 2019 前端之家. 当前版本 V7.0.16

            前端之家 版权所有 
            闽ICP备13020303号-10