数据采集器
数据采集器-数据采集器
数据采集器是什么
是一种具有现场实时数据采集、处理功能的自动化设备。具备实时采集、自动存储、即时显示、即时反馈、自动处理、自动传输功能。为现场数据的真实性、有效性、实时性、可用性提供了保证。
数据采集器-相关条目
数据采集器通常有两种解释:一种是指盘点机、掌上电脑等终端电脑设备;另外一种是指网络数据采集用的软件。
数据采集器(一)
(Bar code Hand Terminal)或称盘点机、掌上电脑,其具有一体性、机动性、体积小、重量轻、高性能,并适于手持等特点。它是将条码扫描装置与数据终端一体化,带有电池可离线操作的终端电脑设备。具备实时采集、自动存储、即时显示、即时反馈、自动处理、自动传输功能。为现场数据的真实性、有效性、实时性、可用性提供了保证。
它具有中央处理器(CPU),只读存储器(ROM)、可读写存储器(RAM)、键盘、屏幕显示器、与计算机接口。条码扫描器,电源等配置,手持终端可通过通讯座与计算机相连用于接收或上传数据,手持终端的运行程序是由计算机编制后下载到手持终端中,可按使用要求完成相应的功能。
数据采集器硬件特点:
1、CPU处理器:随着数字电路技术的发展,数据采集终端大多采用16位或是更好的32位CPU(中央微处理器)。CPU的位数、主频等指标的提高,使得数据采集器的数据采集处理能力、处理速度要求越来越高。使用户的现场工作效率得到改善。
2、手持终端内存:目前大多数产品采用FLASH-ROM+ RAM型内存。操作系统、应用程序、字库文件等重要的文件存储在FLASH-ROM里面,即使长期的不供电也能够保持。采集的数据存储在RAM里面,依靠电池、后备电池保持数据。由于RAM的读写速度较快,使得操作的速度能够得到保证。手持终端内存容量的大小,决定了一次能处理的数据容量。
3、功耗:包括条码扫描设备的功耗、显示屏的功耗、CPU的功耗等及部分。由电池支持工作。
4、输入设备:包括条码扫描输入、键盘输入两种方式。
5、显示输出:目前的数据采集器大都具备大屏液晶显示屏。能够显示中英文、图形等各种用户信息。同时在显示精度、屏幕的工业性能上面都有较严格的要求。
6、与计算机系统的通讯能力:作为计算机网络系统的延伸,手持终端采集的数据及处理结果要与计算机系统交换信息。
7、外围设备驱动能力:
利用数据采集器的串口、红外口,可以联接各种标准串口设备,或者通过串-并转换可以连结各种并口设备。包括:串并口打印机、调制解调器等,实现电脑的各种功能。
条码数据采集器是离线采集条码的设备。按传输方式分为批处理和无线的方式:批处理方式是数据采集器采集好条码后,利用和电脑连接的通讯座把采集的条码信息用文件的方式传输到电脑;无线方式是数据采集器以802.11b和GPRS等方式无线实时和 PC交换数据。在产品出入库、物流快件管理、固定资产管理、抄表系统、图书管理系统上,数据采集器用得非常广泛。
数据采集器(二)
用来批量采集网页,论坛等的内容,直接保存到数据库或发布到网络的一种信息化工具。可以根据用户设定的规则自动采集原网页,获取格式网页中需要的内容,现在发展成也可以对数据进行处理的工具(系统)。下面以最通用乐思(Knowlesys)数据采集器为例来做性能和应用介绍。
数据采集器系统特点
本系统最大的特点是:采集方法的灵活性与采集数据的准确性
灵活性:任何复杂的查询与页面布局都可以灵活处理
准确性:结果数据高度准确(99%-100%)
对目标网站进行信息自动抓取,支持HTML页面内各种数据的采集,如文本信息,URL,数字,日期,图片等
用户对每类信息自定义来源与分类
可以下载图片与各类文件
支持用户名与密码自动登录
支持命令行格式,可以Windows任务计划器配合,定期抽取目标网站
支持记录唯一索引,避免相同信息重复入库
支持智能替换功能,可以将内容中嵌入的所有的无关部分如广告去除
支持多页面文章内容自动抽取与合并
支持下一页自动浏览功能
支持直接提交表单
支持模拟提交表单
支持动作脚本
支持从一个页面中抽取多个数据表
支持数据的多种后期处理方式
数据直接进入数据库而不是文件中,因此与利用这些数据的网站程序或者桌面程序之间 没有任何耦合
支持数据库表结构完全自定义,充分利用现有系统
支持多个栏目的信息采集可用同一配置一对多处理
保证信息的完整性与准确性,绝不会出现乱码
支持所有主流数据库:MS SQL Server, Oracle, DB2, MySQL, Sybase, Interbase, MS Access等
行业应用
乐思网络信息采集系统在各个注重外部信息获取的行业都有着广泛的应用:
门户网站
可以做到:
每天自动采集指定网站(可达几百个,上千个)的最新内容(可以做到每天自动从上千个网络媒体采集上万条新闻信息)
每天自动采集指定购物网站产品价格信息(产品名称,说明,价格,图片等)
利益:
大大节约工作人员采集因特网信息的时间与精力,让他们有更多时间专注于业务问题
轻松实现行业信息整合
迅速提高本网站信息量与浏览量,同时提高Google排名与Alexa排名
轻松实现价格比较系统的前端采集子系统
新闻媒体
可以做到:
每天定时自动采集指定网站的新闻内容,扩大内容来源与数量
轻松整合不同地区与行业的新闻,形成专题
采集行业内的专业文章,论坛帖子,并进行整合
利益:
节约采编人员大量的时间,从而让他们可以有更多的精力来从事其他的事情
迅速提高本网站信息量与浏览量
轻松拥有海量信息输入
企业
可以做到:
实时而准确地采集国内外新闻,行业新闻,技术文章
实时而准确地采集竞争对手以及供应商的新闻,人事,产品,价格等信息
实时而准确地采集公共信源的商业情报(同行产品价格,竞争对手的用户反馈,行业新闻)
实时而准确地采集本企业的品牌以及竞争对手的品牌在各大搜索引擎中的结果
实时而准确地采集各大行业论坛中的信息,从中了解消费者的需求与反馈,从而发现市场趋势与商业机会
准确地从网络公共信息中采集销售线索,潜在客户的资料
准确地从网络公共信息中采集本行业上万种产品的产品信息(描述,价格等),图片,技术文档。
利益:
快速而大量地获取目标商业信息,立刻提高公司的市场营销能力
快速实现企业应用(ERP,CRM等)及企业门户网站对于因特网内容的整合
快速建立大容量专业知识数据库,立刻促进公司的知识管理水平
节约内部员工到各网站查阅新闻的时间
政府机关与军队
可以做到:
实时跟踪、采集与政府工作相关的国内外及地方新闻,政策法规,经济,产业等信息
解决与因特网隔离的重要部门对于因特网的信息需求问题
解决政府主网站对各地级子网站的信息采集与整合问题
利益:
全面满足内部工作人员对外部因特网的实时信息的整合需求
迅速解决政务外网、政务内网的信息量不足,更新不及时问题
通过扩大信息量(如新闻,供求信息等)提高政务网站的用户满意度
大大节约工作人员采集因特网信息的时间与精力
广告与市场研究机构
可以做到:
快速而大量地获取公共信息中的商业名录资料
快速而大量地获取目标网站的各种原始信息(例如Blog与BBS中的信息)到数据库中
利益:
快速形成特定群体的具有很高可信度的商业名录数据库
快速形成用于分析统计与研究的用户反馈基础数据库
为品牌客户监视Blog与BBS上的相关信息
科学与技术研究单位
可以做到:
实时跟踪、采集相关的国内外科技信息与新闻
整合分布在各个网站网页上的科研数据,例如美国国家卫生研究院的生物科技信息中心(NCBI)公布的的大量基因相关数据
本地文本数据抽取
利益:
全面满足科研人员对于实时科技信息的整合浏览需求
从因特网的公开的可信来源轻松获取科学研究的相关数据
节约科研人员的极其宝贵的时间与精力
数据采集器是什么
是一种具有现场实时数据采集、处理功能的自动化设备。具备实时采集、自动存储、即时显示、即时反馈、自动处理、自动传输功能。为现场数据的真实性、有效性、实时性、可用性提供了保证。
数据采集器-相关条目
数据采集器通常有两种解释:一种是指盘点机、掌上电脑等终端电脑设备;另外一种是指网络数据采集用的软件。
数据采集器(一)
(Bar code Hand Terminal)或称盘点机、掌上电脑,其具有一体性、机动性、体积小、重量轻、高性能,并适于手持等特点。它是将条码扫描装置与数据终端一体化,带有电池可离线操作的终端电脑设备。具备实时采集、自动存储、即时显示、即时反馈、自动处理、自动传输功能。为现场数据的真实性、有效性、实时性、可用性提供了保证。
它具有中央处理器(CPU),只读存储器(ROM)、可读写存储器(RAM)、键盘、屏幕显示器、与计算机接口。条码扫描器,电源等配置,手持终端可通过通讯座与计算机相连用于接收或上传数据,手持终端的运行程序是由计算机编制后下载到手持终端中,可按使用要求完成相应的功能。
数据采集器硬件特点:
1、CPU处理器:随着数字电路技术的发展,数据采集终端大多采用16位或是更好的32位CPU(中央微处理器)。CPU的位数、主频等指标的提高,使得数据采集器的数据采集处理能力、处理速度要求越来越高。使用户的现场工作效率得到改善。
2、手持终端内存:目前大多数产品采用FLASH-ROM+ RAM型内存。操作系统、应用程序、字库文件等重要的文件存储在FLASH-ROM里面,即使长期的不供电也能够保持。采集的数据存储在RAM里面,依靠电池、后备电池保持数据。由于RAM的读写速度较快,使得操作的速度能够得到保证。手持终端内存容量的大小,决定了一次能处理的数据容量。
3、功耗:包括条码扫描设备的功耗、显示屏的功耗、CPU的功耗等及部分。由电池支持工作。
4、输入设备:包括条码扫描输入、键盘输入两种方式。
5、显示输出:目前的数据采集器大都具备大屏液晶显示屏。能够显示中英文、图形等各种用户信息。同时在显示精度、屏幕的工业性能上面都有较严格的要求。
6、与计算机系统的通讯能力:作为计算机网络系统的延伸,手持终端采集的数据及处理结果要与计算机系统交换信息。
7、外围设备驱动能力:
利用数据采集器的串口、红外口,可以联接各种标准串口设备,或者通过串-并转换可以连结各种并口设备。包括:串并口打印机、调制解调器等,实现电脑的各种功能。
条码数据采集器是离线采集条码的设备。按传输方式分为批处理和无线的方式:批处理方式是数据采集器采集好条码后,利用和电脑连接的通讯座把采集的条码信息用文件的方式传输到电脑;无线方式是数据采集器以802.11b和GPRS等方式无线实时和 PC交换数据。在产品出入库、物流快件管理、固定资产管理、抄表系统、图书管理系统上,数据采集器用得非常广泛。
数据采集器(二)
用来批量采集网页,论坛等的内容,直接保存到数据库或发布到网络的一种信息化工具。可以根据用户设定的规则自动采集原网页,获取格式网页中需要的内容,现在发展成也可以对数据进行处理的工具(系统)。下面以最通用乐思(Knowlesys)数据采集器为例来做性能和应用介绍。
数据采集器系统特点
本系统最大的特点是:采集方法的灵活性与采集数据的准确性
灵活性:任何复杂的查询与页面布局都可以灵活处理
准确性:结果数据高度准确(99%-100%)
对目标网站进行信息自动抓取,支持HTML页面内各种数据的采集,如文本信息,URL,数字,日期,图片等
用户对每类信息自定义来源与分类
可以下载图片与各类文件
支持用户名与密码自动登录
支持命令行格式,可以Windows任务计划器配合,定期抽取目标网站
支持记录唯一索引,避免相同信息重复入库
支持智能替换功能,可以将内容中嵌入的所有的无关部分如广告去除
支持多页面文章内容自动抽取与合并
支持下一页自动浏览功能
支持直接提交表单
支持模拟提交表单
支持动作脚本
支持从一个页面中抽取多个数据表
支持数据的多种后期处理方式
数据直接进入数据库而不是文件中,因此与利用这些数据的网站程序或者桌面程序之间 没有任何耦合
支持数据库表结构完全自定义,充分利用现有系统
支持多个栏目的信息采集可用同一配置一对多处理
保证信息的完整性与准确性,绝不会出现乱码
支持所有主流数据库:MS SQL Server, Oracle, DB2, MySQL, Sybase, Interbase, MS Access等
行业应用
乐思网络信息采集系统在各个注重外部信息获取的行业都有着广泛的应用:
门户网站
可以做到:
每天自动采集指定网站(可达几百个,上千个)的最新内容(可以做到每天自动从上千个网络媒体采集上万条新闻信息)
每天自动采集指定购物网站产品价格信息(产品名称,说明,价格,图片等)
利益:
大大节约工作人员采集因特网信息的时间与精力,让他们有更多时间专注于业务问题
轻松实现行业信息整合
迅速提高本网站信息量与浏览量,同时提高Google排名与Alexa排名
轻松实现价格比较系统的前端采集子系统
新闻媒体
可以做到:
每天定时自动采集指定网站的新闻内容,扩大内容来源与数量
轻松整合不同地区与行业的新闻,形成专题
采集行业内的专业文章,论坛帖子,并进行整合
利益:
节约采编人员大量的时间,从而让他们可以有更多的精力来从事其他的事情
迅速提高本网站信息量与浏览量
轻松拥有海量信息输入
企业
可以做到:
实时而准确地采集国内外新闻,行业新闻,技术文章
实时而准确地采集竞争对手以及供应商的新闻,人事,产品,价格等信息
实时而准确地采集公共信源的商业情报(同行产品价格,竞争对手的用户反馈,行业新闻)
实时而准确地采集本企业的品牌以及竞争对手的品牌在各大搜索引擎中的结果
实时而准确地采集各大行业论坛中的信息,从中了解消费者的需求与反馈,从而发现市场趋势与商业机会
准确地从网络公共信息中采集销售线索,潜在客户的资料
准确地从网络公共信息中采集本行业上万种产品的产品信息(描述,价格等),图片,技术文档。
利益:
快速而大量地获取目标商业信息,立刻提高公司的市场营销能力
快速实现企业应用(ERP,CRM等)及企业门户网站对于因特网内容的整合
快速建立大容量专业知识数据库,立刻促进公司的知识管理水平
节约内部员工到各网站查阅新闻的时间
政府机关与军队
可以做到:
实时跟踪、采集与政府工作相关的国内外及地方新闻,政策法规,经济,产业等信息
解决与因特网隔离的重要部门对于因特网的信息需求问题
解决政府主网站对各地级子网站的信息采集与整合问题
利益:
全面满足内部工作人员对外部因特网的实时信息的整合需求
迅速解决政务外网、政务内网的信息量不足,更新不及时问题
通过扩大信息量(如新闻,供求信息等)提高政务网站的用户满意度
大大节约工作人员采集因特网信息的时间与精力
广告与市场研究机构
可以做到:
快速而大量地获取公共信息中的商业名录资料
快速而大量地获取目标网站的各种原始信息(例如Blog与BBS中的信息)到数据库中
利益:
快速形成特定群体的具有很高可信度的商业名录数据库
快速形成用于分析统计与研究的用户反馈基础数据库
为品牌客户监视Blog与BBS上的相关信息
科学与技术研究单位
可以做到:
实时跟踪、采集相关的国内外科技信息与新闻
整合分布在各个网站网页上的科研数据,例如美国国家卫生研究院的生物科技信息中心(NCBI)公布的的大量基因相关数据
本地文本数据抽取
利益:
全面满足科研人员对于实时科技信息的整合浏览需求
从因特网的公开的可信来源轻松获取科学研究的相关数据
节约科研人员的极其宝贵的时间与精力