Skip to main content

Tokenize

Split text into tokens. A variety of methods are available. The default method is to split on spaces.

Tokenize elements in a list or string into individual tokens.

Parameters​

NameDescriptionAccepted ValuesDefaultRequired
I/O
inputColumn(s) to be split into tokens.string, integer, array—Yes
outputName of the output column.string, array, nullnullNo
Options
methodMethod to split the list. Options include space, boundary, boundary_ignore_space, custom functions as custom.<function>, or regex patterns as regex:<pattern>.string; one of:
  • space
  • boundary
  • boundary_ignore_space
or string
"space"No
Conditions
ifCondition that determines whether the wrangle runs as a whole. Recipe variables may be referenced with ${variable}.string—No
whereFilter rows before applying the wrangle using SQL-like criteria, such as column1 = 123 OR column2 = 'abc'.string—No
where_paramsValues used with where for parameterized criteria. Uses SQLite placeholder syntax such as ? or :name.array, object—No

Examples​

wrangles:
- split.tokenize:
input: Materials
output: Tokenized List
Materials
Stainless Steel Oak Wood
Tokenized List
['Stainless', 'Steel', 'Oak', 'Wood']
wrangles:
- split.tokenize:
input: Materials
output: Tokenized List
Materials
['Stainless Steel', 'Oak Wood']
Tokenized List
['Stainless', 'Steel', 'Oak', 'Wood']
Access
RequirementValue
AI-poweredNo
Requires WrangleWorks accountNo
Requires subscriptionNo
Requires external API keyNo
Technical details
FieldValue
Catalog ID66
Catalog keysplit.tokenize
Recipe keysplit.tokenize
Catalog statusactive
Lifecycle statusactive
Recipe Writer eligibleYes
Namespacesplit
Documentation groupsplit
AliasesNone
Runtime symbolwrangles.recipe_wrangles.split.tokenize
Legacy UUID6cc88418-ae0c-43f6-84ee-31e0d5f838c3

Sources