I have clustered environment, and with certain frequently some node goes down, sometimes crashing database. To recover Vertica's database it is necessary restoring it to last good epoch (some days before), causing a gap on displayed data. Is there any way to recover database without losing this amount of data?
PS: I noticed that some large "core.*" files were created on problematic node
/data/drdata/v_drdata_node0002_catalog
[root@host v_drdata_node0002_catalog]# ls -lha
total 7.1G
drwx------ 9 dradmin dradmin 4.0K Mar 25 04:02 .
drwxrwxr-x 4 dradmin dradmin 4.0K Mar 25 04:02 ..
drwx------ 4 dradmin dradmin 4.0K Feb 11 18:14 Catalog
drwx------ 2 dradmin dradmin 4.0K Feb 11 18:14 CopyErrorLogs
-rw------- 1 dradmin dradmin 1.9G Mar 24 12:46 core.12425
-rw------- 1 dradmin dradmin 1.9G Mar 24 18:20 core.15732
-rw------- 1 dradmin dradmin 1.9G Mar 24 16:39 core.18424
-rw------- 1 dradmin dradmin 1.9G Mar 24 17:20 core.2524
drwxrwx--- 2 dradmin dradmin 68K Mar 25 11:54 DataCollector
-rw------- 1 dradmin dradmin 2.2K Feb 11 18:14 debug_log.conf
-rwx------ 1 dradmin dradmin 18K Mar 24 18:20 ErrorReport.txt
drwx------ 2 dradmin dradmin 4.0K Feb 11 18:14 Libraries
drwxrwxr-x 2 dradmin dradmin 4.0K Mar 24 01:33 Snapshots
drwx------ 2 dradmin dradmin 4.0K Feb 11 18:14 tmp
drwx------ 2 dradmin dradmin 4.0K Mar 25 04:02 UDxLogs
-rw------- 1 dradmin dradmin 984 Feb 20 10:56 vertica.conf
-rw------- 1 dradmin dradmin 113M Mar 25 11:54 vertica.log
-rw------- 1 dradmin dradmin 14M Mar 25 04:02 vertica.log.1.gz
-rw------- 1 dradmin dradmin 20M Mar 24 04:03 vertica.log.2.gz
-rw------- 1 dradmin dradmin 15M Mar 23 04:02 vertica.log.3.gz
-rw------- 1 dradmin dradmin 45 Mar 24 21:38 vertica.pid
Thanks in advance!