Hi all,


I am facing a issue while setting up heartbeat version 2.0 using cib.xml
I am using two resources postgre and PCS.
Postgres is running fine,But the PCS resource is starting and stopping
continuously.

*Issue: The hearbeat resources are starting and stopping constantly and
becoming stable after a certain amount of time.*



Please help me out with this issue


Below is my cib.xml

 <cib admin_epoch="0" epoch="6" num_updates="1" generated="true"
have_quorum="true" ignore_dtd="false" ccm_transition="2" num_peers="2"
cib_feature_revision="2.0" crm_feature_set="2.0"
dc_uuid="949f9b38-545f-457d-9d09-63c21afce200" cib-last-written="Sat Jan 31
14:01:55 2009">
   <configuration>
     <crm_config>
       <cluster_property_set id="cib-bootstrap-options">
         <attributes>
           <nvpair id="cib-bootstrap-options-symmetric-cluster"
name="symmetric-cluster" value="true"/>
           <nvpair id="cib-bootstrap-options-no-quorum-policy"
name="no-quorum-policy" value="stop"/>
           <nvpair id="cib-bootstrap-options-default-resource-stickiness"
name="default-resource-stickiness" value="0"/>
           <nvpair
id="cib-bootstrap-options-default-resource-failure-stickiness"
name="default-resource-failure-stickiness" value="0"/>
           <nvpair id="cib-bootstrap-options-stonith-enabled"
name="stonith-enabled" value="false"/>
           <nvpair id="cib-bootstrap-options-stonith-action"
name="stonith-action" value="reboot"/>
           <nvpair id="cib-bootstrap-options-startup-fencing"
name="startup-fencing" value="true"/>
           <nvpair id="cib-bootstrap-options-stop-orphan-resources"
name="stop-orphan-resources" value="true"/>
           <nvpair id="cib-bootstrap-options-stop-orphan-actions"
name="stop-orphan-actions" value="true"/>
           <nvpair id="cib-bootstrap-options-remove-after-stop"
name="remove-after-stop" value="false"/>
           <nvpair id="cib-bootstrap-options-short-resource-names"
name="short-resource-names" value="true"/>
           <nvpair id="cib-bootstrap-options-transition-idle-timeout"
name="transition-idle-timeout" value="5min"/>
           <nvpair id="cib-bootstrap-options-default-action-timeout"
name="default-action-timeout" value="20s"/>
           <nvpair id="cib-bootstrap-options-is-managed-default"
name="is-managed-default" value="true"/>
           <nvpair id="cib-bootstrap-options-cluster-delay"
name="cluster-delay" value="60s"/>
           <nvpair id="cib-bootstrap-options-pe-error-series-max"
name="pe-error-series-max" value="-1"/>
           <nvpair id="cib-bootstrap-options-pe-warn-series-max"
name="pe-warn-series-max" value="-1"/>
           <nvpair id="cib-bootstrap-options-pe-input-series-max"
name="pe-input-series-max" value="-1"/>
           <nvpair id="cib-bootstrap-options-dc-version" name="dc-version"
value="2.1.4-node: aa909246edb386137b986c5773344b98c6969999"/>
         </attributes>
       </cluster_property_set>
     </crm_config>
     <nodes>
       <node id="949f9b38-545f-457d-9d09-63c21afce200" uname="pcs2"
type="normal"/>
       <node id="2e554730-e032-4ec9-9af1-d0df1f7a2d26" uname="pcs1"
type="normal">
         <instance_attributes
id="nodes-2e554730-e032-4ec9-9af1-d0df1f7a2d26">
           <attributes>
             <nvpair id="standby-2e554730-e032-4ec9-9af1-d0df1f7a2d26"
name="standby" value="on"/>
           </attributes>
         </instance_attributes>
       </node>
     </nodes>
     <resources>
       <group id="group_1">
         <primitive class="ocf" id="IPaddr_192_168_1_5" provider="heartbeat"
type="IPaddr">
           <operations>
             <op id="IPaddr_192_168_1_5_mon" interval="5s" name="monitor"
timeout="5s"/>
           </operations>
           <instance_attributes id="IPaddr_192_168_1_5_inst_attr">
             <attributes>
               <nvpair id="IPaddr_192_168_1_5_attr_0" name="ip"
value="192.168.1.5"/>
             </attributes>
           </instance_attributes>
         </primitive>
         <primitive class="heartbeat" id="drbddisk_2" provider="heartbeat"
type="drbddisk">
           <operations>
             <op id="drbddisk_2_mon" interval="120s" name="monitor"
timeout="60s"/>
           </operations>
           <instance_attributes id="drbddisk_2_inst_attr">
             <attributes>
               <nvpair id="drbddisk_2_attr_1" name="1" value="r0"/>
             </attributes>
           </instance_attributes>
         </primitive>
         <primitive class="ocf" id="Filesystem_3" provider="heartbeat"
type="Filesystem">
           <operations>
             <op id="Filesystem_3_mon" interval="120s" name="monitor"
timeout="60s"/>
           </operations>
           <instance_attributes id="Filesystem_3_inst_attr">
             <attributes>
               <nvpair id="Filesystem_3_attr_0" name="device"
value="/dev/drbd0"/>
               <nvpair id="Filesystem_3_attr_1" name="directory"
value="/shared"/>
               <nvpair id="Filesystem_3_attr_2" name="fstype" value="ext2"/>
               <nvpair id="Filesystem_3_attr_3" name="options"
value="noatime,nodiratime"/>
             </attributes>
           </instance_attributes>
         </primitive>
         <primitive class="heartbeat" id="postgresql_4" provider="heartbeat"
type="postgresql">
           <operations>
             <op id="postgresql_4_mon" interval="120s" name="monitor"
timeout="60s"/>
           </operations>
         </primitive>
         <primitive class="heartbeat" id="PCS_5" provider="heartbeat"
type="PCS">
           <operations>
             <op id="PCS_5_mon" interval="120s" name="monitor"
timeout="60s"/>
           </operations>
         </primitive>
       </group>
     </resources>
     <constraints>
       <rsc_location id="rsc_location_group_1" rsc="group_1">
         <rule id="prefered_location_group_1" score="100">
           <expression attribute="#uname"
id="prefered_location_group_1_expr" operation="eq" value="PCS1"/>
         </rule>
       </rsc_location>
     </constraints>
   </configuration>
 </cib>


Below are my logs:


tengine[6572]: 2009/01/31_14:03:01 info: process_te_message: Processing
graph derived from /var/lib/heartbeat/pengine/pe-input-17726.bz2
tengine[6572]: 2009/01/31_14:03:01 info: unpack_graph: Unpacked transition
33: 8 actions in 8 synapses
tengine[6572]: 2009/01/31_14:03:01 info: te_pseudo_action: Pseudo action 22
fired and confirmed
tengine[6572]: 2009/01/31_14:03:01 info: send_rsc_command: Initiating action
6: stop PCS_5_stop_0 on PCS2
crmd[6556]: 2009/01/31_14:03:01 info: do_lrm_rsc_op: Performing
op=PCS_5_stop_0 key=6:33:0:03283b15-14a0-4229-b60a-a710ee42a262)
lrmd[6553]: 2009/01/31_14:03:01 info: rsc:PCS_5: stop
crmd[6556]: 2009/01/31_14:03:01 info: process_lrm_event: LRM operation
PCS_5_monitor_120000 (call=59, rc=-2) Cancelled
pengine[6573]: 2009/01/31_14:03:01 info: process_pe_message: Transition 33:
PEngine Input stored in: /var/lib/heartbeat/pengine/pe-input-17726.bz2
lrmd[6553]: 2009/01/31_14:03:01 info: RA output: (PCS_5:stop:stdout)
stopping PCS....

lrmd[6553]: 2009/01/31_14:03:01 info: RA output: (PCS_5:stop:stdout) ...
lrmd[6553]: 2009/01/31_14:03:04 info: RA output: (PCS_5:stop:stdout) ...
lrmd[6553]: 2009/01/31_14:03:05 info: RA output: (PCS_5:stop:stdout) [
lrmd[6553]: 2009/01/31_14:03:05 info: RA output: (PCS_5:stop:stdout)   OK  ]
done

crmd[6556]: 2009/01/31_14:03:05 info: process_lrm_event: LRM operation
PCS_5_stop_0 (call=60, rc=0) complete
tengine[6572]: 2009/01/31_14:03:05 info: match_graph_event: Action
PCS_5_stop_0 (6) confirmed on PCS2 (rc=0)
tengine[6572]: 2009/01/31_14:03:05 info: te_pseudo_action: Pseudo action 23
fired and confirmed
tengine[6572]: 2009/01/31_14:03:05 info: te_pseudo_action: Pseudo action 7
fired and confirmed
tengine[6572]: 2009/01/31_14:03:05 info: te_pseudo_action: Pseudo action 20
fired and confirmed
tengine[6572]: 2009/01/31_14:03:05 info: send_rsc_command: Initiating action
19: start PCS_5_start_0 on PCS2
crmd[6556]: 2009/01/31_14:03:05 info: do_lrm_rsc_op: Performing
op=PCS_5_start_0 key=19:33:0:03283b15-14a0-4229-b60a-a710ee42a262)
lrmd[6553]: 2009/01/31_14:03:05 info: rsc:PCS_5: start
lrmd[6553]: 2009/01/31_14:03:05 info: RA output: (PCS_5:start:stdout) PCS is
stopped.....

lrmd[6553]: 2009/01/31_14:03:05 info: RA output: (PCS_5:start:stdout)
checking for the Postgres DB

lrmd[6553]: 2009/01/31_14:03:05 info: RA output: (PCS_5:start:stdout)
Postgres is running

lrmd[6553]: 2009/01/31_14:03:05 info: RA output: (PCS_5:start:stdout)
starting PCS...

lrmd[6553]: 2009/01/31_14:03:05 info: RA output: (PCS_5:start:stdout) [
lrmd[6553]: 2009/01/31_14:03:05 info: RA output: (PCS_5:start:stdout)   OK
]
done

crmd[6556]: 2009/01/31_14:03:05 info: process_lrm_event: LRM operation
PCS_5_start_0 (call=61, rc=0) complete
tengine[6572]: 2009/01/31_14:03:05 info: match_graph_event: Action
PCS_5_start_0 (19) confirmed on PCS2 (rc=0)
tengine[6572]: 2009/01/31_14:03:05 info: te_pseudo_action: Pseudo action 21
fired and confirmed
tengine[6572]: 2009/01/31_14:03:05 info: send_rsc_command: Initiating action
5: monitor PCS_5_monitor_120000 on PCS2
crmd[6556]: 2009/01/31_14:03:05 info: do_lrm_rsc_op: Performing
op=PCS_5_monitor_120000 key=5:33:0:03283b15-14a0-4229-b60a-a710ee42a262)
lrmd[6553]: 2009/01/31_14:03:06 WARN: There is something wrong: the first
line isn't read in. Maybe the heartbeat does not ouput string correctly for
status operation. Or the code (myself) is wrong.
crmd[6556]: 2009/01/31_14:03:06 info: process_lrm_event: LRM operation
PCS_5_monitor_120000 (call=62, rc=0) complete
tengine[6572]: 2009/01/31_14:03:06 info: match_graph_event: Action
PCS_5_monitor_120000 (5) confirmed on PCS2 (rc=0)
tengine[6572]: 2009/01/31_14:03:06 info: run_graph: Transition 33:
(Complete=8, Pending=0, Fired=0, Skipped=0, Incomplete=0)
tengine[6572]: 2009/01/31_14:03:06 info: notify_crmd: Transition 33 status:
te_complete - <null>
crmd[6556]: 2009/01/31_14:03:06 info: do_state_transition: State transition
S_TRANSITION_ENGINE -> S_IDLE [ input=I_TE_SUCCESS cause=C_IPC_MESSAGE
origin=route_message ]


Regards

Akshat
_______________________________________________
Linux-HA mailing list
[email protected]
http://lists.linux-ha.org/mailman/listinfo/linux-ha
See also: http://linux-ha.org/ReportingProblems

Reply via email to